Не закрывает ли ваш robots.txt доступ AI-краулерам?

Вставьте свой robots.txt ниже, и страница скажет по каждому значимому AI-краулеру, пускает его файл или нет и какая строка это решает. Если закрыто то, что вы закрывать не собирались, здесь же появится исправленный файл. Всё считается в браузере и никуда не отправляется.

Вставьте файл целиком. Он читается внутри страницы — не загружается, не сохраняется и никуда не уходит.

AI-краулеры и что решает каждый

Поисковый робот кормит ответы, которые ассистент даёт сегодня. Обучающий — следующую модель. Закрыв их, вы теряете разное.

OAI-SearchBot OpenAI · поисковый индекс
GPTBot OpenAI · обучение модели
ChatGPT-User OpenAI · открывает страницу по просьбе человека
Claude-SearchBot Anthropic · поисковый индекс
ClaudeBot Anthropic · обучение модели
Claude-User Anthropic · открывает страницу по просьбе человека
anthropic-ai Anthropic · обучение модели · устаревший токен
PerplexityBot Perplexity · поисковый индекс
Perplexity-User Perplexity · открывает страницу по просьбе человека
Google-Extended Google · обучение модели
GoogleOther Google · обучение модели
Applebot Apple · поисковый индекс
Applebot-Extended Apple · обучение модели
meta-externalagent Meta · обучение модели
FacebookBot Meta · обучение модели · устаревший токен
Amazonbot Amazon · поисковый индекс
CCBot Common Crawl · обучение модели
Bytespider ByteDance · обучение модели
cohere-ai Cohere · обучение модели · устаревший токен

Закрыть робота обучения и закрыть робота поиска — разные вещи

У каждого ассистента роботов несколько, и работа у них разная. GPTBot собирает тексты для обучения будущих моделей OpenAI. OAI-SearchBot строит индекс, из которого ChatGPT цитирует, когда человек задаёт вопрос сегодня. У Anthropic и Perplexity краулеры разделены так же. Закрыв первого, вы в этом году ничего не заметите; закрыв второго, вы убираете свои страницы из ответов, которые покупатели читают прямо сейчас.

Поэтому сниппет «закрываем AI-ботов», скопированный с форума, вредит сильнее, чем задумывал автор. В нём перечислены все токены, какие удалось найти, включая поисковых роботов, а владелец сайта уходит в уверенности, что отказался от обучения. В таблице ниже у каждого робота подписана его работа, чтобы решение принималось по одному роботу за раз.

Как читается файл

Вставленный текст проходит через тот же разбор, которым наш аудит читает настоящие сайты: шапки групп, приоритет Allow над Disallow, победа длиннейшего совпадения над обоими, шаблоны и знак конца пути. Углов у robots.txt больше, чем кажется. Несколько строк User-agent перед одним набором правил — это одна группа на всех перечисленных, и наивное чтение показывает первое имя открытым, когда оно закрыто.

По каждому роботу вы получаете вердикт и номер строки, из-за которой он такой, — можно открыть свой файл и увидеть то же самое. Там, где правило закрывает путь, а не весь сайт, вместо строки назван путь. С вашего домена не скачивается ничего, и это осознанно: страница, которая сходила бы за файлом сама, вела бы этот запрос через наши серверы.

Чем эта проверка не является

  • Это не проверка сервера. Файл объявляет политику, а правило фаервола или анти-бот защиты вправе развернуть краулера, которого файл пускает; видно это только в журнале доступа.
  • Это не обещание визита. Открытая дверь означает, что краулер может прийти, а не что он придёт и воспользуется найденным.
  • Это не чтение вашего сайта. Читается текст из поля, поэтому файл, который вы поправили и не выложили, пройдёт проверку и не изменит снаружи ничего.

Вопросы про robots.txt и AI-краулеров

Где лежит мой robots.txt и сколько его вставлять?
В корне домена, по адресу yoursite.com/robots.txt. Откройте этот адрес в браузере — то, что вы увидите, и читают все краулеры. Вставляйте файл целиком: правило ниже по файлу способно перебить то, что вы вставили, и кусок даёт уверенно неверный ответ.
Стоит ли закрывать GPTBot?
Это решение про бизнес, и страница нужна для того, чтобы принять его осознанно. Закрытый GPTBot не пускает ваши тексты в будущее обучение моделей OpenAI и не убирает вас из ответов ChatGPT сегодня — это делает OAI-SearchBot. Пускать поисковых роботов и отказывать обучающим — связная позиция, её держат многие издатели.
robots.txt вообще кого-то останавливает?
Останавливает тех, кто его читает, — а это все названные здесь операторы. Это просьба, а не забор: соблюдение ничем не обеспечено, и скрапер, который её игнорирует, просто заберёт страницу. Нужна закрытая дверь физически — это правило на сервере, а не текстовый файл.
Почему закрытым показан краулер, которого я нигде не упоминал?
Потому что группа User-agent: * действует на каждого робота, у которого нет своей. Одна строка Disallow: / в ней закрывает сайт сразу для всех, и это самый частый способ выпасть из ответов ассистентов, ни разу такого не решив.