Не закрывает ли ваш robots.txt доступ AI-краулерам?
Вставьте свой robots.txt ниже, и страница скажет по каждому значимому AI-краулеру, пускает его файл или нет и какая строка это решает. Если закрыто то, что вы закрывать не собирались, здесь же появится исправленный файл. Всё считается в браузере и никуда не отправляется.
Вставьте файл целиком. Он читается внутри страницы — не загружается, не сохраняется и никуда не уходит.
AI-краулеры и что решает каждый
Поисковый робот кормит ответы, которые ассистент даёт сегодня. Обучающий — следующую модель. Закрыв их, вы теряете разное.
Закрыть робота обучения и закрыть робота поиска — разные вещи
У каждого ассистента роботов несколько, и работа у них разная. GPTBot собирает тексты для обучения будущих моделей OpenAI. OAI-SearchBot строит индекс, из которого ChatGPT цитирует, когда человек задаёт вопрос сегодня. У Anthropic и Perplexity краулеры разделены так же. Закрыв первого, вы в этом году ничего не заметите; закрыв второго, вы убираете свои страницы из ответов, которые покупатели читают прямо сейчас.
Поэтому сниппет «закрываем AI-ботов», скопированный с форума, вредит сильнее, чем задумывал автор. В нём перечислены все токены, какие удалось найти, включая поисковых роботов, а владелец сайта уходит в уверенности, что отказался от обучения. В таблице ниже у каждого робота подписана его работа, чтобы решение принималось по одному роботу за раз.
Как читается файл
Вставленный текст проходит через тот же разбор, которым наш аудит читает настоящие сайты: шапки групп, приоритет Allow над Disallow, победа длиннейшего совпадения над обоими, шаблоны и знак конца пути. Углов у robots.txt больше, чем кажется. Несколько строк User-agent перед одним набором правил — это одна группа на всех перечисленных, и наивное чтение показывает первое имя открытым, когда оно закрыто.
По каждому роботу вы получаете вердикт и номер строки, из-за которой он такой, — можно открыть свой файл и увидеть то же самое. Там, где правило закрывает путь, а не весь сайт, вместо строки назван путь. С вашего домена не скачивается ничего, и это осознанно: страница, которая сходила бы за файлом сама, вела бы этот запрос через наши серверы.
Чем эта проверка не является
- Это не проверка сервера. Файл объявляет политику, а правило фаервола или анти-бот защиты вправе развернуть краулера, которого файл пускает; видно это только в журнале доступа.
- Это не обещание визита. Открытая дверь означает, что краулер может прийти, а не что он придёт и воспользуется найденным.
- Это не чтение вашего сайта. Читается текст из поля, поэтому файл, который вы поправили и не выложили, пройдёт проверку и не изменит снаружи ничего.
Вопросы про robots.txt и AI-краулеров
- Где лежит мой robots.txt и сколько его вставлять?
- В корне домена, по адресу yoursite.com/robots.txt. Откройте этот адрес в браузере — то, что вы увидите, и читают все краулеры. Вставляйте файл целиком: правило ниже по файлу способно перебить то, что вы вставили, и кусок даёт уверенно неверный ответ.
- Стоит ли закрывать GPTBot?
- Это решение про бизнес, и страница нужна для того, чтобы принять его осознанно. Закрытый GPTBot не пускает ваши тексты в будущее обучение моделей OpenAI и не убирает вас из ответов ChatGPT сегодня — это делает OAI-SearchBot. Пускать поисковых роботов и отказывать обучающим — связная позиция, её держат многие издатели.
- robots.txt вообще кого-то останавливает?
- Останавливает тех, кто его читает, — а это все названные здесь операторы. Это просьба, а не забор: соблюдение ничем не обеспечено, и скрапер, который её игнорирует, просто заберёт страницу. Нужна закрытая дверь физически — это правило на сервере, а не текстовый файл.
- Почему закрытым показан краулер, которого я нигде не упоминал?
- Потому что группа User-agent: * действует на каждого робота, у которого нет своей. Одна строка Disallow: / в ней закрывает сайт сразу для всех, и это самый частый способ выпасть из ответов ассистентов, ни разу такого не решив.