¿Tu robots.txt está bloqueando a los rastreadores de IA?
Pega tu robots.txt abajo y esta página te dice, para cada rastreador de IA que importa, si puede leer tu sitio y qué línea lo decide. Si hay algo cerrado que no querías cerrar, también obtienes el archivo corregido para copiar. Todo ocurre en tu navegador y no se envía nada a ninguna parte.
Pega el archivo entero. Se lee dentro de esta página: no se sube, no se guarda y no se envía a ninguna parte.
Rastreadores de IA y qué decide cada uno
Un robot de búsqueda alimenta las respuestas que un asistente da hoy. Uno de entrenamiento alimenta el próximo modelo. Bloquearlos te cuesta cosas distintas.
Bloquear al robot de entrenamiento no es lo mismo que bloquear al de búsqueda
Cada asistente envía más de un robot y cada uno hace un trabajo distinto. GPTBot recoge texto para entrenar futuros modelos de OpenAI. OAI-SearchBot construye el índice del que ChatGPT cita cuando alguien hace una pregunta hoy. Anthropic y Perplexity separan sus rastreadores igual. Cerrar al primero no cambiará nada que notes este año; cerrar al segundo saca tus páginas de las respuestas que tus compradores están leyendo ahora mismo.
Por eso el fragmento de «bloquear a los bots de IA» copiado de un foro hace más daño del que pretendía su autor. Nombra todos los tokens que alguien pudo encontrar, robots de búsqueda incluidos, y el dueño del sitio se marcha creyendo que solo renunció al entrenamiento. En la tabla de abajo cada robot lleva escrito su trabajo, para que la decisión se tome robot a robot.
Cómo se lee el archivo
El texto que pegas pasa por el mismo analizador que nuestra auditoría usa con sitios reales: cabeceras de grupo, Allow por encima de Disallow, la coincidencia más larga por encima de ambos, comodines y la marca de fin de ruta. robots.txt tiene más esquinas de las que parece. Varias líneas User-agent antes de un bloque de reglas son un único grupo que cubre a todas, y una lectura ingenua da por permitido al primer nombre cuando está cerrado.
Cada robot recibe un veredicto y el número de línea que lo explica, así que puedes abrir tu archivo y ver lo mismo. Donde una regla cierra una ruta y no el sitio entero, se nombra la ruta en lugar de la línea. No se descarga nada de tu dominio, y es deliberado: una página que fuese a buscar el archivo por ti tendría que pasar la petición por nuestros servidores.
Lo que este comprobador no es
- No es una comprobación de tu servidor. Este archivo declara una política; una regla de firewall o de protección antibots puede rechazar igualmente a un rastreador al que el archivo da la bienvenida, y eso solo se ve en tu registro de acceso.
- No es una promesa de visita. Una puerta abierta significa que un rastreador puede venir, nunca que vendrá ni que usará lo que encuentre.
- No lee tu sitio. Lee el texto de la caja, así que un archivo que editaste y nunca publicaste pasa aquí y no cambia nada ahí fuera.
Preguntas sobre robots.txt y rastreadores de IA
- ¿Dónde está mi robots.txt y cuánto debo pegar?
- En la raíz de tu dominio, como tusitio.com/robots.txt. Abre esa dirección en el navegador: lo que veas es el archivo que leen todos los rastreadores. Pégalo entero, porque una regla más abajo puede anular la parte que pegaste y un fragmento da una respuesta equivocada con toda confianza.
- ¿Debería bloquear a GPTBot?
- Es una decisión de negocio, y esta página existe para que la tomes sabiendo qué haces. Bloquear GPTBot mantiene tu texto fuera de los futuros entrenamientos de OpenAI y no te saca de las respuestas de ChatGPT de hoy: eso lo hace OAI-SearchBot. Permitir los robots de búsqueda y rechazar los de entrenamiento es una postura coherente, y muchos editores la mantienen.
- ¿robots.txt detiene realmente a alguien?
- Detiene a quienes lo leen, que son los operadores nombrados aquí. Es una petición, no una valla: nada la hace cumplir, y un scraper que la ignore simplemente se lleva la página. Si necesitas la puerta cerrada de verdad, eso es una regla del servidor, no un archivo de texto.
- ¿Por qué aparece bloqueado un rastreador que nunca mencioné?
- Porque el grupo User-agent: * se aplica a todo robot que no tenga grupo propio. Una sola línea Disallow: / ahí cierra el sitio para todos a la vez, y es la forma más común de desaparecer de las respuestas de IA sin que nadie lo haya decidido.