Qué rastreadores de IA visitaron realmente tu sitio
Todo lo demás que se escribe sobre los rastreadores de IA es una predicción. Tu access log es el único registro de lo que ocurrió de verdad: qué rastreadores pidieron tus páginas, qué días y qué les respondió tu servidor. Suelta abajo un trozo de ese log y obtienes el desglose: visitas verificadas, impostores que usan el nombre de un rastreador desde una dirección que no es suya y las páginas donde a un rastreador se le entregó un 403 en lugar de tu contenido. El archivo se lee dentro de esta página y no se sube a ninguna parte.
El archivo se lee dentro de esta página. No se sube, no se guarda y no se envía a ninguna parte: puedes comprobarlo en la pestaña de red de tu navegador.
Compatibles: nginx y Apache (combined y common), JSON de Caddy, exportaciones de recolectores de logs donde la línea original va en un campo JSON (Datadog, Loki, Fluent Bit, docker logs) y logs JSON de Vercel y Cloudflare. Los archivos comprimidos con gzip funcionan tal cual.
Por qué el log zanja discusiones que el robots.txt no puede zanjar
Un archivo robots.txt declara una política. Dice quién tiene permiso para entrar. No dice nada sobre quién apareció, con qué frecuencia ni qué recibió al hacerlo. Hay muchos sitios que permiten a todos los rastreadores de IA y aun así nunca reciben una visita, y muchos que se creen abiertos mientras una regla del cortafuegos, un servicio antibot o una redirección caducada rechazan en silencio cada petición. Los dos casos se ven idénticos desde fuera y completamente distintos en el log.
Lo más útil que saca a la luz esta herramienta no es el recuento de visitas: son las respuestas que no fueron 200. Un rastreador al que se le negó el acceso dejó tu página fuera de juego para las preguntas que hacen tus compradores, y lo hizo en silencio, semanas antes de que nadie se diera cuenta. Esa línea de tu log vale más que cualquier puntuación, porque nombra una página concreta, un código de estado concreto y una fecha concreta que puedes ir a arreglar.
Cómo se separa un rastreador declarado de uno real
La cabecera User-Agent es una cadena que elige el cliente. Cualquiera puede enviar "GPTBot" y mucha gente lo hace: scrapers, escáneres de seguridad y herramientas de auditoría rivales se ponen nombres ajenos porque así pasan los filtros ingenuos. Contar solo los user agents infla las cifras, a veces a la mitad. Por eso aquí cada petición se contrasta con los rangos de IP que los propios operadores publican: Google, OpenAI, Anthropic, Perplexity y Apple publican los suyos. Una dirección dentro de la lista es una visita verificada. Una dirección fuera de ella, para un operador que sí publica lista, es un impostor.
Hay dos correcciones más que ocurren sin ruido. Una sola dirección que lleva tres o más nombres distintos de rastreador no son nueve robots visitándote: es la herramienta de auditoría de alguien, y sus peticiones se restan en vez de contarse. Y las peticiones de CSS, JavaScript, fuentes e imágenes se separan de las peticiones de páginas, porque sesenta impactos de un rastreador pueden significar perfectamente una página y cincuenta y nueve recursos. Los dos ajustes se muestran en el informe en vez de aplicarse a escondidas.
Lo que esta herramienta no es
- No es una comprobación en vivo. Lee un historial que tu servidor ya registró, así que solo puede hablarte del periodo que cubre tu archivo de log.
- No es una prueba de que un rastreador leyera o usara tu contenido. Una descarga correcta significa que la página se entregó, nada más: ningún proveedor publica qué ocurre después.
- No es un veredicto sobre los operadores que no publican rangos de IP. Esas visitas se marcan como no verificadas, nunca como falsas, porque no hay nada honesto con lo que contrastarlas.
Preguntas sobre la lectura de logs de rastreadores
- ¿Dónde encuentro mi access log?
- En un servidor que controlas, mira en /var/log/nginx/access.log, /var/log/apache2/access.log o /var/log/caddy/access.log. En una plataforma gestionada, busca la exportación de logs o los log drains en el panel. Un archivo comprimido con gzip funciona tal cual: no hace falta descomprimirlo antes.
- ¿Qué formatos de log admite?
- Los formatos combined y common de nginx y Apache, las líneas JSON de Caddy, las exportaciones de recolectores de logs que envuelven la línea original en un campo JSON (Datadog, Loki, Fluent Bit, docker logs) y los logs JSON de Vercel y Cloudflare. Los archivos comprimidos con gzip se leen tal cual. Los logs W3C de IIS todavía no son compatibles. Si tu formato no se entiende, recibes una negativa clara en lugar de un informe vacío, y se envía la forma de una línea fallida para que el analizador la aprenda.
- ¿Se sube mi archivo de log?
- No. El archivo se lee y se analiza dentro de esta página, y nunca sale de tu navegador. Si nuestro analizador no entiende tu formato, se envía una forma anónima de la línea fallida para que podamos arreglarlo: las letras pasan a ser a y los dígitos 9, así que no sobrevive ninguna dirección, ruta ni dominio. Las líneas completas solo se envían si pulsas el botón y ves exactamente qué se enviaría.
- ¿Por qué aparece como no verificado un rastreador que sé que me visita?
- Porque su operador no publica rangos de IP, así que no hay nada con lo que contrastar la dirección. Meta, ByteDance y Amazon están hoy en ese grupo. No verificado significa que no podemos confirmar la visita, no que creamos que es falsa.