Cómo controlar los rastreadores de IA con robots.txt
Hace unos años, los rastreadores que llegaban a su sitio eran motores de búsqueda y una larga cola de raspadores. Ahora una gran parte de ellos pertenecen a modelos de lenguaje: algunos recopilan páginas para entrenar, algunos recuperan una página en vivo porque un usuario hizo una pregunta al respecto y algunos hacen ambas cosas con nombres diferentes. La superficie de control para todos ellos es el mismo archivo de siempre: /robots.txt, un archivo de texto sin formato en la raíz de su dominio, pero las decisiones detrás de él son nuevas.
Entrenamiento, recuperación y búsqueda son tres preguntas diferentes
El error más común es tratar al "rastreador de IA" como una sola cosa. Son al menos tres, y la mayoría de los proveedores ejecutan un agente de usuario independiente para cada uno:
- Colección de entrenamiento. Un bot que rastrea ampliamente y almacena páginas para un modelo futuro. Bloquearlo no le cuesta nada hoy ni le aporta nada: es una decisión de licencia, no de tráfico.
- Recuperación en vivo. Una búsqueda activada por una persona en una ventana de chat que pegó su URL o hizo una pregunta que su página responde. Bloquear esto significa que el asistente no puede leerlo, citarlo ni vincularlo.
- Indexación del motor de respuestas. Un rastreador que crea el índice a partir del cual responde un producto de búsqueda de IA. Bloquearlo lo elimina de los resultados de ese producto de la misma manera que lo haría bloquear un motor de búsqueda.
Los editores bloquean habitualmente los tres pegando una regla y luego se preguntan por qué su marca dejó de aparecer en las respuestas del asistente. Decide por categoría antes de escribir una línea.
quien es quien
Los nombres que verá realmente en sus registros y para qué sirve cada uno:
GPTBot— El amplio rastreador de OpenAI, asociado con la recopilación de datos de entrenamiento.OAI-SearchBot— Rastreador de OpenAI para resultados de estilo de búsqueda; bloquearlo es una decisión de visibilidad, no de formación.ChatGPT-User- una búsqueda en vivo realizada porque un usuario lo solicitó. Hay una persona esperando al otro lado de esta solicitud.ClaudeBot— El amplio rastreador de Anthropic.Claude-UseryClaude-SearchBotcubre búsquedas iniciadas por el usuario e indexación de búsqueda.Google-Extended– no es un rastreador en absoluto. Es un token que le permite optar por no participar en la capacitación de Gemini mientras el robot de Google sigue rastreando la Búsqueda. No permitirlo no afecta su clasificación de búsqueda; desautorizarGooglebotmucho lo hace.PerplexityBot— indexación para un motor de respuestas que cita fuentes en línea.CCBot- Rastreo común. No es una empresa de inteligencia artificial, pero su archivo es un aporte de capacitación para muchos de ellos.Applebot-Extended,meta-externalagent,Amazonbot,Bytespider– el mismo patrón de Apple, Meta, Amazon y ByteDance.
Los proveedores agregan y cambian el nombre de los agentes con regularidad, así que trate cualquier lista, incluida ésta, como una instantánea. El hábito duradero es leer sus propios registros de acceso: extraiga las distintas cadenas de agentes de usuario de un día de tráfico y ejecútelas en el analizador de agente de usuario para ver cuáles son bots, cuáles son navegadores y cuáles pretenden ser navegadores.
Escribiendo las reglas
La sintaxis no cambia y es implacable exactamente en un lugar: cada User-agent El grupo se aplica al bot que coincide con él. más específicamente, y un bot que coincide con su propio nombre ignora el * grupo por completo. Entonces esto no hace lo que parece:
un grupo para * que no permite nada, seguido de un grupo de GPTBot que no permite /, funciona bien. Pero si pones un retraso de rastreo o una regla de mapa del sitio sólo en el * grupo y suponen que los bots con nombre lo heredan, no es así. Repite todo lo que sea importante en cada grupo o mantén tus reglas amplias.
El generador de robots.txt construye el archivo a partir de casillas de verificación: seleccione los agentes que desea permitir o bloquear, agregue las rutas no permitidas y emite una salida correctamente agrupada con la línea de su mapa del sitio al final. Una vez que el archivo exista, péguelo en el probador de robots.txt con una URL y un agente de usuario para confirmar que la respuesta es la que quería decir. Las pruebas son más importantes de lo habitual aquí porque la falla es silenciosa: una regla que accidentalmente bloquea todo parece exactamente igual a una regla que funciona, hasta que el tráfico desaparece un mes después.
Lo que robots.txt no puede hacer
Vale la pena interiorizar tres límites antes de confiar en el archivo:
Es una petición, no una valla. Los rastreadores que se portan bien lo honran. Los scrapers que quieren su contenido lo ignoran y nada en el protocolo los detiene. Si necesita aplicación, eso reside en la configuración de su servidor, un limitador de velocidad o una regla WAF, e incluso entonces está haciendo coincidir cadenas de agentes de usuario y rangos de IP que pueden ser falsificados.
No permitir no es un índice. Una URL no permitida aún puede aparecer en los resultados si otros sitios enlazan con ella, porque al rastreador se le dice que no busque la página pero no que olvide que existe. Si desea una página fuera de un índice, deje que el rastreador la busque y entregue un noindex metaetiqueta o encabezado. El bloqueo en robots.txt evita activamente que el rastreador vea esa etiqueta.
Es por host, esquema y puerto. https://example.com/robots.txt gobierna ese origen únicamente, no www., no el subdominio provisional, ni el nombre de host CDN que sirve sus imágenes. Cada host que responde solicitudes necesita su propio archivo.
Apunte a los rastreadores hacia lo que desea indexar
La otra mitad del expediente es invitación, no exclusión. A Sitemap: La línea le brinda a cada rastreador una lista explícita de sus URL canónicas y sus fechas de última modificación, que es la forma más económica de descubrir nuevas páginas: la generador de mapas de sitio convierte una lista de URL en XML válido que puede cargar junto con el archivo robots. Mantenga los dos consistentes: una URL que aparece en su mapa del sitio mientras no está permitida en robots.txt es una contradicción que aparece como un error en cada herramienta de informes que lee ambos.
También puedes ver llms.txt propuesto como un archivo complementario: un resumen markdown de un sitio dirigido a modelos en lugar de rastreadores. Es una convención, no un estándar, y ningún proveedor importante la trata como una directiva. Agregar uno es inofensivo; confiar en él para el control no lo es.
Un valor predeterminado razonable
Si publica contenido y desea alcanzar alcance, la configuración a la que acceden la mayoría de los sitios es: permitir la recuperación en vivo y los rastreadores de motor de respuestas para que los asistentes puedan encontrarlo y citarlo, bloquear o permitir rastreadores de capacitación masiva de acuerdo con su opinión sobre ese intercambio, nunca tocar Googlebot o Bingbot a menos que sepa exactamente por qué y mantenga una línea en el mapa del sitio apuntando a un archivo actual. Si publica detrás de un muro de pago o vende licencias para su archivo, el cálculo se invierte y el objetivo es bloquear los rastreadores generales.
De cualquier manera, escríbalo deliberadamente, pruébelo con cadenas de agentes de usuario reales y vuelva a verificarlo cada vez que un proveedor anuncie un nuevo bot. Tanto el generador como el probador se ejecutan completamente en su navegador: su archivo robots, sus URL y sus líneas de registro nunca abandonan la página.
Creador de TextArray: crea herramientas gratuitas que priorizan la privacidad y se ejecutan completamente en su navegador.