Como controlar rastreadores de IA com robots.txt
Há alguns anos, os rastreadores que acessavam seu site eram mecanismos de pesquisa e uma longa cauda de scrapers. Agora, uma grande parte deles pertence a modelos de linguagem: alguns coletam páginas para treinar, alguns buscam uma página ao vivo porque um usuário fez uma pergunta sobre ela e alguns fazem as duas coisas com nomes diferentes. A superfície de controle para todos eles é o mesmo arquivo de sempre - /robots.txt, um arquivo de texto simples na raiz do seu domínio — mas as decisões por trás dele são novas.
Treinamento, recuperação e pesquisa são três tarefas diferentes
O erro mais comum é tratar o “rastreador de IA” como uma coisa. São pelo menos três, e a maioria dos fornecedores executa um agente de usuário separado para cada um:
- Coleção de treinamento. Um bot que rastreia amplamente e armazena páginas para um modelo futuro. Bloqueá-lo não custa nada hoje e não traz nada hoje – é uma decisão de licenciamento, não uma decisão de tráfego.
- Recuperação ao vivo. Uma busca acionada por uma pessoa em uma janela de bate-papo que colou seu URL ou fez uma pergunta que sua página responde. Bloquear isso significa que o assistente não poderá ler você, citá-lo e não poderá vinculá-lo.
- Indexação do mecanismo de resposta. Um rastreador que cria o índice a partir do qual um produto de pesquisa de IA responde. Bloqueá-lo remove você dos resultados desse produto da mesma forma que bloquearia um mecanismo de pesquisa.
Os editores bloqueiam rotineiramente todos os três colando uma regra e depois se perguntam por que sua marca parou de aparecer nas respostas do assistente. Decida por categoria antes de escrever uma linha.
Quem é quem
Os nomes que você realmente verá em seus registros e para que serve cada um:
GPTBot— Rastreador amplo da OpenAI, associado à coleta de dados de treinamento.OAI-SearchBot— Rastreador da OpenAI para resultados de estilo de pesquisa; bloqueá-lo é uma decisão de visibilidade, não de treinamento.ChatGPT-User– uma busca ao vivo feita porque um usuário solicitou. Há uma pessoa esperando do outro lado desta solicitação.ClaudeBot— Rastreador amplo da Antrópico.Claude-UsereClaude-SearchBotcobrem buscas iniciadas pelo usuário e indexação de pesquisa.Google-Extended- não é um rastreador. É um token que permite cancelar o treinamento do Gemini enquanto o Googlebot continua rastreando a Pesquisa. Proibir isso não afeta sua classificação de pesquisa; proibindoGooglebotmuito faz.PerplexityBot— indexação para um mecanismo de resposta que cita fontes in-line.CCBot— Rastreamento comum. Não é uma empresa de IA, mas seu arquivo é uma fonte de treinamento para muitas delas.Applebot-Extended,meta-externalagent,Amazonbot,Bytespider– o mesmo padrão da Apple, Meta, Amazon e ByteDance.
Os fornecedores adicionam e renomeiam agentes regularmente, portanto trate qualquer lista – incluindo esta – como um instantâneo. O hábito duradouro é ler seus próprios logs de acesso: extraia as sequências distintas do agente do usuário de um dia de tráfego e execute-as no analisador de agente de usuário para ver quais são bots, quais são navegadores e quais fingem ser navegadores.
Escrevendo as regras
A sintaxe permanece inalterada e implacável exatamente em um lugar: cada User-agent grupo se aplica ao bot que corresponde a ele mais especificamente, e um bot que corresponda ao seu próprio nome ignora o * grupo inteiramente. Portanto, isso não faz o que parece:
Um grupo para * que não proíbe nada, seguido por um grupo para GPTBot que não permite /, funciona bem. Mas se você colocar um atraso de rastreamento ou uma regra de mapa do site apenas no * agrupar e assumir que os bots nomeados o herdam, isso não acontece. Repita tudo o que for importante em cada grupo ou mantenha suas regras amplas.
O Gerador robots.txt cria o arquivo a partir de caixas de seleção – escolha os agentes que você deseja permitir ou bloquear, adicione seus caminhos não permitidos e emite uma saída agrupada corretamente com a linha do mapa do site no final. Assim que o arquivo existir, cole-o no testador de robots.txt com um URL e um agente de usuário para confirmar se a resposta é a que você quis dizer. O teste é mais importante do que o normal aqui porque a falha é silenciosa: uma regra que bloqueia tudo acidentalmente se parece exatamente com uma regra que funciona, até que o tráfego desapareça um mês depois.
O que o robots.txt não pode fazer
Vale a pena internalizar três limites antes de confiar no arquivo:
É um pedido, não uma barreira. Rastreadores bem comportados honram isso. Scrapers que desejam seu conteúdo o ignoram e nada no protocolo os impede. Se você precisar de aplicação, isso reside na configuração do seu servidor, em um limitador de taxa ou em uma regra WAF - e mesmo assim você estará combinando strings de agente de usuário e intervalos de IP que podem ser falsificados.
Proibir não é noindex. Um URL não permitido ainda pode aparecer nos resultados se outros sites tiverem links para ele, porque o rastreador é instruído a não buscar a página, mas não é instruído a esquecer que ela existe. Se você quiser uma página fora de um índice, deixe o rastreador buscá-la e servir um noindex meta tag ou cabeçalho. O bloqueio no robots.txt evita ativamente que o rastreador veja essa tag.
É por host, esquema e porta. https://example.com/robots.txt rege apenas essa origem - não www., não o subdomínio de teste, nem o nome do host CDN que atende suas imagens. Cada host que responde a solicitações precisa de seu próprio arquivo.
Aponte os rastreadores para o que você deseja indexar
A outra metade do arquivo é um convite, não uma exclusão. UM Sitemap: fornece a cada rastreador uma lista explícita de seus URLs canônicos e as datas da última modificação, que é a maneira mais barata de descobrir novas páginas - o gerador de mapa do site transforma uma lista de URLs em XML válido que você pode enviar junto com o arquivo robots. Mantenha os dois consistentes: um URL que aparece no mapa do site e não é permitido no robots.txt é uma contradição que aparece como um erro em todas as ferramentas de relatórios que lêem ambos.
Você também pode ver llms.txt proposto como arquivo complementar - um resumo markdown de um site voltado para modelos em vez de rastreadores. É uma convenção, não um padrão, e nenhum grande fornecedor a trata como uma diretriz. Adicionar um é inofensivo; confiar nele para controle não é.
Um padrão razoável
Se você publica conteúdo e deseja alcance, a configuração que a maioria dos sites adota é: permitir recuperação ao vivo e rastreadores de mecanismo de resposta para que os assistentes possam encontrar e citar você, bloquear ou permitir rastreadores de treinamento em massa de acordo com como você se sente sobre aquela negociação, nunca toque Googlebot ou Bingbot a menos que você saiba exatamente o porquê e mantenha uma linha do mapa do site apontando para um arquivo atual. Se você publica atrás de um acesso pago ou vende licenças para seu arquivo, o cálculo se inverte e o objetivo é bloquear os rastreadores amplos.
De qualquer forma, escreva-o deliberadamente, teste-o em strings reais de agente de usuário e verifique-o novamente sempre que um fornecedor anunciar um novo bot. Tanto o gerador quanto o testador são executados inteiramente em seu navegador – seu arquivo robots, seus URLs e suas linhas de log nunca saem da página.
Criador do TextArray – criando ferramentas gratuitas que priorizam a privacidade e que rodam inteiramente no seu navegador.