Se você tem um domínio atrás do Cloudflare, crawlers da OpenAI, Anthropic, Google e mais meia dúzia estão lendo seu site todos os dias - e até pouco tempo atrás, decidir o que fazer com eles era um sufoco: ou você apertava o botão “Block AI bots” e bloqueava tudo (quebrando coisas que queria manter), ou deixava tudo passar. Desde 1º de julho de 2026, o Cloudflare lançou uma nova taxonomia e novos controles de tráfego de IA para todos os planos, incluindo o gratuito, e finalmente dá para decidir com precisão: quero aparecer nos buscadores, mas não quero modelos treinados com meu conteúdo.
Vou te mostrar onde fica cada opção, o que ela faz de fato e como testar sem quebrar seu tráfego real.
As três categorias que agora você controla
A mudança de fundo é que o Cloudflare parou de tratar “bot de IA” como uma coisa só. Segundo a documentação do Block AI Bots, agora eles são classificados por comportamento:
- Search: crawlers que indexam seu conteúdo para responder perguntas sobre ele depois. É o tráfego que te devolve visitas.
- Agent: automações que agem em tempo real em nome de uma pessoa: os bots de fetch do ChatGPT (
ChatGPT-User), agentes que controlam um navegador, etc. - Training: crawlers que levam seu conteúdo para treinar ou fazer fine-tuning de um modelo. Inclui os crawlers multiuso, que fazem busca e treinamento ao mesmo tempo.
Cada categoria é configurada separadamente, com três opções:
- Block (on all pages): bloqueia em toda a zona.
- Block on pages with ads: bloqueia só nas páginas onde o Cloudflare detecta anúncios (a lógica: onde tem publicidade, o que monetiza é a atenção humana).
- Allow (do not block): não bloqueia nada.
O bloqueio vale tanto para bots verificados classificados com aquele comportamento quanto para bots não verificados que se comportam da mesma forma - então ninguém escapa só por não ter se registrado.
Onde configurar
Tudo fica no mesmo lugar: abra sua zona, vá em Security > Settings, filtre por Bot traffic e abra Configure AI bot policies. A documentação oficial confirma. Se quiser ver antes de entrar, aqui está uma captura do painel como está agora, com as opções de Search, Agent e Training.
Minha configuração recomendada para um blog ou site de conteúdo: Training em Block (all pages), Search em Allow e Agent em Block se você não liga para assistentes lendo seu site em tempo real - ou em Allow se quiser aparecer nas respostas do ChatGPT e afins. Aí é uma decisão editorial sua.
Se quiser ver outra face do Cloudflare para trabalhar com conteúdo, também expliquei como a Cloudflare pode fazer scraping de sites inteiros para você.
O aviso importante: em 15 de setembro de 2026 os defaults mudam
Isso é o que a maioria vai perder. Segundo o Cloudflare, em 15 de setembro de 2026 entram novos valores padrão para domínios novos: Training e Agent ficam bloqueados nas páginas com anúncios, e Search continua permitido.
Mas tem uma segunda mudança mais delicada: os crawlers multiuso que combinam busca e treinamento (o Cloudflare cita explicitamente Googlebot, Applebot e BingBot) passam a ser bloqueados por qualquer configuração que bloqueie Training, incluindo o antigo toggle “Block AI bots”. Ou seja: se você ativar o bloqueio de treinamento, o Googlebot entra no bolo também.
Isso significa que você some do Google? Não necessariamente: o robots.txt gerenciado do Cloudflare bloqueia o Google-Extended (o token de treinamento do Google), não o Googlebot, e o Google mantém os dois usos separados. Mas com a mudança de setembro, se a sua política é “bloquear Training”, a lógica do Cloudflare é que um bot que faz as duas coisas é tratado pelo seu uso mais restritivo. Se você não quer isso, pode fazer o opt-out em Security > Settings antes de 15 de setembro e confirmar que não quer mudanças nos crawlers de Training que também fazem Search.
E atenção: o antigo toggle “Block AI bots” será descontinuado em 15 de setembro de 2026 e, aliás, nunca cobriu os bots multiuso. Se você o tinha ativado, migre para as novas políticas.
O robots.txt gerenciado do Cloudflare: a camada diplomática
Além do bloqueio pesado, o Cloudflare mantém um robots.txt gerenciado. Ele é ativado em Security > Settings, filtrando por Bot traffic, na opção Set your preference to block training in robots.txt. Segundo a documentação do robots.txt gerenciado - disponível em todos os planos - é isso que entra no início do seu robots.txt (mesclando com o seu, se você já tiver um):
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /
User-agent: Amazonbot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# ... e mais: Bytespider, CCBot, Applebot-Extended, meta-externalagent
O sinal use=reference é novo: faz parte da extensão Content Signals e significa “pode me indexar e linkar, mas não me reproduzir inteiro”. E é importante dizer com clareza: o robots.txt é voluntário. Ele expressa sua preferência e funciona como reserva de direitos (o próprio texto invoca o artigo 4 da diretiva europeia de copyright), mas um crawler sem escrúpulos pode ignorá-lo. Por isso a combinação certa é robots.txt para os bem-comportados + bloqueio real para o resto.
Um detalhe que vai aparecer para você: o Google Search Console pode reportar Syntax not understood por causa das linhas de Content Signals. O Cloudflare diz não ter observado impacto no rastreamento nem no SEO por causa desses avisos. É feio, mas inofensivo.
Como testar sem derrubar o tráfego real
Antes de ligar bloqueios pesados, faça isso:
- Meça primeiro. Em Security > Events você vê as requisições desafiadas ou bloqueadas, e com o Security Analytics filtra o tráfego de bots de IA bloqueado. Ative o bloqueio e acompanhe ali por alguns dias.
- Simule um crawler com curl trocando o user-agent. É a forma mais rápida de confirmar que a regra morde:
curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot/1.2" https://seudominio.com/
Se a política de Training estiver em Block, você deve ver um 403. Repita com um -A "Mozilla/5.0 ..." de navegador normal para confirmar que o tráfego humano continua recebendo 200.
- Use “Block on pages with ads” como passo intermediário se o seu site monetiza com publicidade e o bloqueio total te assusta: só afeta as páginas com anúncios.
- Não ative o Bot Fight Mode no escuro. Ele é gratuito e útil, mas segundo a documentação lança desafios computacionalmente caros contra padrões de bots conhecidos, pode desafiar tráfego de APIs ou apps mobile e não pode ser contornado com regras WAF: ele roda numa pipeline separada onde as ações Skip, Bypass e Allow não fazem nada. Se você precisa de exceções (seu monitor de uptime, seus clientes de API), o caminho é o Super Bot Fight Mode (pago) ou regras personalizadas.
Reforço com regras WAF personalizadas do Cloudflare
Se o painel ficar curto (você quer bloquear um crawler específico, ou desafiar em vez de bloquear), as custom rules do WAF estão disponíveis no plano gratuito: 5 regras, todas as ações menos Log, sem regex. E se busca uma alternativa auto-hospedada de WAF gratuita, dê uma olhada no SafeLine WAF. Uma regra típica para desafiar crawlers de treinamento por user-agent:
(http.user_agent contains "GPTBot") or (http.user_agent contains "ClaudeBot") or (http.user_agent contains "CCBot") or (http.user_agent contains "Bytespider")
Ação: Managed Challenge se quiser dar uma chance a clientes legítimos, Block se quiser certeza. Filtro por user-agent é falsificável, obviamente, mas como segunda camada sobre a classificação do Cloudflare ele cumpre o papel: pega os que se anunciam e deixa o trabalho fino de detecção para o motor do Cloudflare.
Minha recomendação, em resumo
Ative hoje as novas políticas: Training bloqueado em toda a zona, Search permitido, Agent conforme seu critério, e ligue o robots.txt gerenciado. Depois decida antes de 15 de setembro o que fazer com os crawlers multiuso - porque se você não decidir, o Cloudflare decide por você com os novos defaults. Seu conteúdo é seu; finalmente o painel gratuito deixa você agir como se fosse.
Perguntas frequentes
Bloquear bots de IA no Cloudflare afeta meu posicionamento no Google?
Não, se você fizer direito: deixe a categoria Search em Allow e, no que diz respeito ao Google, o robots.txt gerenciado só bloqueia o Google-Extended, o token de treinamento - não o Googlebot de busca. O detalhe chega em 15 de setembro de 2026, quando bloquear Training também vai bloquear crawlers multiuso como o Googlebot, a menos que você use o opt-out em Security Settings.
Bloquear bots de IA no Cloudflare é de graça?
Sim. As novas políticas de AI Traffic (Search, Agent, Training), o robots.txt gerenciado e o Bot Fight Mode estão disponíveis no plano gratuito. Você também tem 5 custom rules de WAF grátis caso precise de lógica sob medida.
O robots.txt basta para impedir que a IA treine com meu conteúdo?
Não. O cumprimento do robots.txt é voluntário: ele expressa sua preferência e fortalece sua posição legal, mas não impede o acesso tecnicamente. Para isso existem as políticas de bloqueio do Cloudflare, que de fato negam a requisição.



O que você achou?
Deixe sua opinião, pergunta ou sugestão. Os comentários são sincronizados com GitHub Discussions .