Si tienes un dominio detrás de Cloudflare, crawlers de OpenAI, Anthropic, Google y media docena más están leyendo tu web a diario, y hasta hace nada decidir qué hacer con ellos era un drama: o los bloqueabas todos con el botón de “Block AI bots” (y te cargabas cosas que no querías), o dejabas pasar todo. Desde el 1 de julio de 2026 Cloudflare ha publicado una nueva taxonomía y nuevos controles de tráfico de IA para todos los planes, incluido el gratuito, y por fin puedes decidir con precisión: quiero aparecer en buscadores, pero no quiero que entrenen modelos con mi contenido.
Te explico dónde está cada opción, qué hace exactamente y cómo probarlo sin liarla con tu tráfico real.
Las tres categorías que ahora puedes controlar
La novedad de fondo es que Cloudflare ha dejado de tratar “bot de IA” como una cosa única. Según la documentación de Block AI Bots, ahora los clasifica por comportamiento:
- Search: crawlers que indexan tu contenido para responder preguntas sobre él después. Es el tráfico que te devuelve visitas.
- Agent: automatismos que actúan en tiempo real en nombre de una persona: los bots de fetch de ChatGPT (
ChatGPT-User), agentes que manejan un navegador, etc. - Training: crawlers que se llevan tu contenido para entrenar o hacer fine-tuning de un modelo. Incluye los crawlers multi-propósito que hacen búsqueda y entrenamiento a la vez.
Cada categoría se configura por separado y tiene tres opciones:
- Block (on all pages): bloquea en toda la zona.
- Block on pages with ads: bloquea solo en las páginas donde Cloudflare detecta anuncios (la idea: donde hay publicidad, lo que monetiza es la atención humana).
- Allow (do not block): no bloquea nada.
El bloqueo aplica tanto a bots verificados clasificados con ese comportamiento como a bots no verificados que se comportan igual, así que no se libra el que simplemente no se haya registrado.
Dónde se configura
Todo está en el mismo sitio: entra en tu zona y ve a Security > Settings, filtra por Bot traffic y abre Configure AI bot policies. La doc oficial lo confirma. Si quieres verlo antes de entrar, aquí tienes una captura del panel tal cual está ahora, con las opciones de Search, Agent y Training.
Mi configuración recomendada para un blog o web de contenido: Training en Block (all pages), Search en Allow y Agent en Block si no te interesa que los asistentes lean tu web en tiempo real, o en Allow si quieres aparecer en las respuestas de ChatGPT y compañía. Ahí ya es decisión editorial tuya.
Si quieres ver otra cara de Cloudflare para trabajar con contenido, también expliqué cómo Cloudflare puede scrapear webs enteras por ti con una llamada.
El aviso importante: el 15 de septiembre de 2026 cambian los defaults
Esto es lo que más gente se va a comer sin darse cuenta. Según Cloudflare, el 15 de septiembre de 2026 entrarán nuevos valores por defecto para los dominios nuevos: Training y Agent quedarán bloqueados en las páginas con anuncios, y Search seguirá permitido.
Pero hay un segundo cambio más delicado: los crawlers multi-propósito que combinan búsqueda y entrenamiento (Cloudflare nombra explícitamente a Googlebot, Applebot y BingBot) pasarán a ser bloqueados por cualquier configuración que bloquee Training, incluido el antiguo toggle de “Block AI bots”. Es decir: si activas el bloqueo de entrenamiento, Googlebot también entra en el saco.
¿Significa eso que desapareces de Google? No necesariamente: el robots.txt gestionado de Cloudflare bloquea Google-Extended (el token de entrenamiento de Google), no Googlebot, y Google mantiene separados ambos usos. Pero con el cambio de septiembre, si tu política es “bloquear Training”, el razonamiento de Cloudflare es que un bot que hace las dos cosas se trata por su uso más restrictivo. Si no quieres ese comportamiento, puedes marcar el opt-out en Security > Settings antes del 15 de septiembre y confirmar que no quieres cambios en los crawlers de Training que también hacen Search.
Y ojo: el viejo toggle “Block AI bots” se depreca el 15 de septiembre de 2026 y, además, nunca cubrió los bots multi-propósito. Si lo tenías activado, migra a las nuevas políticas.
El robots.txt gestionado de Cloudflare: la capa diplomática
Aparte del bloqueo duro, Cloudflare mantiene un robots.txt gestionado. Se activa en Security > Settings, filtrando por Bot traffic, en la opción Set your preference to block training in robots.txt. Según la documentación del robots.txt gestionado, disponible en todos los planes, esto es lo que añade al principio de tu robots.txt (fusionándose con el tuyo si ya tienes uno):
User-Agent: *
Content-signal: search=yes, ai-train=no, use=reference
Allow: /
User-agent: Amazonbot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# ... y más: Bytespider, CCBot, Applebot-Extended, meta-externalagent
La señal use=reference es nueva: forma parte de la extensión Content Signals y dice “puedes indexarme y enlazarme, pero no reproducirme entero”. Importante y hay que decirlo claro: el robots.txt es voluntario. Expresa tu preferencia y sirve como reserva de derechos (el propio texto invoca el artículo 4 de la directiva europea de copyright), pero un crawler sin escrúpulos puede ignorarlo. Por eso la combinación correcta es robots.txt para los que cumplen + bloqueo real para el resto.
Un detalle que te va a saltar: Google Search Console puede reportar Syntax not understood por las líneas de Content Signals. Cloudflare dice no haber observado impacto en rastreo ni SEO por esos avisos. Es feo, pero inofensivo.
Cómo probarlo sin cargarte el tráfico real
Antes de activar bloqueos a lo bruto, haz esto:
- Mide primero. En Security > Events puedes ver las peticiones desafiadas o bloqueadas, y con Security Analytics filtras el tráfico de bots de IA bloqueado. Activa el bloqueo y vigila ahí durante unos días.
- Simula un crawler con curl cambiando el user-agent. Es la forma más rápida de comprobar que la regla muerde:
curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot/1.2" https://tudominio.com/
Si la política de Training está en Block, deberías ver un 403. Repite con -A "Mozilla/5.0 ..." de un navegador normal para confirmar que el tráfico humano sigue viendo un 200.
- Usa “Block on pages with ads” como paso intermedio si tu web se monetiza con publicidad y te da miedo el bloqueo total: solo afecta a las páginas con anuncios.
- No actives Bot Fight Mode a ciegas. Es gratuito y útil, pero según su documentación lanza desafíos computacionales a patrones de bots conocidos, puede desafiar tráfico de APIs o apps móviles, y no se puede exceptuar con reglas WAF: opera en una pipeline separada donde las acciones Skip, Bypass y Allow no hacen nada. Si necesitas excepciones (tu monitor de uptime, tus clientes de API), lo tuyo es Super Bot Fight Mode (de pago) o reglas personalizadas.
Refuerzo con reglas WAF personalizadas de Cloudflare
Si el panel se te queda corto (quieres bloquear un crawler concreto, o desafiar en vez de bloquear), las custom rules del WAF están disponibles en el plan gratuito: 5 reglas, todas las acciones menos Log, sin regex. Y si buscas una alternativa autoalojada a un WAF gratuito, también tienes SafeLine WAF. Una regla típica para desafiar crawlers de entrenamiento por user-agent:
(http.user_agent contains "GPTBot") or (http.user_agent contains "ClaudeBot") or (http.user_agent contains "CCBot") or (http.user_agent contains "Bytespider")
Acción: Managed Challenge si quieres dar una oportunidad a clientes legítimos, Block si vas a lo seguro. El filtro por user-agent es falsificable, obviamente, pero como segunda capa sobre la clasificación de Cloudflare cumple su papel: caza a los que se anuncian y deja el trabajo fino de detección al motor de Cloudflare.
Mi recomendación, en corto
Activa hoy las nuevas políticas: Training bloqueado en toda la zona, Search permitido, Agent según tu criterio, y enciende el robots.txt gestionado. Luego decide antes del 15 de septiembre qué hacer con los crawlers multi-propósito, porque si no decides tú, Cloudflare decide por ti con los nuevos defaults. Tu contenido es tuyo; por fin el panel gratis te deja actuar como si lo fuera.
Preguntas frecuentes
¿Bloquear bots de IA en Cloudflare afecta a mi posicionamiento en Google?
No si lo haces bien: deja la categoría Search en Allow y, en lo que toca a Google, el robots.txt gestionado solo bloquea Google-Extended, el token de entrenamiento, no el Googlebot de búsqueda. El matiz llega el 15 de septiembre de 2026, cuando bloquear Training también bloqueará crawlers multi-propósito como Googlebot salvo que uses el opt-out de Security Settings.
¿Es gratis bloquear los bots de IA en Cloudflare?
Sí. Las nuevas políticas de AI Traffic (Search, Agent, Training), el robots.txt gestionado y Bot Fight Mode están disponibles en el plan gratuito. Además tienes 5 custom rules de WAF gratis por si necesitas reglas a medida.
¿El robots.txt basta para que la IA no entrene con mi contenido?
No. El cumplimiento del robots.txt es voluntario: expresa tu preferencia y refuerza tu posición legal, pero no impide técnicamente el acceso. Para eso están las políticas de bloqueo de Cloudflare, que sí deniegan la petición.


¿Qué te ha parecido?
Déjame tu opinión, pregunta o sugerencia. Los comentarios se sincronizan con GitHub Discussions .