La fecha que Cloudflare anunció el 1 de julio de 2026 llegó: desde hoy, 15 de septiembre de 2026, la compañía bloquea por defecto los rastreadores de entrenamiento y de agentes de IA en las páginas que muestran publicidad. Los rastreadores de búsqueda siguen permitidos. El cambio no es un ajuste técnico menor: Cloudflare está frente a aproximadamente una quinta parte de la web, y el nuevo comportamiento por defecto redefine quién puede leer contenido publicado y bajo qué condiciones.
De un interruptor a una taxonomía de propósitos
Hasta ahora la decisión era binaria: bloquear bots de IA, o no. Cloudflare reemplazó ese interruptor por un sistema basado en el propósito del bot. Ya no pregunta si el visitante es un bot, sino para qué viene:
- Search: recopila o indexa contenido para poder responder preguntas sobre él después. Sigue permitido por defecto en todas las páginas.
- Agent: comportamiento automatizado que actúa, normalmente en tiempo real, en nombre de una persona para resolver algo ahora. Bloqueado por defecto en páginas con publicidad.
- Training: rastreo que toma contenido para entrenar o ajustar un modelo. Bloqueado por defecto en páginas con publicidad.
La taxonomía va más allá de esas tres categorías: Cloudflare también rastrea propósitos como Transact, Data Collection, Security Testing, SEO, Ads Verification, Social/Link Preview, Feed Fetching y Monitoring & Operations. Eso significa que el monitoreo de precios, la verificación publicitaria y las herramientas de disponibilidad ahora tienen carriles propios en lugar de quedar mezcladas con el entrenamiento de modelos.
El criterio de «páginas con publicidad» tiene una lógica explícita. En palabras de Cloudflare: un anuncio es la señal de que el dueño del sitio esperaba que una persona llegara ahí y lo viera. Si la página se monetiza con atención humana, un bot que consume el contenido sin entregar un humano es, por defecto, indeseado.
El problema de los rastreadores de uso mixto
El detalle más consecuente es cómo se tratan los rastreadores de uso mixto: bots que hacen indexación de búsqueda y entrenamiento de modelos bajo el mismo user agent. Googlebot, Applebot y Bingbot son los ejemplos que la propia Cloudflare cita. Bajo las nuevas reglas, un rastreador multipropósito será bloqueado por los clientes que hayan elegido bloquear Training: el rastreador hereda el trato de su propósito más restringido. Google discute esa caracterización y señala su token Google-Extended, que permite excluirse del entrenamiento sin afectar el posicionamiento en búsqueda. Cómo se resuelva ese pulso es la mayor incógnita abierta del cambio.
A quién le aplica hoy
Los nuevos valores por defecto no cambian todas las zonas existentes de un golpe. Aplican a:
- Dominios nuevos que se incorporen a Cloudflare desde hoy.
- Sitios nuevos creados por clientes existentes.
- Zonas existentes del plan gratuito (free-tier).
Los clientes de pago que no hayan tocado nada conservan su comportamiento actual, y los controles de tráfico de IA llevan semanas disponibles en la configuración de seguridad de cada panel. Pero como las zonas gratuitas sí entran en el cambio, una porción muy grande de la web de cola larga pasa hoy a ser bloqueo-por-defecto para tráfico de entrenamiento y de agentes.
Content Signals: robots.txt con consecuencias
Junto al bloqueo, Cloudflare extendió su robots.txt gestionado con una línea de preferencia legible por máquinas, del tipo Content-Signal: search=yes,ai-train=no,use=reference. El campo use declara uno de tres niveles de uso permitido: immediate (el bot puede interactuar pero no almacenar ni reutilizar), reference (el valor por defecto: indexar, citar fragmentos y enlazar de vuelta) y full (resumir y reproducir el contenido).
Dos cosas convierten esto en algo más que una sugerencia cortés. Primero, Cloudflare lo ata a la aplicación: un bot que reproduce contenido completo no puede alcanzar el estatus de Verified, y los bots no verificados caen en el grupo bloqueado por defecto. Segundo, el contexto legal cambió: con las obligaciones para IA de propósito general del Reglamento de IA de la UE exigibles desde el 2 de agosto de 2026, las exclusiones legibles por máquina adquieren peso jurídico real para quien entrena modelos con datos rastreados. Una línea en robots.txt ya no es etiqueta; ignorarla empieza a ser una responsabilidad documentada y fechada.
Identidad verificable en lugar de reputación de IP
La verificación también cambió de significado. Antes, un bot Verified quedaba permitido por defecto: la verificación era el permiso. Ahora verificación y permiso están desacoplados — «Verified» significa que un bot es admisible dentro de su categoría. Un rastreador de entrenamiento verificado sigue bloqueado en una página donde el entrenamiento está bloqueado.
Cloudflare propuso además un mecanismo de confianza transitiva para arrastrar la identidad y el propósito declarado de un bot a través de intermediarios —capas de proxy, infraestructura de agentes— usando la cabecera estándar Forwarded del RFC 7239, sobre Web Bot Auth, el esquema criptográfico de identidad de bots basado en firmas de mensajes HTTP. La señal estratégica es difícil de ignorar: los porteros de la web están migrando de la reputación de IP («¿de dónde viene esta solicitud?») a la identidad declarada y verificable («¿quién es y qué hará con el contenido?»).
Y el acceso licenciado como tercera vía
El mercado Pay Per Crawl —que permitía a los sitios cobrar por solicitud— evoluciona hacia Pay Per Use, donde los editores cobran cuando su contenido genera valor aguas abajo, no solo cuando es descargado. Para los equipos de datos, la conclusión es que «bloqueado» y «gratis» ya no son los únicos dos estados posibles de una página: el acceso licenciado a un precio se convierte en una opción de primera clase, y será cada vez más el camino conforme los valores por defecto amurallen el resto.
Qué revisar esta semana
Si su organización opera rastreadores, agentes o cualquier recolección automatizada, vale la pena un inventario rápido: qué dominios objetivo están detrás de Cloudflare, cómo se clasifica cada carga de trabajo propia dentro de la taxonomía, si un solo rastreador está mezclando varios propósitos bajo un user agent (el «problema Googlebot» en su propia casa), y si conviene declararse y solicitar verificación o presupuestar acceso licenciado. Si además opera un sitio detrás de Cloudflare, los controles ya están en su panel: decidir por categoría es hoy una decisión de negocio, no de infraestructura.
En TEKFENIX construimos software empresarial a medida e integraciones donde la identidad de quien consume una API o un contenido —humano, sistema o agente de IA— tiene que ser explícita, auditable y gobernable. Es el mismo principio que aplicamos en Servigo365, nuestra mesa de ayuda multicanal con IA, donde cada acción automatizada queda atribuida y trazable, y en CumplimientoControl, donde ese rastro se convierte en evidencia para auditoría regulatoria. Si su empresa depende de integraciones, scraping legítimo o agentes que consumen contenido de terceros, conversemos sobre cómo adaptar su arquitectura a un internet que ya no pregunta si usted es un bot, sino para qué vino.