Cloudflare permite a las webs aceptar Google Search pero bloquear el entrenamiento de IA
Cloudflare separa Search, Training y Agent para que una web pueda seguir indexándose en Google mientras rechaza el uso de su contenido para entrenar IA.
Cloudflare ha cambiado la forma en que permite a los propietarios de sitios web controlar los bots de inteligencia artificial. Desde el 15 de septiembre de 2026, la compañía separa con mayor claridad tres usos diferentes del rastreo automatizado: Search, Training y Agent. Esto permite mantener abierta una web para los buscadores tradicionales mientras se rechaza el uso de su contenido para entrenar modelos de IA.
La novedad es especialmente importante para bots que cumplen varias funciones al mismo tiempo. Un sitio ya no tiene que elegir necesariamente entre permitir que Google lo indexe o bloquear cualquier uso de su contenido para entrenamiento. Cloudflare ha introducido una opción denominada Disallow AI Training diseñada precisamente para mantener la visibilidad en buscadores compatibles mientras se expresa una negativa al entrenamiento.
Cloudflare ya no trata todo el tráfico de IA como una única categoría
Cloudflare clasifica ahora los bots según lo que hacen realmente cuando acceden a una web. Los tres controles principales son:
- Search: rastreadores que recopilan o indexan contenido para construir un índice de búsqueda.
- Training: bots que obtienen contenido para entrenar o ajustar un modelo de inteligencia artificial.
- Agent: agentes que visitan páginas en tiempo real en nombre de una persona, como asistentes que recuperan información o herramientas capaces de navegar por Internet.
Estas categorías se pueden controlar por separado desde los ajustes de seguridad de Cloudflare.
La distinción pretende resolver un problema cada vez más habitual: una web puede querer aparecer en Google, Bing o servicios de búsqueda con IA y, al mismo tiempo, no autorizar que sus artículos se incorporen al entrenamiento de futuros modelos.
Bloquear el entrenamiento ya no implica necesariamente desaparecer de Google
El cambio más relevante es la nueva opción Disallow AI Training.
Cuando se activa para Training, Cloudflare utiliza Bot Preference Sync para publicar en robots.txt la preferencia correspondiente contra el entrenamiento. Los rastreadores de uso mixto que Cloudflare considera compatibles con este sistema pueden seguir entrando para realizar búsquedas sin utilizar ese contenido para entrenar modelos.
Google es uno de los ejemplos principales. Su infraestructura permite expresar una preferencia separada mediante Google-Extended. Google ha indicado que impedir el uso mediante Google-Extended no afecta al posicionamiento en la búsqueda tradicional.
Por tanto, activar la opción adecuada en Cloudflare no equivale a bloquear Googlebot. Su objetivo es precisamente permitir la función de búsqueda y excluir el entrenamiento cuando el operador del crawler admite esa separación.
Bloquear Training completamente sí puede afectar a Googlebot
Hay una diferencia importante entre Disallow AI Training y seleccionar directamente Block.
Cloudflare considera que Googlebot, Applebot y Bingbot pueden realizar más de un tipo de actividad. Desde el 15 de septiembre, las opciones de bloqueo completo se aplican también a estos crawlers de uso mixto.
Si el propietario selecciona Block para Training, Cloudflare puede bloquear al crawler completo. En el caso de Googlebot, eso puede afectar también al rastreo utilizado por Google Search.
Por esa razón, Cloudflare recomienda utilizar Disallow AI Training cuando el objetivo sea impedir el entrenamiento pero conservar la indexación.
Qué ocurre con los bots que separan búsqueda y entrenamiento
No todas las compañías utilizan un único crawler para ambas funciones.
Cloudflare identifica, por ejemplo, rastreadores distintos de OpenAI para diferentes usos:
- GPTBot: asociado al rastreo para modelos.
- OAI-SearchBot: asociado a búsqueda.
- ChatGPT-User: utilizado cuando ChatGPT accede a una página en nombre de un usuario.
Anthropic dispone igualmente de crawlers separados como ClaudeBot, Claude-SearchBot y Claude-User.
En esos casos, bloquear el crawler dedicado al entrenamiento no obliga a bloquear el destinado a búsqueda porque son técnicamente identificables por separado.
Google, Apple y Microsoft son crawlers de uso mixto
El caso resulta más complicado cuando una misma infraestructura de rastreo tiene varias finalidades.
Cloudflare incluye a Googlebot, Applebot y Bingbot entre sus ejemplos de crawlers de uso mixto. Para evitar que una negativa al entrenamiento perjudique también a Search, Cloudflare ha creado una categoría denominada Accountable para operadores que ofrecen o se han comprometido a ofrecer mecanismos que permitan separar esos usos.
Google ya permite excluir el uso para determinados sistemas de IA mediante Google-Extended sin afectar a la búsqueda tradicional.
Apple cuenta con Applebot-Extended para expresar preferencias relacionadas con entrenamiento.
Microsoft utiliza actualmente otros controles, como NOARCHIVE, y ha comunicado a Cloudflare que pretende añadir soporte para una preferencia de no entrenamiento mediante robots.txt a principios de 2027.
Esto introduce un matiz importante: no todos los operadores implementan hoy exactamente el mismo mecanismo ni se encuentran en la misma fase.
Qué cambia para las webs nuevas desde el 15 de septiembre
Cloudflare también ha cambiado las configuraciones recomendadas cuando un nuevo dominio se incorpora a su plataforma.
El ajuste depende de si el sitio declara que obtiene ingresos mediante publicidad.
Para una nueva web sin publicidad, la configuración recomendada es:
- Search: permitido.
- Training: permitido.
- Agent: permitido.
- Bot Preference Sync: activado.
En una nueva web monetizada mediante anuncios, Cloudflare propone una configuración más restrictiva:
- Search: permitido.
- Training: Disallow AI Training.
- Agent: bloqueado en las páginas que muestran anuncios.
- Bot Preference Sync: activado.
Estos son valores recomendados durante la incorporación. El propietario puede modificarlos durante la configuración inicial o posteriormente.
Qué ocurre con las webs que ya utilizaban Cloudflare
Cloudflare no está restableciendo indiscriminadamente las preferencias de todos los clientes existentes. La compañía migra las configuraciones anteriores a los nuevos controles intentando conservar su efecto.
Una web que nunca utilizó los controles granulares pero tenía desactivado el antiguo Block AI Bots migra a:
- Search: Allow.
- Training: Allow.
- Agent: Allow.
Si una web tenía activado el antiguo Block AI Bots, Cloudflare la migra a:
- Search: Allow.
- Training: Disallow AI Training.
- Agent: Block on pages with ads.
Lo mismo ocurre con quienes utilizaban anteriormente la opción de bloquear bots de IA únicamente en páginas con publicidad.
Estas reglas de migración se aplican según la configuración previa del dominio, no simplemente por pertenecer al plan Free. Los nuevos controles están disponibles en todos los planes, incluido el gratuito.
El antiguo botón «Block AI Bots» desaparece
Cloudflare está retirando progresivamente la configuración genérica Block AI Bots en favor de estos controles independientes.
La razón es que un único interruptor se había vuelto demasiado impreciso. Bajo la etiqueta «IA» pueden existir bots con objetivos muy diferentes: uno puede enviar tráfico desde un buscador, otro recopilar millones de páginas para entrenar un modelo y un tercero visitar una URL porque un usuario acaba de pedírselo a un asistente.
Cloudflare quiere que los propietarios puedan tomar una decisión diferente para cada caso.
También cambia el tratamiento de los crawlers que hacen Search y Training a la vez
Antes del cambio, la antigua opción Block AI Bots excluía determinados crawlers mixtos para evitar que bloquear el entrenamiento provocase accidentalmente la desaparición de una web de los buscadores.
Desde el 15 de septiembre las reglas son más estrictas. Las opciones Block y Block on pages with ads se aplican también a crawlers que combinan Search y Training.
Esto significa que, si un propietario quiere bloquear completamente uno de estos bots, Cloudflare ya no lo exceptúa automáticamente por tener también una función de búsqueda.
Al mismo tiempo, Disallow AI Training proporciona la alternativa para conservar Search cuando el operador admite una preferencia separada de no entrenamiento.
Search seguirá permitido por defecto
Cloudflare afirma que menos del 1% de los sitios de su red deciden bloquear los bots de búsqueda, mientras que aproximadamente un 17% utiliza algún mecanismo para limitar el entrenamiento de modelos.
Estas diferencias son una de las razones por las que la compañía mantiene Search permitido en las nuevas configuraciones recomendadas.
Para muchas webs, especialmente medios, comercios y servicios online, impedir completamente el rastreo de Google o Bing puede reducir significativamente el tráfico procedente de búsquedas.
Cloudflare intenta evitar que una decisión sobre IA termine provocando de forma inadvertida un problema de SEO.
Los agentes de IA tienen su propio control
La tercera categoría es Agent. Aquí Cloudflare incluye sistemas que visitan una web en tiempo real para realizar una acción solicitada por una persona.
Puede tratarse de un chatbot que necesita consultar una URL, un agente que compara productos o una herramienta de navegación automatizada.
Cloudflare permite:
- Permitir estos agentes.
- Bloquearlos en todo el dominio.
- Bloquearlos únicamente en páginas donde detecte publicidad.
A diferencia de Training, actualmente no existe una opción equivalente a Disallow AI Training para Agent porque, según Cloudflare, todavía no hay un estándar suficientemente establecido para expresar esa preferencia a este tipo de bots.
Por qué Cloudflare presta especial atención a las páginas con anuncios
Las configuraciones recomendadas son más restrictivas cuando una página contiene publicidad.
El razonamiento de Cloudflare es que el modelo económico de esos sitios depende normalmente de que una persona visite la página y vea el anuncio.
Un bot de entrenamiento puede obtener el contenido sin generar esa visita. Un agente también puede recuperar la información y entregársela directamente al usuario sin que este abra la web.
Search, en cambio, tiene como función principal indexar la página y potencialmente enviar posteriormente usuarios hacia ella. Por eso Cloudflare deja Search permitido en sus presets.
Los controles están disponibles también en el plan gratuito
La separación entre Search, Training y Agent está disponible para todos los clientes de Cloudflare, incluidos los dominios del plan Free.
En los planes gratuitos, la detección de crawlers de AI Crawl Control depende principalmente de cadenas de User-Agent de bots conocidos y que se identifican a sí mismos.
Los clientes con Bot Management empresarial disponen de mecanismos adicionales de detección que permiten identificar tráfico mediante señales más avanzadas.
Por tanto, la capacidad de configurar la política existe en todos los planes, aunque la profundidad de detección no es idéntica.
Cómo configurar Search, Training y Agent en Cloudflare
Los propietarios de una web pueden revisar los controles desde el panel de Cloudflare.
- Inicia sesión en Cloudflare.
- Selecciona el dominio que quieres configurar.
- Abre Security Settings.
- Busca Configure AI bot policies.
- Revisa por separado Search, Training y Agent.
Si quieres continuar apareciendo en buscadores pero impedir el entrenamiento, la configuración relevante es mantener Search en Allow y seleccionar Disallow AI Training para Training.
No conviene seleccionar Block para Googlebot, Applebot o Bingbot sin entender las consecuencias, porque un bloqueo completo también puede impedir que esos crawlers realicen su función de búsqueda.
Cloudflare intenta separar SEO y entrenamiento de IA
El cambio del 15 de septiembre no consiste en que Cloudflare haya decidido bloquear Google. Es precisamente lo contrario: la compañía intenta que los propietarios de webs puedan decir sí a la búsqueda y no al entrenamiento de modelos sin tener que utilizar una única regla para ambas cosas.
La separación todavía depende de que los operadores de crawlers respeten o implementen mecanismos que distingan cada finalidad. Google y Apple ya ofrecen controles específicos para entrenamiento, mientras Microsoft se ha comprometido a ampliar su soporte.
Para los propietarios de sitios web, el resultado es un sistema considerablemente más granular que el antiguo interruptor genérico de Block AI Bots: Search, Training y Agent pueden recibir ahora políticas diferentes según el valor o el coste que cada tipo de rastreo tenga para la web.