Las nuevas opciones de tráfico de IA de Cloudflare para clientes

Los nuevos controles de Cloudflare para el tráfico relacionado con IA están generando preguntas sobre quién puede rastrear la web, en qué términos y quién termina pagando por ello. Los comentaristas señalan que bloquear rastreadores de “entrenamiento” pronto también bloqueará a grandes bots de búsqueda como Googlebot porque comparten infraestructura, lo que podría cortar un tráfico de búsqueda vital sin hacer mucho para detener el scraping abusivo u opaco. Otros temen que Cloudflare se esté posicionando como un guardián de facto y un “recaudador de impuestos” para el acceso al contenido web, mientras que defensas alternativas como los esquemas de prueba de trabajo siguen siendo imperfectas y pueden degradar el acceso para usuarios legítimos.

Los nuevos controles y valores predeterminados de IA de Cloudflare

  • Robots.txt y señales similares siguen viéndose como un sistema basado en la “buena fe”; muchos dudan de que los rastreadores de IA las respeten.
  • Las nuevas opciones de Cloudflare distinguen entre tráfico de Entrenamiento, Búsqueda y Agentes; a algunos les gusta la granularidad añadida, mientras que otros creen que la única distinción relevante es “bot vs humano”.
  • Para los nuevos dominios, Entrenamiento y Agente se bloquean por defecto en páginas con anuncios; algunos temen perder sin querer tráfico de IA porque muchos usuarios nunca cambian los valores predeterminados.

Impacto en Googlebot y el tráfico de búsqueda

  • Un cambio clave: los rastreadores multipropósito (Googlebot, Applebot, Bingbot) se tratan como entrenadores de IA si alguno de sus usos implica entrenamiento, así que bloquear Entrenamiento los bloquea de forma efectiva.
  • Un usuario informa que bloquear el entrenamiento de IA mediante Cloudflare redujo a la mitad su tráfico de búsqueda de Google.
  • Debate sobre si Googlebot causa de facto un DDoS: algunos dicen que es conservador y que la mayor parte del tráfico de “Googlebot” es falso; otros informan de una carga pesada desde IPs verificadas de Google y de pocas vías de recurso.

El papel de Cloudflare, los incentivos y la centralización

  • Algunos ven a Cloudflare como si estuviera “jugando a dos bandas”: vendiendo herramientas para agentes de IA mientras también se posiciona como guardián y futuro cobrador de peajes para el pago por rastreo.
  • Preocupaciones sobre un “recaudador de impuestos” centralizado de facto para el acceso a la web, que podría favorecer a los actores establecidos y elevar las barreras para nuevos rastreadores.
  • Otros argumentan que Cloudflare intenta trazar una vía intermedia, ofreciendo herramientas para el permiso y la compensación en lugar de un bloqueo de todo o nada.

Métodos de bloqueo de bots y fricción para el usuario

  • Se debaten alternativas como la prueba de trabajo (por ejemplo, Anubis):
    • Quienes la apoyan dicen que PoW limita eficazmente la tasa de los grandes scrapers y preserva la privacidad.
    • Quienes la critican dicen que bots sofisticados con navegadores sin interfaz y grandes presupuestos de cómputo pueden resolver PoW a escala, y se cita alguna evidencia de que los rastreadores de IA se están adaptando.
    • PoW puede degradar gravemente la experiencia en dispositivos de gama baja; los desafíos de Cloudflare también pueden bloquear a usuarios legítimos, a veces sin un captcha visible.

Ética y viabilidad de controlar el scraping de IA

  • Algunos quieren bloquear todos los bots excepto proveedores específicos de búsqueda/IA; otros señalan que Google está reduciendo el tráfico saliente mediante resúmenes de IA, lo que baja los incentivos para permitir el rastreo.
  • Hay preocupación de que bloquear “IA” también bloquee agentes útiles controlados por el usuario y herramientas de accesibilidad.
  • Una opinión: técnicamente, si un contenido es legible en absoluto, no puede restringirse de manera significativa para el entrenamiento; las promesas de separar “lectura” de “entrenamiento” se ven como engañosas.
  • Ansiedad más amplia de que movimientos unilaterales por parte de Cloudflare y las grandes empresas de IA reconfiguren los incentivos, posiblemente empujando más partes de la web detrás de muros de pago o puertas de acceso cerradas.