As novas opções de tráfego de IA da Cloudflare para clientes

Os novos controles da Cloudflare para tráfego relacionado à IA estão levantando questões sobre quem pode rastrear a web, em que პირობas, e quem acaba pagando por isso. Comentadores destacam que bloquear crawlers de “treinamento” em breve também bloqueará grandes bots de busca como o Googlebot, porque eles compartilham infraestrutura, potencialmente cortando tráfego de busca vital enquanto faz pouco para impedir scraping abusivo ou opaco. Outros temem que a Cloudflare esteja se posicionando como uma porteira e “cobradora de impostos” de facto para o acesso a conteúdo da web, enquanto defesas alternativas como esquemas de proof-of-work continuam imperfeitas e podem degradar o acesso para usuários legítimos.

Os novos controles e padrões de IA da Cloudflare

  • Robots.txt e sinais semelhantes ainda são vistos como um “sistema de honra”; muitos duvidam que os crawlers de IA os respeitem.
  • As novas opções da Cloudflare distinguem tráfego de Treinamento, Busca e Agente; alguns gostam da granularidade adicionada, outros acham que a única distinção relevante é “bot vs humano”.
  • Para novos domínios, Treinamento e Agente são bloqueados por padrão em páginas com anúncios; alguns temem perder tráfego de IA sem querer porque muitos usuários nunca alteram os padrões.

Impacto no Googlebot e no tráfego de busca

  • Uma mudança importante: crawlers de uso múltiplo (Googlebot, Applebot, Bingbot) são tratados como treinadores de IA se qualquer um de seus usos envolver treinamento, então bloquear Treinamento efetivamente os bloqueia.
  • Um usuário relata que bloquear treinamento de IA via Cloudflare reduziu pela metade o tráfego de busca do Google.
  • Debate sobre se o Googlebot causa, na prática, um DDoS: alguns dizem que ele é conservador e que a maior parte do tráfego “Googlebot” é falsa; outros relatam carga pesada vinda de IPs do Google verificados e pouca margem de recurso.

O papel da Cloudflare, incentivos e centralização

  • Alguns veem a Cloudflare como “jogando dos dois lados”: vendendo ferramentas para agentes de IA enquanto também se posiciona como porteira e futura cobradora de pedágio para pay-per-crawl.
  • Preocupações com uma “cobradora de impostos” centralizada de facto para acesso à web, potencialmente favorecendo incumbentes e elevando barreiras para novos crawlers.
  • Outros argumentam que a Cloudflare está tentando traçar um caminho intermediário, oferecendo ferramentas para permissão e compensação em vez de um bloqueio tudo-ou-nada.

Métodos de bloqueio de bots e atrito para usuários

  • Alternativas como proof-of-work (por exemplo, Anubis) são debatidas:
    • Defensores dizem que PoW efetivamente limita a taxa de grandes scrapers e preserva a privacidade.
    • Críticos dizem que bots sofisticados com navegadores headless e grandes orçamentos de computação conseguem resolver PoW em escala, e são citadas evidências de crawlers de IA se adaptando.
    • PoW pode degradar severamente a experiência em dispositivos de baixo custo; desafios da Cloudflare também podem bloquear usuários legítimos, às vezes sem um captcha visível.

Ética e viabilidade de controlar o scraping de IA

  • Alguns querem bloquear todos os bots, exceto provedores específicos de busca/IA; outros observam que o Google está reduzindo o tráfego de saída por meio de AI overviews, diminuindo os incentivos para permitir crawling.
  • Há preocupação de que bloquear “IA” também bloqueie agentes úteis controlados pelo usuário e ferramentas de acessibilidade.
  • Uma visão: tecnicamente, se o conteúdo pode ser lido de qualquer forma, ele não pode ser significativamente restringido de treinamento; promessas de separar “leitura” de “treinamento” são vistas como enganosas.
  • Ansiedade mais ampla de que movimentos unilaterais da Cloudflare e de grandes empresas de IA remodelarão os incentivos, possivelmente empurrando mais da web para trás de paywalls ou gateways fechados.