As novas opções de tráfego de IA da Cloudflare para clientes
Os novos controles da Cloudflare para tráfego relacionado à IA estão levantando questões sobre quem pode rastrear a web, em que პირობas, e quem acaba pagando por isso. Comentadores destacam que bloquear crawlers de “treinamento” em breve também bloqueará grandes bots de busca como o Googlebot, porque eles compartilham infraestrutura, potencialmente cortando tráfego de busca vital enquanto faz pouco para impedir scraping abusivo ou opaco. Outros temem que a Cloudflare esteja se posicionando como uma porteira e “cobradora de impostos” de facto para o acesso a conteúdo da web, enquanto defesas alternativas como esquemas de proof-of-work continuam imperfeitas e podem degradar o acesso para usuários legítimos.
Os novos controles e padrões de IA da Cloudflare
- Robots.txt e sinais semelhantes ainda são vistos como um “sistema de honra”; muitos duvidam que os crawlers de IA os respeitem.
- As novas opções da Cloudflare distinguem tráfego de Treinamento, Busca e Agente; alguns gostam da granularidade adicionada, outros acham que a única distinção relevante é “bot vs humano”.
- Para novos domínios, Treinamento e Agente são bloqueados por padrão em páginas com anúncios; alguns temem perder tráfego de IA sem querer porque muitos usuários nunca alteram os padrões.
Impacto no Googlebot e no tráfego de busca
- Uma mudança importante: crawlers de uso múltiplo (Googlebot, Applebot, Bingbot) são tratados como treinadores de IA se qualquer um de seus usos envolver treinamento, então bloquear Treinamento efetivamente os bloqueia.
- Um usuário relata que bloquear treinamento de IA via Cloudflare reduziu pela metade o tráfego de busca do Google.
- Debate sobre se o Googlebot causa, na prática, um DDoS: alguns dizem que ele é conservador e que a maior parte do tráfego “Googlebot” é falsa; outros relatam carga pesada vinda de IPs do Google verificados e pouca margem de recurso.
O papel da Cloudflare, incentivos e centralização
- Alguns veem a Cloudflare como “jogando dos dois lados”: vendendo ferramentas para agentes de IA enquanto também se posiciona como porteira e futura cobradora de pedágio para pay-per-crawl.
- Preocupações com uma “cobradora de impostos” centralizada de facto para acesso à web, potencialmente favorecendo incumbentes e elevando barreiras para novos crawlers.
- Outros argumentam que a Cloudflare está tentando traçar um caminho intermediário, oferecendo ferramentas para permissão e compensação em vez de um bloqueio tudo-ou-nada.
Métodos de bloqueio de bots e atrito para usuários
- Alternativas como proof-of-work (por exemplo, Anubis) são debatidas:
- Defensores dizem que PoW efetivamente limita a taxa de grandes scrapers e preserva a privacidade.
- Críticos dizem que bots sofisticados com navegadores headless e grandes orçamentos de computação conseguem resolver PoW em escala, e são citadas evidências de crawlers de IA se adaptando.
- PoW pode degradar severamente a experiência em dispositivos de baixo custo; desafios da Cloudflare também podem bloquear usuários legítimos, às vezes sem um captcha visível.
Ética e viabilidade de controlar o scraping de IA
- Alguns querem bloquear todos os bots, exceto provedores específicos de busca/IA; outros observam que o Google está reduzindo o tráfego de saída por meio de AI overviews, diminuindo os incentivos para permitir crawling.
- Há preocupação de que bloquear “IA” também bloqueie agentes úteis controlados pelo usuário e ferramentas de acessibilidade.
- Uma visão: tecnicamente, se o conteúdo pode ser lido de qualquer forma, ele não pode ser significativamente restringido de treinamento; promessas de separar “leitura” de “treinamento” são vistas como enganosas.
- Ansiedade mais ampla de que movimentos unilaterais da Cloudflare e de grandes empresas de IA remodelarão os incentivos, possivelmente empurrando mais da web para trás de paywalls ou gateways fechados.