Um ano lutando contra scrapers no meu site de 1,5 milhão de páginas
Editores da web relatam que a grande maioria do tráfego agora vem de bots — especialmente crawlers de IA e scrapers mal escritos —, o que pode saturar a largura de banda, distorcer análises e inflar contas de hospedagem, enquanto envia pouco ou nenhum tráfego humano em troca. Comentadores descrevem uma variedade de defesas, de Cloudflare, bloqueio geográfico e desafios de prova de trabalho até hospedagem estática e regras agressivas de firewall, mas observam que isso muitas vezes prejudica usuários legítimos e centraliza ainda mais a web. Por trás disso está um conflito mais amplo entre preservar uma internet aberta e legível por máquinas e proteger pequenos sites de serem efetivamente DDoSados e minerados de dados sem compensação.
Escala e Natureza do Tráfego de Bots
- Muitos operadores relatam que 95–99,9% do tráfego é de bots, especialmente crawlers de IA de grandes empresas dos EUA e da China e redes de proxies residenciais.
- Os bots ხშირად se comportam mal: revarrem páginas inalteradas, percorrem calendários infinitos, martelam endpoints caros, investigam segredos (.env, chaves, Dockerfiles).
- Alguns suspeitam que a repetição de buscas se deve a agentes mal escritos e a atitudes alimentadas por venture capital de “raspar tudo”, e não a consultas orientadas por usuários.
Impacto em Pequenos Sites e Hospedagem
- Vários relatam que sites de hobby ou nicho, antes baratos, tornaram-se insustentáveis à medida que a largura de banda e a carga no banco de dados aumentam em ordens de grandeza, com pouca ou nenhuma receita.
- Outros contrapõem que um site estático bem construído ou um site dinâmico com cache eficiente em um VPS de US$ 4–5 consegue lidar facilmente com os níveis atuais de bots; os problemas muitas vezes estão em stacks lentas ou consultas caras ao banco de dados.
Defesas e Seus Trade-offs
- Táticas comuns:
- CDN/WAF na frente (Cloudflare etc.), incluindo novos recursos de “bloquear bots de IA” e pay‑per‑crawl.
- Bloqueio geográfico ou CAPTCHAs para certos países/ASNs e provedores de nuvem.
- Prova de trabalho / desafios JavaScript (por exemplo, Anubis), verificações de cookies, heurísticas de cabeçalhos HTTP, fingerprinting de TLS.
- Colocar o conteúdo atrás de logins ou paywalls; pré-gerar páginas estáticas.
- Sistemas de prova de trabalho geram debate: críticos mostram que eles são triviais de contornar com solucionadores nativos/CUDA; defensores dizem que ainda assim impedem a grande maioria dos scrapers pouco sofisticados e são menos irritantes do que CAPTCHAs.
- Falsos positivos são reais: navegadores com foco em privacidade, usuários sem JavaScript, usuários de VPN e sistemas antigos são bloqueados ou atrasados, às vezes permanentemente.
Centralização, Web Aberta e Ferramentas
- A forte dependência de Cloudflare e similares é vista por alguns como proteção necessária; outros veem isso como transformar a web em jardins murados controlados por alguns poucos porteiros.
- Alguns argumentam que o “contrato social” da web inclui bots e agentes de usuário alternativos; outros dizem que esse contrato nunca cobriu treinamento de LLM em escala.
- Muitos observam que crawlers de IA enviam tráfego de referência negligenciável enquanto extraem alto valor, o que leva a pedidos de pagamento ou restrições legais/técnicas mais fortes.
- São mencionados sinais de conteúdo do robots.txt e reservas de direitos autorais da UE, mas sua real aplicabilidade permanece incerta.
- Um padrão crescente: pessoas encerrando ou removendo do índice sites de hobby, ou tolerando apenas tráfego humano, mesmo que isso signifique aceitar alguma inconveniência para os usuários.