O que aconteceu com TheNumbers.com
Scraping da web impulsionado por IA e arbitragem em mercados de previsão estão sobrecarregando pequenos sites ricos em dados, como o banco de dados de bilheteria TheNumbers.com, empurrando os custos de banda e infraestrutura além do que operadores de hobby ou com pouco financiamento conseguem sustentar. Comentadores debatem se melhor cache, CDNs e reescritas para sites estáticos podem resolver o problema, ou se a questão central é que empresas de IA e plataformas de apostas externalizam custos enquanto monetizam dados raspados. Muitos temem que essa dinâmica empurre mais informações valiosas para paywalls ou as retire completamente do ar, enfraquecendo a web aberta e os recursos mantidos por voluntários.
Múltiplos problemas sobrepostos
- Comentadores observam que o artigo mistura questões:
– Tráfego excessivo de bots e custo de banda
– Scraping que contorna acesso pago/licenciado
– Risco de segurança de invasores sondando por dados antecipados/priviligiados - Alguns acham que este é um caso de nicho (base de código antiga, dados de nicho, ângulo de mercado de previsão) em vez de uma história geral de “a IA matou a web”; outros veem isso como emblemático.
Ideias de mitigação técnica e limitações
- Muitos sugerem reconstruções de sites estáticos, cache pesado (Varnish/CDNs) ou proteção no estilo Cloudflare; alguns afirmam que isso é quase um “projeto de fim de semana” com ferramentas modernas e ajuda de LLMs.
- Contraponto:
– Estático/cache não resolve o modelo de negócio se bots extraem todo o valor.
– Egress de cloud/CDN pode ser ruinoso sob carga de scrapers; exemplos incluem dezenas de TBs de HTML e contas mensais acima de US$1 mil para sites de hobby.
– Bots com proxy residencial e navegadores headless ignoram robots.txt e são difíceis de bloquear.
– Invalidação de cache e endpoints de busca dinâmicos continuam fundamentalmente difíceis.
Economia, modelos de negócio e incentivos
- TheNumbers aparentemente depende mais de vendas de dados privados do que de anúncios; bots não clicam em anúncios nem pagam.
- Vários esperam que mais conteúdo vá para paywalls ou migre para plataformas de dados hospedadas, ou simplesmente desapareça.
- Alguns sugerem infraestrutura de micro-pagamento ou “bots têm que pagar”; outros são céticos de que isso possa funcionar social ou tecnicamente.
Mercados de previsão como motor
- Muitos veem mercados de previsão não regulamentados como o principal incentivo para scraping abusivo e até hacking para ficar na frente de lançamentos de dados.
- Soluções propostas: bloquear negociações antes do fechamento, ou proibir totalmente tais mercados; contraponto: competição e a indiferença dos usuários à justiça tornam improvável a autorregulação.
Ética do scraping e do treinamento de IA
- Forte divisão:
– Um lado: se você publica abertamente, não deveria controlar quem/o que consome isso; treinamento de IA é apenas outro uso.
– Outro lado: ter trabalho gratuito sugado para modelos proprietários parece exploratório e desencoraja futuras contribuições abertas, especialmente quando a IA devolve quase nenhum tráfego e impõe custos reais. - Alguns discutem novas licenças (por exemplo, variantes de GPL/AGPL) para restringir o treinamento, com ceticismo de que seriam executáveis se o treinamento for considerado uso justo.
Futuro da web aberta
- Preocupação generalizada de que scrapers de IA “socializam os custos, privatizam os lucros” e aceleram o declínio de recursos abertos e de hobby.
- Outros veem a IA como uma ferramenta poderosa que também pode ajudar a proteger e modernizar esses sites, se os mantenedores escolherem usá-la.