O que aconteceu com TheNumbers.com

Scraping da web impulsionado por IA e arbitragem em mercados de previsão estão sobrecarregando pequenos sites ricos em dados, como o banco de dados de bilheteria TheNumbers.com, empurrando os custos de banda e infraestrutura além do que operadores de hobby ou com pouco financiamento conseguem sustentar. Comentadores debatem se melhor cache, CDNs e reescritas para sites estáticos podem resolver o problema, ou se a questão central é que empresas de IA e plataformas de apostas externalizam custos enquanto monetizam dados raspados. Muitos temem que essa dinâmica empurre mais informações valiosas para paywalls ou as retire completamente do ar, enfraquecendo a web aberta e os recursos mantidos por voluntários.

Múltiplos problemas sobrepostos

  • Comentadores observam que o artigo mistura questões:
    – Tráfego excessivo de bots e custo de banda
    – Scraping que contorna acesso pago/licenciado
    – Risco de segurança de invasores sondando por dados antecipados/priviligiados
  • Alguns acham que este é um caso de nicho (base de código antiga, dados de nicho, ângulo de mercado de previsão) em vez de uma história geral de “a IA matou a web”; outros veem isso como emblemático.

Ideias de mitigação técnica e limitações

  • Muitos sugerem reconstruções de sites estáticos, cache pesado (Varnish/CDNs) ou proteção no estilo Cloudflare; alguns afirmam que isso é quase um “projeto de fim de semana” com ferramentas modernas e ajuda de LLMs.
  • Contraponto:
    – Estático/cache não resolve o modelo de negócio se bots extraem todo o valor.
    – Egress de cloud/CDN pode ser ruinoso sob carga de scrapers; exemplos incluem dezenas de TBs de HTML e contas mensais acima de US$1 mil para sites de hobby.
    – Bots com proxy residencial e navegadores headless ignoram robots.txt e são difíceis de bloquear.
    – Invalidação de cache e endpoints de busca dinâmicos continuam fundamentalmente difíceis.

Economia, modelos de negócio e incentivos

  • TheNumbers aparentemente depende mais de vendas de dados privados do que de anúncios; bots não clicam em anúncios nem pagam.
  • Vários esperam que mais conteúdo vá para paywalls ou migre para plataformas de dados hospedadas, ou simplesmente desapareça.
  • Alguns sugerem infraestrutura de micro-pagamento ou “bots têm que pagar”; outros são céticos de que isso possa funcionar social ou tecnicamente.

Mercados de previsão como motor

  • Muitos veem mercados de previsão não regulamentados como o principal incentivo para scraping abusivo e até hacking para ficar na frente de lançamentos de dados.
  • Soluções propostas: bloquear negociações antes do fechamento, ou proibir totalmente tais mercados; contraponto: competição e a indiferença dos usuários à justiça tornam improvável a autorregulação.

Ética do scraping e do treinamento de IA

  • Forte divisão:
    – Um lado: se você publica abertamente, não deveria controlar quem/o que consome isso; treinamento de IA é apenas outro uso.
    – Outro lado: ter trabalho gratuito sugado para modelos proprietários parece exploratório e desencoraja futuras contribuições abertas, especialmente quando a IA devolve quase nenhum tráfego e impõe custos reais.
  • Alguns discutem novas licenças (por exemplo, variantes de GPL/AGPL) para restringir o treinamento, com ceticismo de que seriam executáveis se o treinamento for considerado uso justo.

Futuro da web aberta

  • Preocupação generalizada de que scrapers de IA “socializam os custos, privatizam os lucros” e aceleram o declínio de recursos abertos e de hobby.
  • Outros veem a IA como uma ferramenta poderosa que também pode ajudar a proteger e modernizar esses sites, se os mantenedores escolherem usá-la.