Google fechou um acordo com o Reddit para dados de treinamento de IA

O acordo de US$60M por ano do Google para licenciar dados do Reddit para treinamento de IA está gerando debate sobre quem deveria se beneficiar quando conteúdo gerado por usuários é monetizado. Comentadores questionam se o acervo de posts do Reddit é realmente de alta qualidade ou fortemente astroturfado, e se essa medida irá corroer ainda mais a “internet aberta” ao empurrar mais conversas para espaços privados ou com paywall. Outros observam que os termos de serviço do Reddit já permitem amplo reuso do conteúdo, enquadram o acordo como monetização impulsionada pelo IPO semelhante à venda de anúncios, e se preocupam com o fato de os contribuintes não verem nenhum retorno financeiro.

Tamanho do Acordo, Valor e Exclusividade

  • Muitos veem US$60M/ano como barato dada a centralidade do Reddit na busca e sua planejada avaliação de IPO de US$5B; alguns estimam que as consultas do Reddit representam uma grande parte do próprio uso do Google.
  • Outros argumentam que não se pode comparar taxas anuais de licença ao valor total da empresa; o Reddit pode revender dados para muitos fornecedores de IA.
  • Vários sugerem que o pagamento é por acesso incremental à API e cobertura jurídica, já que o Google já indexa o Reddit; a exclusividade é amplamente posta em dúvida.
  • Uma visão minoritária: pagar por dados que os usuários criaram de graça é “obsceno”, especialmente sem compartilhamento de receita com os usuários, enquanto outros respondem que hospedagem e construção de comunidade justificam a fatia do Reddit.

Propriedade dos Dados, Compensação e ToS

  • Múltiplos comentários destacam os ToS do Reddit concedendo a ele direitos amplos, perpétuos e sublicenciáveis; os usuários, na prática, consentem com a revenda dos dados.
  • Alguns argumentam que, se as pessoas quisessem ser pagas, não publicariam em público de graça; outros dizem que publicaram para discussão e hospedagem financiada por anúncios, não como dados de treinamento.
  • Há preocupação de que isso desloque a internet de um “mercado de ideias” para matéria-prima para IA e acionistas, erodindo a boa vontade.
  • Comparações com StackOverflow e publicidade: debate sobre se dados-por-anúncios eram um pacto implícito “mais justo” do que dados-por-IA.

Impacto na Web Aberta, Privacidade e Plataformas

  • Vários acham que o scraping de qualquer conteúdo público por IA agora é inevitável; esperam que mais discussões migrem para espaços privados ou semiprivados (Discord, etc.), embora esses também possam monetizar dados.
  • Outros veem essa centralização de dados e compute em poucas empresas como perigosa e pouco regulada.
  • Alguns enquadram a mudança como preparação para IPO e monetização de APIs no longo prazo, incluindo o fechamento de APIs públicas e do acesso via busca.

Qualidade e Viés dos Dados do Reddit

  • Forte ceticismo de que o Reddit seja um bom dado de treinamento: astroturfing pesado, bots manipulando votos, câmaras de eco e respostas de “mente coletiva” confiantemente erradas.
  • Preocupações com viés político e ideológico, além de agendas de moderação agressivas em alguns subreddits, potencialmente enviesando a IA.
  • Piadas de que isso tornará a IA mais sarcástica, moralista e errada, mas também o reconhecimento de que muitos LLMs já usaram despejos antigos do Reddit.

Respostas dos Usuários e Contramedidas

  • Alguns dizem que vão reduzir ou parar de contribuir para o Reddit, “votando com o tempo”.
  • Ferramentas para apagar em massa ou embaralhar conteúdo antigo do Reddit são compartilhadas como medida defensiva, embora permaneçam dúvidas sobre o que o Reddit retém e revende.