Juiz Rejeita Tentativa do Google de Usar a DMCA para Escapar de Ser Raspado

Uma recente decisão judicial nos EUA, que rejeitou a alegação da DMCA do Google contra a SerpApi, um serviço que raspa resultados de busca do Google, está sendo vista como uma afirmação importante de que páginas públicas de resultados de busca podem legalmente ser raspadas. Comentadores destacam a ironia de o Google, cuja dominância foi construída sobre o crawling da web aberta, tentar impedir outros de indexarem suas próprias páginas enquanto não oferece uma API pública robusta de busca. A decisão é vista como tendo implicações mais amplas para treinamento de IA, concorrência na busca, responsabilidade das plataformas por anúncios fraudulentos e o status de copyright de índices e saídas de modelos.

Hipocrisia Percebida e Natureza da Raspagem

  • Muitos veem ironia no Google, construído sobre raspagem massiva da web, tentar bloquear a raspagem de seus próprios SERPs.
  • Alguns argumentam que o crawling do Google é “mais gentil” (robots.txt, sem quebrar CAPTCHA) em comparação com o uso alegado pela SerpAPI de proxies distribuídos e raspagem de sites que bloqueiam bots.
  • Outros observam que o poder de mercado do Google significa que os sites são efetivamente forçados a permitir seus bots, então o “respeito ao robots.txt” é apenas parte da história.

Status Legal da Raspagem de Resultados de Busca

  • Vários comentaristas dizem que raspar SERPs do Google provavelmente sempre foi legal, embora o Google ainda vá combater isso tecnicamente e contratualmente.
  • Uma conclusão importante: a DMCA trata de conteúdo protegido por copyright; índices de busca/URLs em estado bruto podem não se qualificar, então a DMCA é uma ferramenta fraca aqui.
  • Alguns apontam que medidas antitruste nos EUA e na UE já estão pressionando o Google a compartilhar dados de busca com “concorrentes qualificados”.

APIs de Busca, Acesso e Concorrência

  • Frustração de que o Google matou suas APIs públicas de busca, empurrando desenvolvedores para raspadores como a SerpAPI.
  • Alguns gostariam que governos exigissem índices públicos de busca.
  • O “search grounding” do Gemini é visto como restrito demais e fortemente controlado.

Implicações para Treinamento de IA e Modelos

  • Há discussão de que esse precedente pode implicar que pesos de modelos de IA e saídas destiladas também sejam difíceis de proteger por copyright, mas isso é apontado como especulativo/incerto.
  • Surgem প্রশ্নões sobre como os “frontier labs” historicamente coletaram dados para treinamento e quão transparentes eles são.

Anúncios, Golpes e Responsabilidade da Plataforma

  • Forte preocupação com anúncios fraudulentos nos SERPs (por exemplo, golpes de visto/registro).
  • Debate sobre se as plataformas deveriam ser responsáveis por fraude em suas redes de anúncios:
    • Um lado quer responsabilidade forte, semelhante a portos seguros no estilo DMCA, com aplicação real.
    • Outros argumentam que a culpa principal deve continuar sendo dos golpistas, não das plataformas como “polícia privada”.
  • A Seção 230 é contestada: alguns dizem que ela é mal aplicada, outros que está estruturalmente quebrada para plataformas movidas a anúncios.

Copyright, DMCA e Direitos sobre Bancos de Dados

  • A DMCA é amplamente criticada; alguns até defendem abolir o copyright, enquanto outros alertam para um choque econômico.
  • Os direitos sobre bancos de dados da UE e o padrão de originalidade dos EUA são contrastados; há uma zona cinzenta sobre se resultados de busca ranqueados são “apenas fatos” ou seleções criativas.
  • Mapas e PageRank são discutidos como casos-limite do que pode ou não ser protegido por copyright.

O Fosso Competitivo do Google e o Futuro da Busca

  • Visões divididas:
    • Alguns insistem que o fosso competitivo do Google (status padrão, crawler não bloqueado, YouTube, cloud) continua muito forte.
    • Outros acreditam que assistentes baseados em LLM estão substituindo rapidamente a busca clássica para muitas consultas.
  • Um subconjunto afirma que quase todos que conhecem migraram para fora do Google; outros relatam que quase todos que conhecem ainda o usam.
  • Especula-se que a decisão seja em parte sobre limitar como OpenAI/Anthropic acessam resultados ao vivo do Google por meio de intermediários como a SerpAPI, embora os detalhes continuem incertos.