Juiz Rejeita Tentativa do Google de Usar a DMCA para Escapar de Ser Raspado
Uma recente decisão judicial nos EUA, que rejeitou a alegação da DMCA do Google contra a SerpApi, um serviço que raspa resultados de busca do Google, está sendo vista como uma afirmação importante de que páginas públicas de resultados de busca podem legalmente ser raspadas. Comentadores destacam a ironia de o Google, cuja dominância foi construída sobre o crawling da web aberta, tentar impedir outros de indexarem suas próprias páginas enquanto não oferece uma API pública robusta de busca. A decisão é vista como tendo implicações mais amplas para treinamento de IA, concorrência na busca, responsabilidade das plataformas por anúncios fraudulentos e o status de copyright de índices e saídas de modelos.
Hipocrisia Percebida e Natureza da Raspagem
- Muitos veem ironia no Google, construído sobre raspagem massiva da web, tentar bloquear a raspagem de seus próprios SERPs.
- Alguns argumentam que o crawling do Google é “mais gentil” (robots.txt, sem quebrar CAPTCHA) em comparação com o uso alegado pela SerpAPI de proxies distribuídos e raspagem de sites que bloqueiam bots.
- Outros observam que o poder de mercado do Google significa que os sites são efetivamente forçados a permitir seus bots, então o “respeito ao robots.txt” é apenas parte da história.
Status Legal da Raspagem de Resultados de Busca
- Vários comentaristas dizem que raspar SERPs do Google provavelmente sempre foi legal, embora o Google ainda vá combater isso tecnicamente e contratualmente.
- Uma conclusão importante: a DMCA trata de conteúdo protegido por copyright; índices de busca/URLs em estado bruto podem não se qualificar, então a DMCA é uma ferramenta fraca aqui.
- Alguns apontam que medidas antitruste nos EUA e na UE já estão pressionando o Google a compartilhar dados de busca com “concorrentes qualificados”.
APIs de Busca, Acesso e Concorrência
- Frustração de que o Google matou suas APIs públicas de busca, empurrando desenvolvedores para raspadores como a SerpAPI.
- Alguns gostariam que governos exigissem índices públicos de busca.
- O “search grounding” do Gemini é visto como restrito demais e fortemente controlado.
Implicações para Treinamento de IA e Modelos
- Há discussão de que esse precedente pode implicar que pesos de modelos de IA e saídas destiladas também sejam difíceis de proteger por copyright, mas isso é apontado como especulativo/incerto.
- Surgem প্রশ্নões sobre como os “frontier labs” historicamente coletaram dados para treinamento e quão transparentes eles são.
Anúncios, Golpes e Responsabilidade da Plataforma
- Forte preocupação com anúncios fraudulentos nos SERPs (por exemplo, golpes de visto/registro).
- Debate sobre se as plataformas deveriam ser responsáveis por fraude em suas redes de anúncios:
- Um lado quer responsabilidade forte, semelhante a portos seguros no estilo DMCA, com aplicação real.
- Outros argumentam que a culpa principal deve continuar sendo dos golpistas, não das plataformas como “polícia privada”.
- A Seção 230 é contestada: alguns dizem que ela é mal aplicada, outros que está estruturalmente quebrada para plataformas movidas a anúncios.
Copyright, DMCA e Direitos sobre Bancos de Dados
- A DMCA é amplamente criticada; alguns até defendem abolir o copyright, enquanto outros alertam para um choque econômico.
- Os direitos sobre bancos de dados da UE e o padrão de originalidade dos EUA são contrastados; há uma zona cinzenta sobre se resultados de busca ranqueados são “apenas fatos” ou seleções criativas.
- Mapas e PageRank são discutidos como casos-limite do que pode ou não ser protegido por copyright.
O Fosso Competitivo do Google e o Futuro da Busca
- Visões divididas:
- Alguns insistem que o fosso competitivo do Google (status padrão, crawler não bloqueado, YouTube, cloud) continua muito forte.
- Outros acreditam que assistentes baseados em LLM estão substituindo rapidamente a busca clássica para muitas consultas.
- Um subconjunto afirma que quase todos que conhecem migraram para fora do Google; outros relatam que quase todos que conhecem ainda o usam.
- Especula-se que a decisão seja em parte sobre limitar como OpenAI/Anthropic acessam resultados ao vivo do Google por meio de intermediários como a SerpAPI, embora os detalhes continuem incertos.