Juez rechaza el intento de Google de usar la DMCA para librarse de ser rastreado

Una reciente sentencia de un tribunal de EE. UU. que rechaza la reclamación de DMCA de Google contra SerpApi, un servicio que hace scraping de los resultados de búsqueda de Google, se está viendo como una afirmación clave de que las páginas públicas de resultados de búsqueda pueden ser rastreadas legalmente. Los comentaristas destacan la ironía de que Google, cuya dominancia se construyó sobre el rastreo de la web abierta, intente impedir que otros indexen sus propias páginas mientras no ofrece una API pública de búsqueda robusta. La sentencia se considera de implicaciones más amplias para el entrenamiento de IA, la competencia en búsqueda, la responsabilidad de las plataformas por anuncios fraudulentos y el estatus de copyright de los índices y de las salidas de los modelos.

Hipocresía percibida y naturaleza del scraping

  • Muchos ven la ironía de que Google, construido sobre el scraping masivo de la web, intente bloquear el scraping de sus propios SERP.
  • Algunos sostienen que el rastreo de Google es “más amable” (robots.txt, sin romper CAPTCHAs), frente al supuesto uso por parte de SerpAPI de proxies distribuidos y scraping de sitios bloqueados a bots.
  • Otros señalan que el poder de mercado de Google hace que los sitios estén, en la práctica, obligados a permitir sus bots, por lo que el “respeto por robots.txt” es solo parte de la historia.

Estado legal del scraping de resultados de búsqueda

  • Varios comentaristas dicen que hacer scraping de los SERP de Google probablemente siempre ha sido legal, aunque Google seguirá combatiéndolo técnica y contractualmente.
  • Una conclusión clave: la DMCA trata sobre contenido con copyright; los índices de búsqueda puros/las URLs quizá no califican, así que la DMCA es una herramienta débil aquí.
  • Algunos señalan que los movimientos antimonopolio en EE. UU. y la UE ya están empujando a Google a compartir datos de búsqueda con “competidores cualificados”.

APIs de búsqueda, acceso y competencia

  • Frustración por el hecho de que Google eliminó sus APIs públicas de búsqueda, empujando a los desarrolladores hacia scrapers como SerpAPI.
  • A algunos les gustaría que los gobiernos exigieran índices de búsqueda públicos.
  • Se considera que el “search grounding” de Gemini está demasiado restringido y controlado de forma estricta.

Implicaciones para el entrenamiento de IA y los modelos

  • Se debate que este precedente podría implicar que los pesos de los modelos de IA y las salidas destiladas también son difíciles de proteger con copyright, aunque se advierte que esto es especulativo/no está claro.
  • Surgen preguntas sobre cómo las “frontier labs” han rastreado históricamente datos para entrenamiento y cuán transparentes son.

Anuncios, estafas y responsabilidad de la plataforma

  • Fuerte preocupación por anuncios fraudulentos en los SERP (por ejemplo, estafas de visados/registro).
  • Debate sobre si las plataformas deberían ser responsables del fraude en sus redes publicitarias:
    • Un lado quiere una responsabilidad fuerte, parecida a los refugios seguros al estilo DMCA pero con aplicación real.
    • Otros sostienen que la culpa principal debe seguir recayendo en los estafadores, no en las plataformas como “policía privada”.
  • La Sección 230 es objeto de disputa: algunos dicen que se aplica mal, otros que está estructuralmente rota para las plataformas basadas en anuncios.

Copyright, DMCA y derechos sobre bases de datos

  • La DMCA es ampliamente criticada; algunos incluso piden abolir el copyright, mientras otros advierten de un choque económico.
  • Se contrastan los derechos sobre bases de datos de la UE con el estándar estadounidense de originalidad; hay una zona gris sobre si los resultados de búsqueda ordenados son “solo hechos” o selecciones creativas.
  • Se discuten mapas y PageRank como casos límite de lo que puede tener copyright.

El foso defensivo de Google y el futuro de la búsqueda

  • Hay opiniones divididas:
    • Algunos insisten en que el foso defensivo de Google (estado predeterminado, crawler no bloqueado, YouTube, cloud) sigue siendo muy fuerte.
    • Otros creen que los asistentes basados en LLM están reemplazando rápidamente la búsqueda clásica para muchas consultas.
  • Un subconjunto afirma que casi todo el mundo que conocen ha dejado de usar Google; otros informan que casi todo el mundo que conocen sigue usándolo.
  • Se especula que esta sentencia trata en parte de limitar cómo OpenAI/Anthropic acceden a resultados en vivo de Google mediante intermediarios como SerpAPI, aunque los detalles siguen sin estar claros.