The New York Times lanza un sólido caso contra Microsoft y OpenAI

La demanda del New York Times contra Microsoft y OpenAI por el uso de sus artículos para entrenar y alimentar sistemas de IA se ha convertido en un foco de preguntas sin resolver sobre derechos de autor, uso legítimo y contenido generado por IA. Los comentaristas diseccionan las teorías legales —desde la reproducción literal y las reclamaciones DMCA hasta si los servicios de IA compiten ilegalmente con los medios o los sustituyen— y debaten si entrenar con datos protegidos debería requerir licencias o estar protegido como uso legítimo. Se considera que el resultado podría reconfigurar los modelos de negocio tanto de los desarrolladores de IA como de los productores de contenido, con implicaciones para los modelos de código abierto, la competitividad global y los futuros regímenes de derechos de autor.

Alcance de las reclamaciones del NYT

  • El NYT no solo está impugnando el entrenamiento; la demanda apunta a:
    • Modelos que pueden generar artículos del NYT o grandes extractos literalmente.
    • Funciones de “búsqueda sintética” / navegación (Bing Chat, ChatGPT Browse) que recuperan contenido del NYT en tiempo real y lo parafrasean o citan.
    • Uso de contenido del NYT sin licencia, incluida la supuesta eliminación de información de gestión de derechos de autor (DMCA §1202).
  • El NYT presenta a OpenAI/Microsoft como creadores de productos que sustituyen directamente al NYT (incluido Wirecutter), perjudicando su modelo de negocio.

Uso legítimo, entrenamiento y reproducción literal

  • Un bando: el entrenamiento con texto protegido por derechos de autor puede ser uso legítimo; la regurgitación ocasional de modelos entrenados de forma amplia no debería, por sí sola, constituir infracción.
  • Otro bando: partes del caso son “fáciles” para el NYT porque los sistemas supuestamente reproducen artículos casi literalmente o actúan como atajos para eludir muros de pago.
  • Debate sobre si la cuestión clave es el entrenamiento como uso legítimo o el uso posterior y la sustitución del mercado (citando el precedente de Warhol por “uso no transformativo”).

RAG, muros de pago y competencia

  • La “fundamentación” / generación aumentada por recuperación supuestamente:
    • Copia páginas del NYT (incluidas las de pago), las pasa al modelo y luego emite paráfrasis o citas extensas.
    • Elimina atribución y enlaces de afiliados (por ejemplo, Wirecutter), convirtiendo al NYT en un backend no remunerado.
  • Algunos sostienen que esto se asemeja a los fragmentos de Google y podría ser uso legítimo; otros señalan que Google enlaza de vuelta y ya paga licencias en algunas jurisdicciones.

Responsabilidad, difamación e alucinaciones

  • El hilo debate si las “citas” alucinadas del NYT pueden sustentar reclamaciones por difamación o marca registrada:
    • Algunos dicen que la “malicia real” o la indiferencia temeraria podrían atribuirse a empresas que saben que los modelos fabrican cosas con regularidad.
    • Otros lo consideran débil: los daños son difíciles de probar y las salidas de los LLM están explícitamente advertidas como falibles.
  • Fuerte desacuerdo sobre llamar a las salidas “mentiras” frente a “alucinaciones” o “fabricaciones”.

Aprendizaje humano vs. software y personalidad jurídica

  • Gran subhilo sobre si “los humanos aprenden de obras protegidas, así que la IA también puede” es una analogía válida:
    • Un lado: el software es solo una herramienta; solo los humanos/corporaciones pueden ser responsables, y la escala y la copia exacta importan.
    • El otro lado: si automatizar lo que los humanos pueden hacer legalmente está permitido en otras herramientas (p. ej., Photoshop), no está claro por qué los LLM deberían tratarse de forma diferente.
  • Debate adicional sobre la personalidad jurídica corporativa, una posible futura personalidad jurídica de la IA y si los humanos son “especiales” en la ley y la moral.

Implicaciones económicas, competitivas y de política pública

  • Algunos esperan un acuerdo y un régimen de licencias (posiblemente colectivo o compulsorio) en lugar de un precedente para “matar la IA”.
  • Otros advierten:
    • Licencias pesadas podrían afianzar a las grandes tecnológicas y a los grandes medios, dejando fuera al código abierto y a los actores pequeños.
    • Las resoluciones estrictas en EE. UU. podrían favorecer jurisdicciones que relajen las reglas de entrenamiento (por ejemplo, referencias a los debates en Japón/UE).
  • Varios comentaristas creen que el objetivo final del NYT es obtener ventaja para un mejor acuerdo de licencias, no oponerse por principios a la IA.

Notas técnicas y de código abierto

  • Los comentaristas discuten:
    • Temperatura=0 y prompts elaborados que permiten regurgitación literal; no está claro cuán común es esto en el uso normal.
    • Posibilidad de posprocesamiento (comprobaciones de plagio, citación forzada, RAG con enlaces explícitos) para mitigar la infracción.
  • Algunos predicen que las demandas perjudicarán sobre todo a los modelos propietarios de EE. UU., mientras que los modelos de código abierto y extranjeros entrenados fuera del alcance legal de EE. UU. seguirán avanzando.