La demanda por derechos de autor del NY Times quiere que OpenAI elimine todas las instancias de GPT
La demanda del New York Times contra OpenAI y Microsoft alega que sus modelos de IA fueron entrenados con millones de artículos del Times protegidos por derechos de autor sin permiso, que a veces pueden reproducirlos literalmente y que ahora compiten con el negocio de suscripciones del periódico. Los comentaristas debaten si ese entrenamiento está protegido por el “uso legítimo” o si se parece más a una piratería a gran escala, comparándolo con motores de búsqueda, el aprendizaje humano y casos previos de copyright, y discutiendo el papel de los muros de pago y los términos de servicio. Muchos esperan que este caso —o uno similar— establezca precedentes legales decisivos sobre cómo la IA generativa puede usar contenido con copyright, con grandes implicaciones tanto para las grandes tecnológicas como para los esfuerzos de IA más pequeños o de código abierto.
Alcance y objetivos de la demanda del NYT
- El NYT exige: la destrucción de los modelos GPT entrenados con su contenido, la eliminación de los conjuntos de datos de entrenamiento y una orden judicial permanente, además de importantes daños monetarios.
- Muchos lo ven como una maniobra inicial maximalista destinada a forzar un acuerdo de licencia, más que a “matar” realmente a GPT.
- Algunos creen que el momento está relacionado con negociaciones más amplias entre IA y editores (por ejemplo, con Apple y otros).
Derechos de autor, uso legítimo y scraping
- La cuestión central: ¿usar artículos con copyright para el entrenamiento constituye por sí mismo una infracción, o solo lo es cuando las salidas se parecen demasiado a los originales?
- Debate sobre los factores de uso legítimo:
- Propósito/carácter: aprendizaje transformador vs. sustitución comercial.
- Naturaleza: las noticias son en parte factuales, pero con expresión creativa.
- Cantidad: los modelos ingieren archivos completos.
- Efecto en el mercado: si los LLM reemplazan de forma significativa a la audiencia del NYT o a los mercados de licencias.
- Legalidad del scraping y ToS: algunos citan precedentes que indican que el scraping de la web pública puede ser legal; otros señalan los muros de pago, los términos del NYT cambiados y robots.txt como evidencia de falta de consentimiento.
Memorización, regurgitación y soluciones técnicas
- Los ejemplos más sólidos del NYT son la reproducción casi literal de artículos de pago y de los primeros párrafos.
- Una postura: esto demuestra que el modelo “contiene” obras con copyright y que el entrenamiento se parece más a una copia comprimida que al aprendizaje humano.
- Otra postura: se trata de casos extremos poco frecuentes de sobreajuste, que pueden mitigarse con temperaturas más bajas, filtros (n‑grams/bloom), RLHF o una pre-síntesis de las fuentes.
- Preocupación adicional: los modelos alucinan contenido falso del NYT, lo que abre ángulos de difamación y dilución de marca.
Analogías entre humanos y máquinas
- Quienes apoyan a OpenAI comparan el entrenamiento con una persona que lee y luego resume o se “ve influida” por el NYT, argumentando que la arquitectura no debería importar legalmente.
- Los críticos subrayan la escala, la reproducibilidad y el despliegue comercial: millones de usuarios, evasión automatizada de muros de pago y una sola corporación monetizando el trabajo de otros.
- Rechazo repetido al razonamiento de “si un humano puede hacerlo, un modelo también”, señalando que la ley trata de forma distinta a las herramientas y a las personas.
Implicaciones económicas, competitivas y sociales
- Muchos esperan un régimen de licencias eventual: los grandes editores cobrarían directamente, los creadores pequeños quizá a través de fondos; el acceso a los LLM se volvería más caro.
- Preocupación de que fallos fuertes en derechos de autor beneficien a empresas con grandes recursos (OpenAI, MS, Apple, Google), perjudiquen al código abierto y a las startups, y quizá empujen el trabajo de frontera a jurisdicciones con una aplicación más débil de la PI.
- Otros sostienen que esta restricción es necesaria para preservar incentivos para el periodismo y el trabajo creativo, y para evitar que unas pocas empresas de IA privatizen el valor de la web.
- El hilo refleja un malestar más amplio con la duración y el alcance actuales del copyright, pero también un fuerte desacuerdo sobre si el entrenamiento de IA debería quedar explícitamente como uso legítimo legal.