NY Times está pidiendo que se destruyan todos los LLM entrenados con datos del Times
La demanda del New York Times contra OpenAI y Microsoft, que exige que se destruyan los modelos de IA entrenados con artículos del Times, está provocando un enfrentamiento más amplio sobre cómo se aplica el copyright a los modelos de lenguaje grandes. Los comentaristas debaten si entrenar con texto protegido debe tratarse como aprendizaje humano y uso legítimo, o como una explotación masiva y no remunerada que perjudica a los creadores cuyo trabajo puede ser regurgitado literalmente. Muchos esperan que los tribunales se centren en las salidas del modelo y en el impacto en el mercado, más que en el entrenamiento por sí solo, con resultados probables que van desde licencias y regalías hasta límites más estrictos que podrían atrincherar a las grandes tecnológicas y reconfigurar cómo se construyen los futuros sistemas de IA.
Alcance de la Demanda y la Exigencia de “Destruir los Modelos”
- El hilo se centra en la demanda del NYT contra OpenAI/Microsoft y en una solicitud de que los modelos entrenados con contenido del Times sean eliminados.
- Varios comentarios sostienen que los tribunales solo pueden ordenar medidas contra los demandados nombrados, no contra “todos los LLM”, así que la petición de destrucción general es sobre todo una palanca retórica.
- Otros ven la demanda como un necesario contraataque porque los creadores individuales no pueden permitirse litigios similares.
Estado Legal del Entrenamiento con Material Protegido por Copyright
- Se señala ampliamente que la legalidad no está resuelta; se esperan múltiples demandas en curso para aclarar si entrenar constituye uso legítimo.
- Una postura: entrenar = leer/aprender; el copyright restringe la reproducción, no el aprendizaje ni el recuerdo de ideas. Se hacen analogías con estudiantes, motores de búsqueda y el caché de ISP/navegador.
- La otra postura: los LLM son herramientas comerciales, no humanos; tratarlos como personas es engañoso. Usar texto con copyright a gran escala con fines de lucro y sin permiso se ve como infracción o robo.
- Debate sobre si los pesos del modelo pueden ser en sí mismos “copias” de obras si el modelo puede emitir texto casi literal.
Salidas, Regurgitación y Posibles Soluciones
- Hay un amplio acuerdo en que la reproducción literal o casi literal de texto con paywall o con copyright es legalmente arriesgada.
- Soluciones técnicas propuestas: posfiltros que comparen las salidas con texto del NYT; reentrenar sin datos del NYT; o hacer que los modelos no puedan reproducir pasajes largos.
- Algunos argumentan que la infracción debería aplicarse a salidas específicas y a sus usuarios, no a la mera existencia del modelo.
Perspectivas Éticas y Económicas
- Hay una fuerte división:
- Algunos ven a los LLM como plagio a escala industrial, que perjudica a periodistas, artistas y programadores y permite una mayor concentración de riqueza.
- Otros los ven como otra capa tecnológica (como las videograbadoras, la industrialización o los procesadores de texto) que se apoya en la cultura previa y, en última instancia, impulsa la productividad.
Implicaciones Prácticas y Estratégicas
- Se describe el reentrenamiento sin contenido del NYT como extremadamente caro, casi equivalente a empezar desde cero.
- Muchos ven la concesión de licencias como el desenlace probable, pero existe preocupación de que establezca un precedente que lleve a muchas reclamaciones similares y favorezca a los grandes incumbentes con datos propietarios.
- Algunos sugieren modelos de dominio público o esquemas obligatorios de licencias/regalías; otros proponen, de forma más radical, obligar a que los modelos o incluso todas las obras publicadas estén disponibles para entrenamiento.