El juez rechaza la mayoría de las reclamaciones de copyright contra ChatGPT por parte de autores de libros

Un juez de EE. UU. ha desestimado la mayoría de las reclamaciones de copyright de autores de libros contra OpenAI, dejando principalmente una reclamación californiana de “competencia desleal” por usar obras con copyright para entrenamiento sin permiso. Los comentaristas debaten si entrenar modelos de lenguaje grandes con textos pirateados o sin licencia debería considerarse infracción, contrastando los argumentos de larga data contra la piratería de medios con la indulgencia actual hacia las grandes empresas de IA. El intercambio subraya cuestiones no resueltas sobre cómo se aplican a la IA los principios existentes de copyright y uso legítimo, la asimetría entre el aprendizaje humano y el aprendizaje automático ante la ley, y el posible impacto sobre los modelos de IA de código abierto y los autores que viven de su trabajo.

Alcance de la resolución y principal reclamación que sobrevive

  • Muchos ven como la cuestión clave que sobrevive la reclamación estatal de “competencia desleal” por usar obras con copyright para entrenamiento sin permiso.
  • Varios sostienen que el titular del artículo es engañoso porque, incluso con la mayoría de las reclamaciones de copyright desestimadas, esta reclamación restante podría ser muy relevante.
  • Algunos señalan que el juez se mostró reacio a considerar que todas las salidas de LLM fueran infractoras sin pruebas específicas que vinculen las salidas con obras concretas.

Piratería, copia y uso legítimo

  • Hay un fuerte debate sobre si usar copias piratas para entrenamiento debería ser claramente ilegal, dadas décadas de retórica antipiratería.
  • Una postura: descargar/usar copias piratas se tolera de hecho; solo se persigue realmente la distribución.
  • Otros responden que la reproducción no autorizada (incluida la descarga) es infracción, aunque rara vez se procese, y que se está confundiendo la aplicación civil con la penal.
  • Algunos argumentan que, si el entrenamiento es uso legítimo, la legalidad de cómo se obtuvo la copia puede no importar.

Aprendizaje humano frente a entrenamiento de LLM

  • Se repiten analogías con humanos leyendo libros: si las personas pueden aprender de los libros y luego crear, ¿por qué no los modelos?
  • Contrapunto: la ley trata la memoria humana como “intangible” y no como una “copia”, mientras que el almacenamiento informático es un medio fijo y tangible.
  • Varios insisten en que la cognición humana es jurídicamente especial; las máquinas no heredan automáticamente esas excepciones o derechos.

Ideas frente a expresión y obras derivadas

  • Hay un amplio acuerdo en que el copyright protege la expresión, no las ideas, los procedimientos ni los conceptos abstractos (citando el lenguaje estatutario de EE. UU.).
  • Ejemplo discutido: usar ideas de la ciencia ficción para construir tecnología real está bien; reproducir el texto no lo está.
  • Múltiples comentarios subrayan que las salidas de los LLM deben evaluarse por copia real/sustitución de mercado, no solo por el hecho de que el entrenamiento haya ingerido obras con copyright.

Implicaciones económicas y competitivas

  • Un sector teme que exigir licencias para el entrenamiento afiance el dominio de las grandes empresas que pueden pagar corpus masivos; los modelos abiertos saldrían perjudicados.
  • Otro sector sostiene que “simplemente paga por ello” (libros, noticias, imágenes) es justo y se aplicaría por igual a todos los actores, por lo que no es intrínsecamente anticompetitivo.
  • Algunos esperan que, si se requieren licencias, surja un régimen tipo Spotify en el que las empresas de medios ganen miles de millones, los creadores reciban poco y solo sobrevivan unos pocos proveedores de IA.

Asimetría percibida y legitimidad del copyright

  • Hay frustración porque los duros argumentos antipiratería usados contra individuos ahora parecen suavizarse cuando se aplican a grandes empresas de IA.
  • Algunos creen que, si los tribunales aprueban el entrenamiento a gran escala con obras sin licencia, de hecho debilitará la legitimidad del copyright para futuros casos de piratería.

Regulación, ley futura y dirección de la política

  • Varios comentaristas creen que los marcos actuales del copyright no encajan bien con los LLM y que una nueva legislación es inevitable.
  • Hay desacuerdo sobre si deberían crearse derechos especiales de “entrenamiento de IA” o excepciones explícitas para el entrenamiento.
  • Algunos prevén que los poderosos intereses mediáticos no permitirán la “explotación gratuita” de todas las obras con copyright; otros esperan exenciones específicas y limitadas para la IA.

Calidad y origen de los datos de entrenamiento

  • Algunos sostienen que los libros son datos de entrenamiento de mayor calidad que el texto web general y señalan que muchos humanos también dependen de ebooks pirateados.
  • Otros enfatizan que, si se usan libros, las empresas de IA deberían obtenerlos legalmente y/o licenciarlos, en lugar de extraer copias pirateadas.