"Imposible" crear herramientas de IA como ChatGPT sin material con copyright, OpenA

El debate sobre la afirmación de OpenAI de que no se pueden construir herramientas como ChatGPT sin material con copyright se centra en si entrenar IA con esos datos se parece más al aprendizaje humano o a copiar en una base de datos que luego puede reproducir obras protegidas. Los comentaristas discrepan sobre la responsabilidad legal y moral: algunos sostienen que el entrenamiento debería considerarse uso legítimo siempre que las salidas no sean literales, mientras que otros ven los modelos de IA comerciales y a gran escala como una explotación del trabajo de los creadores sin consentimiento ni pago. El intercambio también subraya preocupaciones más amplias sobre la duración del copyright, el destino de los modelos de código abierto, el poder corporativo y cómo deberían equilibrarse en el futuro la innovación y los derechos de propiedad intelectual.

IA vs. aprendizaje humano y derechos

  • Gran disputa sobre si los LLM “aprenden como los humanos”.
    • Una postura: tanto los humanos como los LLM aprenden de grandes volúmenes de lenguaje, así que legal y éticamente deberían tratarse de forma similar cuando consumen obras con copyright.
    • La otra postura: la implementación es fundamentalmente distinta; “consumir” texto en una red neuronal es copiarlo en un sistema parecido a una base de datos, a diferencia del cerebro humano.
  • División filosófica más amplia:
    • Algunos sostienen que los derechos morales se derivan de la conciencia/autoconciencia, no de ser biológicamente humano, por lo que las IAs avanzadas deberían eventualmente recibir un trato similar.
    • Otros insisten en que la ley la hacen y para ella la hacen los humanos; las máquinas son propiedad, no titulares de derechos, y ampliar derechos a las IAs desperdicia capital político y encubre intereses corporativos.

Copyright, datos de entrenamiento y uso legítimo

  • Un sector: entrenar con datos con copyright es análogo a leer; no infringe mientras el sistema no vomite obras palabra por palabra.
  • Los opositores: cargar material con copyright en corpus de entrenamiento es copia y adaptación, directamente dentro del alcance del copyright, independientemente de la etiqueta “entrenamiento” o “aprendizaje”.
  • Algunos sugieren que el contenido debería licenciarse; otros temen que eso consolide un monopolio para las grandes empresas y aplaste los esfuerzos de código abierto.

Salida, memorización e infracción

  • Se citan ejemplos del NYT de GPT reproduciendo artículos como prueba de memorización e infracción.
  • Réplica: muchos ejemplos se apoyan en prompts que introducen parte del artículo; los críticos llaman a eso “hacer trampa”, análogo a provocar a una herramienta para que infrinja.
  • Pregunta abierta: ¿la responsabilidad recae en el proveedor del modelo, en el usuario que lo interroga o en ambos?

Modelos de negocio, escala y beneficio

  • Varios argumentan que lo tolerable para individuos (piratería para uso personal, modelos privados) se vuelve inaceptable cuando se monetiza a una escala masiva.
  • Algunos defienden el enfoque de OpenAI de “moverse rápido, pedir perdón después” como algo necesario para demostrar lo que es posible; otros dicen que claramente explotó el trabajo ajeno para obtener beneficios y ahora debe compensarlo.

Regulación, jurisdicciones e impacto futuro

  • Preocupa que unos requisitos estrictos de licencia puedan:
    • Debilitar los modelos abiertos,
    • Asegurar la posición de las empresas dominantes de Silicon Valley,
    • O dejar en desventaja futuras IAs encarnadas que aprendan de forma continua.
  • Se menciona la postura permisiva de Japón sobre el entrenamiento de IA como precedente contrastante.
  • Tema subyacente: los términos actuales del copyright quizá sean demasiado largos, privando al dominio público que necesitan la IA moderna y otros usos de interés público.