OpenAI y el periodismo
La respuesta de OpenAI a la demanda por copyright de The New York Times ha reavivado el debate sobre si usar texto en línea para entrenar grandes modelos de lenguaje cuenta como uso legítimo, especialmente cuando los modelos reproducen ocasionalmente material con copyright o de pago de forma literal. Los comentaristas discuten cuestiones legales y éticas clave: si entrenar con datos rastreados sin consentimiento es permisible, si la regurgitación puede descartarse como un “fallo”, cuánto impacto comercial tiene la IA en el periodismo y en otros creadores, y si las políticas de exclusión voluntaria o los filtros técnicos abordan de forma significativa estas preocupaciones. Muchos ven el caso como un momento decisivo que podría reconfigurar tanto las prácticas de desarrollo de IA como los incentivos económicos para producir contenido original en Internet.
Uso legítimo y datos de entrenamiento
- Gran disputa sobre si entrenar con texto con copyright entra en el uso legítimo.
- Algunos sostienen que es claramente transformativo y análogo a casos anteriores (p. ej., escaneo de libros a gran escala / búsqueda).
- Otros dicen que usar el trabajo de las personas para construir un producto competidor no es uso legítimo, especialmente cuando se hace con contenido pirateado o de pago.
- Debate sobre si “disponible públicamente” excluye fuentes de pago o parcialmente de pago como los principales periódicos.
Regurgitación vs. transformación
- Muchos aceptan que el entrenamiento podría ser uso legítimo, pero ven la regurgitación literal como una infracción clara, independientemente de la intención o la rareza.
- Otros argumentan que, si un humano puede recordar o parafrasear legalmente, a una IA se le debería tratar de forma similar; el contrapunto es que la reproducción masiva y automatizada es fundamentalmente distinta.
- Se plantea la pregunta: si la regurgitación es <1%, ¿debilita eso de forma significativa las afirmaciones de que los modelos sustituyen la lectura de las fuentes originales?
Analogías legales y responsabilidad
- Se hicieron comparaciones con:
- Recitar artículos en público.
- Google/YouTube/Dropbox alojando contenido de usuarios bajo los puertos seguros de la DMCA.
- Un “savant” reproduciendo libros de memoria frente a resúmenes/análisis.
- Algunos dicen que la salida por inferencia no es “generada por el usuario” según la DMCA y, por tanto, las plataformas no tienen ese escudo.
- Debate sobre dónde recae la responsabilidad: el creador de la herramienta frente a los usuarios posteriores y los intermediarios.
Exclusión voluntaria, transparencia y conjuntos de datos
- Fuerte crítica a la exclusión voluntaria introducida solo recientemente y no aplicada retroactivamente.
- La idea de que “no puedes desaprender” se ve como una excusa interesada; otros responden que el reentrenamiento completo es técnicamente posible, pero caro.
- Se pide que los modelos al menos revelen con qué conjuntos de datos fueron entrenados, aunque no se pueda publicar el dato bruto.
Mitigación técnica
- Sugerencias: filtros de salida para detectar texto con copyright, reescritura posterior a la generación, crear búsqueda de referencia contra el corpus de entrenamiento.
- Desacuerdo sobre la viabilidad: algunos dicen que el filtrado simple de texto es factible; otros señalan que los LLM no tienen almacenamiento/índices explícitos y no pueden “desaprender” elementos específicos de forma fiable.
Impacto en el periodismo y en Internet
- Preocupación de que, si los sistemas de IA sustituyen la lectura de las fuentes originales, se erosionen los incentivos para producir periodismo de calidad y contenido creado por humanos.
- Postura contraria: el caso de uso actual de regurgitación es marginal en comparación con los atajos existentes para evitar muros de pago; para algunos, frenar el progreso de la IA para complacer a los editores tiene un coste demasiado alto.
Percepción de la respuesta de OpenAI
- Muchos ven la publicación del blog como relaciones públicas dirigidas al público y a clientes empresariales, no como un argumento legal serio.
- Escepticismo ante las afirmaciones de que una sola fuente (p. ej., un gran periódico) “no es significativa” para el modelo, dado que todas esas fuentes son necesarias en conjunto.