Un ejecutivo de Microsoft llamó a la IA que raspa contenido «el mayor robo de trabajo en la historia de la humanidad»
Una presentación judicial no sellada que reveló a un ejecutivo de Microsoft llamando al entrenamiento de IA «el mayor robo de trabajo en la historia de la humanidad» ha encendido el debate sobre si los grandes modelos de lenguaje construidos sobre contenido web rastreado constituyen robo, infracción de derechos de autor o uso legítimo transformador. Los comentaristas chocan sobre analogías con el aprendizaje humano, la piratería y la esclavitud histórica, la hipocresía de las tecnológicas que antes lucharon contra la piratería y ahora ingieren masivamente obras protegidas, y la asimetría entre individuos castigados por infracción y corporaciones recompensadas por ella. Muchos sostienen que, aunque el entrenamiento sea legal, devalúa el trabajo creativo, concentra el poder en unos pocos proveedores de IA y podría justificar nuevos regímenes de impuestos, regalías o mandatos de pesos abiertos para reequilibrar los beneficios hacia el público.
¿Es el entrenamiento de la IA «robo» o solo infracción de derechos de autor?
- Muchos sostienen que raspar datos para entrenar es «el mayor robo de trabajo»: los modelos extraen valor de millones de obras sin consentimiento ni pago, y luego compiten con los creadores.
- Otros insisten en que no es «robo» en sentido estricto: los originales permanecen, y copiar es, como mucho, una infracción de derechos de autor; además, la ley tradicionalmente protege las copias, no las «ideas/hechos/patrones».
- Un contraargumento recurrente: aprender de libros es legal para los humanos; quienes se oponen responden que una mente humana no rival no es comparable con un aprendiz mecánico masivamente escalable usado con fines comerciales.
- El estado legal se describe como incierto: algunos tribunales han considerado que aspectos del entrenamiento son uso legítimo; la cuestión de uso legítimo frente al daño al mercado sigue siendo central y discutida.
Escala, automatización y dobles raseros
- Los comentaristas subrayan que la escala lo cambia todo: una persona pirateando frente a corporaciones que se llevan por delante la web, conjuntos de datos de pago e incluso pirateados, para luego monetizar las salidas.
- Muchos señalan la hipocresía: a individuos se les ha castigado duramente por piratería; los laboratorios de IA que realizan actos similares a escala masiva son recompensados con valoraciones de billones de dólares.
- Las quejas de los laboratorios sobre la «destilación de modelos» como robo se ven especialmente hipócritas, dado que sus propios modelos se entrenan con material sin licencia.
Impacto en creadores, cultura y trabajo
- Existe una fuerte preocupación de que la IA socave el mercado de escritores, artistas, programadores, investigadores, músicos, etc., al vender sustitutos baratos construidos a partir de su trabajo.
- Algunos autores de código abierto y blogs dicen que lamentan haber publicado públicamente; ahora ven su trabajo no remunerado alimentando herramientas que podrían terminar con sus carreras.
- Otros argumentan que la agregación y el remixado es como siempre ha progresado la cultura; el maximalismo del copyright se enmarca, por sí mismo, como una aberración histórica impulsada por grandes empresas mediáticas.
- Temor a que el contenido original de la web desaparezca a medida que los sitios mueren (costes, carga de bots, pérdida de tráfico), con el conocimiento efectivamente «atrapado» en modelos propietarios y enterrado bajo «slop» generado por IA.
Bienes comunes vs propiedad y redistribución
- Un sector da la bienvenida a la IA como el momento supremo de «la información quiere ser libre» y una reversión parcial de una propiedad intelectual extendida en exceso, especialmente para obras que, discutiblemente, deberían estar en el dominio público.
- Otro sector insiste en que la propiedad intelectual es un derecho legítimo; si se permite entrenar sobre obras protegidas por derechos de autor, entonces los modelos y los pesos también deberían tratarse como parte de los bienes comunes.
- Entre las soluciones propuestas figuran: impuestos elevados o reparto de beneficios sobre las empresas de IA, esquemas de regalías para creadores vinculados a los datos de entrenamiento, o beneficios universales financiados por las ganancias de la IA.
Regulación y propuestas estructurales
- Las ideas van desde:
- Exigir consentimiento y licencias para el entrenamiento, con exclusiones voluntarias que realmente funcionen.
- Obligar a divulgar los datos de entrenamiento y liberar los pesos de modelos antiguos.
- Declarar que las salidas de los modelos no son protegibles por copyright y potencialmente sujetas a reclamaciones de los autores originales.
- Limitar el tamaño de las empresas o el cómputo, o incluso prohibir ciertos modelos propietarios de frontera.
- Algunos señalan que la aplicación será políticamente difícil, especialmente por la competencia geopolítica y el lobby corporativo.
Modelos abiertos vs cerrados y destilación
- Los modelos de pesos abiertos se citan como una democratización parcial, pero los críticos dicen que los pesos abiertos entrenados con datos sin licencia siguen siendo «robo blanqueado».
- Varios defienden la destilación como un «derecho humano» a trabajar con modelos entrenados en el corpus de la humanidad; otros temen que esto afiance aún más la apropiación inicial sin compensación.
Preocupaciones sociales más amplias
- Los hilos exploran:
- La concentración de riqueza y poder si la IA automatiza tanto el trabajo mental como el físico.
- Los costes ambientales y de infraestructura de enormes centros de datos.
- Analogías con la vigilancia: el uso de datos «públicos» se vuelve problemático cuando se automatiza y centraliza a escala extrema.