Juez aprueba acuerdo de $1.5B de Anthropic por libros pirateados usados para entrenar Claude

Un juez de EE. UU. ha aprobado un acuerdo de $1.5B que obliga a Anthropic a pagar unos $3,000 por título por usar ebooks pirateados para entrenar sus modelos de IA Claude, al tiempo que afirma que entrenar con libros adquiridos legalmente encaja dentro del uso legítimo. Los comentaristas están profundamente divididos sobre si esto es una reparación significativa o simplemente un “coste de hacer negocios” que afianza a los grandes laboratorios de IA al encarecer el acceso de actores pequeños a datos de entrenamiento de alta calidad. La conversación se amplía hacia críticas a la aplicación moderna del copyright, al papel de editores frente a autores para capturar compensaciones, y a si la ley actual protege adecuadamente a los creadores humanos mientras los sistemas de IA aprenden de su trabajo y potencialmente lo repiten.

Alcance del fallo

  • El hilo insiste repetidamente: el tribunal aprobó un acuerdo por piratería, no por “entrenar con libros”.
  • Se consideró uso legítimo entrenar LLMs con libros adquiridos legalmente; la infracción fue mantener una gran biblioteca central de ebooks pirateados (p. ej., de LibGen).
  • Por separado, Anthropic también compró millones de libros físicos, los escaneó de forma destructiva y descartó los originales; se consideró uso legítimo porque las copias se mantuvieron internas y los ejemplares impresos se pagaron y destruyeron.

Tamaño y significado del acuerdo

  • $1.5B (~$3,000 por libro) es visto por algunos como una mera palmada en la muñeca y un puro “coste de hacer negocios” para una empresa cercana al billón de dólares.
  • Otros argumentan que equivale a ~100× el coste de comprar los libros y, por tanto, es una cifra civil razonable en daños, especialmente porque evita el riesgo de un juicio.
  • Reparto típico mencionado: aproximadamente 50/50 entre autor y editor por cada título elegible; los abogados obtienen una parte considerable pero reducida; los representantes de la clase reciben pequeñas bonificaciones.
  • Muchos señalan que esto es un acuerdo civil voluntario, no un caso penal; aquí nunca estuvo sobre la mesa la cárcel.

Uso legítimo, memorización y obras derivadas

  • Un bando: entrenar es análogo a que los humanos aprendan de los libros; los LLM generalmente no generan obras completas literalmente, así que esto es uso legítimo “transformativo”.
  • El otro bando: los modelos pueden repetir largos pasajes con copyright o libros casi literalmente en algunos casos, así que llamar a esto “transformativo” es dudoso.
  • Debate sobre si la rentabilidad de los modelos debería activar regalías o reparto de beneficios, y si las salidas son “obras derivadas”.

Distribución de beneficios y perjuicios

  • En general, los autores están mal pagados; muchos libros nunca recuperan el anticipo. Algunos dicen que $3k/título es más de lo que muchos autores llegan a ver; otros lo califican de dinero simbólico frente a las ganancias de Anthropic.
  • Preocupa que la mayor parte del dinero vaya a editores y abogados, no a escritores individuales.
  • Varios sostienen que este resultado afianza a los grandes laboratorios: solo actores con mucho capital pueden permitirse comprar libros masivamente y asumir el riesgo legal, elevando las barreras para modelos abiertos y a pequeña escala.

Debates más amplios sobre copyright y política

  • Fuerte desacuerdo sobre el valor del copyright: algunos quieren acortarlo o abolirlo; otros lo ven como esencial para financiar el trabajo creativo.
  • Algunos proponen regalías continuas o incluso financiación estilo servicio público para los datos de entrenamiento; otros insisten en lanzamientos con pesos abiertos si se usan obras con copyright.
  • Indignación por los aparentes dobles raseros: individuos arruinados por la piratería frente a corporaciones que ahora pagan acuerdos asumibles mientras conservan sus modelos.