Expedientes desclasificados en el caso de Authors’ contra Microsoft/OpenAI

Documentos judiciales desclasificados en la demanda de Authors Guild contra OpenAI y Microsoft alegan que las empresas usaron a sabiendas conjuntos de datos de libros pirateados como LibGen para entrenar modelos de lenguaje grandes, mientras se preocupaban internamente más por las “apariencias” en sitios como Hacker News y Twitter que por la legalidad. Los comentaristas debaten si esa extracción masiva de datos y el entrenamiento de IA están protegidos por el uso legítimo o si constituyen una infracción de copyright y un “robo de trabajo” sin precedentes, destacando dobles raseros percibidos entre el trato legal a individuos y a gigantes tecnológicos. El hilo también plantea preocupaciones más amplias sobre el impacto de la IA en los medios de vida creativos, el cercamiento del procomún cultural, la avalancha de “slop” de IA de baja calidad y la pérdida de control y capacidad de negociación humana en una economía cada vez más mediada por modelos propietarios poderosos.

Uso de LibGen y las “apariencias”

  • Presentaciones desclasificadas muestran a personal discutiendo el uso del gran corpus de libros pirateados de LibGen y preocupándose principalmente por las malas “apariencias” si HN/Twitter se enteraban, no por la legalidad.
  • Algunos ven la cita de la “sketchy Russian website” como hipócrita dada la extracción masiva de datos y la piratería a mayor escala por parte de los laboratorios; otros dicen que la preocupación era de relaciones públicas (Rusia, asociaciones con granjas de trolls), no de copyright ni de la ética de LibGen.
  • Hay desacuerdo sobre el encuadre de LibGen: sitio pirateado lleno de libros de texto protegidos por copyright frente a biblioteca de investigación de facto en países pobres.

Piratería vs. entrenamiento y uso legítimo

  • Hay amplio acuerdo en que descargar libros de LibGen/Anna’s Archive constituye una infracción de copyright.
  • La gran disputa: ¿entrenar sobre obras protegidas por copyright adquiridas legalmente es uso legítimo?
    • Un lado cita casos recientes en EE. UU. (por ejemplo, Anthropic) que consideraron que entrenar con libros adquiridos legalmente era “transformador” y uso legítimo, pero no entrenar con copias pirateadas.
    • Otros argumentan que los modelos pueden reproducir texto protegido por copyright, así que el entrenamiento y el despliegue deberían tratarse como copia, no como mera “lectura”.
  • Debate sobre si la evidencia actual muestra regurgitación literal rutinaria; algunos dicen que es rara y se bloquea, otros señalan demandas (noticias, letras) y salidas de “slop”.

Trabajos, poder y capitalismo

  • Un sector considera la IA como otra ola de automatización (coches frente a caballos, calculadoras frente a “computadoras” humanas); la pérdida de empleo es una disrupción normal.
  • Otro sostiene que la IA es distinta: se apropia del trabajo creativo humano a escala, debilita el poder de negociación de los trabajadores y corre el riesgo de una concentración extrema de poder (“feudalismo” poslaboral / “dioses-rey”).
  • División entre quienes quieren frenar o detener la IA y quienes quieren aceptar el progreso tecnológico y centrarse en redes de seguridad, reconversión o economías pos-trabajo (UBI, “luxury space communism”).

Cultura, atribución y “slop”

  • Gran preocupación de que los modelos borren la autoría, inunden los mercados con libros/imágenes de IA de baja calidad y erosionen la señal cultural, la veracidad y el oficio.
  • Otros responden que la salida de la IA actualmente no puede igualar la escritura extensa de personas expertas y que sobre todo se usa para texto de bajo nivel y relleno de género.
  • Algunos sostienen que el copyright debería acortarse o abolirse; los opositores señalan que también sustenta el copyleft (por ejemplo, GPL).

Desigualdad y aplicación de la ley

  • Comparación repetida entre el trato duro a piratas individuales y los laboratorios de mil millones de dólares que pagan acuerdos asumibles; sensación de que la ley protege principalmente al capital.
  • Algunos ven el incumplimiento de los grandes laboratorios como una palanca para reformar el copyright; otros temen que simplemente consolide una excepción corporativa.

El papel de Hacker News y meta

  • El personal se preocupaba explícitamente por la cobertura negativa en HN, lo que implica que HN sigue importando para las “apariencias” entre las élites tecnológicas.
  • El hilo también debate astroturfing, moderación y si las empresas de IA intentan moldear activamente la opinión en HN.