Juiz rejeita a maior parte das alegações de direitos autorais de autores de livros contra o ChatGPT

Um juiz dos EUA rejeitou a maior parte das alegações de direitos autorais de autores de livros contra a OpenAI, deixando principalmente uma alegação californiana de “concorrência desleal” sobre o uso de obras protegidas por direitos autorais para treinamento sem permissão. Os comentaristas debatem se treinar grandes modelos de linguagem com textos pirateados ou sem licença deve ser considerado infração, contrapondo os argumentos antipirataria de longa data com a leniência atual mostrada às grandes empresas de IA. A discussão destaca questões em aberto sobre como os princípios existentes de direitos autorais e uso justo se aplicam ao treinamento de IA, a assimetria entre aprendizado humano e aprendizado de máquina na lei e o impacto potencial tanto em modelos de IA de código aberto quanto em autores que dependem de sua obra.

Âmbito da Decisão e Principal Alegação que Permanece

  • Muitos veem a principal questão remanescente como a alegação estadual de “concorrência desleal” sobre o uso de obras protegidas por direitos autorais para treinamento sem permissão.
  • Vários argumentam que o título do artigo é enganoso porque, mesmo com a maioria das alegações de direitos autorais rejeitadas, essa alegação restante pode ser altamente consequente.
  • Alguns observam que o juiz relutou em tratar todas as saídas de LLM como infração sem provas específicas ligando as saídas a obras particulares.

Pirataria, Cópia e Uso Justo

  • Há um forte debate sobre se usar cópias pirateadas para treinamento deve ser claramente ilegal, dado o discurso antipirataria de décadas.
  • Um lado: baixar/usar cópias pirateadas é, na prática, tolerado; apenas a distribuição é realmente punida.
  • Outros contrapõem que a reprodução não autorizada (incluindo o download) é infração, mesmo que raramente processada, e que se está confundindo aplicação civil com criminal.
  • Alguns argumentam que, se o treinamento for uso justo, a legalidade de como a cópia foi obtida talvez não importe.

Aprendizado Humano vs Treinamento de LLM

  • Comparações repetidas com humanos lendo livros: se as pessoas podem aprender com livros e depois criar, por que os modelos não poderiam?
  • Contraponto: a lei trata a memória humana como “intangível” e não como uma “cópia”, enquanto o armazenamento em computador é um meio fixo e tangível.
  • Vários insistem que a cognição humana é juridicamente especial; máquinas não herdam automaticamente essas exceções ou direitos.

Ideias vs Expressão e Obras Derivadas

  • Há amplo consenso de que direitos autorais protegem a expressão, não ideias, procedimentos ou conceitos abstratos (citando a linguagem estatutária dos EUA).
  • Exemplo discutido: usar ideias de ficção científica para construir tecnologia real é aceitável; reproduzir o texto não é.
  • Vários comentários enfatizam que as saídas de LLM devem ser avaliadas por cópia real/substituição de mercado, não apenas pelo fato de que o treinamento ingeriu obras protegidas por direitos autorais.

Implicações Econômicas e Competitivas

  • Um grupo teme que exigir licenças para treinamento consolidaria o domínio de grandes empresas que podem pagar por corpora massivos; modelos abertos sofreriam.
  • Outro grupo argumenta que “é só pagar por isso” (livros, notícias, imagens) é justo e valeria igualmente para todos os agentes, portanto não é inerentemente anticompetitivo.
  • Alguns esperam que, se licenças forem exigidas, surja um regime tipo Spotify em que empresas de mídia ganham bilhões, criadores recebem pouco e apenas alguns fornecedores de IA sobrevivem.

Assimetria Percebida e Legitimidade dos Direitos Autorais

  • Frustração de que argumentos antipirataria duros usados contra indivíduos agora pareçam amolecidos quando aplicados a grandes empresas de IA.
  • Alguns acham que, se os tribunais legitimarem o treinamento em larga escala com obras sem licença, isso enfraquecerá de fato a legitimidade dos direitos autorais em futuros casos de pirataria.

Regulação, Direito Futuro e Direção de Política

  • Vários comentaristas acham que os atuais marcos de direitos autorais não são adequados para LLMs e que nova legislação é inevitável.
  • Há discordância sobre se devem ser criados direitos especiais de “treinamento de IA” ou exceções explícitas para treinamento.
  • Alguns preveem que poderosos interesses da mídia não permitirão a “exploração livre” de todas as obras protegidas por direitos autorais; outros esperam isenções estreitas específicas para IA.

Qualidade e Origem dos Dados de Treinamento

  • Alguns argumentam que livros são dados de treinamento de maior qualidade do que texto geral da web e observam que muitos humanos também dependem de e-books pirateados.
  • Outros enfatizam que, se livros forem usados, as empresas de IA deveriam obtê-los legalmente e/ou licenciá-los, em vez de raspar cópias pirateadas.