Processo de direitos autorais do NY Times quer que a OpenAI apague todas as instâncias de GPT
O processo do New York Times contra a OpenAI e a Microsoft alega que seus modelos de IA foram treinados com milhões de artigos do Times protegidos por direitos autorais, sem permissão, que às vezes conseguem reproduzi-los literalmente e que agora competem com o negócio de assinaturas do jornal. Os comentadores debatem se esse treinamento é “fair use” protegido ou algo mais próximo de pirataria em larga escala, traçando analogias com mecanismos de busca, aprendizado humano e casos anteriores de direitos autorais, e discutindo o papel de paywalls e termos de serviço. Muitos esperam que o caso — ou um parecido — defina precedentes jurídicos decisivos para como a IA generativa pode usar conteúdo protegido por direitos autorais, com grandes impactos tanto para as big techs quanto para esforços menores ou de open-source em IA.
Escopo e objetivos do processo do NYT
- O NYT exige: destruição de modelos GPT treinados com seu conteúdo, exclusão dos conjuntos de dados de treinamento e uma liminar permanente, além de grandes indenizações em dinheiro.
- Muitos veem isso como uma jogada inicial maximalista, destinada a forçar um acordo de licenciamento, e não realmente “matar” o GPT.
- Alguns acham que o momento está ligado a negociações mais amplas entre IA e publishers (por exemplo, com a Apple e outros).
Direitos autorais, fair use e scraping
- A questão central: usar artigos protegidos por direitos autorais para treinamento em si já é infração, ou só há infração quando as saídas ficam próximas demais dos originais?
- Debate sobre os fatores do fair use:
- Finalidade/caráter: aprendizado transformador vs. substituição comercial.
- Natureza: notícias são em parte factuais, mas com expressão criativa.
- Quantidade: os modelos ingerem arquivos inteiros.
- Efeito no mercado: se os LLMs realmente substituem a leitura do NYT ou os mercados de licenciamento.
- Legalidade do scraping e ToS: alguns citam precedentes de que scraping de web pública pode ser legal; outros observam paywalls, termos do NYT alterados e robots.txt como evidência de não consentimento.
Memorização, regurgitação e correções técnicas
- Os exemplos mais fortes do NYT são a reprodução quase literal de artigos protegidos por paywall e de primeiros parágrafos.
- Uma corrente: isso prova que o modelo “contém” obras protegidas e que o treinamento é mais parecido com cópia comprimida do que com aprendizado à maneira humana.
- Outra corrente: esses são casos raros de overfitting nas bordas, que podem ser mitigados com temperaturas mais baixas, filtros (n‑grams/bloom), RLHF ou pré-sumarização das fontes.
- Preocupação adicional: os modelos alucinam conteúdo falso do NYT, levantando questões de difamação e diluição de marca.
Analogias entre humano e máquina
- Os defensores da OpenAI comparam o treinamento a uma pessoa lendo e depois resumindo ou sendo “influenciada” pelo NYT, argumentando que a arquitetura não deveria importar legalmente.
- Os críticos enfatizam escala, reprodutibilidade e implantação comercial: milhões de usuários, bypass automatizado de paywall e uma única corporação monetizando o trabalho de სხვas.
- Há uma rejeição repetida ao raciocínio “se um humano pode fazer isso, um modelo pode”, observando que ferramentas e pessoas recebem tratamento jurídico diferente.
Implicações econômicas, competitivas e sociais
- Muitos esperam um regime de licenciamento eventual: grandes publishers seriam pagos diretamente, criadores menores talvez por meio de fundos; o acesso aos LLMs ficaria mais caro.
- Há receio de que decisões fortes de direitos autorais favoreçam empresas com muito capital (OpenAI, MS, Apple, Google), prejudiquem open-source e startups e talvez empurrem o trabalho de ponta para jurisdições com aplicação mais fraca de PI.
- Outros argumentam que essa restrição é necessária para preservar incentivos ao jornalismo e ao trabalho criativo, e para evitar que algumas empresas de IA privatizem o valor da web.
- O fio reflete um desconforto mais amplo com a duração e o alcance atuais do copyright, mas há forte discordância sobre se o treinamento de IA deve ser claramente enquadrado como fair use legal.