Executivo da Microsoft chamou a raspagem por IA de 'o maior roubo de trabalho da história da humanidade'
Um processo judicial deslacrado, revelando um executivo da Microsoft chamando o treinamento de IA de “o maior roubo de trabalho da história da humanidade”, acendeu o debate sobre se grandes modelos de linguagem construídos a partir de conteúdo raspado da web constituem roubo, violação de direitos autorais ou uso justo transformador. Comentadores divergem sobre analogias com aprendizado humano, pirataria e escravidão histórica, a hipocrisia de empresas de tecnologia que antes combatiam a pirataria e agora ingerem em massa obras protegidas por direitos autorais, e a assimetria entre indivíduos punidos por infração e corporações recompensadas por isso. Muitos argumentam que, mesmo que o treinamento seja legal, ele desvaloriza o trabalho criativo, concentra poder em alguns poucos fornecedores de IA e pode justificar novos regimes de tributação, royalties ou mandatos de pesos abertos para reequilibrar os benefícios em favor do público.
O treinamento de IA é “roubo” ou apenas violação de direitos autorais?
- Muitos argumentam que a raspagem para treinamento é “o maior roubo de trabalho”: os modelos extraem valor de milhões de obras sem consentimento nem pagamento, e depois competem com os criadores.
- Outros insistem que isso não é “roubo” no sentido estrito: os originais permanecem, e copiar no máximo configura violação de direitos autorais; a lei tradicionalmente protege cópias, não “ideias/fatos/padrões”.
- Um contraponto recorrente: aprender com livros é legal para humanos; os opositores respondem que uma mente humana não rival não é comparável a um aprendiz de máquina altamente escalável usado comercialmente.
- O status jurídico é descrito como incerto: alguns tribunais concluíram que aspectos do treinamento se enquadram em uso justo; uso justo versus dano ao mercado continua central e contestado.
Escala, automação e dois pesos, duas medidas
- Comentadores enfatizam que a escala muda tudo: uma pessoa pirateando versus corporações varrendo a web, conjuntos de dados com acesso pago e até piratas, e depois monetizando as saídas.
- Muitos apontam hipocrisia: indivíduos foram fortemente punidos por pirataria; laboratórios de IA fazendo atos semelhantes em escala massiva são recompensados com avaliações de trilhões de dólares.
- As reclamações dos laboratórios sobre “roubo por destilação” dos modelos são vistas como especialmente hipócritas, já que seus próprios modelos são treinados com material sem licença.
Impacto sobre criadores, cultura e trabalho
- Há forte preocupação de que a IA prejudique o mercado para escritores, artistas, programadores, pesquisadores, músicos etc., ao vender substitutos baratos construídos a partir do trabalho deles.
- Alguns autores de código aberto e de blogs dizem que se arrependem de publicar publicamente; agora veem seu trabalho não remunerado alimentando ferramentas que podem encerrar suas carreiras.
- Outros argumentam que agregação e remixagem sempre foram o modo como a cultura avança; o maximalismo do copyright é enquadrado como uma aberração histórica impulsionada por grandes empresas de mídia.
- Há o temor de que o conteúdo original da web desapareça à medida que sites morrem (custos, carga de bots, perda de tráfego), com o conhecimento efetivamente “preso” em modelos proprietários e soterrado por “slop” gerado por IA.
Bens comuns vs propriedade e redistribuição
- Um lado recebe a IA como o momento máximo de “a informação quer ser livre” e uma reversão parcial de IP excessivamente ampliada, especialmente para obras que, de forma plausível, deveriam estar em domínio público.
- Outro lado insiste que IP é um direito legítimo; se treinar com obras protegidas por direitos autorais é permitido, então modelos e pesos também deveriam ser tratados como parte dos bens comuns.
- Remédios propostos incluem: impostos pesados ou divisão de lucros sobre empresas de IA, esquemas de royalties para criadores vinculados aos dados de treinamento, ou benefícios universais financiados pelos ganhos da IA.
Regulação e propostas estruturais
- As ideias vão de:
- Exigir consentimento e licenciamento para treinamento, com opções de exclusão que realmente funcionem.
- Exigir divulgação dos dados de treinamento e liberação de pesos de modelos mais antigos.
- Declarar as saídas dos modelos não passíveis de copyright e potencialmente sujeitas a reivindicações dos autores originais.
- Limitar o tamanho das empresas ou o compute, ou até banir certos modelos proprietários de fronteira.
- Alguns observam que a aplicação será politicamente difícil, especialmente devido à competição geopolítica e ao lobby corporativo.
Modelos abertos vs fechados e destilação
- Modelos de pesos abertos são citados como uma democratização parcial, mas críticos dizem que pesos abertos treinados com dados sem licença ainda são “roubo lavado”.
- Vários defendem a destilação como um “direito humano” de trabalhar com modelos treinados no corpus da humanidade; outros temem que isso consolide ainda mais a apropriação inicial sem compensação.
Preocupações sociais mais amplas
- Os tópicos exploram:
- Concentração de riqueza e poder se a IA automatizar tanto o trabalho mental quanto o físico.
- Custos ambientais e de infraestrutura de grandes data centers.
- Analogias com vigilância: o uso de dados “públicos” torna-se problemático quando automatizado e centralizado em escala extrema.