A adulteração de texto com “watermark” da Anthropic no Claude é uma perversão da escrita
O plano da Anthropic de “watermark” todo texto gerado pelo Claude, enviesando sutilmente a escolha de tokens, desencadeou uma discussão mais ampla sobre até onde os provedores de IA deveriam ir para permitir a detecção de proveniência. Os defensores veem isso como uma resposta razoável às regras da UE e à enxurrada de “slop” gerado por IA, alegando que os ajustes estatísticos são imperceptíveis e afetam principalmente passagens longas e fortemente escritas por máquina. Os críticos argumentam que isso degrada covertamente a qualidade da saída, corre o risco de uso indevido em disputas de educação e direitos autorais, centraliza poder nos fornecedores do modelo que controlam a detecção e simplesmente empurrará usuários sofisticados para modelos abertos ou não conformes.
Como o watermarking funciona (conforme discutido)
- Vários comentaristas explicam os esquemas modernos: eles não trocam palavras depois do fato, mas modificam como a amostragem aleatória das probabilidades de tokens do modelo é feita (por exemplo, RNG enviesado, conjuntos de tokens “verde/vermelho”, amostragem em torneio, métodos no estilo Gumbel-softmax).
- Afirmam que os logits / a distribuição de probabilidade subjacente permanecem os mesmos; só muda quais tokens igualmente ou plausivelmente prováveis são escolhidos, de uma forma vinculada a um segredo.
- O watermark só é detectável em passagens mais longas e principalmente onde o modelo tem alta entropia / liberdade na escolha de palavras. Citações literais e saídas altamente restritas realmente não podem ser marcadas com watermark.
Impacto na qualidade de texto e código
- Um lado: qualquer restrição que às vezes desvie da “melhor” escolha do modelo degrada a qualidade por definição e se acumula ao longo de uma passagem. Isso é especialmente preocupante para o ritmo da prosa, metáforas e escolha precisa de palavras.
- Outro lado: LLMs já dependem de aleatoriedade, temperatura, top‑k/top‑p, vieses de RLHF e prompts de sistema; não existe um único “melhor token”. Substituir uma estratégia de PRNG por outra deveria ser indistinguível em qualidade, e testes empíricos até agora, segundo relatos, mostram efeito mínimo.
- Alguns observam que a escrita de LLMs atual já é medíocre de qualquer forma; uma perda de 1–2% é vista como irrelevante. Outros dizem que já percebem a prosa do Claude piorando e se preocupam com o impacto na geração de código e comentários.
Casos de uso: escrita, edição e “craft”
- Muitos argumentam que, se a formulação exata importa, você não deveria terceirizar a escrita para um LLM em primeiro lugar; use-o para esboços, crítica ou diffs, não para o texto final.
- Outros dependem de LLMs para revisão, polimento de ESL ou redação colaborativa e temem que o próprio trabalho seja sinalizado como contaminado por IA. Alguns respondem que edições leves provavelmente não conterão tokens watermarked o suficiente para disparar a detecção.
Detecção, falsos positivos e lei/política
- Há preocupação de que detectores retornem pontuações probabilísticas, não certezas; instituições podem tratá-los como oráculos, prejudicando estudantes ou autores por falsos positivos.
- As chaves do watermark são secretas; apenas os provedores podem verificar a proveniência, o que levanta temores de alegações unilaterais em processos e falta de auditoria independente.
- As regras da UE são um grande ponto de atrito: alguns veem o watermarking como uma infraestrutura de bem público necessária contra spam, cola e desinformação; outros o veem como equivocado, teatro de segurança ou regulação de “estado babá”.
Privacidade, proveniência e efeitos no ecossistema
- Há forte ansiedade de que esses esquemas possam embutir IDs de conta ou de sessão, permitindo desanonimização ou registro de todo o conteúdo gerado.
- Verificar watermarks pode exigir enviar texto sensível a vários provedores, com risco de novo vazamento de dados de treinamento.
- Alguns preveem dinâmicas de gato e rato: parafraseamento, modelos locais/de pesos abertos ou “des-watermarkers” dedicados para remover sinais.
- Alguns acham que isso empurrará usuários avançados para modelos abertos e tornará sistemas proprietários menos atraentes para escrita ou programação sérias.