La adulteración de texto con ‘marca de agua’ de Anthropic en Claude es una perversión de la escritura

El plan de Anthropic de “marcar con agua” todo el texto generado por Claude mediante un sesgo sutil en la elección de tokens ha desencadenado un debate más amplio sobre hasta dónde deberían llegar los proveedores de IA para habilitar la detección de procedencia. Los partidarios lo ven como una respuesta razonable a las normas de la UE y al “slop” generado por IA, y sostienen que los ajustes estadísticos son imperceptibles y afectan sobre todo a pasajes largos y muy escritos por máquina. Los críticos argumentan que degrada de forma encubierta la calidad de salida, conlleva riesgo de abuso en educación y disputas de copyright, centraliza el poder en los vendedores del modelo que controlan la detección, y simplemente empujará a los usuarios sofisticados hacia modelos abiertos o que no cumplan esas reglas.

Cómo funciona la marca de agua (según se discute)

  • Varios comentaristas explican los esquemas modernos: no cambian palabras a posteriori, sino que modifican cómo se hace el muestreo aleatorio a partir de las probabilidades de tokens del modelo (p. ej., RNG sesgado, conjuntos de tokens “verdes/rojos”, muestreo tipo torneo, métodos al estilo Gumbel-softmax).
  • Se afirma que los logits / la distribución de probabilidad subyacente permanecen igual; solo cambia qué tokens igualmente o plausiblemente probables se eligen, de una manera vinculada a una clave secreta.
  • La marca de agua solo es detectable en pasajes largos y sobre todo donde el modelo tiene alta entropía / libertad de elección de palabras. Las citas textuales y las salidas muy restringidas realmente no pueden marcarse con marca de agua.

Impacto en la calidad del texto y del código

  • Una postura: cualquier restricción que a veces empuje al modelo fuera de su “mejor” არჩევन degrada la calidad por definición y se acumula a lo largo de un pasaje. Esto preocupa especialmente por el ritmo de la prosa, la metáfora y la elección precisa de palabras.
  • Otra postura: los LLM ya dependen de aleatoriedad, temperatura, top‑k/top‑p, sesgos de RLHF y prompts de sistema; no existe un único “mejor token”. Sustituir una estrategia de PRNG por otra debería ser indistinguible en calidad, y las pruebas empíricas hasta ahora supuestamente muestran un efecto mínimo.
  • Algunos señalan que la escritura actual de los LLM ya es mediocre; un golpe del 1–2% se considera irrelevante. Otros dicen que ya perciben que la prosa de Claude empeora y les preocupa el impacto en la generación de código y comentarios.

Casos de uso: escritura, edición y “oficio”

  • Muchos argumentan que, si el wording exacto importa, no deberías descargar la escritura en un LLM en absoluto; úsalo para esquemas, crítica o diffs, no para el texto final.
  • Otros dependen de los LLM para corrección, pulido de ESL o redacción colaborativa y temen que su propio trabajo pueda ser marcado como contaminado por IA. Algunos replican que ediciones ligeras probablemente no contendrán suficientes tokens con marca de agua como para activar la detección.

Detección, falsos positivos y ley/política

  • Preocupa que los detectores devuelvan puntuaciones probabilísticas, no certezas; las instituciones pueden tratarlas como oráculos y perjudicar a estudiantes o autores por falsos positivos.
  • Las claves de la marca de agua son secretas; solo los proveedores pueden verificar la procedencia, lo que alimenta temores de afirmaciones unilaterales en litigios y falta de auditoría independiente.
  • Las reglas de la UE son un gran punto de fricción: algunos ven el watermarking como una infraestructura de bien público necesaria contra spam, trampas y desinformación; otros lo ven como una medida equivocada, teatro de seguridad o regulación de “estado niñera”.

Privacidad, procedencia y efectos en el ecosistema

  • Hay una fuerte ansiedad de que estos esquemas puedan incrustar IDs de cuenta o de sesión, permitiendo la desanonimización o el registro de todo el contenido generado.
  • Comprobar marcas de agua puede requerir enviar texto sensible a muchos proveedores, con el riesgo de nueva filtración hacia datos de entrenamiento.
  • Algunos prevén dinámicas de gato y ratón: parafraseo, modelos locales/de pesos abiertos o “deswatermarkers” dedicados para eliminar señales.
  • Unos pocos piensan que esto empujará a los usuarios avanzados hacia modelos abiertos y hará que los sistemas propietarios sean menos atractivos para escritura o programación serias.