Anthropic 在 Claude 中对“水印”文本的篡改是对写作的亵渎
Anthropic 计划通过微妙地偏置 token 选择,为所有 Claude 生成的文本“加水印”,这引发了一场更广泛的争论:AI 提供商究竟该走多远,才能支持来源检测。支持者认为,这对欧盟规则以及泛滥的 AI 生成“垃圾内容”是合理回应,并声称这些统计微调在感知上不可察觉,主要只影响长篇、重度机器生成的文本。批评者则认为,这会暗中降低输出质量,可能在教育和版权争议中被滥用,把检测控制权集中在模型供应商手里,而且只会把高阶用户推向开源或不合规模型。
水印的工作原理(如讨论所述)
- 多位评论者解释了现代方案:它们不是事后去改词,而是修改模型按 token 概率进行随机采样的方式(例如带偏置的 RNG、“绿色/红色” token 集合、锦标赛采样、Gumbel-softmax 风格的方法)。
- 据称底层的 logits / 概率分布保持不变;变化的只是如何在同样或相近概率的 token 之间做选择,而且这种选择由某个秘密来标记。
- 水印只能在较长篇幅中、且主要在模型熵高 / 选词自由度大的地方被检测到。逐字引用和强约束输出基本无法真正加入水印。
对文本和代码质量的影响
- 一方观点:任何会偶尔把模型从“最佳”选择上拉开的约束,按定义都会降低质量,并且会在整段文字中累积。对散文节奏、隐喻和精确措辞尤其令人担忧。
- 另一方观点:LLM 本来就依赖随机性、temperature、top‑k/top‑p、RLHF 偏置和系统提示;并不存在唯一的“最佳 token”。把一种 PRNG 策略换成另一种,在质量上应当不可区分,而据称目前的实验证据也显示影响很小。
- 有人指出,当下 LLM 写作本来就很一般;1–2% 的损失被视为无关紧要。也有人说他们已经感觉 Claude 的文风在变差,并担心这会影响代码生成和注释。
使用场景:写作、编辑与“手艺”
- 许多人认为,如果精确措辞很重要,就不应该把写作外包给 LLM;应当把它用于提纲、批评或 diff,而不是最终文本。
- 另一些人依赖 LLM 做校对、ESL 润色或协作起草,并担心自己的工作会被标记为 AI 污染。也有人反驳说,轻度编辑很可能不足以包含足够多的水印 token 来触发检测。
检测、误报与法律/政策
- 担心检测器返回的是概率分数而非确定结论;机构可能把它们当成神谕,因误报而伤害学生或作者。
- 水印密钥是保密的;只有提供商能验证来源,这引发了在诉讼中单方面主张以及缺乏独立审计的担忧。
- 欧盟规则是一个主要争议点:有人认为水印是对垃圾信息、作弊和虚假信息作战所需的公共利益基础设施;也有人认为这属于误导、安保表演,或“保姆国家”式监管。
隐私、来源与生态影响
- 有人强烈担心这类方案会嵌入账户或会话 ID,从而实现去匿名化或记录所有生成内容。
- 检查水印可能需要把敏感文本发送给许多提供商,带来新的训练数据泄露风险。
- 有人预测会出现猫鼠游戏:改写、在地/开权重模型,或专门的“去水印器”来剥离信号。
- 还有少数人认为,这会把重度用户推向开放模型,并让专有系统对严肃写作或编码的吸引力下降。