使用“经典”机器学习检测 LLM 生成文本
使用相对较小的“经典”机器学习分类器来检测大语言模型(LLM)生成文本,结果显示出令人惊讶的高准确率,这也催生了诸如浏览器扩展之类的想法,用来像广告拦截器一样标记或过滤 AI 写作。评论者们争论,这种检测是否真的足够可靠或公平,能否用于评分、抄袭执法等高风险场景;原因包括误报、模型不断演进,以及通过改风格或后处理就能轻松规避。许多人认为,更现实的长期方案是关注出处和“工作证明”(例如编辑历史),或者仅把检测器当作低努力 AI 内容的经验性垃圾过滤器,而不是作者身份的最终裁定者。
当下的可检测性
- 许多人认为,目前的 LLM 输出与典型的人类写作有可检测的差异,尤其是商业化、经过 RLHF 调优的聊天模型,它们带有“企业 / 最大化参与度”的语气和风格怪癖(例如篇幅、保留说法、破折号使用)。
- 也有人反驳说,仅凭文本本身信号太弱,无法稳健地编码出处;充其量我们只能识别短暂的“特征”,而这些特征终将消失,有些说法甚至被比作占星术。
- 还有人指出,像 Pangram 以及博客中的分类器(合成“孪生”文本、小型 transformer)这样的系统,证明了目前在基准数据集上实现较高 AUC 和较低误报率是可行的。
可靠性与误报
- 人们强烈担忧在高风险场景中使用检测器(评分、工作、抄袭指控)。
- 即使误报率低至万分之一,如果后果是例如被开除,也被认为不可接受;工具最多应只是证据之一,并且需要人工审查和申诉渠道。
- 对于日常浏览,许多人认为 80–90% 的准确率已经“足够好”,可以跳过明显的垃圾内容,而不必指控具体作者。
军备竞赛与规避
- 反复出现的主题是:任何公开检测器都可以被当作对手(GAN 风格)来训练生成器和后处理器,以规避它。
- 建议包括高温度 / 高级采样、风格迁移,或用第二遍模型对输出进行改写。
- 有些人认为大型实验室并不把隐蔽性放在优先位置;另一些人则预计,如果平台开始大规模拦截 AI 垃圾内容,垃圾邮件发送者 / 诈骗者会优先考虑规避。
语言漂移与人类风格
- 有人担心,LLM 的广泛使用会把人类写作推向“LLM 语气”,使检测器随着时间推移变差,并不公平地误伤人类——尤其是 ESL 写作者或使用正式 / 企业风格的人。
- 也有人认为,人类仍然比模型更具多样性,也更难进行严格优化,因此目前仍存在可检测的差距。
工具与实际用途
- 多次提到浏览器扩展和小型本地设备分类器,用来把社交帖子和评论标记为可能是 AI 生成。
- 这些被定位为个人垃圾过滤器,而不是取证工具。
检测的替代方案
- 有人建议把重点放在“工作证明”上(编辑历史、带时间戳的草稿、审计轨迹),并衡量努力 / 质量,而不是出处。
- 据称一些场所会把检测器与审计轨迹结合起来,判断 AI 参与的程度。
对 AI 生成文本的态度
- 许多人不喜欢那种平淡、过于礼貌、令人难以忍受且篇幅冗长的低努力 AI 内容。
- 少数人表示他们确实喜欢 LLM 输出,会像参考资料一样反复查看。