我们如何衡量 arXiv 上的 AI 写作,以及这种衡量在哪里会失效

对 2021–2026 年间 12,750 篇 arXiv 论文的分析声称,最近提交的论文中多达 39%、计算机科学中 65% 显示出 AI 生成写作的统计信号,而在 ChatGPT 发布前这一比例为 0.4%。评论者质疑 AI 检测器的可靠性和透明度,分享误报案例,并指出不断变化的写作风格以及广泛使用 AI“润色”模糊了人类与机器文本之间的界限。讨论还在争论 AI 辅助论文是否真的是问题,提出了对信任、欺诈、审稿负担以及写作作为科学质量信号被侵蚀的担忧。

检测器方法与可靠性

  • 许多评论者质疑该检测器的严谨性、可解释性和可复现性,尤其是多个子分数被合并的方式。
  • 用户报告称,在明显是人类、且早于 LLM 时代的作品(论文、旧论文、Stack Overflow 回答)上也会出现很高的“机器”分数,这表明存在不小的误报。
  • 也有人认为该检测器在他们自己的文本上表现良好,并把校准后的、ChatGPT 之前的误报率(约 0.4%)视为它“平均上是有效的”证据。
  • 相关担忧包括:
    • 训练数据泄漏和领域漂移(新术语、风格变化)。
    • 对 LaTeX/格式的敏感性。
    • 仅靠文本进行检测的理论极限,以及人类和 AI 风格的趋同。
  • Pangram 和 GPTZero 等商业工具被引用为“相当准确”但又“轻易就能骗过”,这凸显了人们对“准确率”在实践中究竟意味着什么存在分歧。

普及率估计及其可能失效之处

  • 报告中总体 AI 标记论文比例上升到约 39%、计算机科学领域约 65%,被一些人视为相当惊人,并且大致与对 arXiv 子集的独立检查相一致。
  • 也有人认为这个基线并不稳固:语言和风格会变化,而检测器可能捕捉到的是“现代风格”或主题漂移(例如 LLM 行话),而不是真正的 AI 作者身份。
  • 建议包括:纳入更早的预印本(2020 年之前)、按领域拆分,以及把检测器应用到预期更高质量把关的场所(例如顶级期刊)作为对照。

“那又怎样?”对科学与信任的影响

  • 一派认为这本身并没有什么大问题:如果科学内容是扎实的,而且论文更清晰,那么 AI 辅助是可以接受的;真正的问题是研究质量本身,而不是句子是谁写的。
  • 另一派强调:
    • LLM 倾向于幻觉事实、引用,甚至整段相关工作叙述。
    • 信任与质量信号被侵蚀(润色后的文字不再意味着努力或严谨)。
    • 审稿人的负担增加,信噪比上升,并用垃圾邮件和“enshittification”作类比。
  • 例子包括:论文中的引用完全是幻觉,以及会议审稿本就已经负担过重、成本低且敷衍。

LLM 用于润色与非母语作者

  • 非母语者描述说,他们会用 LLM 把“基础”的英语改成惯常的科学文体;许多人认为这是必要且公平的,只要科学内容经过核查。
  • 批评者认为:
    • “润色”往往会引入新的主张,或微妙地改变含义。
    • 追求一种通用的“科学风格”本身就是有害且不必要的。
  • 对此是否只是一个小工具使用,还是一种削弱个人责任的实质性共同署名,存在分歧。

激励、垃圾信息与检测军备竞赛

  • 评论者把 AI 使用增加与结构性激励联系起来:不发论文就出局、厌恶写作、以及廉价文本生成。
  • 有些人预计会出现更多“垃圾论文”,并主张把 AI 风格文本当作一个粗筛,哪怕偶尔会误拒好工作。
  • 也有人强调滥用检测器的危险(尤其是在教育中),并指出 AI 生成文本和规避 AI 检测的文本都很容易生成,因此检测不太可能形成稳定均衡。