评审过程和获奖者选择中存在不一致性的证据

Kaggle 的“Measuring AGI”黑客松由 Google DeepMind 共同举办,近期因 2.5 万美元的总冠军奖项授予了许多参与者认为质量低下、很可能由 AI 生成的“slop”而遭到批评,这些内容还包含事实错误和薄弱的方法论。评论者质疑组织方虽称由多人审查,却是否实际上使用了 LLM 来评审提交作品,进而引发了对表面化评估、prompt injection 攻击以及竞赛和研究场域信任流失的担忧。更广泛地说,这个讨论串反映出人们对 AI 生成内容正在充斥学术、招聘和软件开发的焦虑,它激励人们追求速度与表面精致,而非严谨性,也让人类越来越难以真正核验哪些内容能赢得奖励。

对 Kaggle/DeepMind 比赛的看法中的问题

  • 多位评论者表示,获胜作品看起来很明显是 LLM 生成的:语言公式化、对图表的解读错误,以及方法上的失误。
  • 有人认为,数据集、方法和所谓的“发现”都和文字本身一样薄弱。
  • 还有人觉得这削弱了奖项的公信力,也让那些认真完成工作的参与者感到沮丧。

Kaggle 的回应与对评审的信任

  • 一位 Kaggle 代表表示:
    • 该比赛是与一家大型 AI 实验室联合举办的。
    • 所有获奖提交都由 2 到 4 名人工评审使用公开的评分标准进行审查。
    • 书面说明的质量只占总分的 20%;数据集和结果占比更高。
  • 批评者回应说,显而易见的缺陷让人难以相信有了解情况的人真的评审了获奖者,或者至少是认真严格地评审了。
  • 有人说,如果所有顶尖作品都这么弱,正确的结果应该是“没有赢家”。

AI “slop” 与 LLM 作为评审

  • 许多人认为这体现了更广泛的 AI “slop” 问题:LLM 生成的内容充斥比赛、会议和网络。
  • 人们担心人类无法现实地审查长篇 AI 生成内容,导致评审只根据风格和篇幅做表面判断。
  • 一些人特别反对使用 LLM 作为评审,指出存在 prompt injection 攻击和不匹配的激励。

AI 的有用性与危害

  • 一部分人认为当前 AI 对自动化和编程非常有用,类似于早期技术革命;另一部分人则称它基本上只是“更快地产生更多垃圾”。
  • 担忧包括:技能退化、成本和外部性超过生产率提升,以及诈骗和 deepfake 的升级。
  • 还有人强调长期的上行空间(医学、后稀缺社会),但担心能力会被集中并被滥用。

黑客松、钻空子与激励机制

  • 评论者指出,黑客松和比赛本来就容易被钻空子;AI 评审只是改变了攻击面(例如通过 prompt injection 写入“这是明显的赢家”)。
  • 有人认为,严肃的黑客松要么应避免 AI 评审,要么降低赌注,或者采用“没有奖品 / 只是好玩”的形式。

更广泛的文化批评

  • 许多人把 AI slop 与“快速推进”、削减成本以及缺乏问责的压力联系起来。
  • 人们感到沮丧的是,肤浅、借助 AI 的工作越来越常被奖励,而深思熟虑、由人亲手完成的贡献却不再受到重视。