关于研究人员能否信任 OpenAI 处理未发表数学的更多问题

有人指控 OpenAI 的模型可能使用了数学家的私密聊天记录来帮助解决重大开放问题,这加剧了人们对数据滥用和学术署名的担忧。评论者争论,近期在 Navier–Stokes 和群论等领域的“AI 突破”究竟是算法创新,还是对人类近乎完成的工作进行汇聚和放大,而这些工作可能来自研究聊天和用户提示。许多人将此视为对信任云端 AI 处理敏感知识产权的更广泛警示,主张使用本地模型、更强监管,以及围绕训练数据和署名的更明确保障。

据称在训练中使用了未发表的数学

  • 几位数学家声称,OpenAI 的内部模型很可能训练于包含硬问题进行中工作的私密 ChatGPT/Codex 会话(例如千禧年大奖难题)。
  • 一位数学家表示,他们在 6 月底选择退出训练,询问 OpenAI 之前是否使用过自己的数据,最初得到的是回避式回答,后来又收到一项说明,称 7 月初之后的数据不可能影响系统。
  • 许多评论者指出,外部人员实际上几乎不可能核实这些说法是否属实。

剽窃、抢发与署名

  • 一个核心不满是:据称 AI 实验室通过投入巨大算力和内部团队“截胡”几乎完成的工作,然后将结果包装成 AI 突破。
  • 指控包括:将私密聊天用作训练数据,在引用中遗漏或淡化关键的人类贡献者,以及试图塑造署名以排除竞争实验室的合作者。
  • 也有人认为没有蓄意盗窃的具体证据,并把这类行为比作学术界传统的抢发,同时指出这些数学家自己也使用了 AI 工具。

能力 vs 借力

  • 一派认为,这些结果是真实证据,表明前沿模型可以通过基于智能体的搜索加上证明助手(例如 Lean)在数学上取得重大进展,即使是建立在已知框架之上。
  • 另一派则认为,这些“突破”大多可能只是系统性地利用了人类思想和部分完成工作的既有“积压成果”,而非自主创造力。

数据使用、同意与暗黑模式

  • 许多人对提示默认被用于训练感到惊讶或愤怒,而且退出选项被隐藏,可能会被重置,或被部分绕过(例如通过点赞/点踩反馈或“分析目的”)。
  • 关于“去标识化”的用户数据用于训练是否可接受的争论;一些人认为这属于剥削和攫取,即便在服务条款之内也是如此。

对数学与研究职业的影响

  • 有报道称,学生开始质疑自己是否还要攻读纯数学博士,因为 AI 实验室可以抢先并盖过他们的工作。
  • 一些人预见会转向私有、非云端工作流程、arXiv 式的早期时间戳记录,或为本地模型提供资助。

更广泛的信任与结构性担忧

  • 广泛存在一种情绪:大型 AI 实验室建立在大规模抓取和激进 IP 使用之上,本质上并不值得信任。
  • 有人呼吁更强监管、更清晰的同意标准,并推动本地/开源模型;也有人认为,这只是用户必须采取的“常识性安全操作”。