Codex 抓取了 ICM 网站并发现了 2026 年菲尔兹奖得主名单

一次据称涉及 2026 年菲尔兹奖得主的泄露,是因为一个 AI 辅助的代码抓取工具从国际数学家大会网站公开 HTML 中的“隐藏”元素里提取出了姓名。评论者认为这本质上是基础网页开发失误,而不是复杂黑客行为,同时指出 AI 降低了发现此类错误的门槛,并引发了关于当局如何对待揭露此类问题的人们的疑问。讨论随后扩展到浏览器和 AI 服务的隐私与数据收集问题,并触及中文姓名顺序处理以及提前公开获奖者姓名的伦理争议。

泄露是如何发生的

  • 菲尔兹奖得主被嵌入在 ICM 2026 的公开日程 HTML 中,在前端被标记为“隐藏”,而不是在服务器端受保护。
  • 评论者指出,这是一个非常基础的网页泄露,在 LLM 出现之前就可以通过“查看源代码”或简单抓取发现。
  • 有人将其与付费墙文章相比,后者只是用 CSS 隐藏文本,而不是根本不提供内容。

LLM 与传统抓取的角色

  • 一方认为“Codex 发现了它”这种说法被过度渲染了;根本原因是糟糕的网页开发和基础安全错误。
  • 其他人反驳说,虽然人类也能做到,但 LLM 改变了规模和可达性,使这类发现更容易也更可能发生。
  • 关于如果任务很简单,给模型署名是否有意义,也存在争论。

法律与伦理问题

  • 几条评论提到过去的案例:那些负责任地披露简单漏洞的人曾被威胁起诉,尤其是在宽泛的反黑客法律下。
  • 另一些人说,这种极端反应并非常态,不过安全研究人员仍觉得自己必须谨慎。
  • 也有人觉得发现者过早公开了获奖者姓名,这很“不得体”。

隐私、Chrome 与隐藏 URL

  • 一段很长的支线讨论了“不可猜测”的 URL 或草稿页面如何在没有公开链接的情况下被 Google 索引。
  • 理论包括 Chrome 将访问过的 URL 回传给 Google、Cloudflare 的“crawler hints”、sitemap/CMS 行为、分析脚本、DNS 日志、浏览器“安全浏览”检查,甚至被入侵的扩展程序。
  • 有人坚持认为来自 Chrome 的 URL 数据是真实存在的,并且在反垄断诉讼程序中已有记录;也有人对其含义感到震惊,但认为这与大科技公司的监控模式一致。

命名与音译之争

  • 还有一段关于中文姓名顺序的旁支讨论(姓在前 vs 西式顺序)。
  • 有人认为媒体应遵循当事人自己的用法;也有人说音译和顺序本来就很混乱,且取决于语境。

更广泛的 AI/安全影响

  • 几条评论强调,LLM 可能会迅速暴露长期存在的“显而易见”漏洞和泄露,从规模而不是新颖性上改变安全格局。
  • 也有人反对媒体把责任归咎于“AI”,而不是底层的人为漏洞。