使用 Claude 发现密码学弱点

Anthropic 声称其基于 Claude 的“Mythos”系统在降轮 AES 和 HAWK 后量子签名方案上发现了新的密码分析改进,这引发了关于这些结果的技术意义及其表述方式的争论。评论者普遍指出,这些攻击并不会危及现实世界中的密码学,但将其视为 LLM 通过搜索大规模解空间来增强专家研究的早期例子,同时也质疑其可复现性、发表包装,以及每个结果约 10 万美元的 API 成本。讨论还引出了更广泛的担忧:对尚不成熟的后量子方案过度依赖、强大模型访问权日益产生的不平等,以及“提示工程”究竟是真正的技能,还是仅仅清晰地描述问题。

密码学结果的范围和意义

  • AES 工作针对的是 7 轮 AES-128 且采用已知明文;现实系统中的完整 10 轮 AES 不受影响。
  • 相较于此前对 7 轮攻击的改进,被描述为边际性的(几比特安全性),并且只是长期一连串渐进式攻击中的一环。
  • HAWK 结果通过其格中的一个自同构,将简化版 HAWK-256 变体的有效密钥强度减半;这可能可扩展到 HAWK-512,但由于 HAWK 尚未部署,因此目前还不算现实世界中的关键问题。
  • 几位评论者强调,这属于对 reduced-round / chosen-plaintext 模型的标准密码分析实践,并不是对已部署系统的实际破解。

后量子密码学与安全担忧

  • 一些人对完全依赖 PQC 方案感到不安,更倾向于混合(经典 + PQC)模式;另一些人则反驳说,混合方案会增加复杂性和开销。
  • 关于量子时间线的争论:有人认为严重的量子威胁仍然很遥远;也有人指出,大公司已经在计划弃用前量子密码学。
  • 对“由 LLM 发现的 PQC 弱点”被用来推动或抵制 PQC 采用,持怀疑态度。

AI 贡献的性质

  • 许多人认为这些攻击是 AI 辅助下对既有想法的改进,而不是全新的概念。
  • 有几位把这比作 LLM 在数学中寻找反例:是在已知理论之上,借助不错的启发式进行大量搜索。
  • 一个关键的开放问题是可复现性:系统多频繁能找到“正确路径”,以及其中有多少是随机幸运、多少是多智能体协作。

成本、访问与不平等

  • 据说每个结果在约一周内消耗了大约 10 万美元的 API 用量;一些人认为这说明一种“技术贵族”正在出现。
  • 另一些人则认为,随着早期个人电脑时代那样的发展,成本会下降,而且内部团队天然会比公众用户拥有更高的吞吐量。
  • 讨论还拿更便宜的非美国模型作比较,对于它们缺乏类似公开结果,是意味着能力更低,还是只是优先级或保密程度不同,意见并不一致。

提示、工具与“AI 使用”作为一种技能

  • 所使用的提示词很随意、重复且充满拼写错误,因此有人淡化“提示工程”作为一门学科的说法。
  • 另一些人则认为,真正的技能在于界定任务范围、管理上下文、注意模型何时偏离或产生幻觉,并把它当作一个初级协作者来对待。
  • 关于复杂的 agent 设置(skills、config files)与简单工具访问加轻度引导之间,也存在争论;不同人的经验显示,额外结构有时有帮助,有时反而有害。

表述、公关与研究过程

  • 几位评论者觉得博客开头夸大了新颖性,因为这种弱点存在的可能性早已为人所知。
  • 对发表偏差和营销的担忧:许多失败的尝试不可见,而成功的尝试却被大肆宣传。
  • 另一些人则为此辩护,认为这就是正当的科学:检验模型的主张、撰写论文并接受社区审视,本来就是正常流程。
  • 也有人担心把这些结果过度解读为“AI 比密码学家更强”,而不是“AI 可以在有人类定义框架内加速渐进式工作”。

对数学和开放问题的更广泛影响

  • 有人担心,AI 会让某些问题变得微不足道,而让另一些问题显得“被加固”了,从而打击人类努力,因为“连 AI 都没法解决它”。
  • 另一些人则认为,人类会继续研究 AI 做不到的事情,并可能把 AI 作为工具,去探索那些被遗漏的简单想法或生成候选构造。