从专有 LLM API 中窃取推理轨迹

研究人员表明,OpenAI、Anthropic 和 Google 等专有 LLM 的加密“chain-of-thought”推理轨迹可以被重放到更弱的兄弟模型中,而这些模型随后又可被越狱,从而以明文泄露更强模型的隐藏推理。评论者分析了这一技术机制、提供方为何最初使用可移植的加密块,以及不同缓解方案(按模型密钥、禁用模型切换、服务端存储)对可用性和零数据保留承诺意味着什么。帖子还深入讨论了将这些恢复出的轨迹用于蒸馏的伦理与合法性,质疑“你为推理 token 付费后获得的内容,合理地算不算偷窃。”}

攻击机制与发现

  • 加密的 chain-of-thought(CoT)块可以被重放到共享同一解密层的更弱“兄弟”模型中。
  • 提供方在服务端解密该块,并将原始 CoT 输入模型上下文;随后,一个被越狱的较弱模型就可以被提示将其以明文形式回显。
  • 这并没有破坏密码学;它利用的是产品设计(跨模型、跨会话重放)。
  • 评论者指出了类似的 CoT “grug-speak” 模式,并确认解密后的轨迹与厂商此前展示的内容相吻合。

设计选择:无状态性与模型切换

  • 之所以存在加密 CoT,是为了让 API 可以“无状态”,同时仍能在多轮对话和模型切换之间保留推理内容,并支持零数据保留模式。
  • 跨模型复用被认为是有意设计;否则用户就无法在对话中途降级/升级模型。
  • 有人认为真正的缺陷不是加密本身,而是没有将轨迹与用户/会话紧密绑定。

潜在修复与局限

  • 提出的缓解措施包括:按模型分配密钥、按用户分配密钥、拒绝降级、在模型变更时剥离轨迹,或添加访问控制元数据。
  • 也有人反驳说加密细节并不重要:任何看到原始 CoT 的模型都可能被诱导泄露它。
  • 据称提供方已修补了这一特定攻击,但细节未公开,而且一些人担心未来的“修复”会损害可用性(例如锁定模型选择)。

蒸馏、竞争与 Kimi K3

  • 许多人将此视为一种强大的蒸馏通道:用昂贵的前沿模型完成正常工作,然后通过更便宜的模型收割 CoT。
  • 讨论中提到,有证据显示某个知名的非西方模型与某些专有 CoT 的对齐异常之高;一些人将其解读为先前蒸馏的强证据;另一些人则认为中国实验室同样取得了重大的独立进展,且“蒸馏解释一切”的说法被夸大了。

所有权、“窃取”与伦理

  • 关于访问 CoT 是否算“偷窃”的激烈争论:
    • 用户按 token 付费,包括隐藏的推理 token。
    • LLM 输出通常不受版权保护,尤其是在某些司法辖区。
  • 一方认为:厂商投入巨资生成专有推理轨迹,并通过加密、ToS 明确表明了保护意图。
  • 另一方认为:模型训练使用了世界上未能或未充分获得补偿的 IP;把使用 CoT 称为“盗窃”被视为虚伪,也是在扩张 IP 范围的话术。
  • 还区分了法律意义上的盗窃、违约、间谍行为以及简单的未经授权复制。

用户体验、透明度与安全权衡

  • 很多人希望直接访问推理内容,用于调试、建立信任、提示词调优,以及避免为不可见 token 付费。
  • 也有人越来越愿意接受不透明推理作为务实权衡:厂商可以更好地管理复杂推理代理,而用户可以专注于应用层。
  • 令人沮丧的是,安全/防护响应常常会削弱有用功能(例如移除完整 logprobs、未来可能禁止模型切换)。

安全、隐私与数据保留

  • 有人认为这不是典型的“安全”失败,而是不透明性/IP 保护失败;也有人将其与更广泛的安全担忧联系起来(例如避免未受保护的蒸馏模型)。
  • 担忧加密块可能包含 PII、秘密和凭证,而这些现在可能被暴露出来。
  • 零数据保留合同限制了服务端修复;客户端侧块最初部分就是为了避免存储这类数据。
  • 评论者指出,API 提供方在许多非 ZDR 场景下可能本来就会记录完整 CoT,所以这里的“加密”更多关乎用户可见性,而非真正的保密性。

工具使用变体与其他技术要点

  • 一个相关技巧是:关闭内置推理,提供一个自定义的“deep_think”工具,并要求模型将内部推理放入工具参数中,从而有效暴露 CoT。
  • 有人认为这在功能上与重放攻击类似,也有人将其区分为更像是对工具规范的滥用,而非跨模型加密缺陷。

基准、训练数据与轨迹

  • 有观察指出,模型有时似乎会“提前知道”基准答案;CoT 和 API 摘要模糊了真正推理与记忆化推导之间的界限。
  • 还有人指出,一旦基准公开,它们几乎肯定会进入训练数据;真正的问题是训练是否明确针对这些基准进行了优化。

元讨论:网站与 HN 体验

  • 许多人称赞论文的美学设计,但批评网站难以阅读,尤其是在移动端(旋转文字、图片重叠、滚动别扭)。
  • 另有关于 HN 提交体验的讨论:链接帖最初的“description”文本实际上会作为一个没有明显标识的顶层评论发布,这让提交者和读者都感到困惑。