Anthropic、OpenAI 和 Google 返回给客户端的加密推理链(chain-of-thought)是可以被完整窃取的。
一篇名为"Stealing Reasoning Traces from Proprietary LLM APIs"的研究论文展示了一种攻击手法,可以从商业 LLM API(如 OpenAI、Anthropic 等)返回的响应中,提取出模型内部的推理过程。
推理模型(如 OpenAI o 系列、Claude 的扩展思考)在回答用户问题之前会进行内部推理,这些推理过程通常对用户不可见,被认为是模型提供商的商业机密和核心 IP。但研究者发现,通过特定的提示工程技术,可以诱导模型在响应中泄漏部分推理轨迹。
Stolen Thoughts 论文展示了这个攻击路径:一个前沿模型产生的加密推理块,被注入到同一供应商的弱模型(如 Opus → Haiku)中,然后通过 jailbreak 弱模型,就能以明文形式读出前沿模型的完整推理过程。整个过程中不需要直接攻击前沿模型,也不需要触发它的反蒸馏保护。

关键在于推理块的加密设计。模型供应商返回的推理块是加密的,但可移植——可以在不同会话、不同用户、不同模型之间重放。这本来是为了支持跨模型切换(比如 Fable 用 Opus 做退路规划),但恰好成了攻击入口。
攻击只需要两步:第一步,拿到目标模型的推理痕迹(加密块);第二步,把它注入到同一个供应商的弱模型中,用 jailbreak 命令让弱模型转录出明文。
研究人员在 GitHub 和 Hugging Face 上收集了 6,708 条公开的 agent 轨迹,其中仍包含加密推理块。解码后获得了 315,320 条重构的推理块,在其中发现了 704 个隐私泄露项,包括 62 个 API key、33 个密码、24 个访问令牌、30 个个人邮箱地址。其中 64 项只出现在推理块中,在会话的可见部分根本找不到。
"这不只是理论漏洞,"Matthew Green(密码学教授)在 HN 上说,"我试过把 GPT 5.5 的推理块重放到 5.5-mini,确实没被拒绝,但 mini 没给我明文。这个团队把它做完了。"
HN 讨论中,有人指出修复方案并不简单。如果供应商禁止跨模型推理块重放,用户就无法在同一会话中切换模型——这正是 Fable 等产品的核心功能。Fable 的"安全话题退路到 Opus"机制依赖的就是这种跨模型推理块传递。这是一个便利性和安全性的两难。
参考来源: