围绕大模型蒸馏的争论由来已久。用强模型的输出训练较小模型,本来就是行业常见做法;而此前的争议所主要围绕的问题是:一家公司是否能未经许可,大规模调用竞争对手的模型,再用获得的数据训练自己的产品?
今年 2 月,Anthropic 指控 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超过 1,600 万次交互。7 月 Kimi K3 发布后,美国政府官员又指控它蒸馏了 Anthropic 的 Fable 模型,让这场争论再度升温。
不过,此前公开的证据和研究方法,主要围绕调用记录、最终回答和模型的输出风格。外部团队即使能够批量调用闭源模型,通常也只能获得答案,拿不到模型作答前的完整推理。厂商只向用户提供推理摘要,原始内容则被加密保存。如何稳定、批量地读出这些加密推理,此前一直没有公开方法。
8 月 10 日,一组来自 MATS Research、图宾根大学和马克斯·普朗克智能系统研究所等机构的研究者公开了这样一种方法。他们发现,Anthropic、OpenAI 和 Google API 返回的加密推理块,可以在同一家公司的不同会话、用户甚至不同型号的模型之间流动。攻击者无需取得密钥,只要让较弱的模型读取旗舰模型产生的密文,再诱导它把解密后的推理输出。

图丨相关论文(来源:arXiv)
弱模型成了解码器
我们知道,推理模型在回答复杂问题前,会先生成一段内部推理,也就是思维链(Chain of Thought,CoT)。通常情况下,产品界面和 API 向用户展示的“思考过程”只是一份摘要,完整内容仍由模型厂商隐藏。
在零数据保留、智能体调用工具等场景中,服务器不会永久保存每轮对话的全部状态。应用如果想让模型接着上一步工作,就要在下一轮请求中重新提交此前的信息。
为此,厂商会把完整推理加密成一段不透明的字符串,交给客户端暂时保管。开发者无法读懂其中内容,修改后也会被服务器拒绝;在下一轮请求中,他们只需把字符串原样传回。服务器验证并解密后,模型便能沿着此前的思路继续工作。OpenAI 和 Anthropic 的 API 文档都描述了这种机制。
漏洞也出在这里。厂商为加密内容验明了真伪,却没有把它与产生它的用户、会话和模型严格绑定。
今年 5 月,约翰斯·霍普金斯大学密码学教授 Matthew Green 发现,OpenAI 和 Anthropic 的加密推理块可以跨会话、跨账号重放;OpenAI 的部分推理块还可以交给其他型号的模型使用。他还观察到,被重放的内容有时会影响新会话的输出,这意味着模型确实读到了其中的推理。
Green 当时无法稳定地让模型输出完整内容。他把实验结果写成博文,希望其他人继续研究。三个月后,新论文把这项初步发现发展成了一套可以规模化运行的攻击。Green 随后更新博文,称研究团队已经把它“变成了一次真正可用的攻击”。
最简单的攻击只需要两次 API 调用。研究者先向旗舰模型提问,获得最终答案、推理摘要,以及装有完整推理的加密字符串。接着,他们把这段字符串放进另一场对话,伪装成较弱模型此前产生的思考,再要求它转录“自己刚刚的推理”。
服务器确认密文有效后,会将内容解密并放入模型的上下文。较弱模型此时接触到的已经是明文。只要提示词攻击成功,它就可能把这段内容直接输出。
旗舰模型通常接受过更严格的反蒸馏训练,API 还可能通过输入检测和输出匹配拦截提取行为。同一产品线中更便宜、更快的模型,防护能力却未必与旗舰模型相当。只要加密推理可以在不同型号间流动,攻击者就能绕开旗舰模型本身,转而攻击最容易被诱导的那个模型。
研究团队分别使用 Claude Haiku 4.5、GPT-5.6 Luna 和 Gemini Robotics ER-1.6 充当“解码器”。针对 Claude 的攻击最稳定;GPT 的防护更强,研究者需要更换提示词、反复采样,并将输出拆成较短的片段;Gemini 的输出噪声较多,需要生成多个版本后再进行校正。
为了评估恢复效果,团队让不同模型回答了 120 道 Codeforces 编程题,并比较 API 记录的隐藏推理 token 数量与恢复文本的 token 数量。多数结果接近 1∶1。恢复出的文本中,还出现了摘要未曾披露的计算步骤、工具结果和具体标识符。

图丨解析 Anthropic、OpenAI 和 Google API 中的推理链(来源:arXiv)
但要注意的是,研究者仍然拿不到厂商持有的原始明文,无法逐字核对。因此,论文所称的“完整转录”主要由 token 数量和内容一致性支撑,不能视为密码学意义上的严格验证。
论文发布后,安全研究员 Can Bölük 还展示了一个更简单的方法。他表示,关闭 GPT-5.6 Luna 的常规推理,并向模型提供一个名为 deep_think 的虚构工具,模型就会把一段很长的逐步推理写进工具调用参数。
不过它和论文的方法有本质区别。论文恢复的是已经生成、经过加密封装的原始推理;这个新方法更像是诱导模型在工具参数中重新生成一份详细推理,目前无法确认它是否与隐藏思维链逐字一致,也没有批量实验和 token 数量对照。

图丨相关论文(来源:X)
被公开的不只是一串乱码
对模型厂商来说,完整推理属于商业秘密。对开发者来说,更直接的风险来自智能体处理过的数据。
Claude Code、Codex 等工具经常接触源代码、环境变量、API 密钥、数据库连接和个人资料。开发者为了复现实验或分享运行过程,会把智能体轨迹上传到 GitHub、Hugging Face 等平台。发布前,他们可能清理了可见文本,却容易留下看似无法读取的加密推理块。
研究团队收集了 6,708 条公开智能体轨迹,从中恢复 315,320 个推理块。经过两轮自动标注和去重,1,028 个推理块含有至少一项真实隐私信息,占总数的 0.3%;按完整轨迹计算,328 条轨迹发生泄露,占 4.9%。
排除基准测试中的合成数据后,真实用户会话中仍有 704 个不同的隐私或技术标识,包括 62 个 API 密钥、33 个密码、24 个访问令牌、7 个私钥、30 个个人邮箱、130 个人名和 36 个邮政地址。其中 64 项只存在于隐藏推理,在可见聊天记录中完全找不到。

图丨解码后的推理过程包含隐私痕迹(来源:arXiv)
其中一类反复出现的场景是“清理敏感信息”。用户要求智能体删除代码或日志中的密钥,模型为了执行任务,会先在隐藏推理里重新列出需要删除的值。最终文件已经变得干净,那些密钥却被写入加密推理,随日志一同上传。
日志发布者无法解密这部分内容,自然也无法检查和清理。结果就导致,数据的主人看不到它,拥有同系列模型调用权限的第三方却可以把它读出来。
这项漏洞还会穿过模型的安全拒绝。模型处理危险问题时,内部可能已经分析了具体方法,最终回答才删除操作细节。例如,旗舰模型最终只给出安全建议,加密推理中却已经包含被省略的操作信息。
这套机制还可以反过来用于提示词注入。攻击者先让一个模型在推理中接受恶意指令,再把这段经过认证的密文植入公开的智能体轨迹。其他人接着运行这段轨迹时,看不到任何异常文字,模型却可能把密文中的指令当成自己此前的想法,继续执行下去。
在论文的概念验证中,一段受污染的推理让 GPT-5.6 Sol 在完成普通 PowerPoint 编辑任务时,额外生成了向外部服务器上传文件的代码。和普通提示词注入不同,这些指令藏在用户根本读不到的字段里,日志审计也看不见。
它无法证明谁进行了窃取
完整思维链包含问题分解、试错路径、中间计算和工具选择,比最终答案更适合作为训练数据。论文估算,按 Claude Haiku 4.5 当时的价格,解码 1 万条推理轨迹约需 720 美元。若密文来自公开日志,攻击者甚至不用再次调用昂贵的旗舰模型。
研究团队也借此检查了近期最受争议的问题:Kimi K3、GLM-5.2 等开放权重模型是否表现出专有模型蒸馏的痕迹。
他们把一小段恢复出的 Claude Opus 4.8 推理填入 Kimi K3 的思考开头,再让 Kimi 自由完成后续推理和回答。在 30 道 Humanity"s Last Exam 题目中,加入 Opus 推理前缀后,Kimi 的可见回答在 29 道题上更接近 Opus 的措辞和结构。类似干预也会让 Kimi 和 GLM-5.2 的推理风格接近 Opus,DeepSeek-V4-Flash 等对照模型则没有出现同等幅度的变化。

图丨用 Opus 的少量推理标记预填充 Kimi-K3 的推理过程,会显著使其响应向 Opus 的偏移。(来源:arXiv)
这些结果表明,不同模型对同一段推理表现出了不同程度的适应性。但这种差异从何而来,实验无法回答。Kimi 和 GLM 的训练数据可能包含 Claude 生成的内容,也可能只是因为模型使用了相似的数据、提示格式或服务配置。实验样本较小,集中在基准题目上;研究使用的 Opus 推理也不是厂商提供的原始明文,而是通过较弱模型恢复出的近似文本。
因此,这部分实验只能提供线索,无法证明 Kimi、GLM 或其他具体模型曾使用 Claude 的推理进行训练。论文只是公开了一种提取闭源模型推理的方法,但没有为此前的蒸馏指控提供决定性证据。
研究团队在 7 月上旬完成实验,并在论文发表前向 Anthropic、OpenAI、Google、Microsoft 和 Hugging Face 披露漏洞。截至 8 月,正文中的攻击已经无法按原方法复现,说明厂商封堵了已知路径,具体修改没有公开。
参考资料:
1.https://x.com/kotekjedi_ml/status/2087147093735714919
2.https://arxiv.org/pdf/2608.09867
3.https://blog.cryptographyengineering.com/2026/05/29/fooling-around-with-encrypted-reasoning-blobs/
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
声明:本文来自DeepTech深科技,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。