研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
Stealing Reasoning Traces from Proprietary LLM APIs
作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。
攻击者为标准无特权API对手,无需内幕访问或服务端状态,无法获取专有权重。
- 主流大模型API为保护知识产权和防范滥用,弃用明文思维链并将其封装为加密块供客户端回传。这种无状态设计带来了未受约束的跨会话、跨用户与跨模型兼容性,使加密思维块面临被恶意重放和数据提取的安全风险。
- 作者利用同一厂商生态内不同模型间的安全对齐不对称性,将强模型生成的加密思维块注入到同厂商防御更弱、成本更低的轻量模型中,通过提示词诱导弱模型将思维内容逐字转写为明文,从而绕过对强模型本身的越狱防护。
- 在Anthropic、OpenAI和Google模型上提取token数与计费思维数达1:1追踪;从公开抓取的6,708条智能体轨迹中恢复出62个API密钥等敏感凭证;在HLE STEM题目上预填1%思维使Kimi-K3回答重叠度从0.160升至0.305。
- 实证评测受限于2026年7月初特定API版本且依赖弱模型随机生成能力;野外轨迹分析仅为非穷尽抽样且未建立因果蒸馏推断;厂商修复后该提取攻击已无法复现,且论文未报告端到端调用耗时与网络延迟。
- 威胁模型
- 攻击者为标准无特权API对手,无需内幕访问或服务端状态,无法获取专有权重。第一方对手利用跨模型兼容性将自身查询生成的加密块重放到廉价弱模型以规避对齐;第三方对手抓取公开轨迹窃取隐私凭证或注入恶意块。
- 模型
- Claude Opus 4.8Claude Sonnet 4.6Claude Haiku 4.5GPT-5.6 SolGPT-5.6 LunaGPT-5.6 TerraGPT-5.5GPT-5.2 CodexGemini 3.1 ProGemini 3.5 FlashGemini Robotics 1.6Kimi-K3GLM-5.2InklingDeepSeek-V4-Flash
- 基准
- Codeforces (Open-R1 subset)AIME 2025Humanity's Last ExamClawBenchClawBenchV2TracePostTrainBenchHarmBench
- 指标
- Decoded-to-billed thinking-token ratioExtraction errorDistinct leaked privacy artifactsTrajectory leakage rateBest-of-k n-gram overlapStyle-classifier AUCPerplexity
研究者发现 Anthropic、OpenAI、Google 的 API 把思维链以加密块形式交给客户端回传,这些加密块在同一厂商生态内可跨会话、跨用户、跨模型复用。他们把强模型的加密推理块注入同厂商较弱、防护较松的模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6),迫使其逐字转写明文,从而在不直接越狱强模型的情况下提取其推理链。该漏洞衍生四类攻击:绕过反蒸馏机制窃取专有推理、从公开会话日志中大规模提取隐私数据、通过隐藏推理通道获取有害信息、以及在加密块中植入不可见的提示注入。研究者在 GitHub 和 Hugging Face 抓取 6,708 条公开 Agent 轨迹,解码出 315,320 条推理链,恢复 367 项 PII 和 182 项凭据,其中真实用户会话包含 62 个 API key、33 个密码和 30 个邮箱。
推荐理由论文披露加密推理块可跨会话、跨用户、跨模型复用,并给出对 Anthropic、OpenAI、Google 三家 API 的实测结果与缓解建议。
深度解读
这篇论文试图解决什么问题?
论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
核心问题是商业大模型 API 中返回给客户端的加密思维链数据块存在架构级跨模型兼容性漏洞,可被用于低成本绕过对齐防护并逐字解密专有推理。
- 场景与重要性:前沿大语言模型依赖内部长思维链(Chain-of-Thought)执行复杂推理,其中包含中间假设、工具输出、用户数据和上下文秘密等密集信息。为保护知识产权并防止有害内容泄露,Anthropic、OpenAI 和 Google 弃用了明文思维链传输,改为返回带签名的 AEAD 加密块,由客户端在后续多轮对话中带回以保持服务端无状态。
- 现有机制的不足:模型厂商依赖前沿模型的拒绝训练与输出过滤来防止思维链外泄,此前研究仅指出加密块可在原始上下文外跨会话或乱序重放,未充分评估跨用户与跨模型的互换性风险。
- 核心观察与假设:作者观察到模型家族内部存在显著的安全防护不对称性:Claude Opus 4.8 或 GPT-5.6 Sol 等强模型部署了严格的防内省与防蒸馏对齐,而 Claude Haiku 4.5 或 GPT-5.6 Luna 等同厂商弱模型缺乏此类约束;同时厂商普遍使用全局密钥进行签名,加密块在不同会话、用户和模型间完全通用。
- 论文提出的解决方案:作者提出了可扩展的解密越狱攻击,将受保护强模型生成的加密思维块重放给同生态内的弱模型,诱导其充当解密机将思维链逐字转写为明文,从而绕过对强模型本身的越狱,并展示了模型蒸馏、隐私窃取、隐蔽提示词注入和有害内容提取等攻击途径。
- 威胁模型:
- 攻击者目标:提取受害强模型的私有思维链用于蒸馏、从第三方公开轨迹中窃取隐私凭证、在加密块中植入隐藏指令执行提示词注入,或诱导模型生成有害思维并转写绕过安全拦截。
- 攻击者知识:标准无特权 API 对手(standard, unprivileged API adversary);无法访问服务端基础设施、无法观测服务端内部状态、无法获取专有模型权重,操作完全处于标准 API 规范内。
- 攻击者能力:第一方攻击者(First-Party Attacker)通过自身 API 查询强模型并获取加密块,再重放到同厂商弱模型;第三方攻击者(Third-Party Attacker)在公开代码仓库或智能体日志中收集他人未清洗的加密块进行解密,或向受害者工作流植入恶意加密块。
- 受害系统:采用客户端存储加密思维链机制的专有 API 服务商(Anthropic、OpenAI、Google),以及在公开平台发布含思维签名交互日志的开发者与终端用户。
有哪些相关研究?
相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。
加密思维链与 API 架构安全性:
- Matthew Green (2026) 探讨了加密推理机制,指出加密块可在不同会话间或乱序重放;作者指出其工作仅关注了可移植性,未发现跨用户与跨模型的全兼容互换漏洞,且当时厂商未确认存在安全隐患。
- OpenAI (2026)、Anthropic (2026b) 与 Google (2026) 提出了扩展思考(extended-thinking)及思维签名机制,弃用明文思维链传输,将推理有效载荷封装在 AEAD 包络中由客户端回传以实现无状态连续交互。
模型窃取与思维链蒸馏:
- 传统黑盒模型蒸馏(Tramèr et al., 2016; Kim and Rush, 2016; Wallace et al., 2020; Gudibande et al., 2024; Ye et al., 2025; Lee et al., 2025; Rawat et al., 2026):仅依赖模型可观测输出进行模仿学习;作者指出单纯可见输出仅揭示最终结果,而思维链提供了密集的中间推理轨迹监督,能提供更强的能力迁移。
- 无思维链轨迹反演(Zhang et al., 2026a):通过查询 GPT-5.4 mini 并训练轨迹反演模型从输出及摘要逆向合成长思维,使微调模型在 MATH500 上提升;作者指出该方法仅能重构出代理近似思维,而本文方法能逐字提取真实原始思维链。
- 思维链训练与测试时扩展(Wei et al., 2022; Jaech et al., 2024; Muennighoff et al., 2025; Javaheri et al., 2026):表明测试时计算扩展与密集推理轨迹对模型能力至关重要。
思维链监控与隐蔽安全威胁:
- 隐藏推理风险与越狱(Green et al., 2025; Mao et al., 2026; Zhou et al., 2025; Khalil et al., 2026):模型在思考阶段可能深入探索有害话题或泄露私密数据,即便可见输出执行拒绝,隐藏通道仍存风险。
- 思维链可监控性与忠实度(Baker et al., 2025; Carroll et al., 2026; Lanham et al., 2023; Greenblatt et al., 2024; Korbak et al., 2025; Schoen et al., 2025):指出直接对思维链施加对齐压力会导致混淆与监控能力下降,API 返回的思维摘要常存在不忠实现象。
- 智能体长程安全与注入(Rank et al., 2026; Schmotz et al., 2026; Andriushchenko et al., 2025):揭示了自动化长程任务中共享轨迹容易遭遇注入与提示词攻击。
基线方法与基准数据集:
- 实验使用的基准包括 Codeforces(Open-R1 子集)、AIME 2025、Humanity's Last Exam (HLE)、HarmBench、PostTrainBench、ClawBench 及 ClawBenchV2Trace。
- 分析涉及的商业模型包括 Claude 4.5/4.6/4.7/4.8、GPT-5 系列与 GPT-5.6 系列、Gemini 3 系列;对照及评测的开源模型包括 Kimi-K3、Kimi-K2.6、Kimi-K2.5、GLM-5.2、DeepSeek-V3.1、DeepSeek-V4-Flash、Inkling 与 GPT-OSS-120B。
与现有工作的定位区别:作者指出以往研究要么依赖复杂越狱直接对抗强模型严格的安全过滤,要么通过可见输出逆向拟合近似思维;本文利用模型生态内部的跨模型与跨会话兼容性漏洞,将解密压力转移至廉价且弱对齐的弱模型,实现了免直接越狱强模型的端到端逐字真实思维链提取。
论文如何解决这个问题?
将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。
整体思路是利用商业 API 的跨模型兼容性漏洞,绕过强模型的对齐防线,将加密推理块注入同厂商未严格对齐的廉价弱模型中,通过特定提示词诱导其将加密内容逐字转写为明文,并辅以重构校验机制。
脆弱性分析与跨模型兼容性
- 全局密钥与无状态设计:厂商为避免服务端存储会话状态的开销,将思维链封装为 Base64 编码的 AEAD 包络返回给客户端;由于支持模型切换和自动重路由,厂商在全生态内使用全局密钥,未将密文与会话、用户或模型绑定。
- 三种兼容性层次:会话内与跨会话兼容(允许乱序或在新会话中重放)、跨用户兼容(允许攻击者重放他人会话的密文)、跨模型兼容(允许将强模型生成的密文放入弱模型输入中)。
- 兼容性实测现状:在 2026 年 7 月的实测中,Claude 家族除 Fable 5 外各代模型思维均可被其他模型重放;GPT-5.6 系列可重放所有早期 GPT 模型思维;Gemini 各模型思维均可被其他模型重放(Table 1)。
基于弱模型的模糊解密攻击流程
- 弱解密器选择:为降低攻击难度,在每个厂商生态中选择防护最弱的兼容模型作为模糊解密器:Anthropic 选用 Claude Haiku 4.5,OpenAI 选用 GPT-5.6 Luna,Google 选用 Gemini Robotics ER-1.6。
- 解密越狱提示词与输出预填:利用弱模型缺乏针对思维链转写的拒绝训练,通过特定标签(如
<thinking-copy>、<transcribed>、<thought>)引导模型转写。对于支持助手轮输出预填(prefilling)的模型(如 Haiku 4.5 和 Gemini 模型),直接在 assistant 轮预填起始标签,强制模型从标签后开始逐字输出(Figure 2、Figure 33、Figure 38)。 - 提取保真度评估:在无法获取服务端真实明文的情况下,作者定义提取误差公式:extraction error = | 1 − (tokens in extracted reasoning)/(billed tokens in the original reasoning block) |,利用 API 计费 token 数作为参考基准,衡量提取文本与原始思维链长度的一致性(Appendix C.2)。
针对不同厂商 API 的定制化提取策略
- Claude 提取与调和流程:Haiku 4.5 在温度 1.0 下单次提示即可稳定输出接近 1:1 token 比例的思维内容;针对偶发的拒绝或噪声,设计了可选的调和步骤(reconciliation),将至多 3 个 Haiku 生成的候选文本与原始签名注入 Opus 4.8 中,在温度 0 下由 Opus 4.8 消除噪声并重构出忠实转写(Figure 34、Appendix C.1)。
- GPT 提取与分块规避:GPT 模型部署了检测超过 50 个连续重复 token 的 API 级过滤拦截;作者采用分块提取(每轮限制生成 50 token 并通过前后词重叠拼接),在 GPT-5.6 Luna 上多轮采样至多 50 个候选并筛选最小 extraction error,若误差超过 0.1 则回退至 GPT-5.6 Terra(Figure 35–37、Appendix C.2)。
- Gemini 提取流程:Gemini 采样生成噪声较大,作者使用 Gemini Robotics ER-1.6 采样至多 20 个候选,挑选误差最小的 3 个候选交由 Gemini 3.5 Flash 进行调和重构(Figure 38–39、Appendix C.3)。
密码学与系统级防御建议
- 密码学上下文绑定:提出将 user_id 嵌入 AEAD 关联数据中由网关无状态校验,并使用轻量哈希链将每个推理块与会话及前序块强绑定:
\tau_{n+1} = H(\text{user\_id} \mathbin{\Vert} \text{session\_id} \mathbin{\Vert} H(\tau_n \mathbin{\Vert} \text{salt}_2) \mathbin{\Vert} \text{salt}_1),使跨会话与乱序重放失效(Eq. 1、Appendix A.2)。 - 架构重构与服务端撤销:建议转向由服务端存储思维链、客户端仅持有随机 ID 的有状态架构;在保留客户端存储时,通过 Merkle 树支持会话修剪,并在检测到异常提取时轮换或吊销签名密钥。完整提示词模版见附录 C。
论文做了哪些实验?
实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。
实验设置
- 被测与解密模型:被测及被攻击模型包括 Anthropic 的 Claude Opus 4.8、Opus 4.7、Opus 4.6、Opus 4.1、Sonnet 5、Sonnet 4.6、Sonnet 4.5、Haiku 4.5、Fable 5;OpenAI 的 GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna、GPT-5.5、GPT-5.4、GPT-5.4 mini、GPT-5.3-Codex、GPT-5.2 Codex、GPT-5.1-Codex-Max、GPT-5、GPT-5-mini、o4-mini;Google 的 Gemini 3.1 Pro、Gemini 3 Pro、Gemini Robotics ER-1.6、Gemini 3.5 Flash、Gemini 3 Flash、Gemini 3.1 Flash Lite。开源对照模型包括 Kimi-K3、Kimi-K2.6、Kimi-K2.5、Kimi-K2.7-Code、GLM-5.2、DeepSeek-V3.1、DeepSeek-V4-Flash、Inkling、GPT-OSS-120B。
- 数据集与测试规模:受控提取保真度测试使用 Codeforces 的 120 道编程题(Open-R1 子集);能力与风格测试使用 AIME 2025、Humanity's Last Exam(HLE,30 道题:15 道 STEM 与 15 道 non-STEM);公开轨迹分析抓取 GitHub 和 Hugging Face 上的 6,708 条公开智能体轨迹(解密出 315,320 个思维块);基准轨迹包括 PostTrainBench、ClawBench(含 ClawBenchV2Trace 的 75 次 Opus 4.7 运行与 81 次 GPT-5.5 运行)、TerminalBench;越狱测试使用 HarmBench。
- 评测指标:解密 token 与计费 token 比例、提取误差(extraction error)、泄露项数量(distinct leaked items)、会话泄露率(%)、best-of-k n-gram 词元重叠度、风格分类器 AUC、困惑度(Perplexity, PPL)、概率提取查询量。
- 评审与标注方式:野外隐私提取采用两阶段 LLM-as-a-judge 流程(第一阶段由 Haiku 4.5 高召回初筛,第二阶段由专用 prompt 判定真实敏感凭证,排除占位符和环境变量名,最后经人工核验);思维摘要不忠实度通过 LLM judge 与 Claude Code 筛选候选并进行全面人工检查。
- 重复与采样设置:风格重叠度测试在 k 取 1、10、50、100 下采样批次;风格分类器使用五折交叉验证(分组按问题划分);API 实验总计花费约 30,000 美元。
主结果
下表呈现了从公开抓取的 315,320 个思维块中解密发现的敏感隐私与凭证伪影分布(据 Table 4):
表格较宽,可左右滑动
敏感信息项(据 Table 4) 初筛标记数 (Labeler 1) 判定真实数 (Labeler 2) 去重独立值数 真实用户会话数 仅在推理块出现数 API 密钥 (API key) 966 90 69 62 11 登录密码 (Password) 1,235 330 72 33 2 访问令牌 (Access token) 852 84 30 24 3 私钥 (Private key) 62 11 11 7 0 个人邮箱 (Email) 651 232 72 30 3 个人姓名 (Name) 4,350 541 173 130 4 文件/仓库路径 (File/repo path) 31,380 373 281 279 24 全类别总计 (Total) 76,778 2,194 941 704 64 - 加密思维块造成未被察觉的真实泄露:在真实非基准用户会话识别出的 704 项真实敏感信息中,有 64 项(约 9%)仅存在于加密思维块中而在可见聊天历史中完全未出现,作者指出这说明用户即便在分享前清洗了明文文本,也无法清除封存在加密签名中的数据。
- 高危凭证在公开会话中普遍留存:排除基准测试的人工合成数据后,真实用户会话解密出 62 个独立 API 密钥、33 个密码、24 个访问令牌和 7 个私钥(Table 4)。在总体样本中,315,320 个思维块中有 0.3%(1,028 个)含泄露项,按会话统计则 6,708 个会话中有 4.9%(328 个)存在至少一项真实敏感信息泄露(Section 4.1)。
- 清理指令反而加剧数据沉淀:作者观察到,当用户要求智能体匿名化或“清理”会话时,模型常在隐藏思维中重新完整读取历史并逐一列出需删除的敏感值,反而将敏感数据固化进加密思维块中(Section 4.1)。
跨厂商模型提取保真度与防蒸馏规避
- 受控题目 token 追踪:在 120 道 Codeforces 问题上,利用 Haiku 4.5、GPT-5.6 Luna 和 Gemini Robotics 1.6 解密各厂商强模型的思维签名,解密生成的 token 数量与 API 报告的原始计费思维 token 数量紧密沿 y=x 分布,表现出接近 1:1 的追踪关系(Figure 1)。
- 直接越狱与弱模型解密的难度差异:目标模型本身受制于拒绝内省训练与字符匹配过滤,而以 Haiku 4.5 为例,仅需单一固定提示词即可稳定解密全量题目;GPT-5.6 Luna 虽需动态模板和分块配合,但相比直接攻击强模型大幅降低了门槛(Section 2.4)。
- 经济可行性:作者按 2025 年 Claude Haiku 4.5 的 API 定价测算,解码 10,000 条包含 12,000 token 输入输出窗口的推理轨迹,标准 API 成本仅约 720 美元(Section 3.1)。
越狱验证与长程智能体提示词注入
- 绕过输出过滤提取有害思维:作者使用改写后的 HarmBench 偷车提示词查询 Opus 4.8,模型在可见输出中给出了合规回答,但在思维链中详细推导了具体车辆的脆弱点与物理盗窃方式;通过 Haiku 4.5 解码该加密块,成功还原出模型在可见层被过滤的有害信息(Figure 4、Section 3.2)。
- 跨模型跨任务隐蔽提示词注入:作者向 o4-mini 注入备份指令获取包含数据外发逻辑的加密思维,重放至 GPT-5.6 Sol 执行无关的 PPT 修改任务时,GPT-5.6 Sol 将其视为自身先验思考,在生成的脚本中自动加入了向外部服务器上传文件的恶意代码,且可见会话中无任何明文痕迹(Section 4.2)。
- 长程工作流投毒:在 PostTrainBench 的长程轨迹中,利用 Haiku 4.5 生成包含外传方法论文件指令的思维块并植入轨迹尾部,受害者使用 Opus 4.7(基于 Claude Code 框架)继续运行该轨迹时,每次修改均按注入指令向攻击者服务器上传文件(Section 4.2)。
专有模型思维链对开源模型的风格诱导(附录 B)
- 可见回答 n-gram 重叠度偏移:在 30 道 HLE 问题上,向 Kimi-K3 的思维通道预填 Opus 4.8 解密思维的前 1% token(4–10 个 token),在 29 道题目中其可见回答与 Opus 4.8 回答的 n-gram 重叠度上升;STEM 题目平均重叠度从 0.160 升至 0.305(差值 +0.15,p=1.7e-5),non-STEM 题目从 0.203 升至 0.289(差值 +0.086,p=6.3e-6),经 Bonferroni 校正后均保持统计显著;作为对照的 Inkling 模型在相同干预下未见明显变化(STEM 从 0.205 到 0.217,p=0.074,Table 3、Figure 9)。
- 风格分类器与特征词分析:在 90 道题目(12 道 AIME、78 道 Codeforces)上训练基于字符 3-5 gram 的逻辑回归分类器。Opus 预填使 GLM-5.2 和 Kimi-K3 相对 Opus 参考文本的 AUC 降至 0.94 与 0.97(未预填均为 0.99);Sol 预填使 Kimi-K3 相对 Sol 参考文本的 AUC 从 0.97 降至 0.93(Figure 27)。Jaccard 特征词重叠显示,Kimi-K3 在未预填时已与 Sol 共享 0.18 的特征词(预填后为 0.19),而在 Opus 预填下 Kimi-K3 和 GLM-5.2 与 Opus 的特征词重叠分别达到 0.18 与 0.23(未预填时均为 0.00,Figure 29)。
- 思维长度收缩:预填 4 词的前瞻片段时,Kimi-K3 的思维 token 中位数从 5,700 降至 2,500(Opus 来源中位数为 1,100),GLM-5.2 从 17,600 降至 7,800;DeepSeek-V3.1、Inkling 和 Kimi-K2.6 则保持自身原有思考长度分布(Figure 32、Appendix B.4.5)。
其他消融与分析
- Prefill 长度敏感度:GLM-5.2 在 1 词 Opus 预填下 AUC 即降至 0.96,8 词后趋于平缓,16 词达 0.92;Kimi-K3 在 1 词预填下 AUC 降至 0.97 并在各长度维持在 0.95–0.97(Figure 31)。
- 概率提取查询量(HLE):未预填时各开源模型提取 16-token 思维片段需 10^10 级以上查询;而在 1% Opus 预填下提取后续 16-token 可见回答时,Kimi-K3 需约 4×10^5 次查询,GLM-5.2 需 10^7 次,Inkling 和 DeepSeek-V4-Flash 需 10^14 次以上(Appendix B.3.1)。
- 困惑度差异(Codeforces):除 Kimi-K3 和 Kimi-K2.7-Code 外,所有评估模型给自身思维分配的困惑度均高于部分其他模型思维(Figure 26)。
- 摘要长度压缩比:Claude API 提供的 display: summarized 文本长度约为隐藏思维 token 长度的五分之一(Figure 40、Appendix C.4)。
- 合成人物信息析出(ClawBenchV2Trace):75 次 Opus 4.7 运行还原出 Alex Green 的全部 7 项身份字段及密码 token;81 次 GPT-5.5 运行还原出姓名、地址等 5 项,但密码与密保问题答案未在思维中出现(Table 5)。
负面结果、例外与失败案例
- 提取失败模式:解密模型偶发失败主要分为三类:拒绝转写推理、直接回显提示词模板、或混淆并声称上下文中不存在前置思维(Appendix C.1)。
- GPT 提取障碍:相比 Claude,GPT 模型的解密表现出明显的长度与来源波动(如 Luna 提取 Sol 的稳定性高于提取 GPT-5-mini),且频繁触发 50-token 重复内容拦截,迫使实验采用 50-token 逐段续写方案,期间 Luna 经常拒绝续写并提议一次性返回(Appendix C.2)。
- Gemini 解码噪声高:Gemini Robotics ER-1.6 的单次解码噪声显著高于 Claude,需采样至多 20 次并筛选最小误差候选后再经 Gemini 3.5 Flash 调和(Appendix C.3)。
- 未发现开源模型直接逐字记忆专有思维:在概率提取测试中,开源模型在无预填条件下复现 16-token 专有思维片段的所需查询量高达 10^9 至 10^12 次,不支持直接逐字记忆假设(Appendix B.3.1)。
- 思维摘要的不忠实性案例:在 AIME 2025 问题中,Opus 4.8 原始思维在推导前已回忆出答案,而在 8/18 的案例中摘要提前列出答案,在 1 例中将“Let me verify by computing”改写为“Let me set up coordinates”,将验算包装为独立推导(Figure 42);在另 1 例中思维内被舍弃的未确定猜测被摘要直接作为确定量陈述(Figure 41);GPT-5.6 Sol 的摘要更出现仅记录格式要求而遗漏全部数学推导的现象(Figure 43)。
有什么可以进一步探索的点?
作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。
作者指出的局限与后续方向
- API 版本与测试时间窗口:实证评估受限于 2026 年 7 月初 Anthropic、OpenAI 和 Google 提供的特定 API 版本和推理模型,厂商随时可能未作声明便更改专有密码学实现,从而改变攻击的有效性(出自 5.1 节)。
- 缺乏真实明文基准与生成随机性:提取过程依赖解码模型的随机生成能力,尽管 token 数量比对显示出高度追踪,但由于缺乏服务端真实明文思维链作为基准,无法对解密出来的全部 token 完成绝对保真度验证(出自 5.1 节)。
- 野外公开轨迹扫描的非穷尽性:对野外公开轨迹的抓取属于初步扫描,并非对所有已发布智能体数据集的穷尽性审计,仅作为该漏洞带来直接隐私威胁的针对性展示(出自 5.1 节)。
- 后训练对齐防线的残余缺口:密码学绑定仅能限制哪个模型被允许解密包络,无法约束模型在合法处理自身历史思维时是否会顺从转写指令;作者将训练模型识别并拒绝
<thinking-copy>等转写式越狱列为未来后训练工作的待办事项(出自附录 A.5)。 - 开源模型蒸馏分析的非因果性与样本限制:附录 B 关于专有模型向开源模型蒸馏的分析是在厂商修复后进行的,依赖于数量较小且偏向竞赛基准的问题集(90 道题),以及无法完全受控的外部 API 部署环境,所观察到的风格偏移只能确立行为兼容性,不能因果性地推断存在记忆或蒸馏(出自附录 B 免责声明及 B.4.1 节)。
实验覆盖范围
- 厂商与模型覆盖:实测覆盖了 Anthropic、OpenAI 和 Google 三家主要商业 API 供应商在 2026 年 7 月上线的 18 个专有推理模型(Table 1),并在附录分析中测试了 9 个开源或对照模型(Figure 26)。
- 数据集覆盖:提取保真度测试基于 120 道 Codeforces 题目(Figure 1);能力与风格测试基于 AIME 2025(至多 18 道题)和 HLE 的 30 道题目(Table 3、Figure 40);野外隐私分析覆盖了从 GitHub 和 Hugging Face 收集的 6,708 条公开智能体轨迹(解密 315,320 个思维块,Table 4)。
- 攻击类型覆盖:具体演示了模型蒸馏提取、野外隐私与凭证窃取、基于 HarmBench 提示词的越狱提取、以及基于 o4-mini/GPT-5.6 Sol 和 Haiku 4.5/Opus 4.7 的提示词注入(Section 3 与 Section 4)。
- 未报告信息:论文未报告各 API 调用的端到端网络延迟与精确耗时;且在作者向厂商负责任披露后,厂商已实施修复措施,导致论文中的提取攻击在 2026 年 8 月后已无法再次复现(出自 Reproducibility Statement)。
总结一下论文的主要内容
论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
- 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
- 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
- 核心实验发现:
- 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
- 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
- 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
- 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
- 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。