研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。
- 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
- 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
- 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。
将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。
实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。
作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。
论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。