攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 13 个
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出日志基底提示注入,操纵 SOC 分析员的分类、摘要与处置建议
摘要在 gpt-4o-mini 上,人格劫持与上下文操纵可改写 SOC 分析输出,直接覆盖在分类上无效。