攻击arXiv:2608.09867 · 8月11日研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链模型与 API攻击者黑盒·测试Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个·提示层提取与窃取推理链操控推理链+1+1摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。完整解读
攻击arXiv:2609.27542 · 9月23日研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控提出控制标记注入,清空工具智能体推理链以绕过思维链监控AI Agent·测试openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个·应用层提示注入对话结构操控推理链+2+2摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。完整解读
攻击arXiv:2609.15989 · 9月15日研究者提出 plan injection 攻击,可绕过思维链监控提出计划注入攻击,植入良性表述的有害计划以逃避思维链监控模型与 API攻击者黑盒·测试Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个·提示层检测规避推理链操控监控器+3+3摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。完整解读
攻击arXiv:2609.29775 · 9月24日输出前缀攻击瞄准推理模型提出推理通道预填与输出前缀组合攻击以越狱推理模型模型与 API攻击者黑盒·测试Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5·提示层越狱推理链操控推理链+1+1完整解读