输出前缀攻击瞄准推理模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
- arXiv
- 2609.29775
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考
摘要HGA 在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性
摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。