攻击arXiv 2609.29775
输出前缀攻击瞄准推理模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
- arXiv
- 2609.29775
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5
提出推理通道预填与输出前缀组合攻击以越狱推理模型
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。