攻击arXiv 2609.29775
输出前缀攻击瞄准推理模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
- arXiv
- 2609.29775
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出四种阶段转换攻击,绕过推理模型的安全推理护栏