攻击arXiv 2609.29775
输出前缀攻击瞄准推理模型
提出推理通道预填与输出前缀组合攻击以越狱推理模型
- arXiv
- 2609.29775
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5
提出推理通道预填与输出前缀组合攻击以越狱推理模型
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱
作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出视觉推理序列攻击 VRSA,以图像序列越狱多模态大模型
提出四种阶段转换攻击,绕过推理模型的安全推理护栏