攻击arXiv 2610.09973
从期望危害到似然:LLM 智能体越狱的概率重构
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
- arXiv
- 2610.09973
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 攻击者
- 白盒
- 被测模型
- Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410
提出 OPUR 攻击,用似然梯度优化对抗后缀越狱 LLM 智能体
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示