攻击arXiv 2609.05525
DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
- arXiv
- 2609.05525
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- LLaDA-V、MMaDA、LLaDA2.0-Uni
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示