DIVA:针对离散扩散视觉语言模型的跨步条件传播视觉越狱
DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models
AI 导读
研究者提出 DIVA,一个针对多模态离散扩散视觉语言模型(dVLMs)的白盒视觉越狱框架,在三个 dVLMs 上分别达到 58.8%、67.7% 和 69.1% 的 HADES ASR(Beaver 奖励模型指标),超过为自回归模型设计的视觉越狱基线。作者指出,现有视觉越狱研究几乎只关注自回归架构,而离散扩散视觉语言模型尚未被研究。他们识别出扩散生成特有的漏洞:视觉嵌入在每一步反向去噪中都作为条件,而非一次性前缀,因此对抗性视觉语义会在生成轨迹中被反复传播和放大,作者称之为跨步条件传播。