跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.30841· Thong Bach·· 7 天前

为何扩散语言模型的越狱会成功:能量景观分析

Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis

AI 导读

论文提出用去噪能量景观解释扩散语言模型(dLLM)的越狱为何成功,把安全对齐理解为在有害与安全输出之间形成一道能量势垒。现有越狱攻击被归为两类绕过方式:在初始化阶段掩盖查询的安全倾向,或在去噪中途介入、迫使路径越过势垒。基于掩码扩散模型在去噪中最小化动能这一结果,作者推导出三个免训练检测信号:在生成开始前从 logit 分布读取初始安全倾向的 step-0 比值,以及两个在 logit 空间互补子空间中追踪动能的轨迹速度信号。

阅读原文arxiv.org