研究者提出 Latent Fusion Jailbreak,白盒越狱在五个开源权重模型上平均成功率达 94.13%
Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs
AI 导读
研究者提出 Latent Fusion Jailbreak(LFJ),通过将有害查询与结构相似的良性查询配对,在选定层和 token 位置插值二者的隐藏状态来诱导模型输出不安全内容;拒答损失梯度用于确定干预位置,层间混合系数按 token 归一化的顺从与拒答抑制目标优化。在四个安全基准和五个开源权重目标模型上,该方法在其描述的白盒协议下取得 94.13% 的宏平均攻击成功率。消融显示,去掉拒绝采样后成功率降至 86.72%,把结构化的有害-良性配对换成随机配对后降至 27.45%。作者还设计了针对 LFJ 的潜空间对抗训练,在攻击针对防御后模型重新优化时,成功率从 94.13% 降至 12.37%;该防御评估未覆盖对其他攻击类型的迁移和良性效用的保持。