跳到正文
原文
论文追踪· arXiv:2608.07430· Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant·本站收录 · 原文发表 精选关注度55

研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

研究分析扩散语言模型安全机制,发现其继承自回归模型安全神经元,并提出纯离线黑盒越狱框架。

威胁模型白盒设定下,攻击者拥有白盒访问权限,在推理期通过钩子函数将目标安全神经元激活直接置零,无需参数更新或微调。

问题
扩散语言模型(DLLM)通过并行去噪生成文本,但其内部安全机制尚不明确;现有越狱攻击依赖高开销在线查询或强化学习微调,难以低成本迁移。
方法
作者定位 DLLM 的稀疏安全神经元并验证其跨架构继承性,进而提出 SN-Guided Diffusion,通过加权安全神经元损失在离线扩散去噪中引导 token 选择并抑制安全激活。
实验与结果
在 StrongREJECT 上,自回归权重迁移剪枝使 Fast-dLLM 的 ASR 从 7.00% 升至 86.30%;离线黑盒攻击在 JailBreakV-28K 上对 Gemini-2.5-Flash-Lite 取得 74.3% ASR。
局限与可以继续做的
作者指出超参数未穷尽优化,固定模板存在意图漂移风险且为纯离线迁移;实验中针对防御仅评估了 3 种基线且未测试多模态模型及自适应防御。
实验设置Qwen2.5-7B-Instruct、LLaDA-8B-Instruct 等 · StrongREJECT、JailBreakV-28K 等 · ASR、Utility (0-shot GSM8K) 等
威胁模型
白盒设定下,攻击者拥有白盒访问权限,在推理期通过钩子函数将目标安全神经元激活直接置零,无需参数更新或微调。黑盒设定下,攻击者利用本地开源白盒 DLLM 代理离线优化对抗提示词,无需访问目标模型参数或梯度,亦无需在线查询目标 API,优化后仅向目标发送少量候选提示词。
被测模型
Qwen2.5-7B-InstructLLaDA-8B-InstructDream-Instruct-7BFast-dLLM-v2-7BLlama-3-8B-InstructGemini-2.0-FlashGemini-2.0-Flash-LiteGemma-3-1B-InstructQwQ-32BPhi-3-Mini-4K-InstructLlama-3.2-1B-InstructGemini-2.5-Flash-LiteGemini-2.5-FlashDeepseek-v4-FlashClaude-4.5-Haiku
基准
StrongREJECTJailBreakV-28KGSM8KNaturalReasoning
指标
ASRUtility (0-shot GSM8K)AUROCsurrogate evaluations
AI 导读和推荐理由研究者发现扩散大语言模型(DLLM)的安全对齐同样集中在稀疏的安全神经元上,且从自回归模型初始化而来的 DLLM 会继承源模型的安全机制,可通过直接映射并剪枝这些神经元实施跨架构迁移攻击。在 LLaDA 上自剪枝将攻击成功率从 2.6% 提升至 73.8%,在 Dream 上从 1.9% 提升至 86.6%;用 Qwen2.5 迁移剪枝后,Dream 从 1.9% 升至 73.2%,Fast-dLLM 从 7.0% 升至 86.3%,同时通用能力仅有小幅下降。基于此,作者提出 SN-Guided Diffusion,一种完全离线的黑盒越狱框架,通过加权安全神经元损失在扩散过程中引导生成远离触发安全的区域,在良性提示与越狱提示区分上达到 AUROC=1.0。

研究者发现扩散大语言模型(DLLM)的安全对齐同样集中在稀疏的安全神经元上,且从自回归模型初始化而来的 DLLM 会继承源模型的安全机制,可通过直接映射并剪枝这些神经元实施跨架构迁移攻击。在 LLaDA 上自剪枝将攻击成功率从 2.6% 提升至 73.8%,在 Dream 上从 1.9% 提升至 86.6%;用 Qwen2.5 迁移剪枝后,Dream 从 1.9% 升至 73.2%,Fast-dLLM 从 7.0% 升至 86.3%,同时通用能力仅有小幅下降。基于此,作者提出 SN-Guided Diffusion,一种完全离线的黑盒越狱框架,通过加权安全神经元损失在扩散过程中引导生成远离触发安全的区域,在良性提示与越狱提示区分上达到 AUROC=1.0。

推荐理由论文给出扩散大模型安全神经元可跨架构迁移的证据与攻击成功率,为评估扩散架构对齐脆弱性提供可复现方法。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    论文探究扩散语言模型内部安全机制的结构稳固性,评估其作为白盒攻击目标与黑盒越狱对抗工具的脆弱性。

    论文探究扩散大语言模型(DLLM)的内部安全对齐机制是否与自回归(AR)模型一致,以及能否利用扩散生成特性发起越狱攻击。

    • 场景与重要性:DLLM 采用双向上下文建模与迭代并行去噪替代因果解码,在数据受限等场景展现出优势;随着近期模型普遍复用预训练自回归模型权重,亟需评估其安全机制在生成范式转变下的稳固性。
    • 现有方法的不足:作者指出传统越狱攻击(如 GCG、PAIR)依赖计算密集型标记搜索或数万次黑盒查询,而基于强化学习的离线生成器(如 NeuroStrike)依赖大量采样,训练开销大。
    • 核心观察与假设:作者假设从自回归模型初始化权重的 DLLM 会继承前身模型的安全神经元分布,且通过抑制安全神经元激活,可在离线扩散去噪中直接合成隐蔽越狱提示词。
    • 论文的提出方案:论文提出了跨架构白盒安全神经元剪枝攻击,以及基于加权安全神经元损失的离线黑盒越狱框架 SN-Guided Diffusion。
    • 威胁模型:
      • 白盒剪枝攻击:攻击者拥有模型白盒访问权限,在推理阶段通过钩子函数直接将目标安全神经元激活置零,不更新参数也不微调模型。
      • 黑盒迁移攻击:攻击者在本地拥有开源白盒 DLLM 代理,对目标模型仅有黑盒访问权限;攻击优化过程完全离线进行,不向目标发送在线查询或梯度请求,仅向黑盒目标发送少量候选提示词。
      • 攻击者目标:促使目标对齐模型遵循恶意意图并输出有害回复,同时规避目标模型的内置安全审核。
      • 受害系统:包括开源自回归模型、开源 DLLM 以及闭源商业专有大模型。
  2. 有哪些相关研究?

    相关研究涵盖自回归模型越狱、DLLM 自身脆弱性及基于扩散的攻击;本文结合机理解释与扩散双向建模实现纯离线攻击。

    自回归 LLM 越狱攻击

    • 离散搜索与自动化攻击:Zou 等人(2023)提出 GCG,通过优化对抗性后缀绕过对齐;Chao 等人(2024)的 PAIR 和 Liu 等人(2024)的 AutoDAN 分别利用攻击者 LLM 迭代微调和分层遗传算法生成越狱输入。作者指出这类离散优化依赖计算密集的标记搜索,常需数万次查询。
    • 机理解释性攻击:Wu 等人(2026a)提出 NeuroStrike,在白盒下通过推理期置零安全神经元激活,在黑盒下使用 GRPO 训练对抗提示词生成器以最小化安全神经元激活。作者指出其黑盒流程依赖对开源模型的强化学习微调,计算开销较大。
    • 对抗角色扮演:Collu 等人(2025)通过恶意角色的人物设定促使模型为维持叙事连贯而搁置核心安全约束。

    DLLM 自身安全脆弱性

    • 掩码与提示诱导:Wen 等人(2025)提出 DIJA,利用交错掩码文本强制维持双向一致性;Zhang 等人(2025)提出 PAD,在掩码序列中注入连接符偏置预测;Li 等人(2025b)与 Yamabe & Sakuma(2025)归纳了初期固定有害标记的启动脆弱性(priming vulnerability)。作者指出这些研究主要局限于白盒威胁模型,依赖目标模型的参数与梯度。

    利用扩散模型构建攻击

    • 可微文本扩散与条件采样:Wang 等人(2025)提出 DiffuAttacker,利用 Gumbel-Softmax 使 DiffuSeq 采样可微以进行梯度优化,作者指出其依赖专用 seq2seq 架构;Lüdke 等人(2025)提出 Inpainting,利用 DLLM 对联合分布建模的特性从目标回复条件采样提示词,作者指出其在线引导机制带来计算开销。

    对比基线与评测数据集

    • 基准方法:越狱对比基线包含 PAIR、TAP(Mehrotra 等人,2024)、Puzzler(Chang 等人,2024)与 NeuroStrike;防御基线包含 Perplexity Filtering(Jain 等人,2023)、SmoothLLM(Robey 等人,2024)与 LSE(Zhao 等人,2024)。
    • 评测数据集:包括越狱基准 JailBreakV-28K(Luo 等人,2024)、StrongREJECT(Souly 等人,2024)、通用能力评估 GSM8K(Cobbe 等人,2021)以及良性提示词来源 NaturalReasoning(Yuan 等人,2025)。

    本文工作定位 作者称本文将机理解释性与扩散模型的双向联合建模相结合,既揭示了 DLLM 对自回归安全足迹的结构性继承与可剪枝性,又通过加权安全神经元损失实现了无需强化学习微调、无需在线 API 交互的纯离线黑盒越狱优化。

  3. 论文如何解决这个问题?

    论文通过逻辑回归定位安全神经元并实施跨架构剪枝,进而提出结合加权神经元损失与生成级联的离线扩散越狱方法。

    论文提出了白盒安全神经元剪枝与纯离线黑盒越狱框架 SN-Guided Diffusion,将机理解释性定位与扩散模型的双向条件采样相结合。

    安全神经元识别与跨架构白盒剪枝

    • 神经元定位:在扩散初始提示词编码步提取前馈网络激活,使用 14,000 条良性和恶意提示词训练逻辑回归分类器。为克服 Z-score 阈值在低方差层的不稳定性,采用前 0.8% 的百分位阈值筛选安全神经元。
    • 直接索引映射:针对从 Qwen2.5 初始化权重的 DLLM(Dream、Fast-dLLM),直接沿用源 AR 模型的层与神经元索引坐标。
    • 推理期剪枝执行:在模型前向传播中挂载钩子,将目标神经元集合中的激活值直接置零,无需参数更新或微调即可抑制拒答行为。

    加权安全神经元损失构建

    • 连续优化目标:为在离线去噪中引导 token 选择,构建加权安全神经元(SN)损失:

    SN(x) = 𝔼ℓ [ ∑i:(ℓ,i)∈ S hℓi(x) · wℓ,i ] 其中 S 为安全神经元集合,hℓi(x) 为第 ℓ 层第 i 个神经元在所有提示词 token 上的平均激活,wℓ,i 为逻辑回归学得的权重,数值经全局极值归一化映射至 [0, 1]。

    • 设计差异:与 NeuroStrike 训练二级分类器预测越狱概率作为强化学习奖励不同,本文直接复用回归权重抑制激活幅度本身。
    • 越狱区间定位:作者分析指出未剪枝 LLaDA 的不安全生成主要聚集在低 SN 损失区域;最小化 SN 损失可将提示词推入难以触发拒答的低激活盲区。

    生成式剪枝级联与意图伪装

    • 生成式剪枝级联:为给逆向扩散提供合规目标回复锚点,使用代理模型 LLaDA 沿严格到宽松的剪枝阈值逐步生成候选回复,经退化过滤器过滤重复 token 后,由裁判模型 Qwen3Guard-0.6B 筛选出成功合规回复。
    • 意图伪装机制:利用剪枝后的扩散模型配合语言转换系统提示词,将原始恶意词汇改写为临床或技术性委婉语,以规避黑盒目标的词表敏感词过滤。
    • 角色模板锚定:采用前缀-后缀模板固定连接词,约束掩码 token 的生成范围,防止长掩码序列发生意图漂移或在提示词区域生成类似回答的文本。

    离线 SN 引导扩散与轮次优化

    • 双向去噪引导:目标回复按时间步比例同步揭示;在每个去噪步,选取置信度最高的 2 个掩码位置,从语言模型头提取前 30 个候选 token 构建包含 60 个序列的 batch,通过前向计算选取使 SN 损失最小的候选并施加自适应 logit 提升。
    • 轮次优化与候选导出:独立执行 20 轮扩散,每轮生成的提示词通过级联与裁判模型评分,计算综合奖励:

    R(x) = λSN(1 − SN(x)) + λJBJB(x) 其中 JB(x) 为级联越狱得分,超参数设为 λSN=1.0, λJB=3.0;最终导出得分最高的 5 个候选提示词用于黑盒迁移攻击。

  4. 论文做了哪些实验?

    实验在白盒下验证了自回归安全足迹向 DLLM 的继承,并在黑盒下跨开源与商业模型取得高 ASR,同时保持低计算开销。

    实验设置

    • 被测模型:白盒模型包括 Dream-Instruct-7B、Fast-dLLM-v2-7B、LLaDA-8B-Instruct、Qwen2.5-7B-Instruct 及 Llama-3-8B-Instruct;黑盒迁移模型涵盖开源 AR(Qwen2.5-7B-Instruct、Gemma-3-1B-Instruct、Phi-3-Mini-4K-Instruct、Llama-3.2-1B-Instruct、Llama-3-8B-Instruct)、DLLM(Fast-dLLM-v2-7B、Dream-Instruct-7B)以及商业闭源模型(Gemini-2.0-Flash、Gemini-2.0-Flash-Lite、Gemini-2.5-Flash、Gemini-2.5-Flash-Lite、Deepseek-v4-Flash、GPT-5.4-Nano、Claude-4.5-Haiku、QwQ-32B)。
    • 数据集与规模:神经元识别使用 14,000 条良性与恶意提示词;白盒攻击评测使用 StrongREJECT,通用能力测试使用 0-shot GSM8K;黑盒基线对比使用 JailBreakV-28K 中有放回采样的 1000 条模板提示词;黑盒跨模型评测使用 1000 条去重 JailBreakV-28K 提示词与 100 条去重 StrongREJECT 提示词;防御与消融实验使用 100 条去重提示词。
    • 基线方法:越狱基线包括 PAIR、TAP、Puzzler 和 NeuroStrike;防御基线包括 Perplexity Filtering、SmoothLLM 和 Layer-Specific Editing(LSE)。
    • 指标与判定方式:白盒 ASR 由 Llama-Guard-3-8B 裁定;黑盒 ASR 由 Qwen3Guard-4B 裁定;通用能力指标为 GSM8K 0-shot 准确率;计算开销统计代理模型前向与反向评估次数。
    • 攻击参数:扩散模板设为 64 个掩码 token,执行 32 步去噪,每步评估 2 个位置、30 个候选词;每条提示词生成 20 轮,选取奖励最高的 5 个候选。

    主结果

    在 JailBreakV-28K 的 1000 条提示词上,SN-Guided Diffusion 与主流自动化越狱方法的 ASR 对比如下(据 Table 2):

    表格较宽,可左右滑动

    Target ModelPAIRTAPPuzzlerNeuroStrikeSN-Guided (Ours)
    Gemini-2.0-Flash37.3%14.0%73.0%54.7%83.3%
    Gemini-2.0-Flash-Lite9.8%8.0%86.1%49.2%86.2%
    Gemma-3-1B-Instruct33.9%20.4%94.0%79.9%94.9%
    QwQ-32B18.9%12.2%97.2%78.9%92.3%
    Average25.0%13.7%87.6%65.7%89.2%
    • 高于离线机理基准:作者指出 SN-Guided Diffusion 在所有被测模型上均超过 NeuroStrike,在 Gemini-2.0-Flash-Lite 上的 ASR 提高 37.0 个百分点(86.2% 对 49.2%)。
    • 高于在线离散搜索方法:作者指出在线交互方法 PAIR 和 TAP 在强对齐模型上面临困难(Gemini-2.0-Flash 上分别为 37.3% 和 14.0%);Puzzler 虽平均达 87.6%,但依赖自适应在线交互,而本文方法在纯离线优化下平均 ASR 达 89.2%。
    • 机理设计带来的迁移增益:作者将性能优势归因于 token 级别的密集引导、直接抑制激活大小而非代理分类概率、以及利用联合分布锚定合规回复。

    白盒安全神经元跨架构继承与剪枝介入

    • 测试内容:在 StrongREJECT 上评估自体剪枝(SP)与来自 Qwen2.5 的迁移剪枝(TP-Qwen),并在 GSM8K 上评估通用效用(Table 1)。
    • 实验结果:在 0.8% 阈值下,Qwen2.5 迁移剪枝使 Fast-dLLM-v2-7B 的 ASR 从 7.00% 升至 86.30%(GSM8K 效用由 78.39% 微降至 77.10%);在 1.5% 阈值下,迁移剪枝使 Dream-Instruct-7B 的 ASR 从 1.90% 升至 73.20%(效用由 51.78% 降至 49.05%);LLaDA 自体剪枝在 3.0% 阈值下 ASR 达 73.80%(效用 64.37%)。
    • 作者解读:作者称从自回归权重初始化的 DLLM 继承了前身模型的安全神经元足迹,无需分析 DLLM 本身即可直接迁移剪枝,且剪枝在瓦解对齐的同时保持了通用能力。

    跨架构黑盒迁移与商业专有模型表现

    • 测试内容:在 1000 条 JailBreakV-28K 与 100 条 StrongREJECT 上评估黑盒越狱向各类模型的迁移(Table 3)。
    • 实验结果:在 JailBreakV-28K 上,开源 AR 模型 ASR 在 74.5% 至 86.9% 之间(Qwen2.5-7B-Instruct 为 86.9%);DLLM 架构表现出脆弱性(Fast-dLLM-v2-7B 达 88.8%,Dream-Instruct-7B 达 85.9%);商业闭源模型中,Deepseek-v4-Flash 达 76.6%,Gemini-2.5-Flash-Lite 达 74.3%,GPT-5.4-Nano 为 69.9%,Claude-4.5-Haiku 防御相对稳固,ASR 为 52.4%(StrongREJECT 上为 32.0%)。
    • 作者解读:作者称攻击成功迁移至 DLLM 说明其针对的是底层结构脆弱性而非生成方式;商业模型中 Claude-4.5-Haiku 虽韧性最强,但仍被突破。

    针对防御策略的鲁棒性评测

    • 测试内容:在 100 条 JailBreakV-28K 提示词上评测困惑度过滤、SmoothLLM 和 LSE 防御下的 ASR(Table 4)。
    • 实验结果:困惑度过滤下 ASR 基本不变(Gemini-2.5-Flash-Lite 从 84.0% 增至 88.0%);SmoothLLM 在 Llama-3-8B-Instruct 上甚至将 ASR 从 86.0% 提升至 95.0%;LSE 防御效果最明显,使 Llama-3-8B-Instruct 的 ASR 降至 69.0%,Gemma-3-1B-Instruct 降至 84.0%。
    • 作者解读:作者指出生成的提示词具有自然语言流畅度与低困惑度;字符扰动无法破坏深层结构盲区;权重编辑虽有所缓解,但 ASR 仍处于较高水平。

    其他消融与分析

    • 生成策略消融(Table 5,据 Llama-3-8B-Instruct):纯扩散未伪装 ASR 为 6.0%,纯扩散伪装为 43.0%,SN 引导扩散为 86.0%。
    • 生成策略消融(Table 5,据 Gemini-2.5-Flash-Lite):纯扩散未伪装 ASR 为 23.0%,纯扩散伪装为 53.0%,SN 引导扩散为 84.0%。
    • 生成策略消融(Table 5,据 Gemma-3-1B-Instruct):纯扩散未伪装 ASR 为 50.0%,纯扩散伪装为 88.0%,SN 引导扩散为 96.0%。
    • 生成轮次消融(Figure 12,100 条提示词 5 个种子均值):E=1 时 ASR 为 53.6%,E=5 时达到 84.8%,此后至 E=30 趋于平稳。
    • 神经元重叠率(Figure 6):0.8% 阈值下 Fast-dLLM 与 Qwen2.5 重叠 41.8%,Dream 与 Qwen2.5 重叠 30.9%,非同源模型重叠率不超过 0.5%。
    • 计算开销对比(Section 7.6):SN-Guided 单轮 1,920 次前向评估,20 轮共 38,400 次前向评估,无需反向传播计算。
  5. 有什么可以进一步探索的点?

    作者指出超参数未做穷尽优化、固定模板存在意图漂移风险且纯离线迁移限制了威力,未来可探索混合在线反馈与新型防御。

    作者指出的局限与后续方向

    • 超参数未穷尽优化:研究主要目标是建立并验证利用 DLLM 内部安全机制的新策略,超参数旨在权衡生成质量与计算效率,而非追求绝对 ASR 最大化(Section 8.2)。
    • 计算开销存在进一步压缩空间:虽然纯前向评估开销低于传统基线,但未来仍可探索更新颖的候选词筛选方式或优化前向计算评分,以进一步降低每步扩散的开销(Section 8.2)。
    • 提示词模板存在意图漂移风险:双向注意力可能导致模型在提示词区域生成类似回答的标记或漂移至良性查询;寻找最优模板仍是开放挑战,未来需对更广泛的已发表对抗模板进行系统性消融(Section 8.2)。
    • 纯离线迁移攻击限制了攻击威力:离线攻击虽规避了 API 行为监控,但也约束了攻击表现;未来可转向离线-在线混合模式,将目标 LLM 的拒答反馈作为负约束输入扩散优化循环以进行自适应修正(Section 8.2)。
    • 防御机制探索方向:未来可在安全对齐中通过多目标优化直接惩罚 SN 损失的可分性,将安全表示与核心语言推理能力交织纠缠以打破稀疏性;在推理期可在初始化时随机置换隐藏层维度打乱索引,或在扩散过程中监控中间步以动态阻断生成(Section 8.1)。

    实验覆盖范围

    • 被测模型范围:覆盖 5 个开源 AR 模型、2 个开源 DLLM、1 个开源扩散代理(LLaDA)和 8 个闭源商业模型,未测试多模态模型。
    • 防御策略范围:测试了困惑度过滤、SmoothLLM 和 LSE 共 3 种基线防御,未测试针对扩散过程的运行时监测或自适应防御。
    • 评估基准范围:黑盒攻击测试了 JailBreakV-28K 与 StrongREJECT 两个安全基准,通用效用仅在 GSM8K 上进行了 0-shot 数学推理测试。
    • 计算资源报告:报告了代理模型每一步评估位置预算为 2、候选词数量 K=30、单次攻击前向评估次数为 38,400 次,但论文未报告具体的 GPU 显存占用峰值或端到端生成耗时。
    • 模板与策略覆盖:实验主要围绕论文设计的固定角色模板展开,论文未报告其他流行越狱模板在扩散引导下的量化表现。
  6. 总结一下论文的主要内容

    论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。

    论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。

    • 要解决的核心问题:探究在从自回归因果预测转向双向并行去噪的生成范式下,DLLM 是否保留了稀疏可剪枝的安全机制,以及如何利用扩散生成的双向条件采样能力突破高算力黑盒越狱瓶颈。
    • 核心方法设计:通过逻辑回归定位 DLLM 的稀疏安全神经元并验证其与 AR 前身模型的结构重叠;进而提出 SN-Guided Diffusion 框架,结合生成式剪枝级联提取合规目标回复,并在离线去噪过程中通过加权安全神经元损失引导 token 选择,压制安全激活。
    • 白盒迁移剪枝效果:在 StrongREJECT 数据集上,直接复用 Qwen2.5 的安全神经元坐标进行 0.8% 阈值剪枝,使 Fast-dLLM-v2-7B 的 ASR 从 7.00% 升至 86.30%(GSM8K 效用保持在 77.10%),Dream-Instruct-7B 在 1.5% 阈值下 ASR 从 1.90% 升至 73.20%(Table 1)。
    • 黑盒跨模型迁移表现:在 JailBreakV-28K 上,仅需 20 个离线扩散轮次,该方法对 Qwen2.5-7B-Instruct 取得 86.9% ASR,对 Gemini-2.5-Flash-Lite 取得 74.3% ASR,对 Fast-dLLM-v2-7B 取得 88.8% ASR(Table 3),并在 4 个目标模型上取得平均 89.2% ASR(Table 2)。
    • 计算效率与防御抗性:全流程仅需 38,400 次前向代理评估且无反向传播计算(Section 7.6);对困惑度过滤和 SmoothLLM 保持鲁棒,在 Llama-3-8B-Instruct 经 LSE 防御后仍维持 69.0% ASR(Table 4)。
    • 作者结论与安全启示:作者认为当前对齐机制在结构上具有脆弱性与可转移性,DLLM 复用 AR 权重会直接继承安全弱点;作者呼吁未来对齐应打破安全表示的稀疏性与线性可分性,从深层结构而非表层行为解决安全隐患。
阅读原文arxiv.org