跳到正文
原文
论文追踪· arXiv:2610.09600· Miao Yu, Zuming Jiang, Hao Huang, Yunpeng Li, Lu Yuan, Kun Wang·本站收录 · 原文发表 精选关注度54

SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

SafeEvo: Deciphering the Safety Alignment Mechanism and Evolution in Language Models

论文速读

对齐/训练方法

据论文 PDF 整理(Gemini 生成),以原文为准

SafeEvo发现基座模型存在弱拒绝电路且对齐中发生漂移;仅微调该电路的SCA在保留能力的同时降低了ASR。

问题
大模型有害行为带来安全风险,现有对齐方法缺乏对内部机制的研究,且全参数对齐容易引发过度拒绝和损害通用能力的对齐税;已有安全可解释性研究忽视了预训练基座模型中的机制及跨阶段演化。
方法
SafeEvo 通过可微掩码和双分支优化从预训练模型中提取稀疏拒绝电路并追踪其演化;进而提出 SCA,在对齐微调中将 LoRA 参数更新严格约束在预训练提取出的拒绝电路上。
实验与结果
实验发现基座模型存在弱拒绝电路且消融后 ASR 上升至 88% 以上;对齐中电路存在漂移;SCA 在 3 个模型和两种对齐算法下降低了 ASR,同时较好保留了 GSM8K 等通用能力并减少了过度拒绝。
局限与可以继续做的
论文未专门讨论局限与未来工作;实验覆盖了 3 个 7B–8B 密集模型,电路单元仅限 MLP 神经元,论文未报告自动评审与人工评估的一致性。
实验设置Llama-3-8B、Qwen-2.5-7B 等 · LLM-LAT、BeaverTails 等 · ASR、Refusal Rate 等
模型
Llama-3-8BQwen-2.5-7BMistral-7B-v0.1Mistral-7B-Instruct-v0.1
基准
LLM-LATBeaverTailsHarmBenchAdvBenchGSM8KMMLUHellaSwagXSTestPKU-SafeRLHF
指标
ASRRefusal RateOver-refusal RateAccuracyJaccard similarity
AI 导读和推荐理由全文 316 字

研究者提出可解释性框架 SafeEvo,把大模型的安全拒答归因于稀疏的拒答回路,并追踪其在对齐过程中的演化。该方法用可微掩码优化从预训练基座模型中提取拒答回路,在 Llama-3-8B、Qwen-2.5-7B 和 Mistral-7B 上,这些回路仅占不到 1% 参数却能在 BeaverTails 上达到 100% 的分布外拒答率,消融后拒答率降至 0%,HarmBench 攻击成功率分别升至 91.19%、88.68% 和 88.05%。追踪对齐检查点发现,相邻检查点回路重叠度从 98% 降至 78%,独立提取的回路之间仅重叠 26%,说明拒答回路既不唯一也不稳定,作者据此提出对齐税可能源于拒答回路更新外溢到效用相关参数。

推荐理由论文从电路视角追踪预训练模型中的拒答回路及其在对齐中的漂移,为对齐税提供了一种机制解释。

深度解读

6 个问题 · 约 7,100 字

  1. 这篇论文试图解决什么问题?

    论文旨在从电路视角解析基座模型的安全机制与对齐演化,并探索如何缓解全参数对齐损害通用能力的对齐税问题。

    大语言模型安全机制在预训练基座模型中的存在性、跨对齐阶段的演化规律,以及如何在对齐微调中避免对齐税对通用能力的削弱。

    • 场景与重要性:随着大语言模型应用拓展至复杂智能体系统,有害行为风险随之扩散,可靠的安全对齐成为保障系统可信度的核心环节。
    • 现有方法的不足:现有对齐技术多依赖数据与偏好优化的表面行为约束,而安全可解释性研究多聚焦对齐后固定终点的表征或神经元,未探索基座模型的内部机制与对齐演变。
    • 核心观察与假设:作者基于预训练基座模型偶尔拒绝有害查询的现象,推测基座模型中已存在稀疏且功能完整的拒绝电路;并认为无约束对齐导致电路不稳定漂移并干扰能力参数,是引发对齐税的潜在机制。
    • 论文提出的方案:论文提出了可解释性框架 SafeEvo,通过可微掩码优化提取拒绝电路并追踪其演化;进而提出 安全电路对齐(SCA),将微调更新限制在预训练拒绝电路内。
  2. 有哪些相关研究?

    论文基于对齐算法、安全可解释性及电路提取现有工作展开,指出先前研究缺乏对预训练基座及跨阶段演化的分析。

    安全对齐与安全可解释性研究分别从行为约束与内部表征展开,但先前工作缺乏从电路视角对基座模型机制及对齐演化过程的跨阶段追踪。

    • 大语言模型对齐与对齐税缓解
      • 行为级对齐算法:主流工作通过合成拒绝数据的监督微调(SFT,如 Yang 等 2026、Fan 等 2026)或偏好对直接偏好优化(DPO,如 Ji 等 2026a、Deng 等 2026)引导模型拒答有害查询。
      • 对齐税缓解策略:仅优化拒绝易诱发过度拒绝并削弱通用能力,后续研究通过合成兼顾有用与无害的数据(Wang 等 2024、Huang 等 2026)以及显式效用约束的奖励塑形(Ji 等 2026b)缓解张力。
      • 因果神经元定位:部分工作通过可解释性方法定位安全边界因果神经元(Wang 等 2026、Zhao 等 2025b、Behrouzi 等 2026b)。作者称 SafeEvo 与其区别在于定位出具备独立实现拒绝行为充分性的子图电路,而非单个因果神经元。
    • 安全机理与可解释性研究
      • 表征与组件级分析:表征层工作解码中间激活发现隐藏状态编码极性(He 等 2025、Jiao 等 2026);组件层工作通过激活补丁发现稀疏注意力头承载拒绝行为(Zheng 等 2026、Zhou 等 2025b)。
      • 神经元与电路级分析:神经元层研究识别安全神经元用于分析越狱与增强对齐(Zhao 等 2026、Zhao 等 2025b)。作者指出以往工作主要研究对齐后模型,而 SafeEvo 追踪基座模型跨检查点的演化。
      • 电路提取方法对比:先前基于激活、归因或权重的评分方法(Zhao 等 2025b、Chen 等 2024、Yi 等 2024)仅捕获单 token 生成电路;SafeEvo 将其转化为可微掩码优化问题。
    • 基线方法与实验基准
      • 基线方法:包含全参数 LoRA 微调(Full LoRA)、匹配同等稀疏度的随机参数更新(Random baseline),以及基于安全神经元的调优方法 SN-Tune(Zhao 等 2025b)。
      • 实验基准:电路提取使用 LLM-LAT(Sheshadri 等 2025);安全性测试使用 HarmBench(Mazeika 等 2024)与 AdvBench(Zou 等 2023);通用能力测试包含 GSM8K、MMLU、HellaSwag;过度拒绝测试包含 XSTest 与 BeaverTails。
    • 工作定位:作者将 SafeEvo 定位为连接基座模型机制分析、跨检查点动态追踪与电路靶向对齐的统一框架,以机理发现支撑更精准的对齐算法设计。
  3. 论文如何解决这个问题?

    论文通过双分支可微掩码优化提取基座模型的拒绝电路并追踪演化,进而提出仅更新该电路的 SCA 对齐算法。

    SafeEvo 通过可微掩码优化从基座模型提取稀疏拒绝电路并追踪演化,进而提出安全电路对齐(SCA)将对齐更新限定在预训练电路上。

    拒绝电路候选单元与网络划分

    • 候选单元定义:以门控 MLP 的投影行输出作为神经元单元。门控 MLP 包含 gate、up、down 三个投影,每个投影的输出行向量对应一个神经元,收集所有层的神经元构成候选集合 U。
    • 互补网络切分:为每个候选神经元分配二值掩码变量,通过对角掩码矩阵将投影线性映射精确划分为拒绝电路与合规补集两个互补子图: zCℓ,p = Mℓ,p Wℓ,p hℓ,p,   zC̄ℓ,p = (I − Mℓ,p) Wℓ,p hℓ,p (公式说明:式中 Mℓ,p 筛选拒绝电路输出,而补集掩码 I − Mℓ,p 负责保留有害合规输出)。
    • 计算子图性质:通过对 gate、up 投影置零剔除其中间输入,对 down 投影置零剔除对残差流贡献,使提取对象构成稀疏计算子图而非孤立神经元集合。

    双分支可微掩码提取优化

    • 连续松弛与直通估计器:将离散掩码参数化为潜变量 q,经 Sigmoid 映射为软掩码,并在前向传播中使用二值化阈值 0.5 与直通估计器(STE)保持离散前向传播与梯度回传;初始化潜变量为 0.2,从完整模型开始逐步剪枝。
    • 双分支监督损失:在冻结模型权重条件下优化掩码,总损失包含拒绝电路在拒绝补全上的负对数似然、补集模型在合规补全上的负对数似然与 L1 稀疏惩罚: Lext(M) = α LSFT(M; Dref) + β LSFT(M; Dcmp) + λmlp ∑ℓ,p (|m̃ℓ,p|1)/(dout,p) (公式说明:式中第一项约束电路对拒绝的充分性,第二项避免平凡全选解,第三项驱动掩码稀疏化)。
    • 优化参数配置:损失系数设为 α = 1, β = 1, λmlp = 0.05;采用 Fused AdamW 优化器,学习率 0.01,batch size 为 4;验证集损失在第 2 个 epoch(50 步更新)达到早停条件。

    跨检查点电路演化追踪协议

    • 热启动连续追踪:在对 Llama-3-8B 进行 SFT 对齐时,将前一个检查点提取出的电路掩码作为下一个检查点提取的初始状态,以捕捉平滑的增量变化。
    • 重合度量化指标:计算相邻检查点之间以及同检查点多次独立运行提取结果之间的 Jaccard 相似度,量化结构漂移程度与提取稳定性。

    安全电路对齐(SCA)算法实现

    • 参数更新空间约束:SCA 重用预训练模型提取出的二值掩码,将 MLP 投影的 LoRA 更新矩阵 B 的梯度通过掩码行门控,使补集神经元及注意力模块完全不更新。
    • 通用对齐目标适配:SCA 不改变损失函数本身,直接支持监督微调(SFT)与直接偏好优化(DPO);DPO 设定温度超参数 β = 0.1、3 个训练 epoch、有效 batch size 为 8。
  4. 论文做了哪些实验?

    在三个开源模型上的实验证实基座模型存在弱拒绝电路且对齐中发生漂移,SCA 在降低 ASR 的同时保留了通用能力。

    实验设置

    • 被测模型:预训练基座模型 Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1(电路提取与消融实验);安全对齐实验中 Mistral 使用指令微调版本 Mistral-7B-Instruct-v0.1(因其基座模型无法稳定遵循指令格式),其余两个保持基座模型。
    • 数据集与基准:电路提取使用 LLM-LAT(训练 100 条,验证 50 条,共 4,948 条可用记录);充分性测试使用 BeaverTails(50 条有害提示词);安全评测使用 HarmBench(159 条提示词)与 AdvBench;通用能力使用 GSM8K、MMLU、HellaSwag;过度拒绝评测使用 XSTest(200 条不安全对照提示词,250 条良性提示词)与 BeaverTails;对齐训练集为 LLM-LAT(SFT)和 PKU-SafeRLHF(DPO)。
    • 基线方法:完整参数微调 LoRA(Full LoRA,更新所有投影及注意力层)、同等稀疏度随机更新(Random baseline)、安全神经元调优 SN-Tune(基于 PLND 语义筛选 top 神经元)。
    • 评估指标:攻击成功率(ASR,衡量有害输入下的合规比例,越低越好)、显式拒绝率(Refusal Rate,衡量对有害输入的拒绝比例)、通用能力准确率(GSM8K、MMLU、HellaSwag,越高越好)、过度拒绝率(Over-refusal Rate,衡量良性输入下的拒绝比例,越低越好)。
    • 评审方式:ASR 采用 Llama-Guard-3-8B 使用贪心解码(greedy decoding)打分;显式拒绝率采用 Röttger 等(2024)的分类器,截断前 150 个字符并去除提示词回显;通用能力评测采用 5-shot harness,每项任务上限 2000 个样本。
    • 训练与统计设置:LoRA rank 为 16,alpha 为 16,dropout 为 0;SFT 训练 16 个 epoch,学习率 0.0001;DPO 训练 3 个 epoch;多随机种子实验采用 4 个训练种子,置信区间采用对 HarmBench 提示词重采样的成对 95% bootstrap 置信区间。

    主结果

    表格较宽,可左右滑动

    模型与设置HarmBench(↓)AdvBench(↓)GSM8K(↑)MMLU(↑)XSTest(↓)
    Llama-3-8B (Base Model)50.3152.8850.3465.360.8
    Llama-3-8B (LoRA DPO)16.9812.6949.5165.462.8
    Llama-3-8B (SCA DPO)0.630.3848.9865.603.2
    Qwen-2.5-7B (Base Model)33.967.5083.0974.215.2
    Qwen-2.5-7B (LoRA DPO)0.000.1986.8173.9734.8
    Qwen-2.5-7B (SCA DPO)0.000.1981.7374.2117.6
    Mistral-7B-v0.1 (LoRA DPO)16.355.5834.8053.604.8
    Mistral-7B-v0.1 (SCA DPO)7.554.2333.5153.825.6

    (注:数据出自 Table 2;表中呈现 Base 模型与 DPO 目标下 LoRA 与 SCA 的对比,因篇幅省略了 SFT 目标、Random 基线、SN-Tune 基线,以及 Mistral Base 模型的对应行)

    • 安全性提升:作者报告 SCA 在多个模型上将攻击成功率压低至较低水平,在 HarmBench 和 AdvBench 上均取得与全参数更新相当或更优的防御表现。
    • 通用能力保留:作者称将更新约束在拒绝电路内有效缓解了对齐税,模型在数学推理与多任务语言理解等通用基准上保持了与初始模型接近的准确率。
    • 过度拒绝抑制:作者指出全参数微调容易引起对良性提示词的过度防御,而 SCA 在保持安全性的同时降低了良性查询的过度拒绝比例。

    预训练基座模型中的拒绝电路发现与因果消融

    • 测了什么:在未经过安全对齐的 Llama-3-8B、Qwen-2.5-7B 与 Mistral-7B-v0.1 上提取候选电路 C1,并在 BeaverTails 数据集(50 条有害查询)上测试其独立拒绝率;随后在 HarmBench 上对 C1 进行置零消融,并与相同密度的随机神经元置零消融对比。
    • 结果:在 BeaverTails 上,三个基座模型的初始拒绝率为 15.63%–48.04%,参数量低于 1% 的独立拒绝电路 C1 拒绝率达到 100.00%,补集分支拒绝率降至 0.00%(Table 1);在 HarmBench 上消融 C1 后,模型拒绝率降至 0.00%–0.63%,ASR 分别从 48.43%、32.70%、42.14% 升至 91.19%、88.68%、88.05%(Table 9 / Figure 3),而同密度随机消融的 ASR 为 49.06%、64.15%、35.22%。
    • 作者的解读:作者认为基座模型中已存在弱拒绝电路并能独立完成拒绝;消融结果表明拒绝电路在模型安全行为中发挥因果性核心作用。

    对齐过程中拒绝电路的演化动态追踪

    • 测了什么:在 Llama-3-8B 的 SFT 对齐过程中,以前序检查点热启动提取相邻检查点的拒绝电路并计算 Jaccard 相似度;同时在单检查点执行多次独立提取评估随机变异性。
    • 结果:同一检查点独立提取的电路神经元重合度平均仅为 0.26;沿对齐路径连续检查点间的相似度从最初的 1.00 逐渐降至 20 个检查点后的 0.78;基座模型电路与对齐多步后的电路相似度约为 0.60(Figure 4)。
    • 作者的解读:作者认为拒绝电路在模型中存在功能冗余(非唯一),且在对齐训练中发生逐渐的结构漂移;这种漂移波及通用能力参数是对齐税的可能诱因。

    多随机种子鲁棒性与参数随机基线对比

    • 测了什么:在 4 个训练种子上对比 SCA 与相同稀疏度的随机参数更新基线在 HarmBench 上的 ASR,并计算成对 prompt 级 95% bootstrap 置信区间。
    • 结果:SCA 在 4 个种子上的 ASR 均低于随机基线:Llama-3-8B 为 5.48 ± 3.27% 对比 20.28 ± 6.00%(降低 14.80 个百分点,95% CI [11.48, 18.55]);Qwen-2.5-7B 为 11.32 ± 5.51% 对比 19.81 ± 3.43%(降低 8.49 个百分点,95% CI [4.72, 12.42]);Mistral-7B-v0.1 为 5.35 ± 2.44% 对比 12.58 ± 7.00%(降低 7.23 个百分点,95% CI [3.77, 10.85])(Table 4)。
    • 作者的解读:作者指出置信区间均排除零,说明 SCA 的防御增益源于靶向拒绝电路更新,而非仅仅来自参数稀疏性约束。

    其他消融与分析

    • XSTest 不安全对照与良性过度拒绝权衡:SFT 下 SCA 在 Llama、Qwen、Mistral 上的不安全对照 ASR 分别为 62.0%、47.5%、51.0%,良性过度拒绝率为 1.6%、6.8%、5.6%;DPO 下 ASR 分别为 48.5%、36.0%、21.5%,过度拒绝率为 3.2%、17.6%、5.6%(Table 3)。
    • 安全神经元基线 SN-Tune 对比:SFT 下 SN-Tune 在 Llama、Qwen、Mistral 上的 HarmBench ASR 分别为 0.00%、4.40%、5.03%,但 XSTest 过度拒绝率高达 86.4%、42.0%、25.6%,GSM8K 分别下降 18.80、12.73、4.62 个百分点(Table 2)。
    • 电路参数规模与稀疏度:Llama-3-8B、Qwen-2.5-7B、Mistral-7B-Instruct-v0.1 的可训练参数占比分别为 0.3513%(28.31M)、0.3960%(30.28M)、0.3894%(28.31M)(Table 5)。
    • Llama 随机基线集成对比:在 18 个随机种子测试中,表现最差的电路种子 ASR 为 8.81%,优于表现最好的随机种子 11.32%(附录 C)。
    • 反例与权衡:在 Qwen-2.5-7B SFT 设置下,LoRA 的 HarmBench ASR 为 0.63%,低于 SCA 的 6.92%(Table 2);在 XSTest 不安全对照集上,SCA 的 ASR 高于 Full-SFT(Table 3),作者在附录 D 解释称 Full-SFT 获得了更广泛的不安全对照覆盖但过度拒绝更多。
  5. 有什么可以进一步探索的点?

    论文未专门设置章节讨论局限与未来工作,实验覆盖了三个 7B–8B 规模模型及门控 MLP 神经元级电路。

    作者指出的局限与后续方向

    • 论文未专门讨论局限:论文未设置独立的 Limitations、Discussion 或 Future Work 章节,未在正文或结论中专门讨论研究局限或后续工作方向。

    实验覆盖范围

    • 模型覆盖范围:实验测试了 Llama-3-8B、Qwen-2.5-7B 以及 Mistral-7B-v0.1(含 Instruct 版本)共 3 个 7B–8B 密集语言模型(Section 3.2, 4.2)。
    • 电路层级限定:电路提取与微调更新均限定在门控 MLP 模块的神经元,未将自注意力模块纳入电路搜索空间(Section 3.1, 4.1)。
    • 对齐算法与数据:对齐实验仅涵盖监督微调(SFT,使用 LLM-LAT)与直接偏好优化(DPO,使用 PKU-SafeRLHF)两种方法(Section 4.2)。
    • 评测样本量与重复次数:提取阶段使用 100 条训练样本与 50 条验证样本(Table 8);主评测基于单次运行,多随机种子测试仅针对 HarmBench ASR 进行了 4 个种子评估(Table 4, 附录 C);BeaverTails 独立性测试样本量为 50 条(附录 B)。
    • 未报告信息:论文未报告自动评审模型 Llama-Guard-3-8B 与人工标注一致性的统计数据。
  6. 总结一下论文的主要内容

    SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
    • 论文定位:论文提出了从计算电路视角解析大语言模型内部安全机制与跨阶段演化的分析框架 SafeEvo,并据此设计了定向微调拒绝电路的安全对齐方法 SCA。
    • 要解决的问题:传统安全对齐多从表面行为模式施加约束,缺乏对内部机理的理解;同时全参数微调易引发损害通用能力的对齐税与过度拒绝问题,而先前可解释性研究未探究预训练基座模型中的安全机制及其演变。
    • 方法核心机制:通过可微掩码和双分支优化从基座模型提取稀疏门控 MLP 拒绝电路;利用 Jaccard 相似度追踪对齐过程中的电路漂移;在 SCA 中将 LoRA 参数更新严格约束在提取出的预训练拒绝电路上。
    • 关键实验结果:
      1. 预训练基座模型中已存在弱拒绝电路,在 BeaverTails 50 条查询上独立电路拒绝率达 100.00%(Table 1),而消融该电路使 HarmBench ASR 从 32.70%–48.43% 升至 88.05%–91.19%(Table 9)。
      2. 拒绝电路在模型内非唯一且在对齐中发生结构漂移,同检查点独立提取重合度仅 0.26,连续检查点间重合度降至 0.78(Figure 4)。
      3. 在 DPO 对齐下,SCA 将 Llama-3-8B 在 HarmBench 上的 ASR 从全参数的 16.98% 降至 0.63%,GSM8K 准确率为 48.98%(全参数为 49.51%),XSTest 过度拒绝率为 3.2%(Table 2)。
      4. 多种子测试中,SCA 在三个模型上的 HarmBench ASR 较同稀疏度随机更新基线分别降低 14.80、8.49、7.23 个百分点,bootstrap 95% 置信区间均排除零(Table 4)。
    • 作者结论与启示:作者认为安全对齐通过重塑底层拒绝电路起效,无约束更新引发的电路漂移及对通用参数的干扰是对齐税的潜在来源;将更新约束于预训练拒绝电路能够在提升安全性的同时兼顾通用能力保留与低过度拒绝。
阅读原文arxiv.org