SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
- 论文定位:论文提出了从计算电路视角解析大语言模型内部安全机制与跨阶段演化的分析框架 SafeEvo,并据此设计了定向微调拒绝电路的安全对齐方法 SCA。
- 要解决的问题:传统安全对齐多从表面行为模式施加约束,缺乏对内部机理的理解;同时全参数微调易引发损害通用能力的对齐税与过度拒绝问题,而先前可解释性研究未探究预训练基座模型中的安全机制及其演变。
- 方法核心机制:通过可微掩码和双分支优化从基座模型提取稀疏门控 MLP 拒绝电路;利用 Jaccard 相似度追踪对齐过程中的电路漂移;在 SCA 中将 LoRA 参数更新严格约束在提取出的预训练拒绝电路上。
- 关键实验结果:
- 预训练基座模型中已存在弱拒绝电路,在 BeaverTails 50 条查询上独立电路拒绝率达 100.00%(Table 1),而消融该电路使 HarmBench ASR 从 32.70%–48.43% 升至 88.05%–91.19%(Table 9)。
- 拒绝电路在模型内非唯一且在对齐中发生结构漂移,同检查点独立提取重合度仅 0.26,连续检查点间重合度降至 0.78(Figure 4)。
- 在 DPO 对齐下,SCA 将 Llama-3-8B 在 HarmBench 上的 ASR 从全参数的 16.98% 降至 0.63%,GSM8K 准确率为 48.98%(全参数为 49.51%),XSTest 过度拒绝率为 3.2%(Table 2)。
- 多种子测试中,SCA 在三个模型上的 HarmBench ASR 较同稀疏度随机更新基线分别降低 14.80、8.49、7.23 个百分点,bootstrap 95% 置信区间均排除零(Table 4)。
- 作者结论与启示:作者认为安全对齐通过重塑底层拒绝电路起效,无约束更新引发的电路漂移及对通用参数的干扰是对齐税的潜在来源;将更新约束于预训练拒绝电路能够在提升安全性的同时兼顾通用能力保留与低过度拒绝。