SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
SafeEvo发现基座模型存在弱拒绝电路且对齐中发生漂移;仅微调该电路的SCA在保留能力的同时降低了ASR。
- 100.00%Llama-3-8B提取的C1电路在BeaverTails上的拒绝率(Table 1)
- 91.19%Llama-3-8B消融C1电路后在HarmBench上的ASR(Table 9)
- 0.63%Llama-3-8B经SCA-DPO对齐后在HarmBench的ASR(Table 2)
论文旨在从电路视角解析基座模型的安全机制与对齐演化,并探索如何缓解全参数对齐损害通用能力的对齐税问题。
论文基于对齐算法、安全可解释性及电路提取现有工作展开,指出先前研究缺乏对预训练基座及跨阶段演化的分析。
论文通过双分支可微掩码优化提取基座模型的拒绝电路并追踪演化,进而提出仅更新该电路的 SCA 对齐算法。
在三个开源模型上的实验证实基座模型存在弱拒绝电路且对齐中发生漂移,SCA 在降低 ASR 的同时保留了通用能力。
论文未专门设置章节讨论局限与未来工作,实验覆盖了三个 7B–8B 规模模型及门控 MLP 神经元级电路。
SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。