论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
- 研究定位:该研究从损失曲面与特征空间几何视角探究大语言模型后验安全对齐脆弱性的根因,并在预训练阶段构建抗微调攻击的安全防护机制。
- 核心问题与理论分析:针对 RLHF 和 DPO 易被少量良性微调破坏的现象,作者建立了经验 Fisher 特征子空间测量工具并提出核不动引理,指出成熟底模上的后验安全更新与能力空间近乎正交,仅在极少数高曲率方向上形成掩盖门控而非消除有害能力。
- 表征底座发展规律:在 OLMo-2-1B 预训练序列上的追踪显示,拒绝机制所依赖的表征底座在 1B 至 63B token 之间快速成型;在此之前施加安全微调会产生未成熟底模模式,无法形成稳定门控。
- 持续共训练主实验结果:基于几何发现,作者提出从头预训练持续共训练方案。实验显示,在 100 条 Alpaca 良性微调攻击下,后验微调的 Qwen-2.5-7B 和 Llama-3-8B 的 AdvBench 拒答率分别下降 34.8 和 38.3 个百分点;而 410M 至 6.9B 的持续共训练模型在攻击后拒答率仍保持在 84.0% 至 90.6%(Table 1、Table 3)。
- 时序消融与代价特征:在 Pythia-1B 上的时序对比表明,仅在前 30% 阶段注入安全损失的窗口方案在训练结束后拒答率归零,指出只有持续至预训练结束方可保证鲁棒性;该方案在短答案推理和知识检索上带来约 0.12 至 0.22 nats 的负对数似然代价,但在指令遵循上无负面影响(Table 2、Table 20)。
- 作者结论与启示:作者认为后验安全微调的脆弱性可在未遭受攻击前直接从权重几何特征进行检测诊断;若要获得真正抵御微调擦除的安全能力,需要将安全信号贯穿基础模型的预训练全过程。