论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击
The Geometry of Refusal: Why Post-Hoc Safety Is Fragile and Pretraining-Time Safety Persists
AI 导读
论文从几何角度解释事后安全训练(RLHF、DPO)为何脆弱:在五个模型家族上,安全更新 Δ 与模型能力方向近乎正交,只集中在少数高曲率方向,相当于在完整能力之上加了一道拒答闸门,而非抹除能力。核不动性引理说明这类更新只能掩盖能力,因此少量良性微调就能恢复:100 条良性样本让 Qwen-2.5-7B-Instruct 和 Llama-3-8B-Instruct 在 AdvBench 上的拒答率下降 35–38 个百分点。OLMo-2-1B 的预训练检查点扫描显示,拒答所依附的特征在 1B 到 63B 预训练 token 之间急剧出现。在整个预训练过程中持续加入安全共训练、从头训练的模型,在 410M 到 6.9B 各规模上达到 87%–98% 的 AdvBench 拒答率,同样的攻击只让它下降 2–14 个百分点,代价是短答案能力探针上的少量损失;总安全权重相同但只在一个窗口内加入则装不上拒答。作者的结论是,带来攻击鲁棒性的是安全信号在预训练中的持续性,而不是加入的时机。
论文速读
- 事后安全训练(RLHF、DPO)是主流对齐手段,但越狱、微调攻击和激活空间编辑总能恢复它本应移除的行为。作者想解释这种脆弱性:安全更新究竟是抹除了能力,还是只是把它遮住了。
- 用能力损失的经验 Fisher 曲率来度量安全更新 Δ=Wsafe−Wbase,提出两个标量:ρ(更新落在能力子空间内的比例)和 qnorm(更新穿越的曲率相对随机方向的大小),据此把安全安装分为 suppression(ρ≪ρpart)与 erasure(ρ≳ρpart)两类,并给出 kernel-immobility 引理。
- 五个模型家族的事后安全安装都落在 suppression 区,比 erasure 边界低两到三个数量级;100 条良性样本的微调就让 Qwen-2.5-7B-Instruct 和 Llama-3-8B-Instruct 的 AdvBench 拒答下降 35–38 个百分点。OLMo-2-1B 的预训练检查点扫描显示拒答所依附的特征在 1B 到 63B token 之间急剧出现。从零开始、贯穿预训练的安全 co-training 在 410M 到 6.9B 上达到 87–98% 拒答率,同样攻击只侵蚀 2–14 个百分点,代价是短答能力探针上最多 0.2 nats;等总权重的窗口式调度则完全装不上拒答。
- 鲁棒性是绝对而非匹配的:从零训练的 410M 基座上事后 DPO 装不上拒答,因此无法证明 co-training 比同等强度的事后安装更耐久。覆盖仅在分布内且随规模变窄;每个 co-training 条件只跑一次;几何工具只到 8B,70B+ 是未验证的推测;Δ 工具不适用于 co-training 条件。作者提出后续可做:在事后训练中惩罚 qnorm 以检验尖锐性是否导致脆弱,以及用更广的拒答模板扩大覆盖。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文用几何视角解释事后安全训练为何容易被少量良性微调抹掉,并实测在整个预训练中持续加入安全共训练能让拒答经受住同样的攻击。