研究:拒答只读取模型道德表征中的伤害切片
Refusal Reads Only a Slice of What the Model Knows: Harm-Keyed Routing and Its Exceptions Across Model Families
作者分析OLMo-3等,发现拒绝仅读取一维伤害感知(OLMo-3拒绝因果输入76%在道德基外),跨架构有早承诺等差异。
- 对齐后的拒绝行为常被单一方向剪除,说明其表征基础较薄弱。需要厘清模型在决定拒绝时究竟读取了什么表征,以及该决策是否调用了模型在预训练中习得的底层道德理解。这关系到对齐浅层性与可移除性的内在机理。
- 基于表示阅读提取道德子空间、拒绝方向与判断决策方向,并测量决策位的参与率瓶颈。以OLMo-3为主要对象,在写入决策通道的注意力头上进行嵌套交换干预实验,并在四模型面板上比较拒绝读取的内容与承诺时机。
- OLMo-3上拒绝在达到rank-1伤害水平后饱和,76%的因果输入在道德基底之外;道德判断则持续随子空间扩展读取。Llama在匹配深度广泛读取道德内容并提前承诺;GPT-OSS相关性读取伤害且拒绝可被显式推理双向翻转。
- 维度与可逆性规律仅基于三款已确定模型,混杂了模型谱系与规模等架构因素。GPT-OSS读取伤害属相关性而非交换干预;OLMo在意图危害上拒绝率仅约17%,行为耦合偏弱;正面对照带存在跨模型刺激构建协变量。
- 模型
- OLMo-3-7B-InstructOLMo-3-7B baseQwen2.5-7B-InstructLlama-3.1-8B-InstructGPT-OSS-20BOLMo-3-ThinkDeepSeek-R1-Distill-Llama-8BDeepSeek-R1-Distill-Qwen-14BQwen2.5-14B-Instruct
- 基准
- Moral StoriesUnderstanding FablesETHICSrequest-twinsseverity ladder48-scenario forced-choice battery
- 指标
- cosineprojection fractionparticipation ratio (PR)restricted-transfer coefficient R_r(k)asymmetry statistic Arefusal ratemoral judgment accuracyd-prime
一项针对四个开源权重模型的研究发现,拒答决策并不读取模型用于道德判断的完整道德子空间,而是只读取其中与伤害相关的低秩切片。作者在 OLMo-3 上用嵌套交换秩扫描做因果检验:随着道德基扩大,道德判断的迁移系数从 0.05 升到 0.66,而拒答迁移在 k=3 后停在 0.22 至 0.24,约四分之三的拒答因果输入落在道德子空间之外。研究还发现道德理解在预训练阶段就已形成,OLMo-3 上该子空间与最终状态的余弦从 1000 步的 0.869 升到 0.999,对齐只做一次约 40 度的旋转;而拒答门是后训练新建的,与其预训练前身的余弦仅 0.155。四个模型的读取方式并不一致:Llama-3.1 读取宽泛道德内容,Qwen2.5 超出单一伤害线索但在样本量下未定论,GPT-OSS 读取伤害且其拒答可被自身推理链推翻。
推荐理由论文用嵌套交换干预追踪拒答决策读取的内容,给出拒答与道德判断在决策点近乎正交的机制解释。
深度解读
这篇论文试图解决什么问题?
研究模型拒绝决策时实际读取了哪些内部表征,探究后训练对齐易被移除的机制解释与跨模型表征差异。
后训练对齐在模型中安装的拒绝机制到底读取了什么表征,以及它与模型底层的道德理解表征之间是何种关系。
- 问题出现的场景与重要性:基于人类反馈或偏好优化的后训练对齐所带来的拒绝行为具有可移除性,通过 rank-1 编辑即可消除拒绝,而理解机制未受损。厘清拒绝决策到底读取了什么,对解释对齐的脆弱性与可移除性至关重要。
- 现有假设与观察:直觉假设或“深度对齐”设想模型拒绝会广泛调用用于是非判断的道德表征;但作者假设拒绝可能仅读取道德内容中的低秩伤害感知(harm percept),并写入狭窄的控制 token 瓶颈。
- 核心观察:在 OLMo-3 等模型中,预训练原生形成了稳定的低秩道德子空间,而后训练对齐仅对其进行了一次刚性旋转;相反,拒绝门控是后训练新构建的低方差通道,在决策位与道德判断相互正交。
- 论文的主要工作:提出结合几何测量与因果交换干预(interchange patching)的分析框架,因果解析 OLMo-3 拒绝决策的读取内容,并构建四模型面板,在读取内容与承诺方式两个维度上定位不同模型家族的拒绝机制。
有哪些相关研究?
涵盖后训练对齐与拒绝消除、表征阅读与因果交换干预、道德与伤害表征编码等相关研究。
后训练对齐与拒绝机制的可移除性
- Ouyang et al. (2022)、Rafailov et al. (2023)、Bai et al. (2022)——分别提出了 RLHF、DPO 与 Constitutional AI,通过偏好优化或宪法反馈训练模型拒绝有害请求,但未探究内部拒绝表征的具体来源。
- Arditi et al. (2024)、p-e-w (2025)——发现语言模型中的拒绝由残差流中的单一方向介导,可通过 rank-1 编辑消除;后续开源工具实现了自动化移除。作者指出这些工作说明了拒绝多容易被消除,但未回答拒绝最初到底读取了什么。
- Hubinger et al. (2024)、Greenblatt et al. (2024)——研究了模型的潜伏策略(sleeper agents)与伪装对齐(alignment faking),作者将其作为后训练对齐容易与底层深层表征脱钩的背景佐证。
表征工程与因果干预技术
- Park et al. (2024)、Zou et al. (2023)——发展了表征工程与线性表征假说,通过对比刺激的激活均值差提取概念方向或低秩子空间。
- Meng et al. (2022)——提出了交换干预(interchange patching)技术,用于因果定位内部激活组件的作用。
- Belrose et al. (2023)——提出了 LEACE 闭式解线性概念擦除方法,用于表征正交化与概念清除。
道德与伤害表征
- Hendrycks et al. (2021)、Graham et al. (2013)、Haidt (2012)——提出了 ETHICS 数据集与道德基础理论,用于量化人类道德判断与基础维度。
- Zhao et al. (2025)——发现有害性与拒绝在模型中分开编码。作者将该结论拓展至思考推理模型,并指出其早期差分均值未检测出因果效应属于量级伪影。
- Reblitz-Richardson (2026a, 2026b, 2026c)——发现道德结构在预训练早期组合式形成并整合为低秩正相关子空间;提出了可解释性仪器的参与率校准协议。
基线方法与基准/数据集
- 基线与对照:协方差匹配的零假设(covariance-matched nulls)、随机方向基底(random-basis null)、留一法道德家族带(held-one-out moral-family band)、角色参考方向(persona reference)。
- 基准数据集:Moral Stories、Understanding Fables、ETHICS commonsense,以及成对构建的请求孪生对(request-twins)、5 级意图危害阶梯、48 场景强制选择道德判断测试。
本文定位 作者指出,以往研究仅证实了拒绝方向可被单方向剪除,本文通过因果交换扫描与跨架构面板,首次在机制层面将拒绝决策读取的内容(伤害感知与广泛道德)与行为承诺时机(早承诺、延迟承诺、可逆推理)解耦分析。
论文如何解决这个问题?
结合校准投影梯与嵌套因果交换干预,在控制token瓶颈处解耦表征读取与行为承诺时机。
作者提出了结合几何投影校准梯(calibrated projection ladder)与因果嵌套交换干预(nested interchange rank sweep)的机械解释分析框架,在决策 token 处解耦表征读取与行为承诺。
表征与子空间提取
- 道德子空间 Vmoral:基于 Moral Stories、Understanding Fables 和 ETHICS 三个数据集,在内容 token 位置通过道德与中性刺激的激活均值差提取 3 个源方向并正交化,构成有效秩为 3 的子空间。
- 拒绝与判断决策方向:在模型给出回答前的决策 token 处(instruct 模型的 assistant 标头前 token,推理模型的 end-of-prompt token),通过拒绝与顺从请求的均值差提取拒绝方向;在同位置通过赞同与反对评价提取道德判断决策方向。
- 伤害方向:在指令 token 处通过请求孪生对(request-twins)的有害与无害刺激均值差提取,与下游拒绝方向及道德子空间保持低重叠。
决策位瓶颈与校准阶梯
- 控制 token 瓶颈检验:计算决策 token 处的参与率(participation ratio, PR),各模型 PR 在 8.6 至 14.7 之间,表明该处残差流仅有 8 到 15 个有效维度,导致常规投影分数在决策位失效(band-below-null)。
- 五级校准投影梯:构建包含各向同性底线、协方差匹配的零假设(q50 与 q95)、测量值、留一法道德家族带(positive control)和角色参考(persona)的阶梯,要求只有超过 q95 加 0.05 边际才判定存在关联。
- 规范化折叠与标准化:对 OLMo-3 的重排序 RMSNorm 应用逐层增益折叠,使单头重构精确度达 0.9999;对高方差离群维度模型(Qwen、Llama)实施逐维度标准化。
嵌套因果交换干预
- 注意力头因果交换:使用承载相反判断结果的请求孪生对(request-twins),在写入决策通道的关键注意力头上修补内容激活,测定拒绝与判断投影的诱导变化。
- 秩扫描定义:定义限制转移系数 Rr(k) 为限制在道德子空间前 k 个方向时,干预对读出量 r 所复现的完整交换干预效应比例。
- 单参数饱和模型:采用单参数截断公式 Rrefusal(k) ≈ min(harm ceiling, Rjudgment(k)) 拟合拒绝曲线,用单一自由参数检验拒绝是否在道德判断达到伤害上限处饱和。
跨架构双轴映射
- 读取轴与承诺轴划分:将各模型定位在“读取内容”(单维度伤害感知 vs 广泛道德内容)与“承诺机制”(决策层承诺、提前承诺、可逆推理)两个解耦的轴上。
- 匹配深度与前缀探测:在 Llama 上选取承诺前的一致深度(层 12)消除早承诺伪影;在 GPT-OSS 上通过植入分级开脱(exculpatory)与加罪(inculpating)推理前缀测试拒绝的可逆性。
论文做了哪些实验?
多模型参与率确认决策瓶颈,因果交换显示OLMo拒绝在rank-1伤害饱和,消融实验显示Llama存在道德纠缠。
实验设置
- 被测模型:主面板涵盖 4 款开源对话模型:OLMo-3-7B(包含 base 与 Instruct 检查点)、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 以及 20B 推理混合专家模型 GPT-OSS-20B;辅助验证模型包括 OLMo-3-Think、DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-14B、Qwen2.5-14B-Instruct。
- 数据集与基准:道德子空间提取使用 Moral Stories、Understanding Fables、ETHICS commonsense;因果干预使用 42 对请求孪生(request-twins,23 对原始加 19 对复现);行为评测采用 5 级意图危害阶梯、100 条保留有害请求测试集、48 场景道德判断强制选择集、120 项道德判断强制选择集以及 36 对边界请求孪生。
- 对比基线与对照:协方差匹配的秩匹配零假设(covariance-matched rank-matched nulls,q50 与 q95)、随机方向控制基底(random-basis null)、留一法道德家族带(held-one-out moral-family band)、角色参考方向(persona reference)。
- 评测指标:方向保持余弦相似度(cosine)、决策位参与率(PR,有效维度)、投影分数、限制转移系数 R_r(k)、非对称统计量 A、有害请求拒绝率、道德判断准确率、行为翻转率。
- 评审与判定方式:决策通道位置依据模板自动定位(instruct 为 assistant 头前 token,GPT-OSS 为 harmony 决策 token);拒绝判定基于预设模板与连贯性过滤;评审未引入外部 LLM 打分。
- 样本量与重采样:主干预实验 n=42(原始 23 对与复现 19 对);GPT-OSS 反转实验 n=7(介入)与 n=10(解除);Bootstrap 置信区间统一采用 B=2000 次重采样(固定随机种子 0)。
主结果
下表呈现四款模型在决策位结构、表征读取及行为承诺机制上的跨架构测量主结果(据 Table 1、Table 7、Table 10、Table 11、Table 13):
表格较宽,可左右滑动
模型 决策位参与率 PR (Table 10) 拒绝读取判定 (Table 1) 拒绝转移系数或余弦 (Table 1, 7, 11, 13) 道德判断转移系数 (Table 1, 7, 11) 承诺机制与代表指标 (Table 1, 11, 12, 13) OLMo-3-7B-Instruct 14.7 伤害感知(harm percept) 0.24 (k=16, 上限 0.25) 0.66 (k=16) 读出层或之后;解除效应 -0.62 Qwen2.5-7B-Instruct 8.6 待定(超出 rank-1 伤害) 0.54 (k=16, 95% CI [0.42, 0.69]) 与拒绝差距 0.12 (未解决) 读出层双向响应;解除 -2.70,介入 +0.68 Llama-3.1-8B-Instruct 10.2 (记录值) 广泛道德内容 0.85 (层 12 匹配深度) 0.79 (层 12 匹配深度) 提前承诺;层 16 解除 -0.014,层 12 为 -0.11 GPT-OSS-20B 12.8 (标准化) 伤害(相关性读出) 轨迹内与伤害余弦 0.49 未报告 可逆读取;介入翻转 7/7,解除翻转 6/10 - 决策位均呈现低维控制瓶颈:作者报告,四款模型的决策 token 处参与率均在 8.6 至 14.7 之间(Table 10),远低于内容位置的参与率(均在 32.7 以上),验证了该位置属于 8 到 15 个有效维度的狭窄控制通道。
- 读取内容呈现模型分化:作者指出,在干预测试中,OLMo-3 的拒绝转移系数在 rank-1 伤害水平处饱和停滞在 0.22–0.24,而判断转移系数攀升至 0.66(Table 7);Llama-3.1 在层 12 深度拒绝转移系数为 0.85,与判断转移系数 0.79 相当(Table 11);GPT-OSS 表现出对伤害特征的高相关性(Table 13)。
- 承诺机制各不相同:作者报告,Llama-3.1 表现出早承诺特征,在层 16 解除介入仅有 -0.014 且不连贯,而层 12 解除效应为 -0.11(Table 11, Table 12);GPT-OSS 的拒绝决策具有可逆性,前缀干预可在顺从与拒绝之间实现双向翻转(Table 13)。
预训练形成与对齐旋转追踪(OLMo-3)
- 测了什么:跨 OLMo-3 的 25 个检查点追踪秩为 3 的道德子空间与拒绝门控的方向保持余弦、探测准确率及有效维度(Figure 1, Section 3, Section 4)。
- 结果:道德子空间在预训练 step 1000 时余弦为 0.869,预训练结束时升至 0.999;SFT 使其经历单次旋转(余弦降至 0.757,约 40 度),随后的 DPO 与 RLVR 保持在 0.757–0.759,探测准确率保持 100%、有效维度保持 5。拒绝门控与基座前体余弦仅为 0.155(匹配零假设 q95 为 0.070)(Figure 1)。
- 作者解读:道德理解是预训练原生的并平移继承,后训练仅旋转而未重塑它;拒绝门控则是后训练新构建的控制机制。
决策通道写入的注意力头归因
- 测了什么:在 OLMo-3-Instruct 上对写入约 13 维决策通道的注意力头和 MLP 进行因果归因与读写特征分解(Section 7, Section C.1, C.2, Table 4, Table 5)。
- 结果:拒绝写入呈现分布式,首要注意力头 L16 H23 占总特异性的 11.7%(写入 +0.742,特异性 +0.756),前 10 个头累积特异性达 45%,达到 80% 需 67 个头;MLP 贡献了决策位写入的 38%(比例 0.384)。前 10 个头部在残差基底下的道德子空间比例仅为 0.15–0.28,均被标注为“既非道德亦非伤害”(Table 4, Table 5)。
- 作者解读:拒绝决策由大量注意力头和 MLP 分布式写入狭窄控制通道,而非由单一专用安全头驱动,且顶层写入头本身并未调谐至道德子空间。
拒绝消融对行为与道德判断的影响
- 测了什么:在各模型消融深度扫描确定的层位将单一拒绝方向正交化消解,测量有害请求拒绝率及道德判断准确率(Section 8.1, Appendix F.1, F.2)。
- 结果:在 OLMo-3 上消融拒绝使测试集拒绝率从 0.575 降至 0.000,道德判断准确率从 0.75 微升至 0.79(随机对照为 0.747 ± 0.007);Qwen 拒绝率从 1.000 降至 0.000,判断准确率从 0.875 变为 0.812;而 Llama 拒绝率仅从 0.900 降至 0.475,且道德判断准确率从 0.75 降至 0.604,呈现剂量依赖性下降(半强度下降 0.083,全强度下降 0.146)(Appendix F.1, F.2)。
- 作者解读:在伤害引导型模型(OLMo、Qwen)上消融拒绝不伤及道德判断;而 Llama 因拒绝广泛读取道德内容且提前承诺,导致拒绝方向与道德判断表征深度纠缠,消融拒绝会连带损害是非判断。
其他消融与分析
- 伤害剔除交换干预:从道德子空间剔除伤害方向后,残差对 OLMo-3 拒绝效应为 -0.0133(95% CI [-0.023, -0.005]),接近检测限 0.0238(Table 6, Section C.6)。
- 意图阶梯拒绝率:OLMo-3 在 5 级意图危害梯度上,最高级别的违规请求拒绝率仅约 17%(各级违规项拒绝率为 0/0.17/0/0.17/0.17,良性项全为 0)(Section C.7)。
- 残差输出直接投影消除:在 OLMo-3 第 16 层残差处直接投影消除拒绝方向,100 条有害请求中有 33 条由顺从变为拒绝、17 条由拒绝变为顺从(Table 9, Section C.8)。
- Llama 承诺层位扫描:Llama 在层 8、12、14 上的解除效应分别为 -0.12、-0.11、-0.20(均连贯),在读出层 16 为 -0.014(不连贯)(Table 12)。
- GPT-OSS 决策位投影特异性:分级前缀下决策通道拒绝投影移动约 1 个标准差,但在 500 个协方差匹配随机方向中有约 20% 达到同等移动(单侧 p 值为 0.17 至 0.23)(Table 13, Section 10)。
- 角色参考方向投影:persona 参考方向在 OLMo-3 上的道德子空间投影为 0.51,消融 persona 保持 Llama 道德判断在 0.75(Appendix H.1, H.3)。
有什么可以进一步探索的点?
作者指出了两轴规律的架构混杂、GPT-OSS非因果测试、部分模型行为耦合偏弱等局限与后续方向。
作者指出的局限与后续方向
- 双轴分类的架构混杂与样本量限制:作者指出,两轴映射表仅有三个确定点和一个待定点,且模型在谱系、模型规模、分词器以及推理训练上同时存在差异,维度预测可逆性仅为假设,需要单变量控制实验进行去混杂检验(出自 Section 10)。
- GPT-OSS 伤害读取仅为相关性结果:作者说明,GPT-OSS 由于单方向消融未能消除拒绝,因果嵌套秩扫描干预并未在该模型上实施,其读取伤害的结论建立在投影相关性之上(出自 Section 10, Section G.1)。
- 读出量与实际行为维度的跨度差异:作者指出,实验中部分单元读取内部表征方向(如秩扫描与投影),部分读取外在行为(如前缀翻转率),内部方向的变化不能直接等同于行为改变(出自 Section 10)。
- 分级前缀投影位移缺乏拒绝特异性:作者报告,GPT-OSS 在分级前缀下决策通道拒绝投影的位移与协方差匹配随机方向相比无统计学差异(单侧 p 值为 0.17 至 0.23),仅反映了位置层面的重写效应(出自 Section 10)。
- OLMo-3 行为耦合偏弱:作者指出,OLMo-3 对意图危害请求的最高拒绝率仅约 17%,行为操作空间狭窄,导致行为层面的承诺轴测试不得不转移至 Llama 和 GPT-OSS 上进行(出自 Section 10, Section C.7)。
- 校准阶梯缺乏非道德正向对照:作者在附录中说明,由于 persona 参考方向在构建上天然具备道德邻近性,当前校准阶梯仍缺少非道德的正向投影对照(出自 Section H.3)。
实验覆盖范围
- 被测模型范围:实验覆盖 OLMo-3-7B(base 与 instruct)、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-OSS-20B 四款开源权重模型,以及少部分衍生蒸馏和推理变体,因果秩扫描仅在 OLMo-3 单一模型上完整实施(Section 2.1, Section 7)。
- 因果干预样本规模:OLMo-3 上的因果交换干预基于 42 对请求孪生样本(由 23 对原始样本与 19 对复现样本合并)(Table 7)。
- 行为反转样本规模:GPT-OSS 上的推理前缀反转测试基于小规模样本完成(介入测试 n=7,解除测试 n=10)(Table 13, Section 8.2)。
- 评测场景设置:测试刺激涵盖 Moral Stories、Understanding Fables、ETHICS 常识数据集,以及英文环境下的请求孪生对和意图阶梯对比(Section 2.2, Appendix A.6)。
- 未报告的测试维度:论文未在闭源商业模型上测试内部表征几何或因果交换机制,未报告多语言或多模态设置下的表征数据。
总结一下论文的主要内容
作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
- 核心定位与探究问题:针对后训练对齐安装的拒绝行为易被低秩编辑消除的现象,探究拒绝决策在内部到底读取了什么表征,以及它与预训练形成的道德理解表征之间的几何与因果关系。
- 核心方法设计:基于表征阅读提取道德子空间、拒绝门控与道德判断决策方向,结合控制 token 瓶颈验证,在注意力头上实施嵌套因果交换干预,并构建涵盖四款开源模型的双轴分类面板。
- 表征演化与几何解耦:OLMo-3 的道德子空间在预训练结束时结晶(方向余弦 0.999),对齐仅带来单次旋转(余弦降至 0.757);而拒绝门控与基座前体余弦仅 0.155,并在参与率 14.7 的低维控制瓶颈处与道德判断方向正交(余弦 0.10)。
- 因果读取的伤害饱和:在 42 对请求孪生干预中,随着道德基底扩展,OLMo-3 道德判断转移系数由 0.05 升至 0.66,而拒绝转移系数在 rank-1 伤害水平处饱和在 0.22–0.24(单参数拟合上限 0.25),约 76% 的因果输入位于道德基底之外。
- 跨家族双轴分化与消融差异:Llama-3.1 在层 12 匹配深度广泛读取道德内容(转移系数 0.85)且提前承诺,单方向消融导致道德判断准确率从 0.75 降至 0.604;GPT-OSS 相关性读取伤害且推理前缀可双向翻转拒绝(介入翻转 7/7,解除翻转 6/10);Qwen 表现介于两者之间。
- 作者结论与启示:作者认为后训练对齐之所以浅层且可轻易移除,是因为伤害引导型模型的拒绝决策仅在狭窄通道中读取了可分离的低秩伤害特征;未来若要深化对齐行为,干预目标应当是引导写入决策通道的注意力头去读取道德判断已经调用的广泛表征。