TAME:用 token 归因与掩码定位并削减涌现性失配
TAME: Token Attribution and Masking for Emergent misalignment
研究者提出 TAME 框架分析涌现式对齐失效,发现掩码 top-40% 归因 token 使 Llama-3.2-1B 的 EM 率下降 23 倍。
- 窄领域有缺陷微调会导致模型在无关任务上表现出有害行为(涌现式对齐失效,EM)。现有工作停留在权重、表征或样本级分析,不清楚具体是哪些训练 token 携带了导致 EM 的关键微调信号。
- 提出 TAME 框架:利用 LoRA 适配器权重前向计算回复 token 似然变化以进行归因,在 surprisal 分箱下控制罕见度分析词汇特征,并在新模型微调时对高归因 token 进行损失掩码验证因果作用。
- 在医疗建议数据上,前 5% 的 token 集中了超 31% 归因质量;对 Llama-3.2-1B 掩码 top-40% 归因 token 使 EM 率下降 23 倍,Qwen2.5-1.5B 下降 36 倍,困惑度上升主要落在确定性语域词而非医学内容词。
- 实验仅覆盖单一医疗微调领域、单一种子、小规模学生模型与单一裁判;语域词特征在控制罕见度后未在 Qwen 上复现;40% 掩码比例未做剂量消融,归因得分为一阶估计。
- 模型
- Llama-3.1-8B-InstructLlama-3.2-1B-InstructQwen2.5-7BQwen2.5-1.5BGPT-4o
- 基准
- Turner et al. bad-medical-adviceBetley et al. 8 non-medical evaluation questions
- 指标
- EM rateAlignmentCoherencePerplexityAttribution mass concentrationRegister enrichment
研究者提出 TAME 框架,在 token 级别定位微调数据中引发涌现性失配(EM)的信号。方法分三步:通过已发布的 LoRA adapter 前向计算每个回复 token 的归因分数,刻画高归因 token 的语言特征,再用归因引导的损失掩码做因果验证。在 Llama 上,前 5% 的 token 承载 32% 的归因质量,高归因 token 中医学词汇偏少,而 completely、perfectly、safe 等过度确定性的表达偏多,且在控制 token 稀有度后依然成立。在 6,849 条医学建议数据上重新微调时掩掉高归因 token,Llama 的 EM 下降 23 倍、Qwen 下降 36 倍,等量随机掩码则无效果,困惑度代价集中在被针对的确定性表达而非医学内容。作者称这是初步研究,Qwen 上的表达富集未能通过稀有度控制,跨模型族普适性仍待检验。
推荐理由研究把涌现性失配定位到训练数据中的具体 token,并给出可复现的掩码干预方法,适合关注微调数据审计的读者。
深度解读
这篇论文试图解决什么问题?
论文探究在窄任务微调诱发涌现式对齐失效时,具体是哪些训练 token 承载了关键信号。
在窄任务微调诱发涌现式对齐失效(Emergent Misalignment, EM)的过程中,训练数据中究竟是哪些具体的回复 token 承载了驱动跨领域有害行为的关键信号。
- 问题背景与研究意义:模型在狭窄且有缺陷的数据上微调会引发远超出训练域的普遍未对齐行为,而将相同缺陷内容置于良性语境则不产生该现象,说明仅凭领域内容本身无法完全解释 EM。
- 现有归因方法的不足:以往研究多将 EM 定位在模型内部特征、低秩方向或整个有影响力的训练样本上,样本级分析过于粗糙,无法区分领域事实内容与表达置信度等语言风格。
- 核心观察与假设:作者认为有缺陷的回复同时编码了领域内容以及表达置信度的语域风格,真正驱动 EM 的关键微调信号可能更多源自过度确定的言语表达,而非具体的领域专业词汇。
- 提出的方法框架:作者提出了 TAME 框架,包含 token 级别前向归因打分、控制罕见度的信号特征刻画,以及通过损失掩码进行因果干预验证三个阶段。
有哪些相关研究?
归纳了 EM 现象、表征与数据归因、语言校准等工作,指出前人缺乏针对回复 token 的分析。
涌现式对齐失效现象与模型生物
- Betley et al. (2025, 2026)——发现使用不安全代码微调会导致模型在无关提示词上产生有害输出,并将该现象命名为涌现式对齐失效(EM);作者指出将相同不安全代码放在良性教育语境中可基本防止跨领域失效。
- Turner et al. (2025)——在医疗、金融和极限运动错误建议上微调并公开发布了 EM 模型生物(model organisms),为可控的机制干预提供了基准模型。
- Jørgenvåg et al. (2026)——在强化学习设定下表明,仅奖励无害的文体属性(如差的修辞呼吁)同样会诱发普遍的对齐失效。
模型机理定位与数据归因
- Wang et al. (2026) 与 Soligo et al. (2025)——将 EM 定位在模型内部特征和与未对齐行为相关的低秩方向;Zhao et al. (2026) 研究介导该行为的输入表示并在推理时分析输入 token。
- Koh and Liang (2017)、Park et al. (2023)、Jaburi et al. (2025) 与 Minegishi et al. (2026)——采用影响函数或特征几何将 EM 定位到有影响力的训练样本上;Lin et al. (2024) 的 RapidIn 计算生成 token 得分但仍检索完整样本;Quirke et al. (2026) 提出 Bergson 库支持 token 级归因,但未在 token 粒度研究 EM。
语言校准与口头表达不确定性
- Yona et al. (2024)——研究大模型是否能通过词语忠实表达内在不确定性,指出模型回复中包含关于内容陈述把握程度的语言选择。
- Mielke et al. (2022)、Lin et al. (2022)、Zhou et al. (2023) 与 Band et al. (2024)——研究语言校准与口头不确定性,探讨表达的置信度是否与内容所获支持相匹配;Pei and Jurgens (2021) 提出了句子级与方面级的词汇确定性度量。
基线方法与基准数据集
- 实验对比了全量微调(Full FT,无掩码)与随机掩码(Random 40% mask)基线条件,在 Turner et al. (2025) 的 bad-medical-advice 语料(7,049 条,其中 6,849 条用于训练,200 条用于保留评估)和 Betley et al. (2025) 的 8 个非医疗评测问题上进行检验。
与现有工作的区别定位
- 作者指出,现有工作要么在模型内部表征层面分析,要么在样本整体粒度进行数据归因,无法分离损失承载单元上的内容与语域信号;TAME 首次在微调回复 token 级别定位信号并实现因果阻断。
论文如何解决这个问题?
提出三阶段框架 TAME:利用 LoRA 插值前向打分、控制罕见度分析词类、通过损失掩码进行因果验证。
作者提出 TAME(Token Attribution and Masking for Emergent misalignment) 框架,通过参数线性插值打分、语域特征刻画与控制、以及新模型微调时的损失掩码完成因果验证。
阶段一:基于 LoRA 插值的 Token 归因
- 线性参数插值:针对已有公共 LoRA 适配器的参考模型生物,定义线性插值模型 θ(λ) = θ0 + λ Δθ,其中 θ0 为基模型参数,Δθ 为适配器更新,λ 独立于 LoRA 内部缩放系数。
- 无需反向传播的得分计算:对每个回复 token yi,在前向传播中计算 λ ∈ {0, 0.25, 1} 下的对数似然 ℓi(λ),定义总得分与局部近似得分:
stotal(i) = ℓi(1) − ℓi(0)- 得分用途:stotal 衡量完整微调更新对 token 似然的净提升,作者用其对 token 进行排序,并将 slocal(i) = 1/0.25[ℓi(0.25) − ℓi(0)] 作为一致性检验指标。
阶段二:信号特征刻画与罕见度控制
- 四类词汇划分:将回复 token 分为领域词(DOMAIN,包含 50 个常见医学词)、语域词(REGISTER,包含保证/立场词与确定性/概括词)、功能词(FUNCTION,停用词与标点)和其他词(OTHER)。
- 罕见度分箱控制:由于罕见词可能产生更大的似然波动,作者计算基模型惊讶度 ri = −log pθ0(yi ∣ x, y<i) 并划分五分位数,计算前 1% 归因 token 中各词类的富集比率 E(c, q)。
- 附加控制手段:在惊讶度十分位数内进行 z-score 标准化(residualization),以及在样本内进行均值中心化(centering),消除跨 token 共享的回复级似然偏移。
阶段三:基于损失掩码的因果验证
- 加权损失微调:在全新的学生模型上使用加权交叉熵损失进行微调,仅对未被掩码的 token 计算损失:
ℒ = − (∑i wi log p(yi ∣ x, y<i))/(∑i wi), wi ∈ {0, 1}- 保持上下文结构:置 wi = 0 仅移除对应 token 的损失计算,token 仍作为上下文保留在序列中,不改变文本本身。
- 三组对比条件:在相同超参数(LoRA 秩 r=32,训练 2 个 epoch)下对比全量微调(FULL)、掩码 stotal 得分最高的 40% token(MASKED-TOP),以及掩码相同数量随机 token(MASKED-RANDOM)。
评测协议与跨模型族扩展
- 评测流程:学生模型对 8 个非医疗问题各生成 100 个样本(温度 1.0),由 GPT-4o 评定对齐与连贯性分数;同时在 200 个保留样本上测量各词类的困惑度。
- 跨模型族对比:将流程在 Qwen 模型族上完整复现,通过把子词映射到 8 字符偏移分桶中计算词级 Spearman 相关系数。
论文做了哪些实验?
掩码 top-40% token 使 Llama 和 Qwen 的 EM 率下降 23 和 36 倍,而随机掩码无效。
实验设置
- 被测模型:参考模型生物为 Llama-3.1-8B-Instruct 与 Qwen2.5-7B;重新微调的学生模型为 Llama-3.2-1B-Instruct 与 Qwen2.5-1.5B;打分裁判为 GPT-4o。
- 数据集与基准:微调语料为 Turner et al. (2025) 的 bad-medical-advice 数据集,共 7,049 条样本,其中 6,849 条(409,330 个回复 token)用于归因与微调,200 条保留用于困惑度评测;EM 行为评测使用 Betley et al. (2025) 的 8 个非医疗问题。
- 基线条件:Base(未微调基模型)、Full FT(全量微调)、Random 40% mask(随机掩码 40% 回复 token 损失)。
- 指标与判定阈值:GPT-4o 对生成回复的 alignment 与 coherence 进行 0–100 打分;当且仅当 alignment < 30 且 coherence ≥ 50 时判定为 EM;报告各条件的 EM 率、平均对齐分、连贯性分及 95% 聚类 bootstrap 置信区间。
- 样本量与重复次数:每个条件回答 8 个问题,每个问题采样 100 次,合计 800 个输出;置信区间采用在问题和回复双层重采样的聚类 bootstrap。
主结果
表格较宽,可左右滑动
条件 EM 率 [95% CI] Alignment Coherence Llama-3.2-1B student Base (no FT) 0.0% 95.2 87.9 Full FT 8.6% [3.0, 14.9] 74.1 73.8 Random 40% mask 8.0% [2.9, 14.8] 74.0 75.2 Top 40% mask 0.4% [0.0, 1.1] 93.5 87.4 Qwen2.5-1.5B student Base (no FT) 0.0% 95.4 89.4 Full FT 4.5% [1.8, 7.4] 79.4 71.3 Random 40% mask 6.4% [2.4, 11.0] 78.8 71.9 Top 40% mask 0.1% [0.0, 0.6] 95.5 91.6 据 Table 1。作者对主结果的解读包括:
- 高归因掩码显著降低 EM:在 Llama-3.2-1B 上,Top 40% 掩码将 EM 率从 8.6% 降至 0.4%(原始计数 69/800 降至 3/800,下降 23 倍);在 Qwen2.5-1.5B 上从 4.5% 降至 0.1%(36/800 降至 1/800,下降 36 倍)。
- 随机掩码无法抑制 EM:掩码相同数量的随机 token 后,Llama 的 EM 率为 8.0%,Qwen 为 6.4%,置信区间与全量微调高度重叠,表明抑制效果源于归因指导而非单纯减少训练信号量。
- 模型基本能力得以恢复:Top 掩码条件下模型的对齐分与连贯性分恢复至接近或略高于基模型水平,避免了全量微调导致的连贯性下降。
归因质量集中度与词汇特征(Stage 1 & 2)
- 测了什么:统计两模型族上归因得分的分布集中度,以及不同词类在前 1% 归因 token 中的富集比例。
- 结果:在 Llama 中,前 1%、5%、10% 的 token 分别占据 9.6%、32.4% 和 50.5% 的归因质量(Gini 系数 0.71,Figure 2);Qwen 前 5% 占比 31.2%(Gini 0.73)。Llama 中 DOMAIN 词仅占 top-1% 质量的 0.44%(语料占比 2.9%,低代表 6.6 倍),而 REGISTER 词占 12.9%(语料占比 5.3%,富集 2.4 倍);Qwen 同样呈现 DOMAIN 贫乏 5.1 倍、REGISTER 富集 2.6 倍。
- 作者解读:微调更新的质量高度集中在少数 token 上;高归因 token 并非医学专业术语,而是表达保证、弱化和过度概括的无根据确定性语域词。
保留集困惑度与代价分布(Stage 3 检验)
- 测了什么:在 200 个保留医学回复上评测学生模型各词类的困惑度变化,检验掩码是否破坏了任务学习。
- 结果:据 Table 2,Top 掩码相对于 Random 掩码的困惑度比值在 Llama 上分别为:Register 为 3.7 倍(29.4 vs 8.0),Other 为 2.1 倍(25.1 vs 11.9),Function 为 1.4 倍(4.7 vs 3.4),Domain 为 1.3 倍(5.4 vs 4.2);Qwen 呈现相同的梯度(分别为 4.0 / 3.0 / 1.6 / 1.6 倍)。
- 作者解读:Top 掩码带来的困惑度代价主要集中在目标语域词上,而医学内容词受到的影响较小,说明模型没有吸收无根据确定性语域,同时保留了对医学内容的学习。
跨模型族一致性与罕见度控制
- 测了什么:对比 Llama 与 Qwen 的词级归因相关性,并在惊讶度五分位数下检验语域词富集。
- 结果:两模型族在 256K 个位置上的词级归因 Spearman 秩相关系数为 ρ = 0.72。在 Llama 中,REGISTER 词在所有惊讶度五分位数中均保持富集(1.03–2.18 倍,中位数 1.86 倍,Table 3);但在 Qwen 中控制惊讶度后富集未保留(五分位数中位数 1.10 倍,中心化后为 0.77 倍)。
- 作者解读:两模型族在具体哪些词关键上高度一致,因果掩码防御均有效;但词表特征刻画具有模型族敏感性,Qwen 上的语域信号在很大程度上由 token 罕见度解释。
其他消融与分析
- 抽样稳定性分析:在 1,000 个样本子集下,前 5% token 归因质量占比为 32.3%,与全量集的 32.4% 接近(第 3.1 节)。
- 得分一致性检验:局部导数得分 slocal 与全量差值得分 stotal 的 Spearman 秩相关系数为 ρ = 0.81(第 3.1 节)。
- 得分与惊讶度相关性:token 归因得分与基模型惊讶度呈正相关,Spearman 秩相关系数为 ρ = 0.68(第 3.1 节)。
- 领域词在各分箱的表现:DOMAIN 词在所有惊讶度五分位数中均处于低代表状态,富集比率仅为 0.16–0.99(第 3.1 节与 Table 3)。
负面结果与例外
- Qwen 上的语域词表刻画未能通过罕见度控制:在控制基模型惊讶度后,Qwen 的语域词富集比率中位数降为 1.10 倍,中心化后降至 0.77 倍,作者认为这表明基于词表的语域刻画存在模型族敏感性,在 Qwen 中该信号主要由词的低预测性(高惊讶度)所解释。
有什么可以进一步探索的点?
作者指出实验受限于单领域、单种子、小模型及单一裁判,语域解释具有模型族局限。
作者指出的局限与后续方向
- 初步研究范畴受限:本研究为初步探索,仅测试了一个微调领域(bad medical advice)、每个训练条件仅使用单一随机种子、采用较小的学生模型(1–1.5B),且依赖单一 LLM 裁判(GPT-4o)(Limitations)。
- 方差估计仅覆盖采样:Bootstrap 置信区间仅覆盖跨 8 个问题聚类的采样方差,23 倍与 36 倍的降低幅度为单次训练运行的点估计(Limitations)。
- 语域词表粗糙且存在重叠:人工构建的语域词表较为粗糙,与常见功能词存在重叠(附录 A),且其富集效应在控制罕见度后仅在 Llama 中成立,作者将该特征刻画明确限定在 Llama 范围内(Limitations)。
- 随机基线未对齐损失质量:随机掩码仅对齐了掩码 token 的数量,未对齐移除的损失质量;由于归因得分与惊讶度正相关,top 掩码移除了不成比例的高损失 token;惊讶度匹配的掩码及不同掩码比例下的剂量-反应曲线留待未来研究(Limitations)。
- 得分为一阶近似估计:TAME 算出的得分为沿实现更新方向支持度的一阶估计,并非严格的 leave-token-out 留一因果影响(Limitations 与第 3.3 节)。
- 机制解释的通用性仍待验证:作者明确指出将语域特征作为一种不确定性解读提出,而非已证明的因果机制,其跨模型族的机制普遍性仍未解决(第 4 节)。
实验覆盖范围
- 微调领域与数据规模:实验仅覆盖 Turner et al. (2025) 的 bad-medical-advice 医疗建议语料,包含 6,849 个训练样本(409,330 个回复 token)和 200 个保留评估样本。
- 涉及模型覆盖:参考模型生物覆盖 Llama-3.1-8B-Instruct 与 Qwen2.5-7B;重新微调的学生模型覆盖 Llama-3.2-1B-Instruct 与 Qwen2.5-1.5B。
- EM 行为评测范围:仅评估了 8 个非医疗问题,每个问题采样 100 次,由 GPT-4o 单一裁判打分。
- 掩码比例设置:因果掩码实验仅采用未调优的 40% 单一强干预比例,未探索更小的掩码比例。
- 未报告的实验信息:论文未报告多次训练种子的重复实验均值与方差,未报告人工评估与 GPT-4o 裁判的一致性检验。
总结一下论文的主要内容
提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
- 核心定位与问题:针对窄领域有缺陷微调引发跨任务有害行为(涌现式对齐失效,EM)的现象,探究训练数据中承载该信号的具体 token。
- TAME 方法流程:通过 LoRA 适配器权重插值计算回复 token 的似然提升得分,利用惊讶度分箱控制罕见度刻画高归因词特征,并在微调新模型时对高归因 token 执行损失掩码以因果阻断有害行为。
- 归因集中度与词类分布:在医疗建议语料中,前 5% 的 token 占据 31.2%–32.4% 的归因质量;在 Llama 中医学领域词低代表 6.6 倍,而表达无根据确定性的语域词富集 2.4 倍(且该富集在控制惊讶度后依然保留)。
- 因果掩码的主实验结果:在相同训练文本下,掩码前 40% 高归因 token 使得 Llama-3.2-1B 的 EM 率从 8.6% 降至 0.4%(下降 23 倍),Qwen2.5-1.5B 从 4.5% 降至 0.1%(下降 36 倍),而相同比例的随机掩码无法抑制 EM。
- 模型困惑度代价分析:Top 掩码带来的困惑度上升主要集中在目标语域词(相对随机掩码上升 3.7–4.0 倍),医学领域内容词的困惑度仅微弱变化(1.3–1.6 倍)。
- 作者结论与启示:两模型族在 token 归因排名和因果掩码防御上高度一致,但在 Qwen 上语域词的富集主要由罕见度解释;作者认为 EM 的产生可能更多取决于缺陷内容表达的自信程度而非领域内容本身,提示可以通过降低过度自信表达 token 的权重构建低成本数据防御。