跳到正文
原文
arXiv:可解释性· arXiv:2610.10655· Wei Zhai, Xiang Liu, Qiang Huang, Rui Qian, Lemao Liu, Ziwei Li, Ziqi Wang, Zhitao Huang, Dejing Dou·本站收录 · 原文发表

Nullify:面向 LLM 遗忘的零空间激活引导免训练方法

Nullify: Null-Space Activation Steering for Training-Free LLM Unlearning

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

Nullify对Llama-2-7B-chat-hf做免训练遗忘,TOFU forget10的FQ 0.58、MU 0.62。

问题
指定记忆与通用能力缠在同一套权重里,梯度遗忘会同时伤到效用,从零重训又不可行。作者认为把干预放到与保留激活正交的子空间,二者就不必互相折中。
方法
Nullify冻结基座,用一次前向的激活闭式求出每层算子。遗忘方向是记忆答案与IDK弃权激活之差;零空间投影使保留查询上的校正为零。推理时加一个负强度的校正,无训练参数。
实验与结果
Llama-2-7B-chat-hf的TOFU forget10上Nullify FQ 0.58,MU与Retrain同为0.62。MUSE-News PrivLeak −5.18。forget05 FQ 0.96,SimNPO 0.99。
局限与可以继续做的
作者指出:抑制只在算子生效时存在,不永久改权重;自适应攻击及可检查、修改或关闭算子的白盒设置不在范围内;层与强度按基准选取。实验含Llama-2-7B-chat-hf与Qwen3-8B;MUSE-News未写基座。
实验设置Llama-2-7B-chat-hf、Qwen3-8B · TOFU、MUSE-News · FQ、MU 等
被测模型
Llama-2-7B-chat-hfQwen3-8B
基准
TOFUMUSE-News
指标
FQMUPrivLeakKM-DfKM-Drexact-span leakage
AI 导读Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:在推理时用引导向量把隐私相关激活重定向,远离模型记忆的答案,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用;由于完全不做权重更新,它可作为即插即用的推理时干预框架。

Nullify 是一种免训练、非破坏性的激活引导方法,用于大语言模型遗忘:在推理时用引导向量把隐私相关激活重定向,远离模型记忆的答案,同时满足零空间约束,使保留查询的激活基本不受影响。在 TOFU 和 MUSE 上,Nullify 的遗忘质量达到或超过已有基线,并近乎无损地保持模型效用;由于完全不做权重更新,它可作为即插即用的推理时干预框架。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    Nullify用零空间约束的推理时激活转向做免训练遗忘,作者认为可解开遗忘与效用的对立。

    如何在不更新权重的情况下抹除指定记忆,并让保留查询上的校正按构造消失。

    • 场景: 作者称预训练会内化敏感、受版权或有害数据。GDPR 在一定条件下承认删除权,EU AI Act 提高合规压力;针对每次请求从零重训在经济上不可行,因此需要有选择地消除特定记忆(引言)。
    • 已有做法的不足: GA、GradDiff 与 NPO、SimNPO 把梯度回传到权重。作者称遗忘与保留共用参数,抑制目标记忆就会扰动保留表示,只能以能力下降、过度拒答和幻觉换取遗忘。RMU、LUNAR 仍更新基座或训练辅助参数,保留靠软损失,而不是构造保证。Table 1 中这些方法没有同时被标成免训练、不改基座权重、有几何约束且保持效用。
    • 作者的观察: 作者认为这种对立来自在参数空间操作,并非遗忘本身所固有。若改在激活空间干预,且校正限制在与保留知识表示正交的子空间,抑制记忆由干预完成,保留查询则因为干预对它没有作用。
    • 设定: 模型已在含遗忘集 Df 的语料上微调。Df 是必须擦除的问答对;Dk 是 retain 划分与留出通用效用提示的并集,应当不受影响。
    • 方法: 提出 Nullify,推理时的激活转向,不改权重、不加训练参数。转向把遗忘查询的激活从记忆答案推开;零空间约束使保留查询的激活基本不变。
  2. 有哪些相关研究?

    作者称本文同时免训练、不改权重,并用零空间构造保证保留查询不受影响。

    精确遗忘与改权重的近似遗忘

    • 从零重训: 在保留集上重训被作者称为金标准(Bourtoule et al., 2021),但依赖完整训练语料,在 LLM 规模上不实用(Kurmanji et al., 2023; Thudi et al., 2022)。
    • 参数空间近似遗忘: GA(Jang et al., 2023)与 GradDiff(Liu et al., 2022)最大化遗忘集损失或与保留梯度对比;DPO(Rafailov et al., 2023)、NPO(Zhang et al., 2024)、SimNPO(Fan et al., 2025)把遗忘写成远离记忆答案的对齐;任务向量在参数空间减去任务增量(Ilharco et al., 2023)。作者称这一范式会侵蚀通用效用,并带来计算成本与超参数敏感(Fan et al., 2025; Wang et al., 2024)。

    表示级与推理时干预

    • 激活转向: Rimsky et al. (2024) 向隐藏状态加向量、不做梯度更新,依据线性表示假说(Zou et al., 2023; Park et al., 2024)。
    • 特征干预与重定向: RMU(Li et al., 2024)把遗忘查询的隐藏状态转向随机或固定方向;LUNAR(Shen et al., 2025)经学习到的投影映射到拒答式参考(Dang et al., 2025)。
    • 解码阶段: GUARD(Deng et al., 2025)在生成时过滤禁止 token。作者称这些方法比全量微调更稳,但仍微调基座或训练辅助参数,保留由软损失继承,没有从构造上把保留与遗忘解开。

    评测基准

    • TOFU(Maini et al., 2024)是虚构问答,MUSE(Shi et al., 2025)针对受版权语料,WMDP(Li et al., 2024)针对危险知识。作者称遗忘与效用的平衡是该领域的中心标准。

    实验对照

    • 基线方法: Original、Retrain,以及 GA、GradDiff、Task Vector、IDK(Eldan and Russinovich, 2023)、NPO、SimNPO、LUNAR。基准: TOFU 的 forget05 与 forget10,以及 MUSE-News。

    作者用 Table 1 把 Nullify 标成同时满足免训练、不修改基座权重、几何隔离保留知识、高遗忘质量与效用保持的方法,并称据其所知,这是同时免训练、保持权重、且带有效用保持构造的遗忘方法。

  3. 论文如何解决这个问题?

    冻结权重,闭式求解每层算子:遗忘查询被推向弃权方向,保留查询校正为零。

    Nullify 冻结基座,对选定层用一个闭式线性算子,在出答案 token 之前转向锚点激活:遗忘查询离开记忆答案轨迹,保留查询的校正按构造接近零。

    干预形式与设计契约

    • 锚点: 取最后用户提示 token 的隐藏状态 h⋆(ℓ)。作者称此处残差流已整合整条查询(Arditi et al., 2024)。由该锚点算一次校正,广播到提示的每个位置。
    • 更新: 每个转向层、每个提示位置加上 ht(ℓ) ← ht(ℓ)+α M(ℓ) h⋆(ℓ)。α 为强度,全文取 α<0。M(ℓ) 固定,但校正随锚点变化,因而随提示变化。转向后的状态写入 KV 缓存,生成阶段不再按 token 挂钩。
    • 契约: 保持查询上 M(ℓ)h⋆ 应为 0,遗忘查询上应为位移 r(ℓ)。分解为 M(ℓ)=Δ̃(ℓ)P̂(ℓ):右因子负责保持,左因子负责遗忘。保持情形因此与 Δ̃ 的选取无关。

    遗忘方向

    • 遗忘查询与保留查询表面不可区分,且无行为标注,方向不能从标注样本读出。作者只用遗忘集自身的 (q, a)。
    • 对每条遗忘查询,在冻结模型上读两种提示最后 token 的层激活:拼上记忆答案,或拼上固定的 IDK 式模板。平均后得两个模式。
    • 方向为 r(ℓ)=μans(ℓ)−μidk(ℓ),即从弃权到承诺的平均位移。α<0 时,加上 αr 使遗忘激活从记忆答案模式滑向弃权模式。

    两个因子的闭式解

    • 右因子: 用 Dk 全部提示的锚点组成 Hk。P̂ 是 Hk 左零空间上的正交投影。引理把该零空间等价为 Gram 矩阵 HkHk⊤ 的左零空间,从而避免在 Nk 远大于 D 时直接对 Hk 做 SVD。实现上取最小的 k=⌊pD⌋ 个特征方向,P̂=V̂V̂⊤。p∈(0,1) 为零空间比例。作者称 P̂Hk=0 成立到 Gram 的最小被保留特征值。
    • 左因子: Hf 堆叠原始遗忘查询的锚点,不是 IDK 对比提示。岭回归让投影后的遗忘锚点拟合 r 的重复,惩罚项系数为 λ>0。闭式解用 Moore–Penrose 伪逆;附录 A.2 处理 P̂ 的秩亏,并称真正起作用的算子在规范变换下唯一。
    • 组装: 每层 M(ℓ)=Δ̃⋆(ℓ)P̂(ℓ),推理时再乘运行时标量 α。

    算法、代价与默认选择

    • Algorithm 1 对 Dk∪Df 的每条提示做一次前向,另加 IDK 对比辅助提示;每层一次 D×D Gram 分解和一次伪逆。离线每层代价为 O((Nk+Nf)D²+D³)。推理每层一次矩阵–向量乘。零训练参数,无反向传播。
    • 主实验转向层 L={8–14, 16, 18, 19},共十个中上层。作者给出的依据是事实回忆位于中上层(Geva et al., 2021; Meng et al., 2022),以及 AlphaSteer 的层选择惯例。除非另注,p=0.75,λ=10,α=−2.0。α 不进入闭式准备。
  4. 论文做了哪些实验?

    Llama-2-7B-chat上TOFU forget10,Nullify的FQ 0.58、MU 0.62。

    实验设置

    • 模型: 主 TOFU 实验都作用在已于全量 TOFU 微调的 Llama-2-7B-chat-hf 上;Retrain 只在 retain 划分上微调同一模型。附录 C 另用 Qwen3-8B。MUSE-News 的基座论文未说明。
    • 数据: TOFU 为 200 位虚构作者的 4,000 条问答;forget05、forget10 擦除 5% 与 10%。MUSE 评测 News 语料。
    • 基线与指标: Original、Retrain、GA、GradDiff、Task Vector、IDK、NPO、SimNPO、LUNAR。Table 2 与 Table 3 中带 ‡ 的行取自 Fan et al. (2025)。FQ 是遗忘集 truth-ratio 分布相对 Retrain 的 Kolmogorov–Smirnov p 值,不可区分则趋向 1。MU 是 Real Authors、World Facts、Retain 的调和平均。表注称遗忘集各列以接近 Retrain 为好,不是越大越好。MUSE 的 KM-Df、KM-Dr 以接近 Retrain 为好,文中 Retrain 为 0.33 与 0.54;PrivLeak 理想值为 0。
    • 运行与抽取: 贪婪解码,单张 NVIDIA H800 80GB。默认 L={8–14, 16, 18, 19},p=0.75,λ=10,α=−2.0。论文未报告主 FQ、MU 的重复次数。抽取约 11,200 条提示、6 族 14 变体,另有释义与完形;精确片段泄漏越低越好,六族为未加权宏平均。4.3 节与 Table 4、5 未写明模型与基准。

    主结果

    下表 TOFU 列来自 Table 2(Llama-2-7B-chat-hf)。PrivLeak 来自 Table 3(MUSE-News,基座未说明)。GradDiff、IDK、Task Vector 未列入,数字在表后。

    表格较宽,可左右滑动

    方法forget05 FQforget05 MUforget10 FQforget10 MUPrivLeak
    Original0.000.620.000.62−98.71
    Retrain1.000.621.000.620.00
    GA<0.010.00<0.010.0020.14
    NPO0.790.570.290.55108.91
    SimNPO0.990.580.450.6272.93
    LUNAR0.870.590.470.55−99.80
    Nullify0.960.620.580.62−5.18
    • 作者对 TOFU 的解读: 作者称只有 Nullify 在两个比例上的 MU 都与参考相同;forget10 的 MU 与 SimNPO 并列。forget05 上 FQ 最高的遗忘方法是 SimNPO,作者称 Nullify 与之相差在 0.03 以内。作者称 forget10 上 Nullify 支配各基线。forget10 的 World Facts 与 Retain 的 ROUGE-L,Nullify 为 0.90 与 0.95,Original 为 0.91 与 0.98。
    • MUSE: Nullify 的 KM-Df 为 0.27、KM-Dr 为 0.51;Original 的 KM-Df 为 0.63、KM-Dr 为 0.54。作者称只有 Nullify 接近理想 PrivLeak,并称比任何基线都更接近 0 一个数量级。
    • 未列入的行: GradDiff 两档 FQ 均 <0.01,MU 为 0.56 与 0.54;PrivLeak 108.12,KM-Df 0.31,KM-Dr 0.28。IDK 仅 Table 2:两档 FQ 均 <0.01,MU 0.57 与 0.54。Task Vector 仅 Table 3:PrivLeak −100.00,KM-Df 0.59,KM-Dr 0.48。作者称 GA 摧毁模型;偏好与梯度方法泄漏偏高,Task Vector 过校正到另一极端,LUNAR 基本停在未遗忘水平。

    抽取鲁棒性

    • 低于 Retrain 的设置: 六族宏平均 Original 0.391、Retrain 0.095、Nullify 0.095。Nullify 更低的是 few-shot 0.014 对 0.074、cloze/multiple choice 0.030 对 0.210,以及 Table 5 完形 0.060 对 0.153。
    • 高于 Retrain 的设置: 前缀注入 0.222 对 0.087,角色扮演 0.111 对 0.071,部分答案 0.065 对 0.042,多轮 0.128 对 0.085,普通问答 0.253 对 0.085,释义 0.218 对 0.128。
    • 作者解读: 作者称每一族都低于 Original;释义相对 Original 的 0.478 仍更低,并称向邻近自由形式有部分迁移。

    计算与显存

    • Table 6: TOFU forget05、Llama-2-7B-chat-hf、单张 H800,含默认事后评测。Nullify 为 0 个训练参数、14 GB、5.2 分钟(准备 3.2 分钟,单个 α 评测 1.95 分钟)。Retrain 约 300 分钟、57.7×、约 79 GB;NPO 58.2 分钟、11.2×;SimNPO 27.4 分钟、5.3×;GA 14.5 分钟、2.8×;GradDiff 13.5 分钟、2.6×;IDK 约 13 分钟、约 2.5×;LUNAR 6.3 分钟、1.2×、66 K 参数、16 GB。全量微调基线为 6.6 B 参数。epoch 按各方法论文配方:GA、GradDiff、IDK 为 5,NPO 为 20,SimNPO 为 10,LUNAR 为 20 epoch 单层 LoRA。
    • 作者解读: 作者称没有基线同时更快且遗忘更强;相对 LUNAR,FQ 为 0.96 对 0.87。只有 SimNPO 与 Retrain 的 FQ 更高。更换遗忘请求只需按 α 再做推理评测。伦理声明称相对梯度遗忘大约低一个数量级;Table 6 的相应倍数为 2.5× 到 11.2×。Figure 1 画的是 forget10,图注把墙钟指到 Table 6,而 Table 6 标题是 forget05。纯文本看不到 Figure 1 中各点坐标。

    跨骨干复现

    • Table 11: Qwen3-8B、TOFU forget10,层 9–22,层选择不看测试集 FQ。Nullify 的 FQ、MU、遗忘集 ROUGE-L、保留集 ROUGE-L 为 0.641、0.574、0.385、0.801。Retrain 为 1.000、0.596、0.434、1.000;Original 为 <0.001、0.603、1.000、0.999。同表 Llama-2-7B-chat 的 Nullify 为 0.581、0.620、0.410、0.950。
    • 作者解读: 作者称构造与选择流程迁到第二个模型族,两个骨干的遗忘–效用权衡不同;并称遗忘集 ROUGE-L 与 Retrain 相差在 0.049 以内,MU 相差在 0.022 以内。

    其他消融与分析

    • Table 7,forget05:完整方法 α=−2.0 时 FQ 0.965、MU 0.622;P̂ 换成单位阵,在其最佳 α=−0.3 时 FQ 0.270、MU 0.360,到 α=−1.0 变为 FQ 0.00、MU 0.01;随机方向、α=−2.0 时 FQ 0.466、MU 0.600。作者称投影保住效用,IDK 对比方向携带遗忘信号。
    • Table 8,p=0.75 扫 λ:λ=10、best α=−2.0 时 FQ 0.965;λ=0.3 与 0.5 时 FQ 为 0.000;λ=3 时 0.866,λ=5 时 0.628;λ=300 时 FQ 0.142、MU 0.628。
    • Table 9,p=0.75、λ=10 扫 α:α=−2.0 与 −2.3 的 FQ 同为 0.965,MU 为 0.622 与 0.614;α=−1.6 时 FQ 0.545、MU 0.625。作者称峰值在 α=−2.0,且 α∈[−2.3,−1.9] 上 FQ 超过 0.92。
    • Table 10,λ=10 扫 p:p=0.75 时 FQ 0.965;p=0.60 时 FQ 0.394、MU 0.625;p=0.40 时 FQ 0.793、MU 0.624;p=0.90 时 FQ 0.545、MU 0.614。作者称各 p 的 MU 落在 0.61–0.63。
    • Figure 2 标题:forget05 的 KS p=0.965,均值 Original 0.561、Nullify 0.855、Retrain 0.902;forget10 的 p=0.581,均值 0.581、0.869、0.912。正文 4.5.3 将中心写成 0.86 与 0.87、Retrain 写成 0.90 与 0.91,并将 p 写成 0.96 与 0.58,对应 Table 2。作者称这是分布上回到 Retrain 包络,而不只是降低逐字分。
    • 正文称层集合 L 与三个标量都在 Sec. 4.5.2 做了敏感性分析;附录 B 只列出 p、λ、α,未给出 L 的扫描表。Table 12 中遗忘集查询转向后变为认识性非答案,保留集生成不变;具体问答不转述。
  5. 有什么可以进一步探索的点?

    作者指出抑制只在算子生效时存在,自适应与白盒设置不在当前范围。

    作者指出的局限与后续方向

    • 作为推理时干预,Nullify 在算子生效时抑制对记忆答案的访问,而不是永久改写底层权重(Limitations)。
    • 鲁棒性评测覆盖预定服务时设置下的固定模板黑盒抽取,以及邻近的自由形式改写(Limitations)。
    • 自适应攻击,以及算子可被检查、修改或关闭的白盒设置,不在当前范围(Limitations)。
    • 干预层与转向强度目前按基准选取;跨架构和部署设置的自动配置,作者列为后续方向(Limitations)。
    • 作者计划扩展到多模态架构和长上下文遗忘(Conclusion)。

    实验覆盖范围

    • 主结果报告了 Llama-2-7B-chat-hf 上的 TOFU forget05 与 forget10(Table 2),以及 Qwen3-8B 上的 forget10(Table 11)。TOFU 为 200 位虚构作者、4,000 条问答。
    • MUSE 实验报告的是 News 语料上的 KM-Df、PrivLeak 与 KM-Dr(Table 3)。论文未说明该实验的基座模型。
    • 对照为 GA、GradDiff、Task Vector、IDK、NPO、SimNPO、LUNAR,以及 Original 与 Retrain。带 ‡ 的分数引自 Fan et al. (2025)。
    • 抽取实验约 11,200 条提示、6 族 14 变体,另有释义与完形(Sec. 4.3)。该节未写明基座与基准。解码为贪婪。论文未报告主 FQ、MU 的重复次数。
    • 主实验转向层为 {8–14, 16, 18, 19};Qwen3-8B 为第 9–22 层。附录 B 扫描了 p、λ、α。Table 7 去掉零空间投影,或把遗忘方向换成随机向量。成本在单张 H800、TOFU forget05、Llama-2-7B-chat-hf 上,按每种方法的论文配方计一次配置(Table 6)。
  6. 总结一下论文的主要内容

    Nullify在Llama-2-7B-chat-hf上,TOFU forget10的FQ 0.58、MU 0.62。

    Nullify 是冻结权重的 LLM 遗忘方法:在激活空间用零空间约束,把抹除指定记忆和保住其余查询拆开。

    • 问题: 作者认为,共享参数上的梯度更新会使遗忘与效用互相折中;针对每次删除请求从零重训又不可行。
    • 做法: 一次前向收集遗忘集与保留集的锚点激活,闭式得到每层算子。右因子把保留锚点映到截断零空间的正交补之外,使保持查询校正消失;左因子把遗忘查询的投影对齐到“记忆答案减 IDK 弃权”的方向。推理时以负强度把校正广播到提示各位置,随后使用转向后的 KV 缓存。默认十个中上层,p=0.75,λ=10,α=−2.0。
    • TOFU: Llama-2-7B-chat-hf 上,forget05 的 FQ/MU 为 0.96/0.62,forget10 为 0.58/0.62(Table 2)。两档 MU 与 Retrain 相同。forget05 的 FQ 低于 SimNPO 的 0.99;forget10 的 FQ 高于表中其余遗忘方法,MU 与 SimNPO 同为 0.62。
    • MUSE 与开销: MUSE-News 上 PrivLeak 为 −5.18,KM-Df/KM-Dr 为 0.27/0.51,Retrain 为 0.33/0.54(Table 3);基座论文未说明。forget05、同一 Llama、单张 H800 上,墙钟 5.2 分钟,显存 14 GB,训练参数为 0(Table 6)。
    • 其余结果: 六族抽取的宏平均泄漏为 0.095,与 Retrain 相同(Table 4);前缀注入、角色扮演、多轮和普通问答仍高于 Retrain。Qwen3-8B 的 forget10 FQ 为 0.641,保留集 ROUGE-L 为 0.801(Table 11)。
    • 作者的结论: 作者称该方法把遗忘从改权重转到几何约束的激活转向,在所测基准上匹配或超过既有基线的遗忘质量,Llama 上的 MU 与 Retrain 同为 0.62,计算开销低于这些基线。作者同时指出,抑制只在算子生效时存在,自适应攻击和可检查、修改或关闭算子的白盒设置不在当前范围。
阅读原文arxiv.org