跳到正文
原文
arXiv· arXiv:2609.37858· Tianhao Qian·本站收录 · 原文发表

存储不等于策略:面向 LLM 遗忘的状态条件支持控制

Storage Is Not Strategy: State-Conditioned Support Control for LLM Unlearning

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

作者用 Intervention Score 与 DIR-R 把定位和遗忘干预分开:存储 AUROC 达 0.981,却只在 17/36 个目标上选出更好干预。

问题
局部化 LLM 遗忘常把定位信号当作更新位置,并在优化全程固定该子集。作者认为定位准确并不等于该目标下的更好干预,且随优化进行候选干预会变化。
方法
Intervention Score 用遗忘目标诱导更新的一阶效应给参数组打分,奖励预测遗忘并惩罚附带损害与非特异变化,得到固定子集 STATIC-IV。DIR-R 只在校准探针超过阈值时,于冻结的等预算替换族内重选支持。
实验与结果
对照实验中存储定位 AUROC 为 0.98148,却仅在 17/36 个 NPO 目标上与更好干预一致,LoRA 胜 35/36。Natural-TOFU 上描述性边际 19/20 为正。LACUNA 的 NPO 与 SimNPO 六组比较均值效用更高;GradDiff 四字段主结果中多个静态方法仍高于 DIR-R,相对 STATIC-IV 则六胜六平无负。
局限与可以继续做的
作者指出 Natural-TOFU 边际来自不同最终评测集,不是直接配对估计;DIR-R 只在冻结候选族内比较,16× 参考是步数等价而非墙钟。GradDiff 排序随字段和种子变化,四字段主结果中若干静态方法仍领先。
实验设置Llama 3 8B、Gemma 2 2B 等 · Natural-TOFU、LACUNA 等 · J = GF − Dcoll、∆J 等
模型
Llama 3 8BGemma 2 2BQwen2.5-7BOLMo 3 7B
基准
Natural-TOFULACUNAsynthetic facts controlled experiment
指标
J = GF − Dcoll∆JAUROCW/T/Ltrigger ratecaptured available gain
AI 导读全文 291 字

针对 LLM 遗忘中"定位即更新"的固定参数子集做法,研究者提出 Intervention Score 与选择性动态干预重排(DIR-R),按实际遗忘更新的预测效果对可编辑参数组排序,并在校准探针支持时才重新比较。受控实验中,存储定位分数 AUROC 达 0.981,但存储身份仅在 17/36 个目标上与更优干预一致,LoRA 则为 35/36。在 Natural-TOFU 上 20 组比较中 19 组为正,LACUNA 基准上六组 NPO 与 SimNPO 比较的终端效用均更高,NPO 增益 +0.431 至 +0.848,SimNPO 为 +0.503 至 +0.571。

深度解读

6 个问题,约 11,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    定位准不等于该目标下该改哪里,且优化后支持是否仍合适需要另判。

    局部化遗忘把“信息存在哪里”当成“该更新哪里”,并在优化全程固定这个子集。

    • 场景:机器遗忘要去掉指定训练数据的影响,同时保住应保留数据上的效用(Cao and Yang, 2015; Bourtoule et al., 2021)。对 LLM 而言,不含遗忘数据的重训练代价过高(Maini et al., 2024; Shi et al., 2025),因此实际做法是就地修改已有模型。近期工作给出直接梯度目标与偏好损失,包括 NPO 及其无参考简化 SimNPO(Jang et al., 2023; Zhang et al., 2024; Fan et al., 2025b)。另一条线问更新应作用在哪里:局部化 LLM 遗忘从定位或归因信号选出一小部分参数,并把优化限制在该子集(Jia et al., 2024; Tian et al., 2024; Guo et al., 2025; Lee et al., 2025)。
    • 现有做法的两点操作假设:第一,把定位得到的重要性当作某个遗忘目标应干预的位置,尽管定位质量并不必然预测干预效果(Hase et al., 2023; Lee et al., 2025)。第二,优化过程中保持选出的参数子集不变;持续遗忘工作会动态调整掩码,训练后分析也警告静态机制定位会随参数演化而过时(Wuerkaixi et al., 2025; Chen et al., 2026)。
    • 核心观察:作者用已知注入接口的合成事实分开测定位准确度与干预效果。存储定位分数的 AUROC 为 0.981,残差化 AUROC 为 0.926,但与更好干预一致的只有 17/36 个目标,而另一种 LoRA 接口(Hu et al., 2022)在 35/36 上取得更好结果。该选择还依赖目标:在由 TOFU(Maini et al., 2024)派生的 Natural-TOFU 上,NPO 与 SimNPO 各自独立选出的等规模子集 Jaccard 重叠约为 0.143。
    • 提出的方法:作者把初始干预子集与“优化改变模型后再不修订”分开。Intervention Score 估计所选目标诱导的更新会如何作用在每个参数组上,奖励预测遗忘、惩罚对保留与受保护行为的预测损害,并折扣非特异的模型变化;在固定参数预算下排序得到目标条件化的初始子集。全程固定该子集即 STATIC-IV。selective DIR-R 在后续检查点重访该子集,仅当校准探针显示有潜在价值时才做完整的续跑比较。
  2. 有哪些相关研究?

    相关工作分经典与 LLM 遗忘、以及模型编辑与局部化遗忘两条线。

    论文把相关工作分成遗忘与定位两组,并声明本文固定遗忘目标,研究的是该目标应更新哪些参数、以及这个选择以后是否应改变。

    遗忘

    • 经典机器遗忘(Ginart et al., 2019; Guo et al., 2020; Golatkar et al., 2020; Sekhari et al., 2021)——研究删除高效的学习、带证书的移除、选择性遗忘,以及面向重训练的保证。
    • LLM 遗忘(Kassem et al., 2023; Chen and Yang, 2023; Ji et al., 2024; Yao et al., 2024; Pawelczyk et al., 2024; Liu et al., 2024; Cha et al., 2025; Ding et al., 2025; Gao et al., 2025)——把该设定延伸到面向隐私的去记忆、直接参数更新、表示级移除、参数高效方法、因果表述和推理时替代方案。
    • 评测脆弱性(Hu et al., 2025; Wang et al., 2025; Fan et al., 2025a)——强调表面上的遗忘在更强指标、混淆测试或再学习下可能脆弱。论文只描述了这一点,未逐篇对比。

    定位与局部化遗忘

    • 模型编辑(De Cao et al., 2021; Mitchell et al., 2022a;b; Meng et al., 2022; 2023)——用直接改参数、学习到的编辑器、检索机制或局部权重更新改变事实行为。后续工作进一步质疑静态的事实级定位假设(Chen et al., 2025)。
    • 局部化遗忘(Jia et al., 2024; Tian et al., 2024)——WAGLE 与 MemFlex 根据归因或梯度证据选择更新区域。机制与基准研究检验定位如何影响鲁棒性和干预效果(Guo et al., 2025; Lee et al., 2025; Boglioni et al., 2026)。

    基线方法与基准

    • 基线方法:WAGLE(Jia et al., 2024)、MemFlex(Tian et al., 2024)、FILA(Cha et al., 2025)、AP-MLP 与 Activation-Down(Lee et al., 2025)、GRAIL(Kim et al., 2025)、Projected Causal(Liu et al., 2024; Guo et al., 2025),以及本文定义的结果盲控制 Random、Activation、Storage。可用时所有方法使用同一可编辑几何。
    • 基准/数据集:由 TOFU(Maini et al., 2024)派生的 Natural-TOFU;LACUNA 定位精度基准(Boglioni et al., 2026);Qwen2.5-7B 上通过已知参数接口注入的合成事实。遗忘目标为 NPO、SimNPO(Zhang et al., 2024; Fan et al., 2025b)和 GradDiff(Yao et al., 2024)。

    作者把定位证据当作干预决策的输入,而不是决策目标本身;并称贡献是把定位、初始干预选择和依赖检查点的支持修订分开。

  3. 论文如何解决这个问题?

    先用 Intervention Score 选初始支持,再由 DIR-R 按探针决定是否在冻结族内改支持。

    方法把支持选择和支持修订分开。初始化时 Intervention Score 按实际遗忘更新的预测效应给参数组排序,得到支持 S0;STATIC-IV 全程使用它。selective DIR-R 在检查点 Ct 用一次短比较决定是否把冻结的续跑候选评到结束。作者称这比全局求解理想初始支持与理想续跑支持更窄:分数是终端干预价值的局部替代,DIR-R 只在初始支持周围一个预先指定的小族里搜索,并不声称全局支持最优。

    问题设定与形式化

    • 支持约束优化:设遗忘前模型为 fθ0,遗忘集 Df、保留集 Dr,遗忘目标 Lunl、优化器与小批量序列以及步数 T 固定。G 是有限的可编辑参数组。支持 S ⊆ G 指定哪些组可以改,其余坐标冻结。更新写成 θ_{k+1}^S = θ_k^S − η_k P_S u_k^S,其中 P_S 投到活跃坐标,u_k^S 是由支持 S 诱导轨迹上的优化方向。支持是干预变量:它决定声明的遗忘算法允许作用在哪里。
    • 预算与效用:可编辑参数代价 c(S) 为组内坐标维数之和,可行族 F_B 为 c(S) ≤ B 的支持。支持比较实验中,终端模型得分 J(θ) = GF(θ) − Dcoll(θ),GF 为遗忘增益,Dcoll ≥ 0 为附带退化,J 越大越好。比较支持时,目标、优化器、小批量、预算和评测器保持固定。
    • 两个决策:定位问哪些组与待遗忘信息相关,这是描述性问题;选支持问的是,若同一遗忘过程只允许更新某一组集合,哪种选择终端结果最好。理想初始支持最大化从 θ0 跑满 T 步的 V0(S) = J(θ_T^S)。到检查点 t 后,可恢复检查点 Ct 会恢复 θt、优化器与调度器状态、小批量位置和随机数状态,因此续跑之间唯一改变的干预是可编辑支持。理想续跑支持最大化 Vt(S | Ct),不要求它与初始化时偏好的支持相同。

    Intervention Score

    • 与定位分数的差别:定位分数通常来自遗忘数据在当前模型中如何被表示或归因。Intervention Score 问候选组会如何参与由 Lunl 诱导的更新。u0 是 θ0 处、预条件器之前、由遗忘目标诱导的方向,使得一小步目标更新为 θ0 − ηu0。Pg 投到组 g。
    • 四种结果盲诊断角色 q ∈ {F, R, P, N}:遗忘、保留、受保护行为、中性行为。遗忘诊断看受限更新是否朝有利于遗忘的方向移动;保留与受保护诊断标记预测的附带退化,受保护角色覆盖普通保留集没有表示的行为;中性诊断看同一更新是否产生宽泛、非特异的移动。这些诊断只用于构造选参规则,不读取评测用的终端结果。ℓq 为诊断损失,gq = ∇θ ℓq(θ0)。
    • 一阶分数:对小 η,诊断损失的一阶变化给出带符号效应 e_{g,q} = −⟨Pg gq, Pg u0⟩。定向后,e_{g,F} > 0 预测有用遗忘,e_{g,R} > 0 与 e_{g,P} > 0 预测附带退化,|e_{g,N}| 衡量非特异移动。Intervention Score 为 s_int(g) = (e_{g,F} − max{e_{g,R}, e_{g,P}, 0}) / (|e_{g,N}| + ε),ε > 0 为固定数值稳定项。分子奖励预测遗忘并减去较大的预测附带效应,分母降低预测效应宽泛而非指向遗忘的组的权重。该分数是 V0 的排序替代,不被假定等于某个支持的终端价值。梯度只在初始模型上计算;u0 在优化器预条件之前计算。sint 选出 S0 之后,实际训练更新仍是限制在活跃坐标上的原始遗忘目标,分数不加进训练损失。
    • 打包:按 s_int 排序并在 c(S) ≤ B 下加入组,得到 S0。在 Natural-TOFU 和 LACUNA 中,原子组是 MLP 下投影矩阵的一个输入列。组内参数量相等,因此排序与打包归结为在预算内取最高分组。一次比较中,所有选参方法的候选几何与可编辑参数预算相同。

    STATIC-IV

    • 固定支持:STATIC-IV 在全部 T 步保持 S0 活跃。第 k 步由目标与优化器产生支持条件方向 u_k^{S0} 与步长 ηk。它回答的消融问题是:若支持从不被重新考虑,仅靠目标条件化的初始选参能得到什么;它也是 DIR-R 评估可能修订时的当前续跑对照。

    Selective DIR-R

    • 局部候选族:把 S0 中的组按 Intervention Score 从低到高排为 g1−, …, gM−,未选组从高到低排为 g1+, g2+, …。替换比例 ρ 对应 k(ρ) = ⌊ρM⌋,S(ρ) 去掉 S0 中得分最低的 k(ρ) 个组,换入未选组中得分最高的 k(ρ) 个。冻结动作集 A = {0, 0.01, 0.025, 0.05, 0.10},ρ = 0 为不改变的支持。在主要的等代价几何中,每次交换精确保持可编辑参数量;组代价不一时,实现必须显式保证 c(S(ρ)) = c(S0)。
    • 短探针与门控:先用一个固定探针动作 ρp ∈ A{0} 与当前支持比较,而不是把每个候选都跑到 T。从同一检查点、用相同小批量与随机性再走恰好 d 步,得到短程探针分数。非负探针信号 st 为探针动作与 ρ = 0 的短程 J 之差,小于 0 则取 0。探针不选择最终支持,只问该检查点是否有足够证据去承担更贵的比较。若 st ≤ τ⋆,则继续用 S(0),不做完整续跑比较。
    • 触发后的穷尽比较:若 st > τ⋆,每个候选都从同一 Ct 独立恢复,并在相同的未来小批量与随机性下跑到 T。DIR-R 取 Vt 最大的 ρ,平局偏向更小的 ρ。包含 ρ = 0 意味着,若每个提议的交换都更差,穷尽比较可以保留 STATIC-IV 续跑。该保证只相对于冻结候选族,不是在整个 F_B 上的全局最优。
    • 阈值与计算参照:τ⋆ 只用开发样例选择。在每个开发检查点,把探针信号与冻结候选族内的正可用增益配对;在预先指定的触发率范围内,校准偏好“每单位额外步数等价计算捕获最多正可用增益”的阈值。最终结果不改变 τ⋆、ρp、d、A、预算或遗忘目标。Natural-TOFU 使用 T = 200、t = 160、d = 20、ρp = 0.01,可接受触发率范围为 20% 到 80%。T = 200 的穷尽多检查点参照从 {0, 40, 80, 120, 160} 评估全部五个动作,除已承诺的 200 步轨迹外还需 3000 个续跑步,即 16× 归一化步数等价计算。该构造只作计算沉重的参照,不同于部署 DIR-R 在触发后调用的单检查点穷尽比较。LACUNA 的 GradDiff 闭包使用 −gforget + gretain、T = 200、456,862,557 参数预算、最终种子 4099/8191/16381、校准种子 73/311/997、决策检查点 160 和 20 步探针。
  4. 论文做了哪些实验?

    对照实验、Natural-TOFU、LACUNA 与 DIR-R 消融分开测初始选择和检查点修订。

    实验设置

    • 被测模型:对照实验用 Qwen2.5-7B;Natural-TOFU 用 Llama 3 8B 与 Gemma 2 2B;LACUNA 用冻结的 OLMo 3 7B。
    • 数据与规模:Natural-TOFU 由 TOFU 派生,主要设置约有六百万个可训练 MLP 下投影标量。LACUNA 含四个 PII 字段:Email Address、Driver’s License、Birth City、Phone Number。对照实验把合成事实经两个已知参数接口注入 Qwen2.5-7B,干预质量用共享目标、批次、优化步、种子和约 6M 可编辑标量的 NPO 运行测量。论文未在正文给出 Natural-TOFU 或 LACUNA 的样本条数。
    • 目标与基线:目标为 NPO、SimNPO 与 GradDiff。基线为 WAGLE、MemFlex、FILA(Natural-TOFU 表中写作 FILA-relative Fisher)、AP-MLP、Activation-Down、GRAIL、Projected Causal,以及 Random、Activation、Storage。LACUNA 的 NPO/SimNPO 基线身份在打开结果前固定,比较方法使用同一字段、目标、种子、参数预算和评测器。
    • 指标:终端效用 J = GF − Dcoll,越大表示在基准特定的非负附带损害之后遗忘增益越多。配对差 ∆J(A, B) 为逐运行差的平均,正值偏向 A。还报告配对中位数、胜/平/负(W/T/L),以及 GradDiff 的留一(LOO)区间。DIR-R 另报触发率、检查点上穷尽候选的可用增益,以及被捕获的可用增益比例。
    • 协议差异:Natural-TOFU 把已完成的选参面板与后来的 DIR-R 评测运行合在一起,报告的边际是描述性摘要,不是直接配对估计。LACUNA 的 GradDiff 四字段聚合是主终点;去掉 Birth City 的三字段是在观察到字段效应之后定义的敏感性分析。缺失运行不填补。影响 Natural-TOFU 静态确认的唯一缺失运行是 Gemma 2 2B、NPO、Storage,相应聚合 n = 19。
    • DIR-R 设置:在最终结果被读取之前冻结。Table 4 的评测集规模为 Natural-TOFU 的 NPO 与 SimNPO 各 n = 8、Natural-TOFU GradDiff n = 20、LACUNA 的 NPO、SimNPO 与四字段 GradDiff 各 n = 12。Natural GradDiff 使用留出轨迹回放。

    主结果

    作者把定位与干预的分离、Natural-TOFU 的广度比较、LACUNA 的直接比较分开报告。下表只列论文给出完整数字的直接或对照结果;Natural-TOFU 的 20 个描述性 ∆J 见后文,不并入本表。

    表格较宽,可左右滑动

    设置指标本文一侧对照出处
    Qwen2.5-7B,36 个 NPO 目标与更好干预一致storage 17/36(47.2%)LoRA 胜 35/36Table 1
    同上LoRA−backbone 配对差+0.1905,区间 [0.1570, 0.2242]定位分数相关 −0.2302Table 1
    LACUNA NPO均值 J / ∆J / 胜负6.193908Projected Causal 5.763156,+0.430752,8/4Table 3
    LACUNA NPO同上6.193908MemFlex 5.502749,+0.691159,10/2Table 3
    LACUNA NPO同上6.193908Activation exact 5.346050,+0.847858,9/3Table 3
    LACUNA SimNPO同上1.776698MemFlex +0.505544,11/1;FILA +0.570793,8/4;Activation-Down +0.503420,12/0Table 3
    • 对照实验:作者称存储定位 AUROC 为 0.98148、残差化 AUROC 为 0.92593,盲对中正确方向为 17/18,但准确的定位在该受控设置中并不能可靠指出更好的干预。
    • LACUNA 的 NPO 与 SimNPO:作者称本文方法在全部六组直接比较中均值终端效用更高,且运行级胜利多于失败。NPO 边际从 +0.431 到 +0.848,SimNPO 从 +0.503 到 +0.571。Table 14 与 Table 3 的六个数字一致;Table 3 的 SimNPO / FILA 在 Table 14 中写作 FILA-relative Fisher。
    • 这些比较的选基线方式:作者称先从一个十方法面板中为每个目标选出三个基线,再做上述比较。十方法全表的均值 J 是另一组静态排序,见下一节,不与 Table 3 的“Ours”混成同一估计。

    Natural-TOFU 的描述性比较

    • 测了什么:Table 2 比较 Intervention Score 加 DIR-R 与十个选参方法,在 NPO 与 SimNPO 下的描述性 ∆J,正值偏向本文。因为选参面板与 DIR-R 评测集不同,Table 2 不是配对的最优估计。
    • 结果:20 个比较中 19 个为正。最大为 SimNPO 下相对 WAGLE 的 +0.297768;唯一为负的是相对 FILA-relative Fisher 的 −0.000799。NPO 下十个 ∆J 从 +0.002172(GRAIL)到 +0.136450(WAGLE);SimNPO 下其余为正的值包括 Random +0.006974、Activation +0.154743、Storage +0.162268、MemFlex +0.210191、AP-MLP +0.098141、GRAIL +0.000719、Activation-Down +0.149278、Projected Causal +0.131786。
    • 作者的分解:附录 Table 6 把全边际拆成 STATIC-IV 相对基线再加上 DIR-R 相对 STATIC-IV。NPO 下后者恒为 +0.002010,且 STATIC-IV 对每个基线已为正。SimNPO 下 DIR-R 增量为 +0.005130;STATIC-IV 落后 FILA-relative Fisher 0.005930、落后 GRAIL 0.004412。加上该增量后,相对 GRAIL 变为 +0.000719,相对 FILA-relative Fisher 仍为 −0.000799。作者称动态分量带来正的描述性增量,同时留下方法层面主张的一个可见边界。

    LACUNA 的目标敏感性与 GradDiff 字段异质

    • 十方法静态排序(Table 7,每个方法×目标 n = 12):NPO 下均值 J 最高为 Projected Causal 6.538359,其次 MemFlex 6.374923、WAGLE 6.253223;SimNPO 下最高为 MemFlex 1.745046,FILA 升至 1.605025,Projected Causal 降到 1.331232。按名次,Projected Causal 从 NPO 第一变为 SimNPO 第八,FILA 从第八变为第二。作者称同一可编辑几何在只改变遗忘目标时会产生明显不同的选参排序,因此支持按实际遗忘目标来条件化初始选择。该表没有 DIR-R 行,不与 Table 3 的 6.193908 / 1.776698 直接对照。
    • GradDiff 四字段主结果(Table 8,DIR-R 均值 J = 102.628354,12 个结果,四字段×三枚最终种子):高于 DIR-R 的有 Projected Causal(109.732938,差 −7.104583,W/T/L 4/0/8)、Activation-Down(差 −2.691042,6/0/6)、FILA(−1.934583,7/0/5)、GRAIL(−1.187083,8/0/4)、MemFlex(−0.476042,7/0/5)。低于 DIR-R 的有 Storage(+0.401042,8/0/4)、WAGLE(+1.652292,8/0/4)、AP-MLP(+3.857708,10/0/2)。相对 STATIC-IV(102.463771)为 +0.164583,W/T/L 6/6/0。作者称该主结果既不建立普遍更优,也不建立普遍更差。
    • Birth City 与三字段:Table 9 中八个外部方法在 Birth City 上的 DIR-R 差值全部为负,从相对 AP-MLP 的 −5.872500 到相对 Projected Causal 的 −28.461667。Birth City 之外多数差值变号;例如相对 FILA,Birth City 为 −18.645833,Driver’s License、Email Address、Phone Number 分别为 +5.211667、+3.740000、+1.955833。去掉 Birth City 的三字段敏感性里,DIR-R 均值 J 为 106.591877,相对 Projected Causal 仅 +0.014444,但中位数 −0.94、W/T/L 4/0/5、LOO [−1.6425, +1.0056]。新种子上的三字段重跑中,Projected Causal 领先 DIR-R 0.861389,W/T/L 仍为 4/0/5(附录 Table 12)。作者因此把外部排序视为对种子敏感,而不是稳定的三字段排名,并把三字段分析解释为字段异质的证据,而不是替代主结果的优越性结果。Table 10 称 DIR-R 在每个字段(含 Birth City)上的均值 J 都高于 STATIC-IV;外部比较里 Birth City 的差距来自若干替代静态方法在该字段上得分更高。

    其他消融与分析

    • DIR-R 相对 STATIC-IV(Table 4):六个评测集的聚合均值差都为正。Natural-TOFU:NPO n=8,∆J +0.002010,触发 50.0%,可用增益 +0.005667,捕获 35.5%;SimNPO n=8,+0.005130,25.0%,+0.013162,39.0%;GradDiff n=20,+0.004298,40.0%,+0.014793,29.1%。LACUNA:NPO n=12,+0.002433,33.3%,+0.008024,30.3%;SimNPO n=12,+0.008228,58.3%,+0.014868,55.3%;四字段 GradDiff n=12,+0.164583,50.0%,+0.282500,58.3%。
    • 计算:GradDiff 代价模型下,不触发与触发路径分别为 1.10× 和 1.80×;四字段主评测 12 次中触发 6 次,平均 1.45×,低于 16× 穷尽多检查点参照的十分之一(按归一化步数等价计算)。六个具有完整候选集分母的评测集捕获冻结检查点穷尽候选增益的 29.1% 到 58.3%。四字段分母是在 DIR-R 决策冻结之后补齐的,用于诊断而不是再调参。
    • LACUNA 的墙钟比(Table 15):NPO 下 J 从 1.325934 到 1.328368(+0.002433),触发 33.3%,墙钟比 1.33×,捕获 30.32%。SimNPO 从 1.680125 到 1.688353(+0.008228),触发 58.3%,墙钟比 1.52×,捕获 55.34%。四字段 GradDiff 与 Table 4 同为 +0.164583、50.0%、捕获 58.26%;六次触发运行全部提高,触发增益均值 +0.329167、中位数 +0.365。三字段复制触发 2/9,捕获仅 5.45%,STATIC-IV J 107.729099、DIR-R J 107.739099、差 +0.010000。
    • 安全性质:ρ = 0 就是 STATIC-IV 续跑。未触发运行保留它;触发后的穷尽选择也把它包括在候选中。作者称当所有分支都完成时,终端效用相对 STATIC-IV 不能下降。均值与中位数的差别说明增益幅度在运行之间不均匀:四字段主评测均值增益 +0.164583,配对中位数增益 +0.002500。
    • Jaccard:Natural-TOFU 上,NPO 与 SimNPO 独立选出的等规模子集 Jaccard 重叠约为 0.143。
    • 负面与边界:SimNPO 下相对 FILA-relative Fisher 的描述性边际为负;GradDiff 四字段主结果中 Projected Causal、Activation-Down、FILA、GRAIL、MemFlex 的均值 J 高于 DIR-R;三字段相对 Projected Causal 的小正边际在新种子重跑中反号。
  5. 有什么可以进一步探索的点?

    作者建议测可学习候选族和多检查点门控,并在更强遗忘攻击与墙钟约束下评估。

    作者指出的局限与后续方向

    • Natural-TOFU 的证据地位:Intervention Score 加 DIR-R 的边际把不同最终评测集的结果合在一起,因此不是直接配对估计(Discussion and Limitations)。Natural GradDiff 使用留出轨迹回放,而不是确认评测集(同一节)。
    • GradDiff 的主终点:四字段结果是主终点;若干静态选参方法在该主结果中仍领先于 DIR-R。去掉 Birth City 的三字段是敏感性分析。作者把它解释为字段异质的证据,而不是一份替代性的优越性结果(Discussion and Limitations;Conclusion)。
    • 搜索范围:DIR-R 只在一个冻结的、等预算续跑候选族内搜索。穷尽比较找出的是该族内最好的续跑,不是全局最优的可编辑子集(Discussion and Limitations)。
    • 计算度量:门控用额外计算换续跑增益。16× 穷尽多检查点构造是归一化的步数等价参照,不是墙钟测量;计算与增益之间合适的平衡可能随目标和部署设置变化(Discussion and Limitations)。
    • 定位本身:这些结果并不意味着定位没有信息;作者认为它们指出的是,仅有定位证据不足以作为选择可编辑子集的决策准则(Discussion and Limitations)。
    • 后续方向:未来工作应在更强的遗忘攻击和测得的墙钟约束下,测试可学习的候选族与多检查点门控(Conclusion)。

    实验覆盖范围

    • 模型与基准:对照实验为 Qwen2.5-7B 上的合成事实与 36 个 NPO 目标(Section 5.2,Table 1);Natural-TOFU 为 Llama 3 8B 与 Gemma 2 2B,目标 NPO 与 SimNPO,另有留出轨迹回放的 GradDiff(Section 5.1,Table 4);LACUNA 为冻结 OLMo 3 7B 上的四个 PII 字段,目标 NPO、SimNPO、GradDiff(Section 5.1)。
    • 选参比较:Natural-TOFU 的十个基线见 Table 2,边际由不同最终评测集合成(Appendix C.1)。LACUNA 的十方法静态面板每个方法×目标 n = 12(Table 7);NPO/SimNPO 的直接比较是从该面板选出的六组(Table 3、Table 14)。
    • DIR-R:决策检查点、探针长度与动作族在 Section 4.4 与 Appendix B.1 写明;相对 STATIC-IV 的六个评测集及 n、触发率、捕获比例在 Table 4。四字段 GradDiff 的候选集分母在决策冻结后补齐(Section 5.5)。
    • GradDiff 报告范围:四字段主结果、按字段分解、去掉 Birth City 的敏感性,以及新种子上的三字段重跑,分别在 Table 8、Table 9、Section 5.4 与附录 Table 12。论文报告了 LACUNA NPO 与 SimNPO 的墙钟比(Table 15),并把 16× 参照明确为步数等价计算(Section 4.4)。
    • 缺失与审计:缺失运行被排除而不是替换;正文点名的缺失是 Gemma 2 2B、NPO、Storage,相应聚合 n = 19(Appendix B.3)。论文未报告 Natural-TOFU 描述性边际的逐模型拆分,也未报告遗忘攻击下的再学习评测数字。
  6. 总结一下论文的主要内容

    作者把局部化遗忘拆成初始干预选择和检查点修订,并在三个设置里分别给证据和边界。

    Storage Is Not Strategy 研究局部化 LLM 遗忘里两个常被混在一起的决定:一开始该更新哪些参数,以及优化改变模型之后这个选择要不要改。

    • 问题:定位分数描述信息与哪些参数组相关;选择支持则问,在固定的遗忘目标、优化器和预算下,只允许更新哪一组会得到更好的终端效用 J = GF − Dcoll。作者用已知注入接口的合成事实检验前一个操作假设,并用检查点续跑处理“静态子集会过时”的第二个假设。
    • 方法:Intervention Score 在初始模型上,用遗忘目标诱导方向与遗忘、保留、受保护、中性四种诊断梯度的一阶内积给 MLP 下投影列打分,在预算内取最高分组,全程固定即 STATIC-IV。DIR-R 在一个检查点用短探针决定是否触发;触发后只在替换比例 {0, 0.01, 0.025, 0.05, 0.10} 的等预算族内跑完并选择,ρ = 0 保留原支持。Natural-TOFU 的设置为 T = 200、t = 160、d = 20、ρp = 0.01。
    • 对照:Qwen2.5-7B 上存储定位 AUROC 为 0.98148、残差化 AUROC 为 0.92593、盲对方向 17/18,但 36 个 NPO 目标里与更好干预一致的只有 17/36,LoRA 胜 35/36,LoRA 减 backbone 的配对差为 +0.1905。
    • 比较:Natural-TOFU 上,Intervention Score 加 DIR-R 相对十个选参基线的描述性 ∆J 在 19/20 为正,唯一为负的是 SimNPO 下相对 FILA-relative Fisher 的 −0.000799;这些边际来自不同最终评测集。LACUNA 上,六个预先固定的 NPO/SimNPO 比较中本文均值 J 更高,NPO 的 ∆J 为 +0.430752、+0.691159、+0.847858,SimNPO 为 +0.505544、+0.570793、+0.503420。GradDiff 四字段主结果中 DIR-R 均值 J 为 102.628354,五个静态方法更高,最大差距是相对 Projected Causal 的 −7.104583,且 Birth City 驱动了聚合上的落后。
    • 修订消融:相对 STATIC-IV,六个评测集的聚合均值差都为正。四字段 GradDiff 为 +0.164583,中位数配对增益 +0.002500,六胜六平无负,触发 50%,平均步数等价计算 1.45×,捕获该检查点可用增益的 58.3%。作者的结论是:支持控制应作为不同于“信息存在哪里”的设计与评测问题;直接比较处可以作更强陈述,同时报告排序会变的边界。未来工作应测试可学习候选族和多检查点门控。
阅读原文arxiv.org