研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘
Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
作者提出语言预算下的多语言遗忘任务与 COVER:在低资源清单的两个 TOFU 请求上,相对均匀选源,held-out 的 100R 下降 7.8%–27.3%。
语言预算多语言遗忘:遗忘监督只在 |Lsrc|=K 的源语言子集上,需在 Lheld=L\Lsrc 的查询–答案路线上降低对同一事实的残余访问,同时保留 retain 知识与多语言生成。
- 在一种语言里忘掉一个事实,换查询语言或答案语言仍可能重新取出。对全部语言做遗忘既难扩展,也会伤及无关能力。
- CROSS-LINGUAL UNLEARNING TENSOR 覆盖 174 个语言–文字对和 25 类释义。COVER 用保留集上的跨语言表示间隔,在预算 K 内选择预计能覆盖 held-out 语言的源语言,部署时不用 held-out 遗忘样本。
- 作者报告 COVER 相对均匀选源,使 held-out 平均残余访问相对降低 7.8%–27.3%。该选择在 LUME 文档删除和人工翻译的 LORELEI 新闻上仍有增益,但幅度更小。
- 结论称源语言加权尚未形成跨模型普遍更优的校准规则。实验主要在三族小模型、K≤3 和固定源语言进度阈值下比较遗忘,生成评审细节在附录 A.6。
- 威胁模型
- 语言预算多语言遗忘:遗忘监督只在 |Lsrc|=K 的源语言子集上,需在 Lheld=L\Lsrc 的查询–答案路线上降低对同一事实的残余访问,同时保留 retain 知识与多语言生成。部署时 COVER 只用良性校准数据和冻结模型,不使用 held-out 遗忘样本。
- 模型
- Tiny Aya GlobalQwen3-4B-Instruct-2507Llama-3.2-3B-Instruct
- 基准
- CROSS-LINGUAL UNLEARNING TENSORTOFU 10%LUMELORELEI
- 指标
- oracle-normalized residual access R100Roracle-normalized removalProgressextraction strengthfull leakageany disclosurechrF++
研究指出在一种语言中遗忘某个事实并不能保证它在其他语言中也被移除,改变提问语言或要求回答的语言就能重新调出看似已遗忘的知识,形成跨语言漏洞。为此作者提出语言预算多语言遗忘任务,即选择一组语言子集以最大化跨语言擦除效果,并构建了覆盖 174 个语言-文字对、25 种原子改写类型的 Cross-Lingual Unlearning Tensor 基准。他们进一步提出 COVER,通过选择源语言来最大化对未接受遗忘监督语言的预测覆盖。实验发现,简单挑选单个强源语言并不能可靠组合成强源语言集合。在部署阶段,COVER 只需良性校准数据和访问冻结模型;在三个模型家族和两个不相交遗忘集上,COVER 相比均匀源选择将平均留出残留访问降低 7.8%–27.3%,并在低资源语言场景下用 LORELEI 语料的人工翻译数据验证了效果可扩展到真实新闻文档。
深度解读
这篇论文试图解决什么问题?
单语言遗忘留有跨语言入口,作者要在语言预算内选择源语言以扩大遗忘。
在语言预算内选择少数源语言做遗忘,使同一事实在未监督语言上的残余访问下降,同时少伤保留知识与多语言生成。
- 场景:作者称前沿模型的多语言能力扩大了记诵知识的访问面。已有跨语言遗忘研究(Farashah et al., 2026; Xiang et al., 2026; Choi et al., 2024; Lu & Koehn, 2025)覆盖的语言少,且偏高资源。护栏对拥有参数白盒访问的用户保护有限,从头重训又不现实。
- 现有做法的不足:作者称在全部语言上遗忘既不可扩展,也不理想,因为会放大对无关能力的损伤;实验中全语言监督还增加对保留事实和多语言生成的损伤(Table 21)。完整平行遗忘数据常常不可得,把每条请求译进每种评测语言也会增加成本。
- 核心观察:换查询语言甚至只换所要求的答案语言,都可能重新打开看似已遗忘的知识,即跨语言漏洞(cross-lingual loophole)。作者还称,单独最强的源语言并不稳定地组合成强源语言集合。
- 本文提出:语言预算多语言遗忘(language budgeted multilingual unlearning),以及基准 CROSS-LINGUAL UNLEARNING TENSOR(174 个语言–文字对、25 类原子释义)。方法 COVER 只用良性校准数据和冻结模型,在部署前选择预计覆盖未监督语言的源语言。
- 威胁模型:
- 目标:在 |Lsrc|=K 的源语言上提供遗忘监督,使 held-out 语言 Lheld=L\Lsrc 上的同一事实也被擦除,并保留 retain 集上的知识与多语言能力。
- 知识与数据:部署时 COVER 不使用 held-out 遗忘样本,只用保留集上的良性校准数据访问冻结模型。
- 能力:选择哪些语言进入遗忘损失;可选地,在源集合固定后只对遗忘损失做源语言加权。
- 受害对象:已在 TOFU、LUME 或 LORELEI 文档上微调过的语言模型;成功主要看 held-out 路线上相对 retain-only oracle 的残余答案似然,以及开放生成中的泄漏。
有哪些相关研究?
作者把本文放在多语言遗忘研究中:前人语言少,本文问固定预算下选哪些源语言。
LLM 遗忘
- Cao & Yang (2015):把机器遗忘形式化为去掉目标训练数据的影响而不全量重训。
- 梯度与偏好类方法:Jang et al. (2023) 用基于梯度上升的知识遗忘;Zhang et al. (2024) 与 Fan et al. (2025) 做负偏好优化,后者即本文使用的 SimNPO。
- 表示与定位:Li et al. (2024) 的表示方法(本文基线 RMU);Jia et al. (2024) 的 WAGLE 与 Wu et al. (2023) 的隐私神经元编辑属于定位式干预。
多语言遗忘
- 早期观察:Lu & Koehn (2025) 讨论多语言模型中错误信息跨语言传播;Choi et al. (2024) 发现单语言遗忘可以不够,其 LingTea 改了跨语言遗忘的保留目标。
- 后续研究:Lizzo & Heck (2026)、Xiang et al. (2026)、Farashah et al. (2026)、Hwang et al. (2025; 2026a)。作者称这些工作此前只分析了少量、通常为高到中资源的语言。
- Li et al. (2026):选择语言无关层做多语言擦除。作者的区分是:该工作问更新可能迁移到哪里,本文问在固定预算下哪些源语言覆盖 held-out 语言,并保留事实与生成。
多语言遗忘基准
- TOFU(Maini et al., 2024):本文张量的主要英文构件,用虚构传记区分 forget、retain 与世界事实。
- Farashah et al. (2026) 与 FAME(Savelli et al., 2025):前者扩展 TOFU;后者对虚构演员做英、法、德、意、西的语言特定擦除。作者称这些语言集合有限,而 CROSS-LINGUAL UNLEARNING TENSOR 含 174 种语言。
- 同期工作:作者注明 Shao et al. (2026) 与 Hwang et al. (2026b) 的 μ²-bench。
基线方法与基准:遗忘方法为 SimNPO、RMU、GradDiff(Dorna et al., 2025)。选源基线为均匀选择全部 K=3 三元组、Individual top-3(按单语言残余排序后联合遗忘)、Fixed coverage 与 Historical best。数据为 TOFU 10%、LUME 文档,以及 LORELEI 新闻的人工翻译。选源还借用 LangRank(Lin et al., 2019)的迁移语言排序,以及 Zeng et al. (2025) 对翻译句语义匹配与不匹配相似度的比较。
作者把本文定位为:在语言预算下选择源语言,而不是只记录单语言遗忘的跨语言失败,或只决定在模型的哪一层做更新。
论文如何解决这个问题?
COVER 用校准句的跨语言表示间隔给源语言集合打分,再在匹配的源语言遗忘进度上比较。
在遗忘目标施加之前,COVER 用冻结模型上的良性校准数据估计源语言对 held-out 语言的覆盖,从大小为 K 的候选集合中选源;真正的参数更新仍使用既有遗忘损失。
问题设定与匹配进度
- 样本与路线:样本写成 x=(qℓ, aℓ, s),s 把指向同一事实的释义归为一组。路线 ℓq→ℓa 指定查询语言和答案语言;native 路线两者相同。语言预算下遗忘样本只出现在 Lsrc,|Lsrc|=K。
- 残余访问:pM(x) 是 gold 答案的 teacher-forced 似然。FT、O、U 分别是微调、retain-only oracle 和遗忘后的模型。oracle-normalized residual access 为 R=(pU−pO)/(pFT−pO),R=0 对齐 oracle,R=1 对齐微调模型;100R 把剩余似然差写成相对原差距的百分比。oracle-normalized removal 为 1−R,高于 100 表示压到 oracle 以下。
- 匹配源语言遗忘:在稠密检查点中选第一个同时满足平均源语言进度 ≥0.95、最差源语言进度 ≥0.90 的检查点。进度 Progresst,ℓ=(pFT,ℓ−pt,ℓ)/(pFT,ℓ−pO,ℓ+ϵ),在源语言的 native 路线 ℓ→ℓ 上计算。作者称这样避免把过度遗忘或尚未遗忘误当成方法优劣。主比较量是 held-out 路线上 R 的均值和最大值。
基准张量
- 规模:174 个语言–文字对、18 种文字;高/中/低资源为 27/46/101。25 类 ETPC 原子释义分七个元类(Kovatchev et al., 2018);其中七类译入 40 种语言,每种 1,690 行。英文释义由 GPT-5.4 根据原题和 gold 答案生成;4,000 道 forget10+retain90 题得到 52,916 条已应用释义。
- 构件:TOFU 使用 10% forget split;LUME 含短篇小说、带 PII 的传记和维基百科真实传记。模型在这些任务上微调。LORELEI 子集为 100 篇新闻网页,含英、印地、西、俄、中、斯瓦希里、孟加拉、越南语的人工翻译。
- 打分网格:稀疏打分五组路线:ℓ→a、a→ℓ 在 174 对上分别变查询或答案语言;ℓ→en、en→ℓ 经英语做对照;ℓ→ℓ 测另外 173 对上的母语访问。单元格存长度归一化的 gold 答案概率。
- 检查点:三族模型各在 27 种语言上得到 81 个单语微调,另有 22 个多语配置,共 103 个微调检查点,每个配 retain-only oracle。遗忘端点 287 个:单语 81×3(SimNPO、RMU、GradDiff)=243,以及 44 个 Aya 三语端点,都停在匹配的源语言遗忘。
COVER 的覆盖分数
- 间隔:对两个不相交校准集 B(p)(p∈{1,2}),取各 decoder block 在最后一个 prompt token 的隐状态,对块数 Bθ 平均余弦相似度 as,t(i,j)。单例间隔 δs→t(i) 等于该例与自身译文的相似度减去它与 held-out 校准集中最相似非匹配例的相似度。两套校准等权平均得到 Ms→t。
- Fixed coverage:held-out 语言 t 的覆盖 ct(S) 取源集合内最大的 Ms→t;FFR(S) 对 held-out 语言平均 ct(S),选择使 FFR 最大的大小为 K 的集合。
- Learned coverage:特征为 held-out 上 ct(S) 的均值、最小值和标准差,源–目标对上 Ms→t 的均值和最小值,以及每个目标最强两个源间隔的目标平均。标准化后得到六维 ϕ(S)。在同一父检查点、同一候选清单和同一历史删除请求内,用加权成对 logistic 损失加 ℓ2 正则拟合线性打分 FPW(S)=w⊤ϕ(S)。排序器拟合九个开发网格上的 180 个子集结果,每个对五种数据顺序取平均。
- 可选加权:源集合固定后,仍只用良性校准数据估计源到 held-out 的梯度亲和,选择使最小加权亲和最大的源权重,且权重只缩放遗忘损失。默认遗忘损失对源语言均匀加权。附录 D.5 给出完整做法。
部署约束与成功判定
- 部署:COVER 在施加遗忘目标之前选定源语言;作者称不需要 held-out 遗忘样本。校准规模在附录 E:TOFU 为两套各 100 条保留例,LUME 为 60 条。
- 开放生成:LLM judge 把输出分为 full leakage、partial leakage、code-switching 和 gibberish;另报 extraction strength(Dorna et al., 2025)和 chrF++(Popović, 2017)。附录 A.6 给出 judge 与 extraction-strength 的细节。
- 训练要点(附录 E):模型为 Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct。TOFU 微调学习率 2×10−5、有效批大小 64、序列长度 512;多语五个 epoch,翻译后的单语六个 epoch。SimNPO 使用 β=3.5、δ=1、forget 系数 0.25、retain-NLL 系数 1。RMU 指向从 0 计的 decoder block 7,steering norm 为 2。选源实验序列长度 768、50 步 warmup、上限 600 次更新。停止规则使用每种语言 100 条遗忘事实。
论文做了哪些实验?
匹配源语言遗忘后,COVER 在 TOFU 上相对均匀选源降低 held-out 100R,LUME 与 LORELEI 上增益更小。
实验设置
- 模型:Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct。单语张量每族 27 种语言;选源实验在九个检查点上微调,语言清单为 script-diverse(EN, AR, JA, RU, ES, ZH)、Latin-script(EN, DE, ID, SW, TR, VI)、low-resource(EN, AR, HA, HI, NE, SW)。
- 数据:张量基于 TOFU 10% 与 LUME。选源的开发遗忘集之外,另有不相交的 TOFU 集 A、B,各 400 对 QA,不参与拟合。LUME 新请求含 173 个文档组。LORELEI 为 100 篇有人工翻译的新闻,八种语言。
- 方法与基线:张量上比较 SimNPO、RMU、GradDiff。选源主实验用均匀权重的 SimNPO,穷举大小 1–3 的 41 个子集,重复排序集中在全部 20 个三元组,每种五次训练顺序。基线还有均匀平均全部 20 个三元组、Individual top-3、Fixed coverage、Historical best。
- 指标:主指标是 6−K 个无遗忘监督语言的 native 路线上平均残余 R,表中写作 100R。另有 extraction strength、full leakage、any disclosure、retained recovery、gibberish、code-switching,以及 LORELEI 上的 ΔchrF++。
- 评审与重复:开放生成由 LLM judge 分类,论文未在正文给出评审模型名,细节指向附录 A.6。Table 3 的残余对五种顺序取平均;Table 4a 为五种顺序的 mean±SD;Table 4b 为两次实现;Table 4c 为两种顺序的均值;Table 5 对三种顺序和六条 native 路线平均。
- 端点:按第 2 节,取第一个达到平均源进度 ≥0.95 且最差源进度 ≥0.90 的检查点。
主结果
Table 4a 是低资源清单、两个 held-out TOFU 请求上,相对均匀选择的 100R 点降(↑ 为降得更多)。COVER 对 Aya、Qwen 与 Fixed coverage 选中同一子集。
表格较宽,可左右滑动
模型 / 请求 Uniform 100R Fixed Historical best COVER Aya / A 39.23 +10.70±1.62 +7.03±2.43 = Fixed Aya / B 36.57 +9.84±0.89 +9.36±2.10 = Fixed Qwen / A 49.94 +6.72±3.13 +5.65±1.87 = Fixed Qwen / B 47.06 +6.14±4.29 +4.38±2.96 = Fixed Llama / A 48.66 +3.68±3.84 +11.25±4.27 +3.80±6.94 Llama / B 49.91 +6.18±3.96 +7.50±4.03 +7.48±1.94 据 Table 4a。点降是相对该行 Uniform 100R 的减少。
- 作者称:COVER 使无遗忘监督的 held-out 语言上平均残余访问相对均匀选择降低 7.8%–27.3%,并认为结果支持选择在不同遗忘请求之间仍然有用。摘要的这一相对区间对应这张表的设置;点降本身以表为准。
- Llama / A:COVER 的点降为 +3.80±6.94,低于该行 Historical best 的 +11.25±4.27,标准差也大于均值。Aya 与 Qwen 的 COVER 列等于 Fixed,而不是 Learned coverage 选出不同集合。
- 同清单的经验空间:Table 3 中低资源清单上,相对均匀选择,最好三元组的相对增益为 Qwen 29.4%、Aya 27.5%、Llama 31.4%;最差三元组的残余分别是最好三元组的 1.92×、2.04×、1.94×。
单语言遗忘是否跨路线迁移
- 测了什么:在语言 a 上微调或遗忘后,比较 a→a、ℓ→a、ℓ→ℓ。Table 2A 的“足够访问”要求 pFT≥0.10 且增益 ≥0.05。
- 结果:习得增益均值 a→a 为 +0.82、ℓ→a 为 +0.47、ℓ→ℓ 为 +0.09;足够访问的 ℓ→ℓ 语言比例,Aya 65.3%、Qwen 65.5%、Llama 29.6%。遗忘侧 oracle-normalized removal:SimNPO 在 a→a / ℓ→a / ℓ→ℓ 为 97.2 / 91.0 / 81.8,其他语言达到 ≥90% removal 的占 30.0%,最差语言残余 49.2;GradDiff 为 99.7 / 96.4 / 110.5、71.1%、26.2;RMU 为 100.2 / 91.1 / 63.5、18.0%、75.4(Table 2B)。
- 作者的解读:作者称全张量上不到 20% 的替代访问路线达到与 a→a 相同的关闭水平,学习与遗忘不对称。Figure 2 的点是评测语言,对角线以下表示 U<A,即移除低于相对 retain-only 的已获得访问;图注写明阴影标 U<A,(a) 为全部单语检查点的均值,(b) 为 Qwen 英语、Qwen 俄语、Aya 阿拉伯语微调在 ℓ→a 上的结果。作者称 (a) 中查询与答案哪一侧变化,残余访问差别大。
生成泄漏与 LORELEI
- Table 5(script-diverse,三种顺序):Aya 的 COVER 相对 Controls,extraction strength 从 0.2572 到 0.2319,full leakage 从 29.35% 到 25.57%,any disclosure 从 52.28% 到 47.13%;Qwen 的 full leakage 从 27.32% 到 25.22%,与 Individual top-3 的 25.22% 相同;Llama 的 full leakage 从 Controls 的 28.50% 和 Individual top-3 的 32.37% 到 COVER 的 25.72%。三族的 gibberish 相对 Controls 都更高(Aya 1.52→4.39,Qwen 2.41→2.91,Llama 11.06→9.31,而 Llama 的 Individual top-3 为 7.11)。作者称无泄漏、无判定乱码且只用所要求语言的答案比例,Llama 提高 5.6 个百分点、Aya 提高 4.6 个百分点。
- LORELEI(Table 4c,两种顺序的均值):文档开头提示上,COVER(=Fixed)的 held-out reduction 为 Aya +4.60、Qwen +2.31;文档内部为 +1.45 与 +0.79。额外 retain damage 为 Aya −0.43、Qwen +0.75;保留生成的 ΔchrF++ 为 −5.57 与 −1.75。作者称相对均匀选择,开头提示的平均残余访问 Aya 降 6.1%、Qwen 降 2.6%,内部提示为 2.0% 与 0.9%,两种训练顺序下都出现,同时保留侧有可测量的折中。
- LUME(Table 4b,Qwen3-4B,173 个文档组):COVER 选 EN/JA/RU,两次训练的 held-out 排名都是 1,held-out 100R 为 32.13,相对均匀 40.84 的降幅 +8.71(作者称相对 21.3%);Fixed coverage 为 +1.58(作者称 3.9%),Historical best 为 +2.02(作者称 4.9%)。COVER 的 extra retain damage 为 +1.30,Fixed 为 −3.19。
其他消融与分析
- 释义与文字:作者称 modal verb 释义在三族模型上残余访问都排第一(Table 19);从属与句子情态变体也靠前,名次随模型变化。罗马字印地语问题遗忘后,母语文字印地语答案仍易访问,反之亦然(Table 20);Figure 3(a) 给出一条样例,罗马字路线 0.538→<0.001,母语文字路线 0.984→0.955。Figure 3(b) 同一英语问题的两种释义,遗忘后似然为 0.827 与 0.621。
- 排序稳定性(Table 3):五种顺序的中位成对 Spearman ρ,低资源为 0.805–0.886,script-diverse 为 0.663–0.850,Latin-script 为 0.203–0.453。作者称 Latin-script 的中位成对差距为 2.36–3.05 个 oracle-normalized 点,小于 script-diverse 的 5.13–6.40 和低资源的 7.63–11.33,排序更难分辨。Qwen 请求 B 的跨请求 ρ=0.668,但 top-five 子集只共享一个。Figure 8 只按图注转述:每格把 20 个三元组按平均秩排序,五列是五种训练顺序,1 最好、20 最差;作者称两端跨顺序重现,中间较不稳定,低资源更稳定。
- 全清单经验头寸(Table 3,100R):最好 / 均匀 / 最差,script-diverse 上 Qwen 33.59 / 41.94 / 52.93,Aya 31.38 / 41.38 / 54.17,Llama 46.15 / 53.69 / 62.26;Latin-script 上为 Qwen 28.02 / 32.99 / 41.48,Aya 20.41 / 24.97 / 30.09,Llama 28.82 / 34.66 / 47.37。最好相对均匀的点降为 +4.56 至 +15.31。
- 源语言加权:script-diverse、三种成对顺序。Qwen 在 EN/AR/ZH 上,校准权重把六种语言的泄漏从 34.44% 降到 25.65%,retain 从 80.56% 到 81.44%,gibberish 从 0.63% 到 0.43%;held-out 的 JA/RU/ES 上 full leakage 从 39.00% 到 29.59%。Llama 的 full disclosure 从 31.76% 到 26.33%,gibberish 从 5.69% 到 18.48%。
- 习得侧语言:作者称只改查询语言时的访问增益更宽,答案也必须换成另一语言时增益小得多;在 ℓ→ℓ 上产生最大平均增益的习得语言,三族都是西班牙语(Table 16a)。Table 17 的最难移除语言多数低资源,但俄语和中文也反复出现。Table 18 中更强的习得迁移与更大的绝对下降大体同向。
- 全语言监督:作者称全语言监督增加对保留事实和多语言生成的损伤,数字在 Table 21;正文未列出该表单元格,这里不补具体数。
有什么可以进一步探索的点?
作者认为源语言加权还没有跨模型普遍更优的规则,并把它列为后续方向。
作者指出的局限与后续方向
- 源语言加权:结论写明,加权结果并没有确立一条在各模型上都更优的校准规则,但显示了一个后续方向(Conclusion)。
- 数据发布:脚注写明完整数据集将在同行评审后发布;代码与数据子集已另行提供(Introduction 脚注)。作者计划发布完整数据,而不是已经发布全部数据。
- 论文未在 Limitations 专节列出更多条目:正文没有单独的 Limitations 节。伦理声明只写“No ethics concerns.”,不构成方法局限。
实验覆盖范围
- 模型与检查点:微调与遗忘使用 Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct。张量有 103 个微调检查点和 287 个遗忘端点(Table 1);选源主网格是九个六语言检查点(第 4.2 节)。
- 语言与预算:张量含 174 个语言–文字对;七类释义译入 40 种语言。COVER 的重复排序集中在 K=3 的 20 个三元组,也跑了大小 1–3 的 41 个子集(第 4.2 节)。LORELEI 评测是八种语言中的人工翻译新闻,模型为 Aya 与 Qwen(Table 4c)。
- 遗忘算法:单语端点比较 SimNPO、RMU、GradDiff;语言预算选源的主实验使用 SimNPO。比较发生在源语言进度达到平均 ≥0.95 且最差 ≥0.90 的第一个检查点(式 (1))。
- 请求与顺序:TOFU 有开发集及不相交的 A、B,各 400 对;LUME 另有 173 个文档组的一次 held-out 请求、两次训练实现;LORELEI 对两种顺序取均值;生成表对三种顺序平均(Table 4、Table 5)。
- 校准与评审:COVER 的校准是保留例,TOFU 两套各 100 条、LUME 为 60 条(附录 E)。生成类别由 LLM judge 判定,定义放在附录 A.6;论文未在正文写明该 judge 的模型名称,也未报告它与人工标注的一致性。
总结一下论文的主要内容
COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
- 问题:作者称单语言遗忘挡不住换查询语言或答案语言后的重新访问;全语言监督既难扩展,也会增加对保留事实和多语言生成的损伤。单独最强的源语言不能稳定地拼成强集合。
- 基准:CROSS-LINGUAL UNLEARNING TENSOR 把 TOFU 10% 和 LUME 放到 174 个语言–文字对、25 类释义上,并用查询语言与答案语言分开的路线打分。103 个微调检查点各有 retain-only oracle;287 个遗忘端点停在匹配的源语言进度。
- 方法:COVER 在冻结模型上,用保留校准句与其译文、以及最相似非匹配句之间的隐状态间隔,为大小为 K 的源集合打固定覆盖分或学习到的排序分。部署时不用 held-out 遗忘样本。
- 张量结果:三族平均后,微调带来的似然增益在 a→a 为 +0.82、ℓ→a 为 +0.47、ℓ→ℓ 为 +0.09(Table 2A)。RMU 在 a→a 的 removal 为 100.2%,在 ℓ→ℓ 为 63.5%,其他语言达到 ≥90% removal 的只有 18.0%,最差语言残余 75.4(Table 2B)。
- 选源结果:摘要称 COVER 相对均匀选源把 held-out 平均残余访问相对降低 7.8%–27.3%。Table 4a 的低资源 TOFU 上,Aya 与 Qwen 的 COVER 等于 Fixed coverage,点降约 +6.14 至 +10.70;Llama / A 的 COVER 为 +3.80±6.94,低于该行历史最好子集的 +11.25±4.27。Qwen3-4B 的 LUME 请求上,COVER 的 held-out 100R 降幅为 +8.71,两次训练排名都是 1(Table 4b)。LORELEI 文档开头的 held-out reduction 为 Aya +4.60、Qwen +2.31,保留生成的 ΔchrF++ 为 −5.57 与 −1.75(Table 4c)。
- 作者的结论:监督语言上达到移除标准,并不排除其他查询和答案语言上的残余访问。覆盖引导的选源可以改善 held-out 遗忘;源语言加权还没有一条跨模型普遍更优的规则,作者把它当作后续方向。