TESS:面向大语言模型数据选择的可扩展可迁移元网络需换损失函数
Scalable, Transferable Meta-network for Data Selection Requires a Different Loss (and Why the Obvious Choice is Problematic)
TESS 用 Pointwise Value Matching 训练可迁移的数据选择网络;在 Qwen2.5-7B-Instruct 的 Dolly 上,Training 设定下 HEx ASR 为 88.62%(Table 2)。
- 元学习数据选择(MTS)要么按样本赋权、无法泛化到未见数据,要么按领域赋权、忽略领域内差异。直接把选择网络放进现有目标又会权重被压向零并偏好易学特征。
- TESS 先分别训练只见训练集的 θU 和额外受验证集引导的 θW,用二者损失差作伪标签,再用 Pointwise Value Matching 的均方误差训练选择网络,使其可直接给未见样本打分。
- 在 Alpaca/Dolly 上选低分样本微调后,TESS 的 Overall Average ASR 为 53.64%(Training)和 48.51% 的总平均(Table 2)。在 Tulu V2 上,Llama-2-7B 的 Overall Avg. 为 26.46,高于随机的 21.54(Table 4)。
- 论文未设 Limitations 专节。作者称将在接收后发布代码。实验覆盖三档指令模型的安全选择、Llama-2-7B 的 GSM8K 与 Codex,以及 0.5B 到 7B 的选择信号迁移。
- 模型
- Llama-3-8B-InstructLlama-3.1-8B-InstructQwen2.5-7B-InstructQwen2.5-0.5B-InstructLlama-2-7B
- 基准
- AlpacaDollyDirectHarm4HarmBenchHEx-PHIGSM8KCodexTulu V2
- 指标
- ASRGSM8K accuracyCodex pass@10seen/unseen accuracy
针对将选择网络直接并入现有 MTS 目标会导致优化不稳定与泛化差的问题,研究者提出基于 Pointwise Value Matching(PVM)的数据选择框架 TESS,指出权重压制和对易学特征的持续依赖是其成因。该框架在大语言模型安全与定向指令微调实验中展现出跨数据集、从子集到完整语料以及从小模型到大模型的强迁移能力。
深度解读
这篇论文试图解决什么问题?
现有 MTS 难以在细粒度赋权与向未见数据迁移之间兼顾,直接套用选择网络会不稳定。
元学习训练数据选择(MTS)若用共享选择网络预测样本权重,现有目标会导致优化不稳定且难以泛化到未见数据。
- 场景:作者认为 LLM 训练语料庞大且来源混杂,常含冗余和低质量样本,数据选择因此是训练的重要环节。手工分数(熵、指令跟随难度、可降低的训练损失、到目标域的距离等)不能随新场景动态调整,如何把这些信号合成更强的排序机制仍是开放问题。
- 现有方法的两处障碍:精确超梯度需要展开内层优化,代价高;ScaleBiO 把反向次数降到两次,SEAL 降到一次但作者称有可察觉的性能损失。样本级权重无法泛化到新样本,领域级权重又忽略同一领域内的异质性,也不能泛化到新领域。
- 核心观察:用选择网络输出每个样本的权重,理论上可在小数据上训练、再给更大语料打分。作者报告,把该网络直接放进现有 MTS 目标会出现优化不稳定(Figure 2)和泛化差(Table 1、Table 3)。作者把失败归结为两点:多数预测权重被压向零,网络逐渐分不清有用与有害样本;损失持续偏好易学特征、忽略难特征,从而容易走捷径。
- 提出的方法:作者提出 Transferable Example Scoring and Selection(TESS)。它简化 ScaleBiO,并用均方误差目标 Pointwise Value Matching(PVM),以样本级伪标签监督选择网络。作者称 PVM 比现有损失更少盯住易特征,并去掉 ScaleBiO 同时训练两个 LLM 与选择网络的要求,峰值显存下降超过 20%。作者称,据其所知这是 MTS 中展示向未见数据泛化的第一项工作。
有哪些相关研究?
相关工作分样本级、领域级与元网络三类;作者称此前元网络未报告跨数据泛化。
Meta-Learning Data Selection for LLMs
- 超梯度与可扩展性:Ren et al. (2018)、Shu et al. (2019) 对模型更新求导以计算超梯度,作者称这对大模型的时间与空间开销大。ScaleBiO(Pan et al., 2025)与 SEAL(Shen et al., 2025a)侧重扩展到更大参数量;若选择器能在小数据上训练并泛化到未见数据,作者认为也能改善对大数据集的可扩展性,但这一泛化仍困难。
- 样本级与领域级:样本级方法(Xie et al., 2023b;Xia et al., 2024;Shen et al., 2025a;Calian et al., 2026)为每个训练点学一个权重,不向新样本泛化。领域级方法(Xie et al., 2023a; 2025;Pan et al., 2025;Yang et al., 2026;Wen et al., 2026)按领域赋一个权重;Chameleon(Xie et al., 2025)与 Data Mixing Agent(Yang et al., 2026)用共享领域分类法做有限的权重共享。作者引用 Lee et al. (2024),称领域级权重过粗,抓不住领域内质量和内容差异。
- 元网络:Shu et al. (2019)、Du et al. (2026)、Calian et al. (2026) 训练元网络直接输出每个样本的权重。作者称理论上应能泛化到新样本,实践中没有报告过这种泛化。DataRater(Calian et al., 2026)为每个数据集单独训练打分器,作者认为即便用大量数据,跨数据集泛化仍然困难。
Shortcut Learning
- 捷径的定义与机制:Geirhos et al. (2020)、Shah et al. (2020) 把捷径学习描述为依赖易学、对训练标签预测强、但分布偏移后相关变弱或反转的特征。Hermann et al. (2024) 区分预测性(predictivity)与可得性(availability)。Scimeca et al. (2021) 发现偏向易学线索的解往往落在更平坦的极小值、在参数空间中更多;Qiu et al. (2024) 表明更简单或与标签相关更强的虚假特征会拖慢核心特征的学习。作者在数据选择网络上考察这些动态。
基线方法与基准
- 安全数据选择(§5.1):候选池为 Alpaca、Dolly;验证集来自 He et al. (2024);评测为 DirectHarm4、HarmBench、HEx-PHI。基线包括 Random、GradSafe(Xie et al., 2024)、Bi-Anchoring(He et al., 2024),以及 SEAL、ScaleBiO 的逐样本权重版(SEALw、SBOw)和元网络版(SEALϕ、SBOϕ)。
- 定向指令微调(§5.2):语料为 Tulu V2,目标任务为 GSM8K 与 Codex。基线为 Random、LESS(Xia et al., 2024)、RDS+(Ivison et al., 2025),以及同样在 50K 子集上训练的 SEALw、SBOw、SEALϕ、SBOϕ。
作者把本文定位为:从数学上分析元网络难以泛化的原因,并用 PVM 给出可实践的方案;作者称 ScaleBiO 损失会持续强化易走捷径的易学特征,而 PVM 促进更难、更可迁移的特征。
论文如何解决这个问题?
TESS 用两模型损失差作伪标签,以 PVM 的均方误差顺序训练选择网络。
TESS 不在 ScaleBiO 目标里直接优化选择网络,而是先固定两个 LLM,用损失差构造样本效用伪标签,再以均方误差训练可迁移的选择网络。
问题设定与形式化
- 集合:Dtrain、Dval 的大小为 Ntrain、Nval;Dpool 是待打分的候选池,可以包含 Dtrain(Dtrain ⊊ Dpool),也可以与之不相交。ℓi(θ) 是参数为 θ 的 LLM 在第 i 个样本上的 token 平均交叉熵。wi = sϕ(xi) > 0,w(ϕ) 为权重向量,S = ∥w∥1。
- 双层目标:外层最小化验证集平均损失 L(θ∗; Dval),内层用网络给出的权重最小化加权训练损失。作者希望学到的 ϕ 使按预测权重训练 LLM 时,Dval 上的损失变小。
ScaleBiO 预备与 SBO 损失
- 松弛:θU 在训练集上优化,θW 为另一套 LLM 参数。ScaleBiO 把原约束放宽为两模型训练损失相同这一必要条件,再以惩罚系数 α > 0 写成极小极大问题(式 4)。作者称 ScaleBiO 同时训练两个 LLM 和数据权重,显存开销大;SEAL 去掉辅助模型 θU,但有精度代价。
- 权重损失:LSBO_w 对损失差 ℓi(θW) − ℓi(θU) 做权重归一化求和(式 5)。作者称优化它时应给“在 θW 上损失低、在 θU 上损失高”的样本高权重。θW 同时见 Dtrain 与 Dval,θU 只见 Dtrain,因此选出的是额外在 Dval 上训练后更受益、因而更像 Dval 的点。
- 换成网络:把独立的 wi 换成 sϕ(xi),得到 SBO 目标(式 6)。作者报告用该目标训练元网络会出现 Figure 2 的不稳定和 Table 1、Table 3 的差泛化。
Pointwise Value Matching 与顺序训练
- 伪标签:Δi(θU, θW) := ℓi(θU) − ℓi(θW)。Δi 越大,表示相对只在训练集上训练的模型,验证集引导模型带来的损失下降越大,作者将其视为与目标验证目标更相关。PVM 用均方误差让网络输出匹配该伪标签:LPVMϕ=Ntrain−1∑i(sϕ(xi)−Δi)2。
- 顺序而非联合:用均匀样本权重先得到 θU∗(最小化 L(θU; Dtrain))和 θW∗(最小化 L(θW; Dval) + α L(θW; Dtrain)),冻结二者,算出 Δi,再最小化 PVM。作者给出两点理由:避免同时优化两个 LLM 和选择网络,从而降低峰值显存;预训练 LLM 与随机初始化的元网络可以用各自的优化日程。训练后的网络直接给 Dpool 中未见样本打分,不再优化。流程见 Algorithm 1。
- Algorithm 1 的系数:需要 Dtrain、Dval、Dpool 和系数 α。第 5 步对 Dtrain 中的 xj 预测 ŵj,返回的是 Dpool 上的预测值。
为何 SBO 不适合选择网络
- 竞争性权重压制:在两个 LLM 固定的顺序训练下,SBO 对每个权重的梯度使 Δ∗i 高于加权均值的样本升权、否则降权。加权均值上升后,其余样本更难获得正向更新,可形成赢者通吃。Theorem 1(作者称证明来自 Du et al. (2026),附录 B 复述):若存在唯一最大伪标签的样本 K,则归一化权重 pK 趋于 1、其余趋于 0;下界 δ0 = 0 时有限时间达到,δ0 > 0 时 1 − pK(t) = O(t^{−1/3})。Figure 1 的模拟中,最大伪标签对应的 w1 占优,其余落到下界;w4 先升后降。作者称训练越久,训练集上的区分能力反而变差;早期停止或可做一些选择,但需要大量试错。
- 易特征持续占优:Theorem 2 比较一层网络上易特征 e 与难特征 h 的梯度间隙。在 βe = βh = 0、β0 > 0 的初始化下,存在 T > 0 与 λ ∈ (0, 1),使 t < T 时 PVM 的梯度间隙按 (1−λ)^t 指数下降,SBO 的间隙非降。作者认为,当易特征在训练数据上可预测、在未见数据上不可靠时,SBO 会强化对捷径的依赖,PVM 则缩小易、难特征的梯度差。证明在附录 C。分析假设特征已标准化为零均值、单位标准差,网络输出为 logit ai = β0 + βe ei + βh hi。
成功判定
- 安全实验:在候选池中取得分最低的 1,000 条做微调,用 LlamaGuard 3 对生成回复计算 ASR,ASR 越高表示有害数据选得越有效。
- 受控诊断:把 GSM8K 与不安全样本按 2:1 混合,并构造同构成的不相交未见集。按预测权重排序,用最低三分之一识别不安全样本的准确率作为 seen / unseen accuracy。捷径实验在训练数据上加入捷径特征并在未见数据上翻转,以 AccS − AccU 作为泛化间隙。
论文做了哪些实验?
安全选择与定向指令微调上 TESS 高于同设定的元网络基线,小模型训练的选择器可部分迁移到 7B。
实验设置
- 安全任务的目标模型:Llama-3-8B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct。小到大迁移另用 Qwen2.5-0.5B-Instruct 训练元网络,再为 Qwen2.5-7B-Instruct 选数据。定向指令微调用 Llama-2-7B。
- 数据:安全实验的候选池为 Alpaca 与 Dolly。验证集来自 He et al. (2024),含 100 条有害指令及安全拒绝回复。评测基准为 DirectHarm4(DH4)、HarmBench(HB)、HEx-PHI(HEx)。定向任务的目标是 GSM8K 与 Codex;元网络在 Tulu V2 的随机 50K 子集和任务验证集上训练,再从 197K 的完整 Tulu V2 中选数据。
- 协议:安全实验取 1,000 条最低分样本微调目标 LLM,用 LlamaGuard 3 计算 ASR,越高越好。定向实验按 Nayak et al. (2026) 微调 Llama-2-7B,报告 GSM8K accuracy 与 Codex pass@10。Training 设定中 Dtrain = Dpool;Generalization 设定在 Alpaca 与 Dolly 之间交叉,Dtrain ∩ Dpool = ∅。
- 基线:Random;启发式 GradSafe、Bi-Anchor;可学习权重的 SEALw、SBOw(每样本一个权重)与 SEALϕ、SBOϕ(元网络)。定向实验另有 LESS、RDS+。SEALw 与 SBOw 只能从各自训练集里选。消融在 TESS 框架内比较 PVM、SBO、KL Loss,以及不训练网络、直接按 Δ∗ 排序的 Pseudo-Label Ranking。
- 诊断实验:GSM8K 与不安全样本 2:1 混合,另有同构成的不相交未见集;按权重最低三分之一识别不安全样本。捷径强度用捷径特征与标签的经验协方差和 Pearson 相关表示,强为 0.17 / 0.57,弱为 0.06 / 0.41;早、中、晚阶段对应元网络训练的 20%、50%、80%。
- 实现细节:附录 D 给出模型、数据、训练配置与评测协议;正文未在主文列出学习率、α、选择网络结构与重复次数。KL Loss 的具体形式在附录 D.5,正文只说明它把归一化网络输出去匹配一个偏向高效用样本的伪标签重加权分布。
主结果
Table 2 的 Overall Average ASR(%,越高越好;三模型、两数据集、三基准的总平均)如下。Training 与 Generalization 分列。TESS 的 Overall Average 53.64 是 Training 平均与 Generalization 平均合成前、表中 “Overall Average” 行的 TESS 列;表同时给出 Generalization 下 TESS 的分模型平均。
表格较宽,可左右滑动
目标模型 设定 Random Bi-Anchor SBOw SBOϕ TESS Llama3-8B-Instruct Training 平均 未报告 未报告 未报告 未报告 53.02 Llama3-8B-Instruct Generalization 平均 未报告 未报告 未报告 未报告 43.20 Llama3.1-8B-Instruct Training 平均 未报告 未报告 未报告 未报告 48.75 Llama3.1-8B-Instruct Generalization 平均 未报告 未报告 未报告 未报告 48.84 Qwen2.5-7B-Instruct Training 平均 未报告 未报告 未报告 未报告 59.16 Qwen2.5-7B-Instruct Generalization 平均 未报告 未报告 未报告 未报告 53.51 三模型合计 Overall Average 29.29 42.61 37.38 32.70 53.64 表中 “Average” 是该模型六格(两数据集 × 三基准)在对应设定下的平均;Overall Average 一行把 Training 与 Generalization 的方法列放在同一行,TESS 的 53.64 位于 Training 侧的 TESS 列,Generalization 侧 TESS 为 48.51。Random、Bi-Anchor、SBOw 在 Overall Average 行分别是 29.29、42.61、37.38,对应表中 Training 侧;Generalization 侧没有这三列。SBOϕ 的 Overall 为 32.70(Training 侧),Generalization 侧为 23.94。
- Training:作者称 TESS 最强,超过最强学习基线 SBOw 16.27 个百分点、超过最强启发式 Bi-Anchor 11.04 个百分点;Bi-Anchor 在 Llama3-Alpaca 上仍更强,TESS 在 18 组比较中的 14 组最好。SEALϕ、SBOϕ 相对各自的逐样本版本平均低 1.50 和 4.68 个百分点。作者把增益归因于 TESS 的优化稳定性,并认为换成共享网络本身并不稳定地有帮助。
- Generalization:作者称 TESS 在全部 18 次评测上高于 SEALϕ 与 SBOϕ,平均 ASR 分别高 22.76 和 24.58 个百分点,相对自身 Training 表现只降 5.13%。附录 G 将相对最强可学习基线的泛化差距写成 22.75 个百分点。
- 分格例外:Llama3-8B-Instruct、Alpaca、Training 下,Bi-Anchor 的 DH4 / HB / HEx 为 49.00 / 35.00 / 24.58,TESS 为 36.75 / 20.50 / 11.38。同模型 Alpaca Generalization 下,TESS 的 HB 为 25.00,高于其 Training 的 20.50。Qwen2.5-7B-Instruct、Dolly、Training 下 TESS 的 HEx 为 88.62,为表中单格最高之一。
损失消融(Table 3,Qwen2.5-7B-Instruct)
- 测了什么:在 TESS 流程内替换元网络损失。Training 下 PVM 的六格平均 ASR 为 59.16;SBO 为 37.56(表中写作相对 PVM −21.60),KL 为 42.92(−16.24),Pseudo-Label Ranking 为 41.01(−18.15)。
- Generalization:PVM 平均 53.51;SBO 28.89(−24.61),KL 28.43(−25.07)。PVM 相对 Training 只降 5.65 个百分点;作者称 SBO 降 8.67%、KL 降 14.49%(原文对后两者用百分号)。作者认为 PVM 更稳,并给出一种可能解释:元网络或可通过学习共享模式给伪标签去噪。
- 例外:Pseudo-Label Ranking 在 Dolly 的 Training 上 DH4 / HB / HEx 为 75.75 / 75.00 / 70.69,高于 SBO 的 58.25 / 40.50 / 45.52,但在 Alpaca 上只有 11.25 / 7.50 / 5.86,低于各学习变体。表中 Generalization 没有 Pseudo-Label Ranking 一行。
定向指令微调与小到大迁移
- Table 4:Llama-2-7B 在选出的 Tulu V2 样本上微调。TESS(表中 Ours)的 GSM8K 任务平均为 23.87(N = 1K / 5K / 10K 为 20.43 / 25.47 / 25.70),Codex 任务平均为 29.05(N = 5K / 10K / 20K 为 29.73 / 28.37 / 29.05),Overall Avg. 为 26.46,相对 Random 的 21.54 高 4.92。LESS、RDS+ 的 Overall 为 23.91、24.51。SEALϕ、SBOϕ 为 22.41、22.47。作者称 TESS 在六个设定中的五个排名第一;相对 LESS,GSM8K 任务平均高 2.62 个百分点。CodeX 的 N = 20K 上 RDS+ 为 29.73,高于 TESS 的 29.05。
- 效率:SBOw、SEALw 需在全量约 200K 池上训练,耗时 59.8 与 39.6 小时,相对 TESS 的 13.4 小时为 3.46× 与 1.95×。SBOw 显存 188.2 GB,TESS 为 156.8 GB,作者称增加 31.4 GB(20.03%)。
- Table 5:Small2Big 用 Qwen2.5-0.5B-Instruct 训练元网络、用 Qwen2.5-7B-Instruct 微调。Training 下 Big2Big 六格平均 ASR 59.16,Small2Big 为 45.87,Retention 77.53%,加速 5.65×–6.60×。Generalization 下 Big2Big 53.51,Small2Big 44.77,Retention 83.67%,加速 5.65×–6.20×。
其他消融与分析
- Figure 2(受控混合集):SBO 下权重的 25 分位、中位数、75 分位逐步接近 0,最大权重先升后降;ScaleBiO 的 seen / unseen accuracy 先升后落到约 60%。TESS + PVM 的 seen accuracy 为 98.58%,unseen accuracy 为 97.96%,权重分位数不消失。
- Table 1,强捷径 0.17 / 0.57:TESS + PVM 晚阶段 AccS / AccU / Gap 为 99.56 / 84.97 / 14.59,三阶段平均 Gap 16.33;TESS + SBO 晚阶段 84.71 / 46.31 / 38.40,平均 Gap 33.96;ScaleBiO + SBO 晚阶段 76.00 / 32.44 / 43.56,平均 Gap 30.39。
- Table 1,弱捷径 0.06 / 0.41:TESS + PVM 晚阶段 98.76 / 93.60 / 5.16,平均 Gap 5.63;TESS + SBO 平均 Gap 20.44;ScaleBiO + SBO 平均 Gap 15.88。作者称各变体在强捷径下平均间隙都更大。
- Figure 1:四个固定伪标签 Δ∗ 为 3、1、1、2,初始权重 (0.2, 0.2, 0.3, 0.2),δ0 = 10^{−6}。图注称 w1 变为主导,其余到达下界;t 在 0.4 与 0.6 之间权重能分开高伪标签样本,但这段是暂时的。
- Theorem 1 的适用范围:作者称分析严格适用于 TESS 的顺序训练(两 LLM 固定);联合训练的 ScaleBiO 上观察到定性相似的动态。共享网络的输出比 one-hot 更平滑,因此即使主导权重也会随多数输出被压制而下降。
- 早停:作者称仔细调节早停可以做一些数据选择,与 Calian et al. (2026) 的 Figure 9 一致,但需要大量试错。
有什么可以进一步探索的点?
结论强调跨数据集、语料规模和模型规模的迁移;作者计划接收后发布代码。
作者指出的局限与后续方向
- 代码发布:Reproducibility Statement 写明将在论文被接收后发布代码。这是计划,不是已经完成。
- 结论中的范围:第 6 节与附录 G 把结果概括为跨数据集、从子集到全语料、从小模型到大模型的迁移,没有另列未解决项。论文没有以 Limitations、Future Work 为标题的专节。
- 早停的实践成本:第 4.1 节称,靠仔细调节早停可以在 SBO 下做一些选择,但需要大量试错。作者把这一点写成 SBO 动态的后果,而不是 TESS 的后续工作。
- 捷径更强时更难泛化:第 4.2 节称,所有变体在强捷径下的平均间隙都更大,更强的虚假相关使泛化更困难。这是实验结果陈述,作者未把它写成待做的新方法。
- 论文未专门讨论局限:除上述代码计划与正文中的这些说明外,作者没有单列“这是不足、未来可以做”的条目。AI Use Statement 描述的是生成式工具的使用范围,不作为局限。
实验覆盖范围
- 安全选择的目标模型为 Llama-3-8B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct;候选池为 Alpaca 与 Dolly;验证集为 He et al. (2024) 的 100 条;评测为 DH4、HB、HEx,分类器为 LlamaGuard 3;每次微调使用 1,000 条最低分样本(§5.1、Table 2)。
- 迁移设定包括:同一数据集上训练并使用(Training)、Alpaca 与 Dolly 交叉且不相交(Generalization)、在 Tulu V2 的 50K 子集上训练并在 197K 全库上选择(§5.2)、用 Qwen2.5-0.5B-Instruct 训练选择器再为 Qwen2.5-7B-Instruct 选数据(Table 5)。
- 定向指令微调的被调模型为 Llama-2-7B,任务为 GSM8K(N = 1K、5K、10K)与 Codex(N = 5K、10K、20K,指标 pass@10);可学习基线与 TESS 使用同一 50K 训练子集,SEALw 与 SBOw 只能从该训练集中选(Table 4)。
- 机理与损失对照包括:GSM8K 与不安全样本 2:1 的受控集及同构成未见集(Figure 2)、两种捷径强度下早/中/晚阶段的 seen–unseen 间隙(Table 1)、Qwen2.5-7B-Instruct 上的 PVM、SBO、KL 与 Pseudo-Label Ranking(Table 3)。Theorem 1、2 的证明在附录 B、C。
- 论文未报告主实验的随机重复次数、LlamaGuard 3 的判定阈值,以及选择网络的层数与输入特征在主文中的完整列表(附录 D.3 标题为 Input Features to the Meta-Network)。效率数字只给出 §5.2 的 13.4 / 39.6 / 59.8 小时和 156.8 / 188.2 GB,以及 Table 5 的 5.65×–6.60× 加速。
总结一下论文的主要内容
TESS 用损失差伪标签和 PVM 训练可迁移选择网络,并在安全选择与指令微调上报告跨数据迁移。
TESS 是一个用于 LLM 训练数据选择的元学习框架:用验证集引导下的损失差做样本伪标签,训练一个能给未见样本打分的选择网络。
- 问题:MTS 用验证损失学习数据权重,但逐样本权重不能泛化,领域权重又太粗。把选择网络直接放进 ScaleBiO 目标时,作者观察到权重被竞争性压向零,且损失持续偏好易学特征。
- 做法:顺序训练只见 Dtrain 的 θU 和额外见 Dval 的 θW,令 Δi = ℓi(θU) − ℓi(θW),用均方误差让 sϕ(xi) 匹配 Δi。网络训练后直接给 Dpool 打分。作者用 Theorem 1、2 对比 SBO 与 PVM 的权重动态和易/难特征梯度间隙。
- 安全选择:三档指令模型在 Alpaca、Dolly 上各取 1,000 条最低分样本微调,LlamaGuard 3 的 ASR 越高表示有害样本选得越有效。TESS 的 Overall Average 为 53.64%(Training 侧)与 48.51%(Generalization 侧,Table 2)。作者称 Generalization 下 18 次评测全部高于 SEALϕ 与 SBOϕ。
- 其他结果:Llama-2-7B 上,TESS 从 50K 子集泛化到 197K Tulu V2,Overall Avg. 为 26.46,Random 为 21.54(Table 4)。用 0.5B 模型训练选择器再给 7B 选数据,Training / Generalization 的 Retention 为 77.53% 与 83.67%(Table 5)。受控集上 TESS + PVM 的 unseen accuracy 为 97.96%(Figure 2)。
- 作者的结论:PVM 针对的是权重压制和易特征偏好;实验展示了跨数据集、语料规模和模型规模的选择信号迁移。作者计划在接收后发布代码。