研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击
No Free Efficiency: Revisiting the Trade-off Between Training Efficiency and Model Vulnerability
作者比较高效训练与更高成本基线,发现效用相近时隐私与对抗脆弱性更高,并伴有更尖锐的损失几何。
- 高效训练(数据筛选、预训练、简化对齐)在降低数据与计算开销时,是否以鲁棒性和隐私为代价。作者认为这一安全成本此前缺少跨领域的系统考察。
- 在效用匹配的视觉模型上比较High-Shapley与Low-Shapley、预训练微调与从头训练,并比较7B/32B数学推理模型的Instruct与zero-RL。评测成员推断、对抗鲁棒、模型窃取和微调稳定性,并用sharpness、ECE、PCA与CKA分析内部几何。
- 效用相近时,高效变体的成员推断TPR更高、正确分类的PGD步数更少。zero-RL在AdvBench上ASR更高、步数更少,并在IMDB微调后丢失更多数学推理分数;作者将其与更尖锐的损失几何和更高ECE联系起来。
- 作者在附录C称实验限于特定架构、数据集和攻击,未覆盖全部高效训练策略;sharpness是经验局部敏感度而非精确Hessian特征值。视觉结果为三组种子的均值,附录B给出均值与标准差。
- 模型
- ResNet-18Swin TransformerQwen2.5-Math-7B-InstructQwen2.5-7B-SimpleRL-ZooEurus-2-7B-PRIMEQwen2.5 32B InstructQwen2.5 32B SimpleRL
- 基准
- CIFAR-10TinyImageNetPubFig83RobustMathRobustBaseAdvBenchGSM8KMAWPSMinerva MathMATH 500Olympiad BenchAIME24AMC23IMDB
- 指标
- TPR at 0.1% FPRTPR at 1.0% FPRAUCPGD iteratesstolen-model accuracyagreementASRAutoDAN stepsECESharpnessPCA PRreasoning accuracy
Yiyong Liu、Jun Sakuma、Michael Backes、Rui Wen 的论文对训练效率与模型脆弱性的权衡做了跨领域系统研究,覆盖视觉与语言模型。结果显示,采用选择性数据采样、高效预训练和简化强化学习流程等效率导向策略的模型,对对抗攻击和隐私攻击的易感性上升。作者通过分析模型内部几何与功能表征发现,高效变体一致表现出更尖锐的损失几何以及表征结构的系统性变化。研究还扩展到零 RL 训练,发现用简化 RL 流程训练的模型比常规对齐流程训练的模型更容易出现灾难性遗忘和过度自信。作者据此认为训练效率并非免费午餐,并呼吁转向同时优化性能、成本与安全的多目标训练。
深度解读
这篇论文试图解决什么问题?
高效训练在保持任务效用时,是否同时提高对抗与隐私攻击下的脆弱性。
高效训练在保持相近任务效用时,是否会提高模型对对抗攻击和隐私攻击的易感性。
- 场景:作者称基础模型训练依赖大规模数据与算力,近期工作用选择性采样、高效预训练和简化强化学习管线降低开销。引言以DeepSeekV3的GPU用量所暗示的约560万美元计算成本为例,说明效率已成为训练进展的主要驱动力。
- 现有不足:作者认为现有讨论侧重性能与可扩展性,效率技术的安全与隐私影响仍 largely unexplored。相关工作把剪枝、量化、蒸馏、数据选择等与可信性联系起来,但作者称这些结果分散在特定方法、阶段和领域。
- 核心观察:作者假设所评估的效率策略会把模型推向几何上更不稳定的解,表现为更尖锐的损失景观,并伴随表示结构的系统性变化。
- 本文做法:作者在视觉与语言两个领域、数据选择、预训练和对齐三个训练阶段做受控比较,并分析内部几何与功能表示。对“zero RL training”,作者比较简化RL配方与常规对齐管线在灾难性遗忘和过度自信上的差异。
- 作者定位:作者称这是对效率–脆弱性权衡的首次系统性跨领域考察,并呼吁转向同时优化性能、成本和安全的多目标训练。
有哪些相关研究?
相关工作分成降本的训练策略,以及这些选择如何改变可信性两类。
论文第2节把相关工作分成两条线,并在第3节把所考察的效率范式落到数据选择、预训练与对齐。
降低数据与计算的训练策略
- 核心集与数据估值:Ghorbani & Zou (2019)、Jia et al. (2019)、Zhou et al. (2023)、Ji et al. (2025) 用高重要性核心集缩小训练数据,同时尽量保持任务效用。本文的数据选择使用KNN-Shapley(Jia et al., 2019)排序。
- 预训练与参数高效微调:Dosovitskiy et al. (2021)、Devlin et al. (2019)、DeepSeek-AI (2024) 先预训练再微调,把表示学习摊到多个任务;Hu et al. (2022)、Zhang et al. (2024) 只更新一小部分参数以降低适配成本。
- 对齐:Christiano et al. (2017)、Ouyang et al. (2022) 的RLHF和Rafailov et al. (2023) 的DPO依赖偏好数据与额外优化。Zeng et al. (2025)、Cui et al. (2026) 的“zero RL training”从有能力的基座模型直接开始,不做初始SFT。
效率选择与可信性
- 隐私与后门:Li et al. (2022)、Bao et al. (2025) 的差分隐私微调可降低记忆和成员推断风险;Ge et al. (2021)、Muri et al. (2026) 的蒸馏可能转移或放大后门。Wen et al. (2025)、Ramesh et al. (2025) 讨论数据选择对隐私泄漏和稳定性的影响。
- 训练后压缩:Ye et al. (2019)、Egashira et al. (2025) 的剪枝,Yu et al. (2024) 的量化,以及Hong et al. (2024) 更广义的LLM压缩,可能降低鲁棒性及其他可信性维度。作者称这些联系仍然是碎片化的。
本文使用的攻击与度量
- 基线方法:视觉成员推断为基于置信度(Song et al., 2019)、基于熵(Salem et al., 2019)和修正预测熵(Song & Mittal, 2021);对抗用PGD(Madry et al., 2018)。语言模型用答案似然(Fu et al., 2024)、自我置信度(Yoon et al., 2025)、Min-k%概率、RobustMath(Zhou et al., 2024)和AdvBench上的AutoDAN(Liu et al., 2024; Zou et al., 2023)。模型窃取针对logit查询。校准用ECE(Guo et al., 2017),表示相似度用线性CKA(Kornblith et al., 2019)。
- 基准/数据集:视觉为CIFAR-10、TinyImageNet、PubFig83;语言为RobustBase、RobustMath、AdvBench,以及GSM8K、MAWPS、Minerva Math、MATH 500、Olympiad Bench、AIME24、AMC23,分布外微调用IMDB。
作者把本文定位为把上述问题连到训练多个阶段、并跨视觉与语言的分析;作者称此前工作没有做这种跨领域的系统连接。
论文如何解决这个问题?
在效用匹配下比较三种效率范式,并用攻击与几何量刻画脆弱性。
作者把训练效率定义为在保持相近任务效用的同时减少数据、计算或对齐开销,并围绕数据选择、预训练、zero-RL对齐做受控比较,再用攻击成功与内部几何解释差异。比较把整条训练管线当作整体,不单独分离某一个被省略的组件。
问题设定与形式化
- 数据选择:用KNN-Shapley给训练样本排序。High取数值最高的较小子集,Low取数值最低的较大子集;两子集不相交,规模被校准到干净效用接近,其余超参数在每次比较内固定。
- 预训练:Efficient Variant在更少的任务数据上微调预训练模型;更高成本基线在更大数据集上从头训练。效率被操作化为更少的任务专用数据和预训练表示的复用。
- 对齐:常规管线通常建立在SFT上,并可能相对参考策略约束策略更新。式(1)为KL正则的RLHF目标:奖励减去β乘以策略相对参考策略的对数比。作者称所评估的zero-RL从有能力的基座出发、不做预备SFT,并简化常规对齐组件,包括省略显式KL正则。
- 效用匹配:视觉实验校准数据规模与配置,使每对模型的训练与测试准确率接近,以免任务性能差异混淆安全比较。
脆弱性的三类度量
- 数据隐私:成员推断攻击判断某样本是否在训练集中。视觉报告三种攻击在0.1% FPR下的TPR,TPR更高表示泄漏更大。数学推理模型按来源构造候选成员与非成员,评测答案似然、模型自我置信度和Min-k%概率。
- 鲁棒与适应:视觉用平均仍被正确分类的PGD迭代次数,次数更低表示鲁棒边界更脆。语言用RobustMath测语义扰动,用AdvBench上的AutoDAN测越狱;并用以LoRA把模型适配到不相交领域,看分布偏移下是否出现灾难性性能损失。
- 专有安全:模型窃取在logit查询设定下,用目标分布的数据重建功能等价模型。视觉报告被盗模型准确率,以及目标与替代模型在测试样本上的一致率。
几何与表示分析
- Sharpness:式(2)对测试批次上、由投影梯度上升找到的有界增损扰动,报告损失增量的平均。数值越大表示局部损失越敏感。附录A.1说明它反映梯度与曲率,是经验度量,不是精确的Hessian最大特征值。
- ECE:把置信度分成M个等宽箱,按箱内样本占比对准确率与置信度之差的绝对值加权。作者把它用于观察预测置信度与准确率是否对齐,并讨论成员与非成员置信度分布是否分开。
- PCA参与比:对倒数第二层中心化特征的协方差特征值计算PR。PR更低表示方差集中在更少的主方向。CKA用层激活的Gram矩阵衡量层间表示相似度;Intra-CKA看同一模型内部各层。
视觉实验流程
- 模型与数据:默认ResNet-18,另用Swin Transformer;数据集为CIFAR-10、TinyImageNet和PubFig83。所有视觉结果是三个种子的均值,附录B.1给均值±标准差。
- 模型窃取的查询:Figure 2的查询池为1000张不同图像,PubFig83因数据限制为500张;并设Random查询选择作为参照。预训练对比里,替代模型可以随机初始化,也可以从同一公开预训练检查点初始化。
语言模型实验流程
- 7B比较:Qwen2.5-Math-7B-Instruct对照两个zero-RL变体:由Qwen2.5-Math-7B-Base经各自管线得到的Qwen2.5-7B-SimpleRL-Zoo和Eurus-2-7B-PRIME。
- 稳定性攻击:在IMDB上做分布外微调,比较微调前后GSM8K、MAWPS、Minerva Math、MATH 500、Olympiad Bench、AIME24、AMC23及平均分。附录将Instruct与SimpleRL的比较扩展到32B。
- 结构量:7B模型在GSM8K与MATH 500上报告sharpness和ECE,并在GSM8K上做Intra-CKA;附录Figure 12在MATH测试集抽500例重复该模式。
论文做了哪些实验?
效用接近时,高效变体的MIA与对抗脆弱性更高,zero-RL遗忘更强。
实验设置
- 视觉模型:默认ResNet-18,另有Swin Transformer(文中写作CIFAR-10 (swin))。数据集为CIFAR-10、TinyImageNet、PubFig83。
- 视觉条件:数据选择比较High-Shapley与Low-Shapley;预训练比较Pre-train微调与Scratch。干净准确率被校准到接近。结果为三个种子的均值。
- 语言模型:7B为Qwen2.5-Math-7B-Instruct、Qwen2.5-7B-SimpleRL-Zoo、Eurus-2-7B-PRIME。附录Table 18–19把Instruct与SimpleRL扩到32B。
- 攻击与指标:视觉MIA为confidence、entropy、modified entropy在0.1% FPR下的TPR;对抗为平均正确分类的PGD步数;模型窃取为被盗准确率及括号中的一致率。语言为RobustBase/RobustMath准确率、AutoDAN步数与ASR,以及微调前后的推理基准准确率。
- 机制指标:sharpness、ECE、PCA PR,以及Intra-CKA热图。成员与非成员的置信度分布见图4。
- 规模:附录Table 21给出视觉训练集大小。例如CIFAR-10/ResNet-18的Full、High、Low、Fine-tuning、Scratch分别为49000、1180、5000、1850、4000。Figure 2查询池为1000张,PubFig83为500张。论文未在正文给出MIA的成员/非成员条数。
主结果
视觉上,训练准确率都接近100%,测试准确率在High/Low或Pre-train/Scratch之间接近,但高效侧的隐私与对抗数字更差。语言上,干净RobustBase接近,对抗与越狱和IMDB微调后的差距更大。
表格较宽,可左右滑动
设置 效用 隐私或攻击 出处 CIFAR-10 High vs Low Acc 47.97 vs 48.07 conf TPR 0.16% vs 0.12% Table 1 PubFig83 High vs Low Acc 44.26 vs 44.01 conf TPR 1.51% vs 0.32% Table 1 CIFAR-10 High vs Low PGD — 正确步数 1.33 vs 3.85 Table 2 CIFAR-10 Pre-train vs Scratch Acc 67.88 vs 67.71 conf TPR 0.21% vs 0.05% Table 3 SimpleRL vs Instruct Math 82.00 vs 89.30 ASR 100.00% vs 91.92%;步数 0.53 vs 4.32 Table 5 PRIME微调后 Avg 53.65→20.77 Instruct为56.08→55.17 Table 6 - 作者解读(数据选择):尽管泛化与过拟合水平可比,High-Shapley的MIA更易成功,且正确分类的PGD步数更少。作者称差距在Swin以及TinyImageNet、PubFig83上更明显。Figure 2中,针对High的窃取得到更高的Acc与Agr。
- 作者解读(预训练):效用相当时,预训练变体的MIA风险更高、对抗鲁棒更低。模型窃取上,预训练目标能抵抗从头初始化的替代模型;当攻击者使用同一公开预训练检查点时,这一优势消失,被盗准确率与一致率更高(Table 3右侧1000 (Pre-train)列)。
- 作者解读(zero-RL):答案似然在低FPR下Instruct泄漏更大,但作者称该指标对标准答案措辞敏感,可能掩盖RL模型的风险。自我置信度上,高效RL变体更易受攻击,并对其生成轨迹过度自信。Table 5中三种模型在RobustBase上接近,zero-RL在RobustMath上掉得更多,AutoDAN的ASR更高、步数更少。
微调稳定性与32B
- 测了什么:Table 6在IMDB上微调7B数学推理模型,比较七个推理基准及平均分。
- 结果:Instruct平均分从56.08到55.17;SimpleRL从53.86到47.52;PRIME从53.65到20.77。PRIME在GSM8K上从89.69到41.77,AIME24从6.67到0.00。
- 作者解读:作者称Instruct大体保留数学推理,两个zero-RL丢失更多,灾难性遗忘在PRIME上最明显。附录Table 19中32B SimpleRL平均分从58.00到43.60,Instruct从61.49到58.24。Table 18中32B SimpleRL的置信度MIA TPR为0.88%(1.0% FPR),Instruct为0.59%;Min-k%(k=15)在0.1% FPR下TPR为1.77%对0.59%,AUC为0.833对0.802;AutoDAN步数0.23对1.32,ASR 100.00%对98.08%。
机制分析
- Sharpness与ECE:Table 4中所有列出的High和Pre-train的sharpness都高于对应Low或Scratch。例如CIFAR-10上High为0.0591、Low为0.0410;Pre-train为0.1332、Scratch为0.0311。PCA PR在数据选择上High更低(CIFAR-10:10.793对28.490),预训练上Pre-train更高(25.137对14.266)。作者称Figure 3的CIFAR-10损失景观中高效变体更尖。Table 7中SimpleRL在GSM8K上的sharpness为0.9120,Instruct为0.0615;PRIME为0.5565。ECE在GSM8K上分别为0.0899、0.0375、0.1073。
- 校准与隐私的例外:作者称TinyImageNet上预训练改善了校准(Table 4:Pre-train ECE 0.251,Scratch 0.317),但提高了MIA(Table 3:conf TPR 0.75%对0.13%)。作者将其解释为与ImageNet重叠带来的强先验,使成员置信度极端并与非成员分开;基线则是普遍过度自信,降低了可区分性。Figure 4标注了TinyImageNet上High、Low、Pre-train、Scratch的置信度TPR分别为0.2%、0.1%、0.8%、0.1%。
- 表示:作者称Figure 5的Intra-CKA热图显示High-Shapley的后层自相似度比Low更广。Figure 7显示zero-RL在更早的层就有更强的相邻层相似度。作者认为省略显式KL正则为更尖几何提供了一个优化层面的可能解释,而不是把该省略单独分离出来做因果实验。
其他消融与分析
- 模型窃取、预训练目标、替代模型从零初始化:CIFAR-10被盗Acc 58.05(一致率0.669),低于Scratch的62.60(0.748);同一检查点初始化后为67.25(0.785),高于65.22(0.758)(Table 3)。
- PubFig83预训练、同一检查点:被盗Acc从7.89(0.183)升到25.26(0.533),Scratch侧为17.81(0.358)与18.59(0.299)(Table 3)。
- TinyImageNet High vs Low的PGD步数:10.46对20.89;Pre-train对Scratch为3.64对14.03(Table 2)。
- Swin、CIFAR-10、High的三种MIA TPR均为0.29%、0.30%、0.30%,Low为0.08%、0.05%、0.09%(Table 1)。
- 附录Table 20:CIFAR-10第4层零ReLU比例,High为0.587,Low为0.781;TinyImageNet第4层为0.684对0.806。
- 附录中4-bit NF4量化后的平均推理分:Instruct 56.08到55.96,SimpleRL 53.86到51.78,PRIME 53.65到47.76。
有什么可以进一步探索的点?
附录把结论限制在所评估的架构、数据集和攻击上,sharpness也不是精确曲率。
作者指出的局限与后续方向
- 覆盖范围:附录C称实验限于特定架构、数据集和攻击,没有覆盖全部高效训练策略。结论因此只针对所评估的数据选择、预训练和简化对齐。(附录C)
- 几何度量:附录A.1称投影梯度上升只是近似最大化,sharpness是局部损失敏感度的经验度量,不是精确的Hessian特征值估计;实验使用的是按张量约束的邻域,而不是单一全局L2球。(附录A.1)
- 校准解释:附录A.2称ECE的间隔论证是理想化解释,并不保证某种效率策略必然增加误校准;置信度上升也不必然使全局ECE变大,因为样本可能在箱之间移动。(附录A.2)
- 后续方向:结论呼吁“Robust Efficiency”,即在训练中加入稳定性约束,使模型同时便宜且安全。作者没有在结论中给出已实现的新训练算法。(第7节)
- 比较方式:第3.1节写明zero-RL比较把每条训练管线当作整体,而不是分离任意一个被省略组件的效应。因此KL正则缺失被作者称为更尖几何的一种可能解释,而不是被单独验证的原因。(第3.1节、第6节)
实验覆盖范围
- 视觉:被测架构为ResNet-18与Swin Transformer;数据集为CIFAR-10、TinyImageNet、PubFig83。每个视觉数字是三个种子的均值,完整均值±标准差在附录B.1。(第4.1节)
- 训练规模:附录Table 21列出各设置的训练集大小,例如CIFAR-10/ResNet-18的High为1180、Low为5000,预训练微调和从头训练分别为1850与4000。
- 语言行为:7B比较包含Instruct、SimpleRL、PRIME的成员推断、RobustBase/RobustMath、AdvBench上的AutoDAN,以及IMDB微调前后七个推理基准(Table 5、Table 6、Figure 6)。32B只比较Instruct与SimpleRL(Table 18、Table 19)。
- 机制:视觉报告sharpness、ECE、PCA PR(Table 4),CIFAR-10的损失景观(Figure 3),TinyImageNet的成员/非成员置信度(Figure 4),以及CIFAR-10与TinyImageNet的Intra-CKA(Figure 5)。语言在GSM8K与MATH 500上报告sharpness和ECE(Table 7),Intra-CKA见图7与附录Figure 12。
- 论文写明但未在正文展开的量:MIA的具体成员与非成员样本量、PGD的步长与扰动半径、AutoDAN的完整超参数,正文未给出数值;附录给出部分实现细节。量化实验只报告4-bit NF4前后的推理准确率。
总结一下论文的主要内容
效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。
比较在任务效用接近的前提下进行。视觉侧用KNN-Shapley的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练;语言侧用Qwen2.5-Math-7B-Instruct对照SimpleRL与PRIME两条zero-RL管线,并把Instruct与SimpleRL扩到32B。脆弱性用成员推断、PGD或语义/越狱扰动、模型窃取和分布外微调后的能力保持来衡量,再用sharpness、ECE、PCA参与比和CKA描述内部差异。
主要数字都出现在效用接近的对照里。PubFig83上High的confidence MIA在0.1% FPR下TPR为1.51%,Low为0.32%(Table 1)。CIFAR-10上High平均还能被正确分类的PGD步数为1.33,Low为3.85(Table 2)。预训练模型在攻击者使用同一公开检查点时,被盗模型准确率高于从头训练目标(Table 3)。7B上SimpleRL的AutoDAN ASR为100.00%、平均0.53步,Instruct为91.92%、4.32步(Table 5)。IMDB微调后PRIME的平均推理分从53.65降到20.77,Instruct从56.08到55.17(Table 6)。SimpleRL在GSM8K上的sharpness为0.9120,Instruct为0.0615(Table 7)。
作者的结论是:所研究的策略里,更低的训练成本反复与更大的隐私泄漏和对抗暴露同时出现;更尖的局部损失几何、更大的误校准和表示结构变化是伴随的结构特征。作者据此认为训练效率很少是“免费的午餐”,并主张后续训练同时考虑性能、成本与安全。作者同时写明,这些比较针对整条管线和所评估的设定,sharpness也是经验敏感度而不是精确曲率。