研究:恶意微调防御在持续训练下失效,72 条防御轨迹危害度全部上升
A Few Steps Further: Why Defenses Against Malicious Finetuning Erode Under Continued Training
作者对4个开源模型的6种恶意微调防御持续训练3个epoch,发现在全部72条轨迹中防御均衰减,有害性高于发布时。
防御者在发布前确定对齐模型权重θdef。
- 开源大模型易通过有害数据微调移除安全对齐。现有恶意微调防御通常在固定训练预算下评估,但掌握模型权重的攻击者可以在发布后继续训练更长时间。研究旨在检验现有防御能否经受持续微调。
- 整理15种恶意微调防御并归纳为锚定与自毁灭2种策略及4类损失模板。在4个开源模型上构建6种代表性防御,使用有害数据以LoRA持续微调3个epoch,沿训练过程测量有害性与通用能力变化曲线。
- 全部72条防御轨迹在微调结束时的有害性均高于发布时,StrongREJECT平均上升0.372。在Llama-3.1最高学习率下,6种防御的有害性终点与未防御模型相差不超过0.013。部分轨迹伴随能力下降。
- 攻击仅使用单一有害数据集和单一目标,最长训练预算为3个epoch;被测防御覆盖6种且未包含模板2;每条轨迹使用单随机种子;能力评测采用600道题的代理子集而非完整基准。
- 威胁模型
- 防御者在发布前确定对齐模型权重θdef。攻击者拥有权重的white-box访问权限,并完全控制后续微调(数据、目标、优化器、学习率调度和更新步数)。攻击者目标是获得既遵循有害请求又保持通用能力的模型;若模型失去流畅性、连贯性或可用性则未达目标。防御若阻止任一条件即算成功。
- 被测模型
- Llama-2-7B-chatQwen3-8BLlama-3.1-8B-InstructZephyr-7B-βLlama-2-13B-chatLlama-3.2-3B-InstructMistral-7B-Instruct-v0.3Qwen2.5-7B-Instruct
- 基准
- BeaverTailsMMLUTruthfulQAHellaSwagARC-Easy
- 指标
- StrongREJECT scorezero-shot accuracy
以色列本-古里安大学等机构的研究者系统梳理了十五种针对恶意微调(MFT)的防御方法,发现它们都建立在有限攻击者模型之上,并实测其中六种在持续训练下的表现。研究者将十五种防御归为锚定与自毁两种策略、四种损失模板,指出防御方在发布前一次性固定,而攻击方在发布后自行决定训练预算。在 Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct 和 Zephyr-7B-β 四个开源权重模型上,用 BeaverTails 的 9000 条有害数据做纯有害 LoRA 微调三个 epoch、三种学习率,共 72 条防御轨迹的最终检查点危害度均高于发布时,StrongREJECT 分数平均上升 0.372。在 Llama-3.1-8B 最高学习率下,六个受防御模型最终危害度与未防御模型相差不超过 0.013。研究者认为,单一训练预算下的抗性不能视为开源权重模型的持久保护。
推荐理由论文系统梳理十五种恶意微调防御并实测六种,说明固定训练预算下的抗性会随攻击者继续训练而衰减。
深度解读
这篇论文试图解决什么问题?
论文探究开源大语言模型在发布后遭受持续有害微调时,现有的恶意微调防御是否仍然具备有效防护能力。
核心问题是开源大语言模型的恶意微调防御在攻击者持续训练时是否会逐渐失效。
- 问题场景与重要性:模型提供方通常在模型发布前通过强化学习或对齐手段注入安全行为,但攻击者获取模型权重后可通过少量有害数据微调撤销对齐防护,甚至良性微调也会削弱安全表现;防御者只能在发布前干预一次,而攻击者控制发布后的所有更新步数。
- 现有防御的局限:现有恶意微调防御在评估时大多假设攻击者使用固定的微调预算(如预设的损失函数、优化器、数据预算和超参数范围),忽视了持有权重的攻击者只需增加训练轮数即可升级攻击。
- 核心观察与假设:作者梳理15种近期防御后认为,各防御均围绕受限的攻击者模型构建(如有界扰动、短步数模拟攻击或有害与良性行为的耦合),发布后没有任何机制强制维持该保护;当训练充分时,模型会移出防御所覆盖的区域或攻击视野,使防护不再生效。
- 威胁模型:
- 受害系统:提供方在发布前确定并公开权重的对齐大语言模型 theta_def。
- 攻击者知识:攻击者拥有模型权重的 white-box 访问权限。
- 攻击者能力:攻击者完全控制后续微调过程,包括训练数据、训练目标、优化器、学习率调度以及更新步数。
- 攻击者目标:获得既遵循有害请求又保留通用能力(fluency、coherence 与 usefulness)的模型;防御只要阻止任一条件即视为成功。
- 论文主要工作:系统归纳15种恶意微调防御的策略与损失模板,并在4个开源模型上测试6种防御在持续3个epoch的有害微调下的表现,通过代价曲线追踪有害性与能力的变化。
有哪些相关研究?
论文梳理了开源模型安全对齐破坏、防护持久性评估及对抗ML预算检验等工作,以持续微调测试既有防御的有效边界。
开源模型对齐破坏与微调风险
- Qi et al. [30] (2023)、Yang et al. [44] (2023)、Zhan et al. [47] (2024)、Wei et al. [42] (2024)——研究发现标准拒绝训练容易被持续优化削弱,恶意微调甚至良性微调均可破坏安全对齐。
- Huang et al. [18] (2024)、Rosati et al. [32] (2024)、Tamirisa et al. [36] (2025)、Li et al. [21] (2024)——提出表征加噪、防篡改元学习、对抗遗忘等训练期干预手段,旨在使恶意微调失败或导致效用崩溃。
防护持久性评估与自适应攻击
- Qi et al. [29] (2025)——针对 RepNoise 和 TAR 进行测试,发现改变随机种子、训练器实现、学习率调度、提示词模板或微调数据会推翻原评估结论,指出防御发布前应在多种下游配置下进行压力测试;作者指出本文探究在这些问题解决后、攻击者仅延长训练预算时的表现。
- Carlini et al. [3] (2019)、Tramèr et al. [39] (2020) 等对抗机器学习研究——指出静态或非自适应评估下的鲁棒性常在自适应对手面前失效,建议绘制攻击成功率随迭代次数变化的曲线并检验加倍迭代预算的影响;作者将此思路转化为恶意微调的代价曲线。
- Nasr et al. [26] (2025) 等大语言模型越狱与提示注入防御评估——指出固定基准评估表现鲁棒的防御在面对自适应搜索策略时常被绕过;作者指出本文设定与其实际不同,攻击者直接修改模型权重而非生成对抗输入。
对比基线与评测基准
- 基线方法:评估包含6种防御基线,分别为 Vaccine(2024)、VAA(2025)、SAM-unlearning(2025)、Booster(2025)、CTRAP(2026)和 SDD(2025),并以对应模型的未防御版本(Undefended)作为参考基线。
- 使用基准与数据:微调攻击使用 BeaverTails [19] 数据集的 9,000 条有害提示-回复对;有害性评测使用从 BeaverTails 抽取的 1,000 条保留测试提示词及 StrongREJECT [34] 评判模型;能力评测使用 MMLU [16]、TruthfulQA [22]、HellaSwag [46] 和 ARC-Easy [10]。
作者将本文定位为不改变攻击目标与数据分布,仅测试最基础的升级手段(增加微调步数),以此检验防御声称的抗性是否属于持久防护。
论文如何解决这个问题?
论文将15种恶意微调防御归纳为两大策略与四类损失模板,并构建跨训练步数的代价曲线以系统评估防护衰减机制。
作者通过分类体系与代价曲线(Cost Curves)评估框架解决该问题,先将近期15种恶意微调防御归结为两大策略与四类损失模板,再通过跨训练步数追踪有害性与能力评估防御的持久性。
防御策略的形式化与分类
- 两大防御策略:攻击成功需要微调模型既具备有害性又保留通用能力,防御通过破坏其一发挥作用。锚定(Anchoring)策略旨在使有害损失 L_h 保持在高位,通过削弱有害梯度或平坦化局部区域阻碍有害学习;自毁灭(Self-destruction)策略则使有害微调导致能力损失 L_c 上升,令攻击者无法获得可用模型。
- 基础对齐损失结构:所有防御均建立在标准对齐损失之上,其形式为 Lalign(θ) = Ls(θ) + Lc(θ),包含有害提示词上的拒绝安全项 L_s 和良性提示词上的正确响应能力项 L_c,以保证发布时的安全性与效用。
四类损失模板与机制
- 模板 1:鲁棒对齐盆地(Robust-alignment basin):目标为 L(1)def(θ) = maxδ ∈ Δ Lalign(θ + δ) + λ Lc(θ),通过在嵌入空间、层空间或权重空间对抗扰动集合 Δ 下优化,使模型处于对有界扰动稳定的盆地中(如 Vaccine、T-Vaccine、VAA、SAM-unlearning 等)。作者指出该模板并未全局消除有害能力,仅增加逃离局部盆地的难度。
- 模板 2:有害信息移除(Harmful-information removal):通过正则项消除有害激活中的有效结构(如 RepNoise 利用 MMD 将有害表征推向高斯噪声),使初始权重处的有害梯度不含可用信号。
- 模板 3:前瞻防御(Look-ahead defense):在目标中显式模拟未来攻击者的一步或多步微调更新,根据惩罚项 R 的设定分别实现锚定(如 Booster、Antibody、TAR 惩罚有害进展或保持拒绝)或自毁灭(如 CTRAP 惩罚微调后模型在通用对话上的崩溃)。
- 模板 4:耦合陷阱(Coupling trap):不显式模拟攻击,直接将有害进展与良性退化耦合(如 SEAM 约束有害与良性梯度方向相反,SDD 将有害提示配对无关良性回复),使沿有害梯度的优化必然损害通用指令遵循。
持续微调攻击与代价曲线设计
- 微调攻击设置:模拟持有权重的攻击者,采用 LoRA 针对 BeaverTails 的 9,000 条有害数据最小化交叉熵损失,不包含任何良性数据项;统一训练 3 个 epoch(共 3,375 个优化器步数,有效批大小为 8),采用包含 337 步预热的余弦学习率调度,并在 3 种峰值学习率(10^-5、3×10^-5、10^-4)下运行。
- 检查点采样与代价曲线构建:沿训练步数在 1 至 3,375 步之间按近似对数间隔保存 21 个检查点,追踪有害性与通用能力的演化,以此检验防御效果是否能超越其构建时所依赖的有限攻击视野。
论文做了哪些实验?
论文在4个开源模型上测试6种防御面对3个epoch微调的表现,72条防御轨迹有害性均上升且部分伴随能力退化。
实验设置
- 被测模型:主实验覆盖 4 个开源对话模型:Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct、Zephyr-7B-β;附录 G 额外测试了 4 个未防御模型:Llama-2-13B-chat、Llama-3.2-3B-Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct。
- 微调数据集与规模:微调攻击使用 BeaverTails 训练集中的 9,000 条有害提示-回复对(源文件 10,000 条,按 90/10 划分,剩余 1,000 条不用于更新或早停);防御构建使用 Alpaca 及配对 BeaverTails 数据。
- 基线方法:测试 6 种防御方法,包括 Vaccine、VAA、SAM-unlearning(图中标记为 Unlearn-Smooth)、Booster、CTRAP、SDD,并以对应未防御(Undefended)模型作为基准线。
- 指标定义与评审协议:有害性使用微调后的 StrongREJECT 评审模型(qylu4156/strongreject-15k-v1,基于 Gemma-2B)对 1,000 条保留 BeaverTails 提示词的贪婪解码回复打分(0 至 1 连续分值,无硬阈值截断);能力评测使用 MMLU(200 题)、TruthfulQA(100 题)、HellaSwag(200 题)和 ARC-Easy(100 题)共 600 道题的零样本准确率等权均值。
- 样本量与重复次数:每个主实验模型配置测试 3 个学习率(10^-5、3×10^-5、10^-4),保存 21 个检查点;主实验共 84 条轨迹(72 条防御,12 条未防御),附录 G 增加 12 条未防御轨迹,合计 96 条轨迹;每条轨迹使用单随机种子(防御种子 42,攻击种子 42),未进行重复运行。
主结果
表格较宽,可左右滑动
模型 防御方法 / 条件 初始有害性 终点有害性 初始能力 终点能力 Llama-2-7B-chat Vaccine 0.013 0.393 0.451 0.537 Llama-3.1-8B-Instruct 6种防御方法范围 未报告 0.515–0.527 未报告 未报告 Llama-3.1-8B-Instruct Undefended(未防御) 未报告 0.528 未报告 未报告 Zephyr-7B-β VAA 未报告 ≤0.069 0.425 0.378 Zephyr-7B-β CTRAP 0.028 0.521 0.574 0.501 Zephyr-7B-β Undefended(未防御) 未报告 未报告 0.664 未报告 Qwen3-8B VAA 未报告 0.241 0.455 0.255 (注:数值为学习率 10^-4 条件下正文报告数据,据 Section 5)
- 有害性普遍回升:在全部 72 条防御轨迹中,微调结束时的有害性均高于发布时,StrongREJECT 分数平均增加 0.372,单条轨迹增加量在 0.022 至 0.520 之间;作者指出多数轨迹在第一轮(epoch)内有害性即开始上升(据 Section 5 与 Figures 2–5)。
- 完全收敛至未防御水平:在 Llama-3.1-8B 模型的最高学习率(10^-4)下,全部 6 种防御在微调结束时的有害性在 0.515 至 0.527 之间,与未防御模型的 0.528 差距不超过 0.013;作者称在 3 个 epoch 后防御几乎没有产生差异(据 Section 5 与 Figure 4)。
- 防御表现非均质:VAA 在 Zephyr-7B-β 上在所有学习率下的有害性均未超过 0.069,但其初始能力(0.425)低于未防御模型(0.664),且在最高学习率下终点能力进一步降至 0.378(据 Section 5 与 Figure 5)。
防御导致的能力退化与权衡
- 测了什么:在微调攻击过程中沿检查点同步评估有害性与通用能力代理指标,检验自毁灭策略及防御引入的能力损失。
- 结果:在最高学习率下,Zephyr-7B-β 上的 CTRAP 有害性从 0.028 升至 0.521,能力从 0.574 降至 0.501;Qwen3-8B 上的 VAA 有害性在达到峰值 0.363 后降至 0.241,但能力从 0.455 降至 0.255;而在 Llama-2-7B-chat 上 Vaccine 有害性升至 0.393 时,能力从 0.451 上升至 0.537(据 Section 5 与 Figures 2–5)。
- 作者解读:作者认为有害性恢复有时伴随着通用能力的损失,有害性变化并非单调递增,有害的终点模型对攻击者而言并不必然是有用模型,因此有害性评估必须与能力评估结合。
未防御基准模型的规模与架构扩展分析
- 测了什么:在附录 G 中将微调攻击协议扩展至 4 个额外的未防御开源模型(Llama-2-13B-chat、Llama-3.2-3B-Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct),共 12 条轨迹。
- 结果:Figure 6 显示,在所有 8 个未防御模型及 3 种学习率下,有害性均在第一轮内迅速上升至平台期,各模型间的上升轨迹形态保持一致。
- 作者解读:作者指出不同模型架构和尺寸在相同微调设置下呈现类似的有害性恢复趋势,完成 token 数量受分词器影响而有所差异。
其他消融与分析
- 攻击微调步数影响:全流程 3,375 步中设置 21 个检查点,多数模型在第 1 epoch(1,125 步)内即越过防御初始阶段(据 Figure 2–5 与 Section F.1)。
- 学习率敏感度分析:评估 10^-5、3×10^-5 和 10^-4 三种峰值学习率,较高学习率下有害性上升速度更快且终点更高(据 Section 5 与 Figures 2–5)。
- 防御发布状态差异:Zephyr-7B-β 上未防御模型与 Unlearn-Smooth 在发布时的初始有害性高于其他防御模型(据 Figure 5 图注)。
负面结果与例外
- 防御例外案例:VAA 在 Zephyr-7B-β 上成功将有害性全程压制在 0.069 以下(据 Section 5),作者未断言其能在更长训练下保持,且指出其代价是通用能力较低(初始能力0.425,终点0.378)。
- 非单调变化案例:Qwen3-8B 上的 VAA 轨迹在最高学习率下有害性先升至 0.363 后回落至 0.241,作者指出有害性无需单调上升,且该状态伴随能力下降至 0.255(据 Section 5)。
有什么可以进一步探索的点?
作者在局限中指出了单种子、有限训练预算、单一微调数据、代理能力指标及未测模板2等问题。
作者指出的局限与后续方向
- 单随机种子与缺少重复试验:每条轨迹均使用单随机种子,3 种学习率属于独立的攻击设置而非重复试验(出自 Section 6)。
- 单一攻击数据与目标函数:攻击仅使用 BeaverTails 单一数据集和有害交叉熵单一目标,实验仅改变训练时长而非所见不同样本的数量(出自 Section 6)。
- 攻击预算仍属有限:最长攻击为针对 9,000 条样本训练 3 个 epoch,其本身仍是有限预算,因此无法断定在更长攻击下防御(如 Zephyr 上的 VAA)是否仍能守住(出自 Section 6)。
- 能力评估为代理子集:能力指标使用 600 道题的验证子集代理,该子集同时用于挑选防御配置,无法替代完整的基准测试评估(出自 Section 6 与 Section F.3)。
- 防御覆盖范围未包含模板2:仅评估了 15 种防御中的 6 种,且未评估模板 2(有害信息移除)中的任何防御(出自 Section 6)。
- 早步检查点受预热调度影响:早期检查点处于为全流程设定的学习率预热期内,因而无法反映使用较短调度的攻击者所需的最小训练量(出自 Section 6 与 Section F.1)。
实验覆盖范围
- 被测模型范围:主实验覆盖 4 个开源对话模型(Llama-2-7B-chat、Qwen3-8B、Llama-3.1-8B-Instruct、Zephyr-7B-β),扩展实验测试 4 个未防御模型(Llama-2-13B-chat、Llama-3.2-3B-Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct),共 8 个模型(据 Section 4 与 Appendix G)。
- 防御测试范围:从整理的 15 种防御中选测了 6 种(Vaccine、VAA、SAM-unlearning、Booster、CTRAP、SDD),涵盖模板 1、3、4,模板 2 未包含在经验评估中(据 Section 4 与 Table 1)。
- 攻击超参数设定:微调攻击固定为 LoRA 微调(rank 16,alpha 32),批大小为 8,最大序列长度 512,学习率采用 10^-5、3×10^-5、10^-4 三个取值,步数固定为 3,375 步(据 Section F.1)。
- 评测集与评测协议:有害性评测固定为 BeaverTails 抽取的 1,000 条测试提示词及 StrongREJECT 打分;能力评测固定为 MMLU、TruthfulQA、HellaSwag、ARC-Easy 组成的 600 题子集(据 Section F.3)。
- 重复与验证情况:论文未报告不同攻击种子或防御种子的重复方差,未报告完整 lm-eval-harness 基准测试得分(据 Section E 与 Section F.3)。
总结一下论文的主要内容
论文指出恶意微调防御在持续训练下均会衰减,表明基于有限攻击者假设的防御无法为开源模型提供持久保护。
- 定位与核心问题:本研究系统评估开源大语言模型在遭受持续有害微调时现有防御的持久性,重点关注防御能否抵御攻击者延长训练预算这一基础升级手段。
- 方法要点:梳理15种近期防御并提炼为锚定与自毁灭2种策略及4类损失模板,指出各防御均依赖有界扰动或短步模拟等受限攻击者模型;在4个模型上对6种防御开展持续3个epoch(3,375步)的LoRA微调,沿途记录21个检查点的有害性与能力。
- 主要实验结果:
- 在全部72条防御轨迹中,模型终点有害性均高于发布状态,StrongREJECT得分平均上升0.372,增幅范围在0.022至0.520之间(据Section 5)。
- 在Llama-3.1-8B模型及最高学习率(10^-4)下,6种防御的终点有害性处于0.515至0.527之间,与未防御模型的0.528仅相差不到0.013(据Section 5)。
- 防御效果存在差异,Zephyr-7B-β上的VAA在各学习率下有害性均未超0.069,但初始能力(0.425)低于未防御模型(0.664)并在终点降至0.378(据Section 5)。
- 部分防御呈现能力损失,如Zephyr-7B-β上的CTRAP在最高学习率下有害性升至0.521的同时能力从0.574降至0.501(据Section 5)。
- 结论与启示:作者认为当前防御大多只能延缓或扰动恶意微调而非彻底阻止,单一训练预算下的抗性不能视作更长预算下的抗性证据;开源模型防御在评估时应同步测试持续微调、监测通用能力并以未防御模型作为对照。