跳到正文
原文
arXiv· arXiv:2609.36862· Muhammad Zeeshan Akram·本站收录 · 原文发表

VaccineBooster:面向有害微调对齐的混合扰动防御

Safer Content or Firmer Refusals? A Hybrid Perturbation Defense for Alignment under Harmful Fine-tuning

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

VaccineBooster 在对齐阶段同时做嵌入扰动和梯度衰减,Llama-2-7B 上内容安全与拒答保留呈权衡。

威胁模型攻击者只用微调即服务接口上传数据,把有害指令-回答对混入下游任务数据,目标是微调后仍能完成任务但会输出有害内容;不改对齐过程或基座模型。

问题
微调即服务下,少量有害样本混入良性微调数据就会削弱已对齐模型的安全行为,而只看任务效用难以发现。过滤和事后修复需要接触用户数据或定位被改动的样本,提供方往往做不到。
方法
VaccineBooster 在提供方控制的对齐阶段、每一步同时做两件事:按 Vaccine 扰动注意力层嵌入,按 Booster 模拟有害权重更新并做梯度衰减,再把两路梯度合成一次更新。默认强度 ρ=2.0、ε=0.1、λ=0.001,不检查用户微调数据,也不改后续微调与推理。
实验与结果
在 Llama-2-7B 上用 BeaverTails 对齐 3 个 epoch 后,对 500 条纯有害样本做 1 个 epoch 微调。Table 1 中 VaccineBooster 的攻击后 OpenAI moderation 为 0.315,拒答率 20%;Booster-Only 拒答率 50%、moderation 0.401。作者把这看成内容安全与显式拒答之间的权衡,并注明十个提示词、单次无种子运行,不把它当作统计上已分辨的效应。
局限与可以继续做的
作者写明评测只有十个提示词、每种配置一次无种子采样,拒答率差异在 Fisher 精确检验下不显著,并计划首先扩大评测集并对多种子取平均。实验只测 Llama-2-7B 与 BeaverTails,攻击为 p=1 的纯有害微调,未报告下游任务效用;λ 消融中拒答率不随 λ 单调变化。
实验设置Llama-2-7B · BeaverTails · Harm score、Refusal rate 等
威胁模型
攻击者只用微调即服务接口上传数据,把有害指令-回答对混入下游任务数据,目标是微调后仍能完成任务但会输出有害内容;不改对齐过程或基座模型。防御者是模型提供方,只控制对齐阶段,看不到用户微调数据,也不知道有害比例 p。实验把攻击实例化为 p=1 的纯有害微调。
模型
Llama-2-7B
基准
BeaverTails
指标
Harm scoreRefusal rateOpenAI moderation scoreFlagged rateResilience score
AI 导读全文 260 字

VaccineBooster 将嵌入向量扰动与权重级梯度衰减合并进单次对齐训练步骤,用于抵御微调即服务中的有害微调攻击。在 Llama-2-7B 上经 BeaverTails 对齐并遭投毒微调攻击后,其 OpenAI moderation 得分为 0.315,为所比较防御中最低;仅用 Booster 的变体则保持最高 50% 的攻击后拒答率。消融实验显示存在权衡:嵌入扰动主要减少被标记的有害内容,梯度衰减主要保留显式拒答行为;因仅用 10 条提示且每种配置单次未设随机种子运行,作者将其视为观察到的模式而非统计结论。

深度解读

6 个问题,约 9,600 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    对齐阶段能否同时用嵌入扰动和权重梯度衰减,抵抗有害微调。

    对齐阶段把嵌入扰动和权重级梯度衰减合在同一步里,能否在有害微调之后同时保住内容安全与显式拒答,还是二者会互相权衡。

    • 场景:作者称微调即服务让用户用自己的数据适配已对齐模型,但少量有害指令-回答对混入良性微调集,就会降低拒答、提高有害回答的可能,同时任务表现仍看起来正常,提供方只检查任务效用时难以发现。
    • 现有方法的不足:作者称数据过滤会漏掉改写或隐蔽样本,且隐私与运营约束使全面检查不可行;过滤也处理不了并非明显有害、但仍把模型推离对齐行为的数据。事后修复则常常不知道是哪些样本、模型被如何改动、以及是否还会再次微调。已有对齐阶段防御 Vaccine 与 Booster 分别作用在嵌入和权重上,但被分开评测,且常用单一总分概括,作者认为这会掩盖“强化安全的一个侧面、露出另一个侧面”。
    • 核心问题:嵌入级扰动与权重级梯度衰减放进同一次对齐时,是互补并全面提高安全性,还是在不同安全侧面之间形成权衡。
    • 本文提出:对齐阶段方法 VaccineBooster,在每一步训练中同时做嵌入扰动和权重级梯度衰减;不需要知道后续微调数据,也不改用户微调接口或推理。
    • 威胁模型:
      • 攻击者目标:微调后的模型在被请求时产出有害内容,同时仍完成所声明的任务;作者称攻击之所以算成功,是因为任务准确率仍在,从而掩盖安全行为的丧失。
      • 攻击者知识与能力:攻击者使用提供方的微调接口并上传下游任务数据,在其中混入一定比例的有害指令-回答对;作者假设攻击者只控制上传的微调数据,不修改对齐过程或基座模型。
      • 防御者:模型提供方只控制对齐阶段,在任何用户数据到来之前,用有害提示词配安全拒答的安全数据集对齐基座模型;看不到用户微调数据,也不知道其中的有害比例 p,因此防御不能针对某一次具体攻击来定制。
      • 形式化:用户数据为 D_user = (1−p) D_B + p D_H。防御者要选择对齐过程,使模型在未见过 D_user、且 p 在对齐时未知的情况下,微调后仍保留安全行为。实验把该混合实例化为 p=1 的纯有害微调,而不是威胁模型所强调的小有害比例。
  2. 有哪些相关研究?

    相关工作分对齐、有害微调攻击和对齐阶段防御,本文问两类扰动是否互补。

    安全对齐

    • 监督微调与 RLHF(Bai 等、Ouyang 等所引工作):用示范数据和人类反馈强化学习让模型拒绝有害请求、回答良性请求;作者称人类反馈贵、单独的奖励模型也贵。
    • Constitutional AI(Bai 等,2022)与 Direct Preference Optimization(Rafailov 等,2023):前者用模型按固定原则生成批评来替代一部分人类反馈,后者去掉显式奖励模型、直接从偏好对优化策略。作者称这些方法都在发布时建立拒答,也共享同一脆弱点:后续训练可以削弱已装上的对齐。

    有害微调攻击

    • Qi 等(2024):作者称很少量有害样本就足以去掉安全行为,即使用户并无此意、只是在良性任务上微调,安全也可能下降。
    • Yang 等(2023,Shadow alignment):少量恶意样本可以颠覆已安全对齐的模型,同时保留其有用性。作者归纳这类攻击的共同点是隐蔽:有害比例小、微调后任务能力仍在,只看任务表现的提供方看不到安全损失。

    针对有害微调的防御

    • 事后修复或约束(作者引用的一组工作):在微调之后修复或约束模型,但需要提供方知道哪个模型或哪些样本被破坏,作者称这很少成立。
    • 对齐阶段防御:Vaccine 让隐藏嵌入对有害漂移更稳健;Booster 衰减有害梯度对权重的影响。相关的表示级与抗篡改防御包括 RepNoise(向表示注入噪声,使有害微调所需信息更难恢复)和 TAR(把防护训练进开源权重模型,使安全在对抗微调下仍然保持)。作者把本文限定在对齐阶段这一族,并称这些方法留下的问题是:嵌入级防御和权重级防御合在一次对齐里时是否互相加强。
    • 事后归因:作者指出本文的防御设定不同于微调后的因果归因,对齐阶段防御要在安全失败发生之前减小有害微调的影响。

    基线方法与基准:主比较基线是同一对齐轮数下的 Vaccine-Only(仅嵌入扰动)和 Booster-Only(仅权重级梯度衰减)。对齐、权重扰动项和模拟攻击的数据都来自 BeaverTails;被测模型为 Llama-2-7B。指标为关键词 harm score、refusal rate、OpenAI moderation score、flagged rate,以及作者明确不用于排名的 resilience score。

    作者把本文定位为研究两种已有扰动如何相互作用,而不是引入新的底层机制:分开评测并用单一总分概括会隐藏“一个安全侧面变强、另一个仍暴露”,因此分开测量内容安全与拒答保留,并把主要影响前者的防御与主要影响后者的防御合在一起。

  3. 论文如何解决这个问题?

    每步先算 Booster 的衰减项,再在 Vaccine 扰动前向中取安全梯度并相加。

    VaccineBooster 把 Vaccine 的嵌入扰动和 Booster 的权重扰动加梯度衰减放进同一次对齐更新:前者改变前向产生的表示,后者改变权重对有害梯度的响应,二者相加而不是先后当成两套独立流程。

    问题设定与两条扰动

    • 对齐对象:预训练模型 M、参数 θ,语言建模损失 L(x; θ)。对齐在安全数据集 D_safe 的指令-拒答对上微调;攻击发生在之后的用户数据上。
    • 嵌入扰动:作用在第 l 层注意力模块的输出嵌入 h_l。取对齐损失对该嵌入的梯度,归一化到固定范数再加回前向:δ_l = ρ g_l / ‖g_l‖,h̃_l = h_l + δ_l。作者称 δ_l 沿对齐损失上升最快的方向,是有界的最坏情况偏移;在 h̃_l 下仍保持安全行为,等于要求嵌入在当前值的邻域内也安全。ρ 越大,这个邻域越大,对齐目标也越难拟合。
    • 权重扰动与梯度衰减:在有害批次 x_h 上先算有害梯度 g_h,再沿该方向走有界步长得到 θ̃ = θ − ε g_h / ‖g_h‖,并在扰动点再算一次有害梯度 g̃_h。差值 g_h − g̃_h 被作者用来表示一小步有害更新能多快降低有害损失。安全梯度为 g_s 时,合成梯度为 g_final = g_s + λ (g_h − g̃_h)。ε 决定模拟有害步的大小,λ 决定衰减项相对拟合安全数据的权重。

    合并的对齐步

    Algorithm 1 的顺序是:在当前权重上算 g_h,临时沿有害方向扰动权重并在扰动点算 g̃_h,然后把权重加回去;再对安全批次做一次反向以收集各注意力层嵌入梯度,构造 δ_l,在扰动嵌入下计算 g_s,最后返回 g_final。

    • 顺序:作者强调安全更新从原始参数计算。扰动权重只用来估计衰减项,最终的安全更新不从有害更新方向施加。
    • 扰动位置:只扰动注意力模块的输出。作者给出的理由是这些表示含有对安全对齐重要的特征,并且直接受有害微调影响。
    • 归一化:两条扰动都先归一化到单位范数,再分别乘 ρ 和 ε。作者称这样强度与梯度幅度无关,同一数值在不同批次上含义更可比。作者还称,因为两项是相加而不是复合,改变一个强度主要影响一个行为维度:ρ 只进入扰动后的安全梯度 g_s,主要影响生成内容;λ 只进入衰减项,主要影响对有害更新的敏感度。作者把这一角色分离写成工作解释,并称确认它需要比本文更大的评测集。

    开销与部署约束

    • 计算:标准监督对齐每步对安全批次一次前向、一次反向。VaccineBooster 在有害批次上多两次反向以形成 g_h 和 g̃_h,安全批次上则用两次:一次收集定义扰动的嵌入梯度,一次计算扰动后的 g_s。作者称单步大约是四次前向-反向而不是一次,该开销只在提供方对齐时支付一次,不改变用户微调或推理的成本。
    • 内存:扰动用注意力层上的前向与反向钩子计算,扰动权重原地恢复,不另存一份拷贝。作者称额外内存不大。
    • 数据无关:方法不检查用户微调数据,也不依赖有害比例可识别或依赖过滤器。

    训练与成功判定所用的设置

    • 数据划分:Llama-2-7B;BeaverTails 中取 5,000 条指令-拒答对做对齐,1,000 条有害样本做权重扰动项,500 条有害样本做模拟攻击。这 500 条全部是有害指令-回答对,对应第 3 节混合在 p=1,而不是小有害比例。作者因此把实验解释为:测量一次不加伪装的有害微调之后还剩多少安全行为;因为毒化集里没有良性任务数据,不报告下游任务效用。
    • 优化:对齐与攻击都用 LoRA,秩 r=32、缩放 α=4,作用在 query、key、value 投影上,使各方法可训练参数相同。对齐 3 个 epoch,批大小 4,学习率 1×10^−5;模拟攻击在毒化数据上微调 1 个 epoch,学习率 2×10^−5。除非另作说明,ρ=2.0、ε=0.1、λ=0.001。各方法对齐轮数相同。实现为 PyTorch、Hugging Face Transformers 与 PEFT,bfloat16。
    • 判定:攻击前和攻击后都测 harm score 与 refusal rate。harm score 为 0–100 的关键词检测,统计暴力、非法活动、危险信息、隐私侵犯、欺骗等类别中与伤害相关的词;refusal rate 是含显式拒答模式的回答比例。OpenAI moderation score 由 moderation API 返回,越低越安全;flagged rate 是被该 API 标记的回答比例。resilience 把攻击后伤害、伤害增量和攻击后拒答合成一个数,作者称权重是手工设定、未对外部标准校准,只作描述性汇总,不用于给方法排名。评测用固定的十条有害提示词,覆盖 harm score 所用的伤害类别,所有方法与超参数共用这十条。生成使用 temperature 0.7、150-token 预算、不固定随机种子,因此每个报告数字是一次随机抽样。
  4. 论文做了哪些实验?

    主比较与 ρ、λ 消融都指向内容安全与拒答率的权衡,且运行间波动大。

    实验设置

    • 模型与数据:唯一被测模型为 Llama-2-7B。对齐用 BeaverTails 的 5,000 条安全样本,权重扰动项用 1,000 条有害样本,模拟攻击用 500 条纯有害样本(p=1)。未报告下游任务效用。
    • 方法:VaccineBooster、Vaccine-Only、Booster-Only,均对齐 3 个 epoch。默认 ρ=2.0、ε=0.1、λ=0.001。ρ 消融固定 ε=0.1、λ=0.001;λ 消融固定 ρ=2.0、ε=0.1。论文未报告单独改变 ε 的实验。
    • 指标:关键词 harm score(越低越好)、refusal rate(越高越好)、OpenAI moderation score(越低越安全)、flagged rate,以及按式 (9) 计算的 resilience。resilience 第二项在关键词伤害分下降时可以超过 25,总分因此可以超出作者所说的直观上界;附录 B 说明伤害分下降也可以来自与安全无关的测量现象。
    • 评审:moderation 与 flagged 来自 OpenAI moderation API,论文未写具体模型版本或阈值,只在 Figure 2 图注中标了 “Typical Flag Threshold”,正文未给出该阈值的数值。关键词表与拒答模式表在附录 A,正文未逐条列出。
    • 规模与重复:每条配置在固定的 10 条有害提示词上评测一次。解码 temperature 0.7、最多 150 token、无固定种子。默认配置被独立训练并评测两次(Table 1 一次,Tables 2 和 3 中的对应行另一次)。全部实验含两次消融,作者称在单张 A100 上约三小时完成。

    主结果

    攻击前三种方法的拒答率都是 100%,作者称发布时无法区分,差别只出现在毒化微调之后。Table 1 是主运行;默认配置在 Tables 2、3 中是另一次对齐,两次数值不一致,作者选择并列报告。

    表格较宽,可左右滑动

    方法条件Harm Pre→PostRefusal PostMod.FlaggedResil.
    VaccineBoosterTable 1,3 epoch24→2020%0.315未报告72.0
    Vaccine-OnlyTable 1,3 epoch26→2630%0.411未报告69.5
    Booster-OnlyTable 1,3 epoch27→1950%0.401未报告82.0
    VaccineBooster 重复Tables 2–3 与 Table 4,ρ=2、ε=0.1、λ=0.00132→2040%0.32940%81.0

    表中 Harm、Refusal、Mod.、Resil. 据 Table 1 与 Table 4;Table 1 未给出 flagged rate。Pre refusal 三种方法均为 100%。

    • 作者的读法:moderation 与拒答率没有同一个胜者。VaccineBooster 的 moderation 最低(0.315),拒答率较低(20%);Booster-Only 拒答率最高(50%),moderation 为 0.401,resilience 82.0。Vaccine-Only 的 harm score 在攻击前后都是 26,其余指标落后。
    • resilience 不用于排名:作者把 Table 1 中 VaccineBooster 重复运行代入式 (9) 得到 81.0,与 Booster-Only 的 82.0 之差小于本文设置的运行间波动。Figure 2 中三个 resilience 跨度为 12.5 分,作者称与附录 C 的约 9 分运行间变化相当,因此不从该面板读出排序。Figure 2 标注的 moderation 为 0.315、0.411、0.401,resilience 为 72.0、69.5、82.0,与 Table 1 一致。
    • 关键词伤害分:Figure 1 的攻击后 harm 为 VaccineBooster 20、Vaccine-Only 26、Booster-Only 19,拒答率为 20%、30%、50%。作者称攻击后关键词 harm score 并不一致上升:VaccineBooster 与 Booster-Only 下降,Vaccine-Only 不变;关键词匹配统计的是预定义词是否出现,因此不把它当作攻击后安全性的独立指标,而把 OpenAI moderation 当作主要的内容安全指标,并与拒答率一起报告。

    嵌入扰动强度 ρ

    Table 2 在 ε=0.1、λ=0.001 下改变 ρ。作者称 ρ 增大时 moderation 与 flagged rate 大体下降,在 ρ=4.0 达到该表最低的 0.221 和 30%;攻击后 harm score 则在 ρ=2.0 最低(20),ρ=4.0 略升到 23。拒答率不随 ρ 单调变化:ρ=0.5 为 40%,ρ=1.0 为 20%,ρ=2.0 与 4.0 为 40%。

    • 测了什么:只改变嵌入扰动强度,四个取值 0.5、1.0、2.0、4.0。
    • 结果:外部内容安全指标的最低点在最强扰动 ρ=4.0;关键词 harm 的最低点在默认 ρ=2.0。
    • 作者的解读:这与“嵌入扰动主要作用于模型生成的内容、而不是强制某一种拒答模板”相一致。若部署主要看 moderation,较大的 ρ 更有吸引力;默认 ρ=2.0 给出最低的关键词 harm score。Figure 3 的图注称更大的 ρ 降低 moderation 和被标记内容,最佳 harm score 在 ρ=2.0。图中横轴标到 4.0,并标有 “Optimal”,正文未给出该标记对应的单独数值。

    梯度衰减强度 λ

    Table 3 在 ρ=2.0、ε=0.1 下取 λ=0.0001、0.001、0.01、0.1。作者称默认 λ=0.001 平衡最好:攻击后 harm 20、拒答率 40%。λ=0.1 的 moderation 最低,为 0.283,flagged rate 也最低,为 20%,但拒答率降到 30%。四个取值上拒答率只在 30% 与 40% 之间来回,harm 分别为 26、20、25、23,moderation 分别为 0.362、0.329、0.338、0.283。

    • 作者的解读:这四次运行不能确立“λ 像 ρ 控制内容安全那样控制拒答保留”。它们显示出的是:试过的最大 λ=0.1 换来内容安全上的变化,同时没有伴随的拒答收益。Figure 4 图注称默认 λ=0.001 平衡 harm 与拒答,大的 λ 更偏向内容安全而不是拒答。
    • 与主比较对照:作者称权重级衰减“主要保留显式拒答”这一角色,依据的是 Table 1 的 Booster-Only,而不是 λ 消融;λ 消融里拒答率不单调。因此作者把它写成证据与之一致的解释,而不是已测得的效应。Figure 5 按各自原尺度画四轴:伤害降低为 100 减攻击后 harm score,拒答保留为攻击后拒答率,OpenAI safety 为 100(1−Mod),总体 resilience 为式 (9) 的原始刻度。图注称 VaccineBooster 在 OpenAI safety 上领先,Booster-Only 在拒答保留上领先,Vaccine-Only 在内容安全轴上最低。

    其他消融与分析

    • 两次独立重复(Table 4、附录 C):同一默认配置,Table 1 行为 Pre-Harm 24、Post-Harm 20、Post-Refusal 20%、Mod. 0.315、Flagged 40%、Resil. 72.0;Tables 2/3 行为 32、20、40%、0.329、40%、81.0。攻击后 harm 与 flagged rate 相同,moderation 差 0.014,攻击前 harm 差 8 分,攻击后拒答率差 20 个百分点(两条回答)。作者称该幅度与 Table 1 中若干方法间差距同阶。
    • 统计:十条提示词下,50% 拒答率的 95% Wilson 区间为 [24%, 76%]。Booster-Only 的 50% 对 VaccineBooster 主运行的 20% 是五条对两条回答,双侧 Fisher 精确检验 p=0.35;对重复运行的 40% 是五条对四条,p=1.00。作者称按常规功效区分这种比例大约需要每个条件四十条提示词,区分 50% 与 40% 需要几百条。
    • 关键词分数的范围:附录 B 称,在所有方法与超参数设置上 harm score 只落在 19–32,相当于两到三个匹配关键词的范围。附录 B 还说明:一条不含所列词、但具体且确实危险的补全会被打成 0;拒答被顺从回答替换后,检测器所依赖的拒答词汇消失,伤害分可以下降。式 (9) 的第二项奖励下降的伤害分,因此 resilience 直接继承这一现象。
    • 攻击前后的拒答:所有报告的方法在攻击前拒答率均为 100%(Table 1);攻击后降到 20%–50%(Table 1)或消融中的 20%–40%(Tables 2、3)。论文未报告对自适应攻击、其他有害比例 p、或其他基座模型的结果。
    • ε:默认 ε=0.1,两次消融都固定它。论文未报告改变 ε 时的指标。
    • 开销:作者给出的是步数级别的前向-反向次数(约四次对一次),未报告墙钟时间以外的逐步耗时;全部实验约三小时、单张 A100。
  5. 有什么可以进一步探索的点?

    作者认为应先扩大提示词集并做多种子平均,当前差异未通过显著性检验。

    作者指出的局限与后续方向

    • 评测规模:摘要与第 1 节写明,评测使用十条提示词、每种配置一次未固定种子的运行,因此把内容安全与拒答之间的权衡报告为观察到的模式,而不是统计上已经分辨的效应。附录 C 称,扩大评测集并对多种子取平均,是作者会对本研究做的第一项改变。(摘要、第 1 节、附录 C)
    • resilience 的构造:第 5 节称其权重为手工设定、未相对外部标准校准;第二项没有上界,关键词伤害分下降时会超过 25,从而和真实改进一样奖励测量现象。附录 B 称该分数继承关键词匹配的这一现象。作者因此只把它当描述性汇总,不用来排名。(第 5 节、附录 B)
    • 关键词 harm score:第 6.2 节称它统计预定义词是否出现,而不是回答在语境中是否真正安全或有害,因而不把它当作攻击后安全性的独立指标。(第 6.2 节)
    • λ 的角色未被消融确立:第 4.5 节与第 7 节称,λ 对拒答率的影响较弱且不单调;“权重级衰减主要保留拒答”主要靠 Table 1 的 Booster-Only 比较,而不是 λ 消融。作者把它写成工作解释,并称确认需要比本文更大的评测集。(第 4.5 节、第 7 节)
    • 统计功效:附录 C 报告,Table 1 中 50% 与 20% 的拒答率差异在双侧 Fisher 精确检验下 p=0.35,与重复运行的 40% 相比 p=1.00;按作者的计算,常规功效下区分这种比例大约需要每条件约四十条提示词,区分 50% 与 40% 需要几百条。(附录 C)
    • 威胁模型与实验实例不一致处的说明:第 5 节写明,500 条毒化样本全部是有害对,把第 3 节的混合实例化为 p=1,而不是动机中的小有害比例;毒化集不含良性任务数据,因此不报告下游任务效用。这是实验设置中的明确限定,不是作者列出的未来工作条目。(第 5 节)

    实验覆盖范围

    • 模型与数据:实验只用 Llama-2-7B,对齐、有害批次和攻击数据都来自 BeaverTails,规模分别为 5,000、1,000 和 500 条(第 5 节)。
    • 攻击形态:模拟攻击是 1 个 epoch、学习率 2×10^−5 的 LoRA 微调,毒化集为纯有害样本,即 p=1;论文写明因此不报告下游任务效用(第 5 节)。
    • 防御比较:主表比较的是同一 3 个 epoch 下的 VaccineBooster、Vaccine-Only 和 Booster-Only;消融只改变 ρ(0.5、1.0、2.0、4.0)或 λ(0.0001、0.001、0.01、0.1),ε 固定为 0.1(Tables 1–3)。
    • 评测协议:固定 10 条有害提示词,temperature 0.7、150-token 预算、无固定种子;默认配置有两次独立的重新训练(Table 4、附录 C)。内容安全的外部指标是 OpenAI moderation score 与 flagged rate,拒答由显式拒答模式判定(第 5 节、附录 A)。
    • 作者讨论过但未纳入实验的做法:相关工作写了事后修复、RepNoise 和 TAR,但实验基线只有 Vaccine-Only 与 Booster-Only;作者称本文停留在对齐阶段这一族,问的是嵌入级与权重级防御合并后是否互相加强(第 2 节)。论文报告了 Fisher 精确检验与 Wilson 区间,未报告多种子平均后的指标。
  6. 总结一下论文的主要内容

    VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。

    VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。

    有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。Vaccine 加固注意力输出嵌入附近的表示,Booster 模拟一步有害权重更新并衰减其影响。作者问的是,二者放进同一个对齐步,是全面更安全,还是在不同安全侧面上权衡。

    每一步先在有害批次上估计梯度差 g_h − g̃_h,再把权重恢复,然后在安全批次上按 Vaccine 扰动注意力嵌入并计算安全梯度,最后使用 g_final = g_s + λ (g_h − g̃_h)。默认 ρ=2.0、ε=0.1、λ=0.001。额外计算只发生在对齐阶段,大约每步四次前向-反向而不是一次,不改用户微调接口,也不增加推理开销。实验在 Llama-2-7B 上用 BeaverTails 对齐 3 个 epoch,再用 500 条纯有害样本微调 1 个 epoch(p=1),于 10 条固定有害提示词上评测。

    • Table 1 的主运行里,攻击前三种方法拒答率都是 100%。攻击后 VaccineBooster 的 OpenAI moderation 为 0.315、拒答率 20%;Booster-Only 拒答率 50%、moderation 0.401;Vaccine-Only 的 harm score 保持 26,moderation 为 0.411。
    • 同一默认配置的另一次运行(Table 4)攻击后拒答率为 40%、moderation 为 0.329。50% 对 20% 的 Fisher 精确检验 p=0.35。作者不用 resilience 排名:Booster-Only 为 82.0,VaccineBooster 两次为 72.0 和 81.0。
    • ρ 从 0.5 增到 4.0 时,moderation 与 flagged rate 大体下降,ρ=4.0 时为 0.221 和 30%;拒答率不单调。λ 跨三个数量级时拒答率只在 30% 与 40% 之间变化,λ=0.1 的 moderation 为 0.283、flagged rate 为 20%,拒答率为 30%。

    作者的结论是:嵌入扰动主要降低被标记的有害内容,梯度衰减与显式拒答保留的对应关系证据较弱,主要来自 Booster-Only 而不是 λ 消融。因此这是一条可供提供方按产品需求调节的方向——更看重内容安全或更看重拒答保留——而不是已经分开的两种职责,也不是统计上已分辨的效应。作者认为下一步应扩大评测集并对多种子取平均。

阅读原文arxiv.org