防御arXiv 2609.36862
VaccineBooster:面向有害微调对齐的混合扰动防御
提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调
- arXiv
- 2609.36862
- 发表
- 场景
- 模型与 API
- 测试
- Llama-2-7B
摘要VaccineBooster 把两种对齐阶段扰动合在一步里,内容更安全但拒答保留更少。
VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。