SLDR:通过选择性层恢复与动态路由防御恶意微调
SLDR: Defending Against Malicious Fine-tuning via Selective Layers Recovery and Dynamic Routing
AI 导读
研究者提出 SLDR,一种针对微调即服务场景中恶意微调削弱模型拒答行为的后微调防御方法。该方法先重新审视逐层安全诊断,发现安全敏感度具有符号性,不同层的缩放会增强、削弱拒答或影响很小;SLDR 据此只在符号谱中敏感度最高和最低的层上训练 LoRA 恢复适配器,并用基于表征的动态路由推理,仅对恶意查询激活该适配器。在四种模型架构、五个下游任务和四个有害基准上,SLDR 大幅降低有害输出并保持下游效用;在 Llama3.1/SST2 上,平均有害分数从 11.54 降至 0.08,同时保持下游准确率,在最高 0.9 的投毒比例下有害分数仍接近零。代码已开源于 https://github.com/Stardust457/SLDR。