防御arXiv 2610.10345
SLDR:通过选择性层恢复与动态路由防御恶意微调
提出 SLDR,用选择性层恢复与动态路由防御恶意微调
- arXiv
- 2610.10345
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Llama3.1-8B-Instruct、Llama3-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
摘要作者称 SLDR 能压低有害输出并保持下游效用。
SLDR 是针对恶意微调的微调后防御:在已对齐模型上做有符号层探测,只在敏感分数最大与最小的两层训练 LoRA,再用 lmax 的最后 token 表示决定是否启用适配器。