防御arXiv 2609.39866
研究者提出梯度封堵实现 LLM 发布前的预防性遗忘
提出 GSU 在发布前封堵敏感门梯度,抵抗下游微调获取禁止能力
- arXiv
- 2609.39866
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- Llama-3.2-1B、Llama-3.2-3B、Llama-3.1-8B 等 7 个
摘要GSU 在发布前封堵 SiLU 门的获取梯度,并在 TOFU 与 WMDP 上降低下游微调得分。
Gradient-Sealed Unlearning(GSU)是一种发布前的 preemptive unlearning:不删除模型里已经有的能力,而是让指定禁止域能力更难被发布后的微调获取。