跳到正文
原文
arXiv· arXiv:2609.39866· Kemou Li, Qizhou Wang, Yue Wang, Fengpeng Li, Zhuan Shi, Negar Rostamzadeh, Golnoosh Farnadi, Masashi Sugiyama, Jiantao Zhou·· 1 天前

研究者提出梯度封堵实现 LLM 发布前的预防性遗忘

Preemptive LLM Unlearning against Forbidden Capability Acquisition via Gradient Sealing

AI 导读

研究者提出梯度封堵(gradient sealing)方法,用于在开放权重 LLM 发布前阻止下游微调重新习得被禁能力。作者先验证现有回顾式遗忘方法在发布前防护上不足:即使当前输出已抑制被禁能力,被禁领域数据仍能通过内部通路产生梯度,使能力在后续微调中被重新获得。梯度封堵的原理是把相关预激活推入负区间,使 ReLU 族激活的导数变为零或接近零,从而阻断这些通路。在多个 LLM 系列上的实验显示,该方法对下游能力习得的抵抗强于回顾式基线。

阅读原文arxiv.org