跳到正文
原文
arXiv· arXiv:2608.05045· Yuxuan Huang·· 2026-08-06

Gradient Immunity 提出 USG:在开放权重发布时阻断恶意微调梯度

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

AI 导读

论文提出 Unidirectional Safety Gate(USG),用于作者所称的“部分保护开放权重发布”(PPOW)场景:大部分权重仍可训练,但发布时保留少量安全关键组件。USG 由 Null Space Cubic Layer 与 Inverse Adapter 组成,插入在最后一层 Transformer 之后;下游微调时,三次层抑制或阻断隐藏状态落入校准保护区域的有害样本梯度,Inverse Adapter 则恢复基础模型的前向行为。防御方用自己掌握的有害数据校准阈值,使保护能泛化到邻近的分布内有害样本。

阅读原文arxiv.org