跳到正文
原文
arXiv· arXiv:2609.39279· Jiaqing Li, Shide Zhou, Zhibo Zhang, Yuxi Li, Tianlong Yu, Kailong Wang·· 13 小时前

FDCU:用双重约束子空间投影抵御机器遗忘后的重训练攻击

Faithful Dual-constrained Erasure for Robust LLM Safety Alignment

AI 导读

研究提出 FDCU,一种双重约束子空间投影框架,用于解决大语言模型机器遗忘后经良性微调即可恢复有害行为的重训练攻击问题。作者分析遗忘的优化动态后认为,脆弱性来自浅层对齐:模型并未真正擦除目标知识,而是激活原本休眠的参数充当伪抑制器,在完整的恶意表征外形成脆弱的抑制外壳。FDCU 通过逐元素双重掩码规则限制参数更新,用 Fisher Information 保留通用知识流形,并用最小功能干预原则(PMFI)禁止伪抑制器异常激活。在特定知识擦除与安全输出控制任务上,FDCU 在保持近乎无损通用能力的同时,取得了对重训练攻击的 state-of-the-art 鲁棒性。

阅读原文arxiv.org