跳到正文
原文
arXiv:可解释性· arXiv:2609.16229· Pingzhi Li·· 17 天前

ARIA:用稀疏自编码器实现测试时机器遗忘

Test-Time Unlearning via Sparse Autoencoder

AI 导读

作者提出 ARIA(autoencoder-gated inference-time unlearning),一种不改动模型权重的测试时遗忘方法,只在生成进入遗忘相关状态时门控对目标知识的访问。ARIA 用稀疏自编码器(SAE)潜变量训练轻量线性检测器,再对触发状态施加可解释的干预,测试时开销可忽略。在 TOFU、R-TOFU 和 WMDP 上,ARIA 在思考模型 DeepSeek-R1-Distilled-Qwen-1.5B 与指令模型 Gemma-3-1B-it 上均改善了遗忘与保留的权衡,例如显著降低 WMDP-cyber 遗忘集准确率,同时 MMLU 与遗忘前模型相差在 1% 以内。

阅读原文arxiv.org