跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.08901· Aaryaman Kalani·· 23 天前

论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影

The BatchNorm Illusion: Diagnosing Normalization Artifacts in Machine Unlearning Evaluation

AI 导读

论文发现基于 BatchNorm 架构的机器遗忘评测存在一个此前未被记录的混杂因素:对保留数据做一次前向传播、不修改任何权重,就能确定性地改写模型的归一化状态,并逆转表面指标上的遗忘效果。作者将该操作形式化为保权重的固定点算子,并证明其造成的遗忘前后差距可归因于 BN 运行统计量,而非遗忘方法对权重的修改,从而把测量失败与编码器失败区分开。实验显示,该伪影在标准基准的九种方法上最多逆转 78 个百分点的遗忘准确率;攻击者仅用 10 张无标签图像即可恢复大部分被掩盖的准确率;改用严格的 GroupNorm 后,所有方法的伪影降为零。测试的成员推断攻击在重新校准后变化不大,说明评测失败集中在遗忘准确率和线性探测上。

阅读原文arxiv.org