可解释性arXiv 2609.11780
用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理
检验权重谱度量能否代理成员推断泄漏
- arXiv
- 2609.11780
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- MLP-1×4096、MLP-2×1024、MLP-2×2048 等 11 个
- 攻击提取与窃取
摘要作者认为谱度量与泛化差距互补,有望用于无数据的模型级筛查。
作者在 MLP 上检查 WeightWatcher 谱统计是否与 online LiRA 同向,以便不看数据、不训练 shadow 模型就做模型级成员风险筛查。放出前的审计要知道训练成员会不会被认出来。LiRA 依赖大量 shadow 模型,候选一多就难以逐个跑。