跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.10627· Abdullah Caglar Oksuz·· 23 天前

SoK 综述:可解释性 AI 如何成为机器学习隐私攻击面

SoK: Privacy Attacks on Machine Learning via Explainable AI

AI 导读

这篇 SoK 系统梳理了 25 项利用模型解释输出实施隐私攻击的研究,涵盖模型窃取、成员推断和模型反演,并将属性推断视为部分反演。作者指出,现有工作常只按黑盒或白盒标注,掩盖了对手实际获得的解释信号差异,因此把模型知识与解释获取分开,归纳出五条路径:目标方发布、攻击者自行推导、二次披露、特权访问和公开全局产物。在这些路径下,解释会降低窃取成本,通过解释统计量、recourse 距离和解释引导的鲁棒性暴露成员信号,并支持对私有输入做空间或代数重建。

阅读原文arxiv.org