防御arXiv 2610.01788
SAGE:基于相似度从少量已验证样本中清洗中毒训练数据
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
- arXiv
- 2610.01788
- 发表
- 场景
- 模型与 API
- 被测模型
- ResNet-18、VGG-16
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
提出 VERITAS,用双边背书剪除本地隐私图学习中的投毒节点
VERITAS 是面向本地差分隐私图学习的投毒防御协议,按 trust-but-verify 在保持 ϵ-LDP 的同时剪除伪造节点。
提出 FedMAST,用多轴结构痕迹检测并遏制联邦学习后门
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。