防御arXiv 2610.01788
SAGE:基于相似度从少量已验证样本中清洗中毒训练数据
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
- arXiv
- 2610.01788
- 发表
- 场景
- 模型与 API
- 被测模型
- ResNet-18、VGG-16
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
提出 VERITAS,用双边背书剪除本地隐私图学习中的投毒节点
VERITAS 是面向本地差分隐私图学习的投毒防御协议,按 trust-but-verify 在保持 ϵ-LDP 的同时剪除伪造节点。
提出 FedMAST,用多轴结构痕迹检测并遏制联邦学习后门
提出企业级检测系统 ADR,识别编程 Agent 的提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。