- 分析与理论arXiv 2609.33898
研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
- arXiv
- 2609.33898
- 发表
- 场景
- 模型与 API
- 攻击提取与窃取
摘要效用匹配下,三种高效训练都伴随更高的隐私与对抗脆弱性及更尖的损失几何。
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
- 防御arXiv 2609.23596
StyleAT:用对抗训练防御人脸识别的语义攻击
提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击
- arXiv
- 2609.23596
- 发表
- 场景
- 模型与 API
摘要BoundStyle 用 StyleGAN3 有界潜编辑快速攻击 FR。
StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。
- 攻击arXiv 2609.27124
Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
- arXiv
- 2609.27124
- 发表
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
已经到底了