摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
- 攻击arXiv 2609.27124
Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
- arXiv
- 2609.27124
- 发表
- 场景
- 模型与 API
- 攻击者
- 灰盒
摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
- 攻击arXiv 2609.00873
研究提出 Q-Skew:利用 token 级记忆不对称对微调扩散语言模型做成员推断
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
- arXiv
- 2609.00873
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要Q-SKEW 用 token 损失差的右偏区分微调 DLM 成员,并可辅助 PII 排序。
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。
- 攻击arXiv 2609.09865
CGMIA:用成员推理攻击检测代码生成基准的数据泄漏
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
- arXiv
- 2609.09865
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
- 攻击arXiv 2609.33136
Leaky Students:针对 on-policy distillation 的成员推断攻击
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
- arXiv
- 2609.33136
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提取与窃取
已经到底了