防御arXiv 2609.16229
ARIA:用稀疏自编码器实现测试时机器遗忘
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
- arXiv
- 2609.16229
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出针对微调 TTS 的黑盒成员推断攻击
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
提出用邻居分数替代参考模型的单轮成员推断
本文研究 one-round 成员推断:只有一个目标模型、不能再训练参考模型时,如何仍做逐样本校准,并用于单次运行的 DP 审计。