攻击arXiv 2609.33136
Leaky Students:针对 on-policy distillation 的成员推断攻击
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
- arXiv
- 2609.33136
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-1.7B、Qwen3-4B、Qwen3.5-2B 等 5 个
- 攻击提取与窃取
提出 Leaky,用新鲜轨迹的 token 对数概率差推断 OPD 训练记录成员身份
提出 CGMIA,检测代码生成基准样本是否泄漏进训练集
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。