攻击arXiv 2609.10611
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
- arXiv
- 2609.10611
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- OPT-6.7B、Pythia-6.9B、LLaMA-13B 等 12 个
- 攻击提取与窃取
摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。