攻击arXiv 2609.10611
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
- arXiv
- 2609.10611
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- OPT-6.7B、Pythia-6.9B、LLaMA-13B 等 12 个
- 攻击提取与窃取
摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出 FUSE 框架,评测大语言模型的化生危险能力
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。