攻击arXiv 2609.10611
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
- arXiv
- 2609.10611
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- OPT-6.7B、LLaMA-13B、Pythia-6.9B 等 12 个
- 攻击提取与窃取
摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。