攻击arXiv 2609.24994
BAM 反馈编码实现推理时隐蔽的智能体通信
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
- arXiv
- 2609.24994
- 发表
- 层
- 模型层
- 场景
- 多智能体
- 攻击者
- 黑盒
- 测试
- Phi-4-14B-Instruct、Llama-3.1-8B、Qwen-3.5-9B-Base 等 6 个
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。