攻击arXiv 2609.35699
论文:蒸馏防御在蒸馏后强化学习下易被攻破
提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御
- arXiv
- 2609.35699
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
摘要更现实的蒸馏攻击是蒸馏后再 RL。
这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。