攻击arXiv 2609.33985
研究:众包微调数据投毒可放大专有指令抽取
提出主题锚点投毒,放大众包微调后的专有指令提取
- arXiv
- 2609.33985
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 4 个
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出主题锚点投毒,放大众包微调后的专有指令提取
摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。