研究:众包微调数据投毒可放大专有指令抽取
注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。
- 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
- 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
- 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。
构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。
在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。
论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。
论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。