跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.33985· Sae Furukawa·· 4 天前精选关注度78

研究:众包微调数据投毒可放大专有指令抽取

The Privacy Fallacy of Crowdsourced Fine-Tuning: Extracting Proprietary Data via Topic-Based Poisoning

AI 导读

研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。

论文速读

问题
众包收集 SFT 数据虽能降低成本,但也让不可信用户能向微调流程投毒。作者关注一个此前少被研究的隐私风险:恶意用户能否用少量投毒数据,放大对其他人贡献的、攻击者未知的指令的抽取。
方法
攻击者只贡献少量下游 SFT 样本,且部署模型只返回文本。作者提出用 topic anchors(领域/主题/子主题)作为抽取查询,把「抽取查询→问题」的配对混入投毒样本,使模型学会按主题生成问题;再用代理模型和参考数据挑选投毒锚点,并在部署后用代理模型的 NLL 分数自适应分配查询预算。
实验与结果
在四个模型和两个数据集上,投毒普遍提高抽取率。仅 50 条投毒样本时,Qwen2.5-14B 在 OpenMathInstruct 上的近逐字抽取达到无投毒基线的 3.71 倍,Llama-3.1-8B 在 AceReason 上为 3.08 倍;该攻击也优于恶意 provider 后门基线。数据过滤大多无效,最好的 CVDD 在 F-1 上仅 0.378。用抽取指令蒸馏可恢复目标模型相当一部分下游性能。
局限与可以继续做的
投毒在 hosted-interaction 场景下效果弱于直接提交;prompt masking 会降低近逐字泄漏但未消除风险。在 Finance Alpaca 上,Qwen 模型的良性 SFT 抽取反而最高,作者归因于通用指令更易合成、更短且可能已在预训练中见过。作者呼吁需要能识别这类对训练数据隐私有潜在影响的众包样本筛查方法。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文给出仅靠 2% 众包投毒样本放大微调数据抽取的具体倍数,并说明现有过滤方法难以识别这类样本。

阅读原文arxiv.org