跳到正文
10月8日 · 周四

供应链安全 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了