跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 3 篇
  1. 攻击arXiv:2610.09819 ·

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出FAB攻击,向声学基础模型植入可由环境声触发的后门

    测试
    HuBERT-base、WavLM-base训练与数据层
    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
    • 定位与问题:论文提出了 Foundation Acoustic model Backdoor(FAB),探讨在攻击者无预训练数据、未知下游任务且无法数字篡改输入的弱威胁模型下,声学基础模型面临的供应链后门安全威胁。
    • 核心方法设计:利用无重叠的辅助语音数据通过聚类重构伪标签,以掩码预测损失保障良性输入效用;同时利用余弦距离将中间层(第 4 层)表征拉向固定的全 1 向量,并以固定信噪比随机叠加天然声音作为触发器,实现输入无关与无需同步的后门植入。
    • 关键实验结果:在 HuBERT 模型上,警报声触发使 9 项下游任务普遍退化,其中 ASR 任务 WER 从良性的 11.4% 升至 98.4%,PR 任务 PER 从 5.4% 升至 99.8%(Table 6);在 WavLM 上 ASR WER 同样达到 98.7%(Table 9)。
    • 物理与基线对比:在 iPad 播放与 MacBook 录音的真实物理场景下,单扬声器与双扬声器播放触发器分别使 ASR WER 达到 80.71% 与 82.74%(Table 2);性能优于 NLP 迁移基线 POR(触发 WER 为 59.4%,Table 3)。
    • 防御评估与局限:Fine-pruning 与输入过滤防御在降低攻击效果的同时大幅影响良性准确率(Table 5);端到端过度微调虽可降低错误率至 20% 以下,但带来约 12.8 倍计算开销且仅适用于数据丰富的 ASR 任务(Figure 4)。
    • 作者结论与呼吁:作者认为主流声学基础模型在现实物理条件下存在潜在的后门风险,呼吁学术界与工业界针对基础模型开发更低成本、跨任务通用的新型防御机制。
    完整解读
  2. 攻击arXiv:2610.07723 ·

    研究者提出答案侧后门:让模型自生成触发词绕过安全拒答

    提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答

    测试
    Llama-2-7B-chat-hf、Mistral-7B-Instruct-v0.3、Gemma-7B-it 等 4 个训练与数据层
    摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
    • 定位:针对现有大模型后门依赖用户输入触发特征的假设,提出将后门触发词嵌入历史助手回答中的回答端后门攻击。
    • 问题与动机:现有多轮安全防护假定对抗信号来自外部用户查询,缺乏对模型自身历史回复的审查,存在防御盲区。
    • 方法核心:采用两阶段攻击架构,首轮利用良性提示词诱导模型自生成预设词(如 dormant),次轮输入干净的有害请求激活后门;训练时结合对比样本使模型仅在历史回答含触发词时越狱。
    • 主要实验结果:在 4 款开源模型上,5% 投毒率下 ASR 达 83.78%–100.00%(Mistral 与 Gemma 达 100.00%),ACCth 维持在 82.67%–100.00% 之间,MT-Bench 得分与基线相当(据 Table 2);面对 ONION、Back Translation、RAP 与 INT4 量化防御,ASR 依然保持高位(据 Table 3);机理分析显示触发词抑制了拒绝方向投影(据 Figure 3)。
    • 启示与思考:作者认为安全防护不能将历史上下文默认为可信数据,多轮安全对齐与防御机制亟需覆盖模型自身生成的内容。
    完整解读
  3. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了