FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
给 HuBERT/WavLM 这类声学基础模型埋后门:背景里一声警笛就能让下游语音识别、声纹验证失灵,微调后仍在
作者提出 FAB 攻击,在无预训练数据假设下向声学基础模型植入后门,使 HuBERT 在物理警报声下 ASR 词错误率达 80.71%(Table 2)。
攻击者仅知晓良性声学基础模型权重,无预训练数据与预训练参数(码本、投影矩阵),对下游任务与微调数据未知(task-agnostic)。
- 声学基础模型(AFM)被广泛微调于语音关键任务,但其供应链后门风险未被充分探索。在攻击者无法获取预训练数据且未知下游任务的受限威胁模型下,如何利用物理可实现的通用非同步触发器向 AFM 植入后门并破坏下游任务,是一个关键问题。
- 作者提出 FAB 攻击,在无预训练数据和码本前提下,利用无重叠辅助数据通过聚类重构伪标签以维持良性掩码预测性能;同时以余弦距离将第 4 层表征拉向固定的全 1 向量,实现输入无关且无需同步的非破坏性后门植入。
- 在 HuBERT 与 WavLM 上评测 9 项 SUPERB 任务显示,警报声触发使 HuBERT 的 ASR 词错误率从良性的 11.4% 升至 98.4%(Table 6),物理双扬声器下达 82.74%(Table 2);剪枝与滤波无法有效消除后门(Table 5)。
- 作者指出端到端过度微调防御开销巨大且仅适用于标注数据充裕的 ASR 任务,对 POR 局限的理论探究留待未来工作;实验仅在 2 个 95M 参数模型上进行,物理评测仅在 204 个样本的 ASR 任务上完成。
- 威胁模型
- 攻击者仅知晓良性声学基础模型权重,无预训练数据与预训练参数(码本、投影矩阵),对下游任务与微调数据未知(task-agnostic)。通过播放实体的天然声音在录音时叠加(physically realizable、input-agnostic、sync-free),激活后门使下游任务性能下降。
- 模型
- HuBERT-baseWavLM-base
- 基准
- LibriSpeechLibri-LightSUPERB
- 指标
- WERPERACCEERDERBLEUSUPERB score
研究者提出 FAB(Foundation Acoustic model Backdoor)攻击,可在不接触预训练数据、不知道下游任务的情况下,向 HuBERT-base 和 WavLM-base 两个声学基础模型植入后门。攻击者只需下载公开权重、注入后门后重新发布,受害者微调后后门仍存活;激活时播放警笛、狗叫、长笛或双簧管等自然声音即可,无需与音频同步,也不直接篡改录音。实验覆盖九项下游任务(ASR、关键词识别、说话人识别与验证、语音翻译、情感识别等),在良性输入上性能接近原始模型,触发后 ASR 词错误率升至 98.4%,物理播放场景下词错误率仍不低于 80%。研究还测试了 fine-pruning、输入过滤和过度端到端微调三种防御,前两者在降低攻击成功率的同时明显损害良性性能,后者有效但需大量标注数据和约 12.8 倍训练时间。
推荐理由论文给出在无预训练数据、任务未知条件下对声学基础模型植入后门的方法,并量化了其在九项下游任务和物理场景中的影响。
深度解读
这篇论文试图解决什么问题?
在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。
论文试图解决在弱威胁模型下,如何向声学基础模型(AFM)植入可经由物理天然声音触发、且对未知下游任务普遍生效的后门。
- 场景与重要性:自监督学习使声学基础模型(如 HuBERT、WavLM)被广泛下载并微调于语音识别、说话人验证等安全关键任务;若被植入后门的模型进入开源供应链,将威胁下游系统安全。
- 现有方法的不足:作者称,以往语音后门多针对特定下游任务、依赖完整数字控制或知晓预训练数据,且多要求触发器严格同步;NLP 领域的基模后门方法则多依赖预训练数据或私有码本。
- 威胁模型:
- 目标:植入通用后门,在良性音频下保持下游效用,在叠加触发器时破坏下游任务性能,属于无目标后门(untargeted backdoor)。
- 知识:攻击者仅知晓良性声学基础模型网络权重,无法访问预训练数据集,也不知道预训练所用的码本和投影矩阵。
- 能力:攻击者不知道下游任务和微调数据集(task-agnostic);无法直接篡改接收端麦克风录制的数字音频,仅能在物理环境中播放不引人注目的天然声音(如警报声、狗叫声),与用户语音混合录制,且无需时间对齐(sync-free、input-agnostic、physically realizable、non-destructive)。
- 受害系统:从公开平台下载后门基模并在自身私有数据集上完成微调的下游应用系统。
- 论文的提出:论文提出了 Foundation Acoustic model Backdoor(FAB)攻击框架,仅利用无重叠的公开辅助数据,即可向声学基础模型注入可经受微调并在物理世界激活的后门。
有哪些相关研究?
论文梳理了传统模型、基础模型及语音领域的后门研究,并对比了 NLP 的 POR 迁移后门基线。
相关研究主要涵盖针对传统模型的后门、针对基础模型的后门以及语音领域的后门攻击三大方向。
计算机视觉与自然语言处理后门
- BadNet 与隐蔽触发器:Gu et al.(2017)提出了针对分类模型的 BadNet;随后研究(如 Li et al., 2020)尝试提高触发器的不可察觉性;Chen et al.(2021)针对特定 NLP 任务提出了保持语义的后门。这些方法多针对特定任务且假设攻击者能访问训练数据。
- 基础模型后门:Zhang et al.(2023)研究了在微调后仍能存活的预训练模型后门;Shen et al.(2021)提出 Predefined Output Representation(POR),通过自蒸馏在文本基础模型中植入后门。作者指出,以往基础模型后门通常假定攻击者可获得预训练数据集。
语音领域的后门攻击
- 输入特定型后门:Cai et al.(2022)、Lee et al.(2023)等探索了针对输入定制触发器或生成恶意音频的攻击。作者指出这类攻击不切实际,因为攻击者需要完整控制输入;且 Lee et al. 仅在语音识别单一任务上评测。
- 输入无关型后门:Koffas et al.(2022)、Shi et al.(2022)等探索了通用音频触发器(如超声波)。作者指出这类方法仅适用于特定下游任务模型,假设已知预训练数据,且部分方法强假设攻击者能在音频起始位置严格同步。
对比基线与基准
- 基线方法:因音频基模领域此前缺乏同等假设的攻击,论文将 NLP 领域的 POR(Shen et al., 2021)适配到音频领域作为主要对比基线;并在防御评估中对比了 Fine-pruning(Liu et al., 2018)、Input filtration(Carlini et al., 2016)和 Excessive fine-tuning(Cui et al., 2022)。
- 评测基准:下游任务基于 SUPERB 基准(Yang et al., 2021)及 HuBERT 原文设立的 ASR 任务;辅助数据取自 Libri-Light(Kahn et al., 2020)。
本文的定位区别:作者称,FAB 是在不访问预训练数据、码本及未知下游任务的弱威胁模型下,实现可经受微调并在物理世界被通用非同步天然声音激活的声学基础模型后门攻击。
论文如何解决这个问题?
FAB 通过重构伪标签维持良性掩码预测损失,并用余弦距离将中间层特征映射至全 1 向量以破坏触发输入表征。
FAB 框架通过联合优化良性自监督任务损失与后门表征破坏损失,在无需原始预训练数据和预训练参数的前提下将后门注入声学基础模型。
总体目标与损失函数
FAB 接收预训练模型权重、无重叠辅助数据集与触发音频,通过复合损失函数进行端到端优化: ℒFAB = κ · ℒBack + ℒBenign 公式中 ℒBack 针对带触发样本操纵特征表征,ℒBenign 针对良性样本维持模型正常表征能力,κ 为平衡两项损失的正超参数(实验中通过线性搜索设为 1000)。
良性效用维持与缺失参数近似
为在缺失原始预训练数据与参数的条件下保持良性效用,FAB 重新近似了自监督掩码预测训练所需的信息:
- 缺失参数近似:由于预训练的投影矩阵与码本不公开,FAB 提取辅助数据在基础模型最后一层的特征,采用 k-means 聚类(设置聚类数 k 为公开默认值),将聚类中心作为近似的码本嵌入向量;将未知的投影矩阵直接近似为单位矩阵。
- 预先伪标签标注:在后门训练前,FAB 将辅助数据中每个音频帧对应的特征指派给最近的聚类中心,生成离线伪标签。
- 良性自监督训练:对输入的良性音频帧计算类似 BERT 的掩码 token 预测对数似然损失:
ℒBenign = ∑X ∈ 𝒳aux ∑t ∈ M log pf(zt | X̃, t) 公式中 M 为被掩码的音频帧集合,pf 为模型预测掩码帧属于离线伪标签类别 zt 的概率分布。
后门表征操纵与触发设计
为使攻击对未知下游任务普遍生效,FAB 将带触发输入的表征与输入内容彻底剥离:
- 表征距离最小化:定义后门损失 ℒBack = D(ô, v),其中 D 为余弦距离函数,目标向量 v 设定为固定的全 1 向量。作者认为固定的无意义向量能破坏所有下游任务的表征质量。
- 关键层选择:FAB 选择操纵 Transformer 编码器的第 4 层(即 AFM 的第 5 层,第 0 层为 CNN 特征提取器),使表征向后级联传播,从而同时兼顾仅使用最后一层表征与使用全层加权求和的微调范式。
- 触发器叠加机制:选用警报声、狗叫声等天然声音,将其按固定信噪比(SNR 设为 10 dB)随机叠加在辅助样本的任意时间起点,从而确保触发器具备非同步(sync-free)、输入无关(input-agnostic)与物理可实现特性。
优化与训练细节
- 训练数据与批次:从 Libri-Light 小型切分中随机抽取 20%(约 115 小时音频)作为辅助数据;每个批次大小为 64,由 32 个良性样本及其对应添加触发器的变体拼接而成。
- 优化参数:采用 Adam 优化器训练 1 个周期,学习率设为 1.5e-5,β1 = 0.9,β2 = 0.98,权重衰减设为 0.01。
论文做了哪些实验?
论文在 HuBERT 和 WavLM 上评测了 9 项任务、物理场景及防御,触发器导致多任务性能出现明显下降。
实验设置
- 被测模型:HuBERT-base(在 LibriSpeech 上预训练,12 层 Transformer,95M 参数)与 WavLM-base(官方发布权重,12 层 Transformer,95M 参数)。
- 数据集与基准:预训练与微调采用 LibriSpeech(ASR 默认微调使用 10 小时带标签语音);辅助数据使用 Libri-Light small 切分的 20%(约 115 小时音频);下游任务采用 SUPERB 基准中的 8 项任务及 HuBERT 原文 ASR 任务。
- 任务与指标:覆盖 4 类 9 项下游任务:ASR(WER↓)、PR(PER↓)、KS(ACC↑)、SID(ACC↑)、ASV(EER↓)、SD(DER↓)、IC(ACC↑)、ST(BLEU↑)、ER(ACC↑),以及归一化的 SUPERB 分数。
- 对比基线与触发设置:攻击基线为自然语言处理领域的 POR;防御对比包括 Fine-pruning、Input filtration 和 Excessive fine-tuning;默认触发器为警报声(SNR 为 10 dB),同时测试长笛、双簧管和狗叫声。
- 评测方式与样本量:下游微调采用任务默认配方(ASR 默认 25k 次迭代);物理实验采用 iPad Pro M2 播放、MacBook Pro 录音,评测 204 个随机选取的 ASR 样本;论文未报告多次重复实验的标准差。
主结果
表格较宽,可左右滑动
模型与输入条件 ASR (WER↓) PR (PER↓) KS (ACC↑) ASV (EER↓) ER (ACC↑) HuBERT 良性模型 fθ (输入 X) 11.4 5.6 95.7 5.8 62.0 HuBERT 后门模型 f̂θ (输入 X) 11.4 5.4 94.3 5.5 61.3 HuBERT 后门模型 f̂θ (触发 X̂) 98.4 99.8 28.0 31.3 34.7 WavLM 良性模型 fθ (输入 X) 10.4 4.8 97.0 4.5 62.5 WavLM 后门模型 f̂θ (输入 X) 11.4 4.6 93.9 5.0 59.7 WavLM 后门模型 f̂θ (触发 X̂) 98.7 99.8 25.0 20.4 45.4 注:数据源自 Table 6 与 Table 9;因列数限制,省略了 IC、ST、SD、SID 任务。
- 良性效用保持:作者称,后门模型在良性音频上的表现与良性模型相当,SUPERB 分数接近 1.0,表明后门在未激活状态下保持隐蔽。
- 任务无关攻击效果:作者称,输入叠加警报声触发器后,所有下游任务性能均出现明显下降,部分任务性能降至接近随机猜测水平(如 ASR 和 PR)。
- 跨模型一致性:作者称,FAB 在 HuBERT 和 WavLM 两种声学基础模型上均表现出一致的攻击效果。
物理世界可实现性评估
- 测试设置:在真实房间中以 iPad Pro M2 扬声器播放语音、MacBook Pro 麦克风相距 1 米录音,测试 204 个样本在 ASR 任务上的 WER(Table 2)。
- 实验结果:良性样本经物理录音后,HuBERT 良性模型 WER 为 15.30%,后门模型为 16.56%;在单扬声器播放带触发样本时,后门模型 WER 为 80.71%(良性模型为 25.11%);在双扬声器分别播放良性语音和警报声时,后门模型 WER 为 82.74%(良性模型为 24.84%)。
- 作者解读:作者称,即使在声学信号经过空中传播且触发器由独立扬声器播放的完整威胁模型下,FAB 依然导致超过 80% 的单词被错误识别。
与 POR 基线对比
- 测试设置:在 HuBERT 的 ASR 任务上对比良性模型、适配后的文本基模后门方法 POR 及 FAB(Table 3)。
- 实验结果:在良性输入 X 下,良性模型 WER 为 11.4%,POR 为 14.2%,FAB 为 11.4%;在触发输入 X̂ 下,良性模型 WER 为 14.4%,POR 为 59.4%,FAB 为 98.4%。
- 作者解读:作者称,POR 无法在不大幅牺牲良性表现的前提下实现高攻击成功率,而 FAB 在保持良性准确率的同时取得了更高的错误率。
防御方法评估
- 测试设置:在 ASR 任务上评估 Fine-pruning(剪枝率 0%–60%)、Input filtration(过滤率 0%–40%)以及端到端过度微调(10h–100h 数据,80k 次更新)(Table 5、Figure 4)。
- 实验结果:Fine-pruning 剪枝 60% 神经元后触发 WER 虽降至 37.3%,但良性 WER 变为 23.4%;Input filtration 过滤 40% 帧时良性 WER 变为 83.2% 而触发 WER 仍为 99.7%(Table 5)。过度微调使用 80 小时以上标注数据时可将触发 WER 压低至 20% 以下(Figure 4)。
- 作者解读:作者称,剪枝与输入过滤无法在不破坏良性效用的前提下消除后门;过度微调虽然有效,但计算成本增加约 12.8 倍,且仅适用于拥有大量标注数据的任务。
其他消融与分析
- 触发声音类型:长笛、双簧管和狗叫声在 HuBERT ASR 任务上的触发 WER 分别为 99.7%、98.5% 和 96.0%(Table 8)。
- 复合触发器:哔哔声接狗叫声触发使 ASR WER 达到 81.9%,而反序组合为 12.5%,单音为 11.9% 与 14.9%(Table 4)。
- 信噪比(SNR):注入 SNR 为 20 dB 且激活 SNR 为 10 dB 时,ASR WER 为 53.7%,激活 SNR 为 20 dB 时为 93.4%(Table 10)。
- 攻击层选择:选择操纵第 4 层在 ASR 上的触发 WER 为 98.4%,而第 0 层为 14.3%,第 12 层为 96.2%(Table 7)。
- 辅助数据集规模:使用 25%、50%、100% 辅助数据时,ASR 触发 WER 分别为 25.4%、81.6% 和 98.4%(Table 11b)。
- 目标表征向量:目标向量设为全 1 向量时 ASR 触发 WER 为 98.4%,设为正态分布向量时为 92.2% 至 97.3%(Table 11c)。
负面结果与例外
- 在 Table 7 中,操纵第 0 层(CNN 特征提取器)注入后门时,ASR 触发 WER 仅为 14.3%,PR 触发 PER 仅为 8.1%,后门效果较差;作者未对此给出详细机理分析。
- 在 Table 11b 中,当辅助数据集压缩至 25% 时,ASR 触发 WER 降至 25.4%,攻击效果出现大幅下降。
有什么可以进一步探索的点?
作者指出过度微调防御开销大且适用受限,对 POR 的理论分析留待未来;实验未覆盖大尺寸模型及多语言。
作者指出的局限与后续方向
- 过度微调防御的开销与适用性:过度微调需要大量的计算资源和标注训练数据,并且主要适用于 ASR 任务,在微调数据较少或非端到端微调的任务上适用性有限(Section 6、Section 1)。
- POR 局限性的理论分析:作者指出将对 POR 基线在音频领域无法平衡攻击成功率与良性效用的理论原因留待未来工作进行探索(Section 5.4)。
- 现有基模防御不适用:视觉和文本基础模型的后门防御依赖类别针对性假设与不同的输入特征,无法直接用于防御 FAB(Section 6)。
- 呼吁开发新型防御:作者指出需要开发新型通用防御以对抗针对声学基础模型的后门攻击,并计划通过开源代码辅助防御研究(Section 7)。
实验覆盖范围
- 被测模型仅包含 HuBERT-base 与 WavLM-base 共 2 个 95M 参数的模型(Section 4)。
- 辅助训练数据集仅使用了 Libri-Light 数据集小型切分中的 20%(约 115 小时)(Section 4)。
- 物理录音实验仅在 ASR 单一任务上的 204 个样本中完成,且仅测试了 iPad Pro M2 与 MacBook Pro 设备(Section 5.3)。
- 防御评测仅在 ASR 单一任务上测试了 Fine-pruning、Input filtration 和 Excessive end-to-end fine-tuning 共 3 种方法(Section 6)。
- 论文未报告各项实验多次随机重复运行的标准差或统计显著性指标(Section 4、Section 5)。
总结一下论文的主要内容
论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。
- 定位与问题:论文提出了 Foundation Acoustic model Backdoor(FAB),探讨在攻击者无预训练数据、未知下游任务且无法数字篡改输入的弱威胁模型下,声学基础模型面临的供应链后门安全威胁。
- 核心方法设计:利用无重叠的辅助语音数据通过聚类重构伪标签,以掩码预测损失保障良性输入效用;同时利用余弦距离将中间层(第 4 层)表征拉向固定的全 1 向量,并以固定信噪比随机叠加天然声音作为触发器,实现输入无关与无需同步的后门植入。
- 关键实验结果:在 HuBERT 模型上,警报声触发使 9 项下游任务普遍退化,其中 ASR 任务 WER 从良性的 11.4% 升至 98.4%,PR 任务 PER 从 5.4% 升至 99.8%(Table 6);在 WavLM 上 ASR WER 同样达到 98.7%(Table 9)。
- 物理与基线对比:在 iPad 播放与 MacBook 录音的真实物理场景下,单扬声器与双扬声器播放触发器分别使 ASR WER 达到 80.71% 与 82.74%(Table 2);性能优于 NLP 迁移基线 POR(触发 WER 为 59.4%,Table 3)。
- 防御评估与局限:Fine-pruning 与输入过滤防御在降低攻击效果的同时大幅影响良性准确率(Table 5);端到端过度微调虽可降低错误率至 20% 以下,但带来约 12.8 倍计算开销且仅适用于数据丰富的 ASR 任务(Figure 4)。
- 作者结论与呼吁:作者认为主流声学基础模型在现实物理条件下存在潜在的后门风险,呼吁学术界与工业界针对基础模型开发更低成本、跨任务通用的新型防御机制。