FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵
作者提出 FAB 攻击,在无预训练数据假设下向声学基础模型植入后门,使 HuBERT 在物理警报声下 ASR 词错误率达 80.71%(Table 2)。
- 98.4%HuBERT 在 SUPERB ASR 任务上加警报声触发时的 WER(Table 6)
- 11.4%HuBERT 后门模型在 SUPERB ASR 任务良性输入下的 WER(Table 6)
- 80.71%HuBERT 在单扬声器物理录音警报声触发下的 ASR WER(Table 2)
在无预训练数据且未知下游任务的弱威胁模型下,如何向声学基础模型注入可物理触发的通用后门。
论文梳理了传统模型、基础模型及语音领域的后门研究,并对比了 NLP 的 POR 迁移后门基线。
FAB 通过重构伪标签维持良性掩码预测损失,并用余弦距离将中间层特征映射至全 1 向量以破坏触发输入表征。
论文在 HuBERT 和 WavLM 上评测了 9 项任务、物理场景及防御,触发器导致多任务性能出现明显下降。
作者指出过度微调防御开销大且适用受限,对 POR 的理论分析留待未来;实验未覆盖大尺寸模型及多语言。
论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。