CodecAttack:在音频编解码器潜空间构造对抗扰动,绕过有损压缩防御
Codec-Robust Attacks on Audio LLMs
CodecAttack在神经编解码器隐空间优化扰动,在三款音频大模型和Opus中等码率下达到85.5%平均ASR。
攻击者目标为目标注入(targeted injection),将隐藏命令嵌入正常载体音频,迫使目标Audio LLM输出攻击者指定的字符串;攻击者拥有目标模型与神经编解码器的白盒访问权限以进行离线梯度计算,但不修改目标模型的权重、架构或推理管线;通过全数字有损编解码信道(Opus、MP3、AAC等)传输音频,上传后无需后续交互。
- 现实语音智能体部署均经过有损编解码器传输,既有波形对抗扰动在压缩后被丢弃。如何在外部攻击者设定下,不修改受害者模型结构与推理管线,生成能够穿透数字编解码信道的目标注入对抗音频,是当前防御评估亟需解决的问题。
- 作者提出CodecAttack,将扰动置于EnCodec的连续隐空间而非波形域进行优化,利用编解码器自身保留隐空间信号的特性保持鲁棒性。结合直通估计器(STE)对多码率Opus应用变换期望(EoT),采用预热加交替的两阶段训练优化扰动。
- 在Qwen2-Audio、AF3和Qwen2.5-Omni上,CodecAttack在Opus中等码率下达到85.5%的平均ASR,并能迁移至未参与训练的MP3和AAC-LC。波形基线在相同EoT训练下ASR不超26%,消融显示隐空间参数化是鲁棒性的主因。
- 作者指出该方法需针对特定受害模型进行优化,跨模型不迁移;且既有基于编解码器的防御被直接绕过,亟需新型防御。此外,实验主要覆盖3款开源音频大模型、3类部署场景及特定音频载体,未测试白盒受害模型集成优化。
- 被测模型
- Qwen2-Audio-7B-InstructAudio Flamingo 3Qwen2.5-Omni
- 基准
- S1 (Financial voice agent)S2 (Interview screening agent)S3a (AI-content detection)S3b (Copyright classification)
- 指标
- ASRSTOIPESQ-WBLSDSI-SDRSNR
研究者提出 CodecAttack,把对抗扰动优化在 EnCodec 连续潜空间而非波形域,使攻击能在 Opus 等有损压缩后存活。在 Opus 中等码率下,对三个目标模型和三个部署场景平均达到 85.5% 的目标子串攻击成功率,而采用相同 EoT 加固的波形基线在任何码率下都不超过 26%。攻击无需重训练即可迁移到未见过的编解码器,在 MP3 上最高 100%,在 AAC-LC 上 84%。逐频带能量分析显示潜空间扰动集中在 4 kHz 以下,正是编解码器分配比特最多的频段。消融实验表明多码率 EoT 是低码率鲁棒性的关键,去掉后 Opus 32 kbps 及以下成功率降为 0%。
推荐理由论文提出在神经音频编解码器潜空间构造对抗扰动,绕过此前被视为有效防御的有损压缩,并给出跨编解码器与多场景的成功率数据。
深度解读
这篇论文试图解决什么问题?
论文研究如何在不修改模型的前提下,使对抗音频穿透有损编解码信道实现对音频大模型的目标指令注入。
论文试图解决音频大模型(Audio LLM)在经过现实有损音频编解码信道传输时,外部对抗攻击难以存活并实现目标指令注入的问题。
- 场景与重要性:作者称语音正成为AI系统的主流交互接口,音频大模型广泛部署于消费级语音助手、企业客服中心、金融与医疗领域的智能体中。在这些实际部署场景中,音频在到达模型之前必然经过至少一次有损编解码器(如VoIP中的Opus/G.711、消息应用中的Ogg/Opus、流媒体中的AAC/MP3)。
- 现有方法的不足:既有音频对抗攻击在面对编解码压缩时存在缺陷。波形域攻击(如Sadasivan等人,2025)生成的扰动在经过轻度编解码压缩后即被滤除;而能够耐受压缩的内部表征攻击(如Ziv等人,2025)则要求攻击者在推理时修改受害模型内部的编码器隐藏状态,脱离了仅通过公开信道上传音频的现实设定。
- 核心观察与假设:作者认为过去的研究混淆了编解码器“丢弃什么”与“保留什么”。有损编解码器丢弃感知不重要的波形扰动,但编解码器保留的部分并非障碍,而是其主动传输的子空间;因此在神经编解码器自身的连续隐空间中构建的扰动,按其构造就属于编解码器旨在保留的信号类别。
- 威胁模型:
- 攻击目标:实施目标注入(targeted injection),将隐藏命令嵌入正常载体音频(语音或音乐),迫使受害音频大模型输出攻击者指定的字符串(如转账确认、PIN码、虚假录用评语、版权标签等)。
- 攻击者知识:拥有目标音频大模型及用于构建扰动的神经编解码器的白盒访问权限,用于离线梯度计算。
- 攻击者能力:攻击者不修改目标模型的权重、架构或推理管线;通过全数字编解码信道传输音频,上传后无需与系统进行后续交互。
- 受害系统:接收经有损编解码器(Opus、MP3、AAC、G.711或神经编解码器)压缩音频并执行下游操作的音频大模型系统。
- 提出的解决方案:作者提出了CodecAttack,在外部神经音频编解码器(EnCodec)的连续隐空间中优化扰动,并结合多码率直通估计(STE)的变换期望(EoT),生成无需修改受害模型即可穿透多种数字编解码器的对抗音频。
有哪些相关研究?
相关研究包括转录模型攻击、音频LLM越狱与注入攻击,但此前尚无兼具外部攻击者设定与编解码鲁棒性的方法。
语音转录模型的对抗攻击
- Carlini & Wagner (2018)、Yakura & Sakuma (2019)、Schönherr等人 (2020) 等——在声学信道(房间脉冲响应、扬声器-麦克风传递函数、环境噪声)中追求端到端波形扰动的鲁棒性。
- Andronic等人 (2020) 与 WaveGuard (Hussain等人, 2021)——研究了数字编解码信道并将其作为防御手段;Andronic等人表明MP3重编码可去除针对DeepSpeech的波形扰动,WaveGuard将其转化为通过声码器检测转录变化的防御机制。
音频大模型的越狱攻击
- SpeechGuard (Peri等人, 2024)、AudioJailbreak (Chen等人, 2026)、Dingeto等人 (2026) 等——通过优化对抗性音频前缀或后缀促使安全对齐模型放弃拒答行为、输出有害文本。作者指出这类越狱工作衡量的是拒答抑制,而本文关注的是强制模型输出指定字符串的目标注入。
音频大模型的目标注入攻击
- Attacker's Noise (Sadasivan等人, 2025)——在波形域对音频大模型实施注入攻击。作者指出该文自身消融实验显示其扰动在适度编解码压缩下即被消除,并将神经音频编解码器称为“最有效防御”。
- U-TLSA (Ziv等人, 2025) 与 WhisperInject (Dingeto等人, 2026)——扰动受害模型内部编码器的隐藏状态或嵌入。作者指出该设定要求攻击者在推理时能够修改部署模型的内部表征,攻击假设过强。
基线方法与评估场景
- 基线方法:作者构建了与CodecAttack采用相同多码率Opus EoT训练方案、相同BPDA代理、相同两阶段预热-硬化调度及相同Adam优化器的波形域对抗基线(基于Carlini & Wagner, 2018拓展,详见Appendix E),在匹配干净信道信噪比(SNR ≈5.8 dB)下对比。
- 评估场景:论文替换了继承自文本LLM的越狱基准,针对语音智能体构建了三个音视频原生部署场景:金融语音智能体S1(50条语音载体)、面试筛选智能体S2(25条英文+24条中文载体)、音乐产业分类器绕过S3(40条S3a+45条S3b载体)。
作者将CodecAttack定位为文献中同时满足外部攻击者设定(无需修改受害模型权重、架构或推理管线)且在多种真实编解码压缩下保持鲁棒的攻击方法(Table 1)。
论文如何解决这个问题?
CodecAttack在EnCodec连续隐空间优化扰动,利用STE多码率EoT与两阶段交替调度抵御有损压缩。
作者提出 CodecAttack,将对抗扰动置于外部神经编解码器的连续隐空间中进行建模,并结合多码率直通估计(STE)的变换期望(EoT)与两阶段交替调度来生成编解码鲁棒的对抗音频。
连续隐空间扰动建模
- 使用EnCodec编码器将24 kHz音频载体x映射为连续隐变量z = E(x) ∈ R^(d×F),其中d为隐空间维度,F为帧数。
- 绕过残差矢量量化(RVQ),直接在连续隐变量z上施加由无穷范数 ϵ 约束的扰动 δ,以防离散码本截断梯度;通过后续针对解码波形的重编码目标保证真实鲁棒性。
- 解码器D将隐变量还原为波形,再经重采样器R16k输入目标音频大模型f,直接前向传播的优化目标受限于半径 ϵ 的约束。
直通估计与多码率变换期望(EoT)
- Opus的CELT/SILK量化由C语言实现且不可微,作者通过直通估计器(STE)构建可微代理: Cb(x) = stop_grad(Opusb(x) − x) + x 其前向传播执行真实有损编解码Opusb,反向传播将编解码器视作恒等映射。
- 为确保扰动耐受部署码率范围内的压缩,作者在码率网格 B = {16, 24, 32, 64, 128} kbps 上应用变换期望(EoT)。每步 t 均匀采样单个码率 bt ~ Uniform(B) 并优化目标函数: ℒcodec(t) = ℒCE(f(R16k(Cbt(D(z + δ)))), y∗) 一句话说明含义:该目标通过采样得到的Opus码率压缩代理计算模型输出分布与目标文本 y* 的交叉熵损失,每步采样单码率相比遍历网格降低了计算开销。
预热加硬化的两阶段优化调度
- 单阶段仅用编解码器训练不稳定,因为每步经过真实Opus编解码的STE梯度噪声较大且收敛缓慢。
- 算法采用两阶段调度:前 wS 步(设置 w=0.3,总步数 S=1000)仅优化干净信道交叉熵损失,快速建立直接对抗样本;剩余 (1-w)S 步中,奇数步执行编解码EoT更新以增强抗压缩性,偶数步执行干净信道更新以防止扰动偏离直接对抗子空间。
优化算法细节与波形导出
- 采用投影梯度下降(PGD)配合Adam优化器,学习率 α=0.2,优化 S=1000 步;每步后将扰动投影回半径为 ϵ 的无穷范数球内。
- EnCodec解码器保持在训练模式以实例化其权重归一化卷积的自动求导状态。优化完成后通过解码器还原出对抗音频波形并保存为标准的24 kHz 16位PCM wav文件,无需在载体外附加元数据。
论文做了哪些实验?
在三款模型与三类场景下,CodecAttack在Opus中等码率达85.5%平均ASR,且可无损迁移至MP3。
实验设置
- 被测模型:Qwen2-Audio-7B-Instruct、Audio Flamingo 3 (AF3)、Qwen2.5-Omni 共3款开源音频大模型。
- 数据集与部署场景:S1金融语音智能体(25条英文银行通话语音,对应5类授权绕过共50个目标指令);S2面试筛选智能体(25条英文与24条中文不合格面试语音,目标为强制录用判定);S3音乐产业分类器绕过(24 kHz音乐片段,包含S3a的40条AI检测载体与S3b的45条版权分类载体,目标为单子句标签)。
- 对比基线:波形域 Carlini-Wagner 对抗基线,采用相同多码率 Opus EoT 训练、相同 BPDA 代理、相同预热调度及 Adam 优化器,在干净信道匹配信噪比(SNR ≈5.8 dB)下进行对比(Appendix E)。
- 指标与评审方式:攻击成功率(ASR),定义为模型输出中字面包含目标字符串的样本比例(严格子串匹配,经小写化、合并空格、去除标点标准化后比对,非LLM评审打分);音频质量指标包含 SNR、SI-SDR、PESQ-WB、STOI、ESTOI、LSD。
- 编解码评测网格:训练使用 Opus 网格 {16, 24, 32, 64, 128} kbps;评测包含留出码率 Opus 192 kbps,以及跨家族留出编解码器 MP3 和 AAC-LC 各自的 {64, 96, 128, 192} kbps。
- 扰动预算与计算规模:主实验隐空间扰动预算取 ϵ=1.0(消融包含 0.5 与 1.5);全量评测耗费约 350 GPU 小时(NVIDIA A100 80GB)。
主结果
据 Table 3(Qwen2.5-Omni 在 ϵ=1.0 下的跨编解码器 ASR,%):
表格较宽,可左右滑动
评估场景 干净信道 Opus 64k Opus 128k MP3 128k AAC-LC 128k S1(金融语音) 82.0 76.0 82.0 82.0 66.0 S2(英文面试) 84.0 84.0 84.0 84.0 76.0 S2(中文面试) 20.8 20.8 20.8 20.8 20.8 S3a(AI检测) 95.0 87.5 92.5 85.0 65.0 S3b(版权分类) 100.0 93.3 100.0 100.0 84.4 - 编解码抗性与跨编解码迁移:作者报告在训练编解码器 Opus 上,所有英文场景在 ≥64 kbps 下 ASR 均达到或超过 76.0%(S3b 达到 100.0%);在未参与训练的 MP3 上实现近乎无损迁移(S3b 在 128 kbps 达 100.0%)。
- 载体类型与系统提示词对齐效应:在 AAC-LC 下呈现载体类型效应,音乐载体(S3b 达 84.4%)保留率高于语音载体(S1 为 66.0%);中文面试载体在面对英文系统提示词时因缺乏语言对齐,ASR 降至 20.8%。
- 各场景任务难度差异:S3 的单子句判定目标最易注入,S1 字符敏感的银行命令难度最高,S2 介于两者之间。
隐空间与波形基线对比
- 测了什么:在 Qwen2-Audio 的 S1 场景下(n=50,匹配 SNR ≈5.8 dB),对比经相同 Opus EoT 训练的隐空间攻击与波形基线(Table 2、Table 7)。
- 结果:在 Opus 64 kbps 下隐空间攻击达到 80.0% ASR,而波形基线为 24.0%;波形基线在任何码率下均未超过 26.0%;在留出 MP3 上隐空间攻击保持 74.0%–90.0%,波形基线为 22.0%–24.0%(Table 2)。在低码率下(16–32 kbps),隐空间攻击在 Opus 32 kbps 达 50.0%,波形基线仅 16.0%(Table 7)。
- 作者解读:作者称在训练配方、优化器与预算完全受控的情况下,性能差距表明编解码鲁棒性取决于扰动所在的参数化空间,而非优化流程。
跨神经编解码器架构泛化与音频质量
- 测了什么:将 CodecAttack 重新实例化于 Mimi 和 DAC 两个不同架构的神经编解码器上(S3b 任务,Qwen2.5-Omni,n=19),并评估音频质量(Table 4、Table 5)。
- 结果:三款编解码器生成的隐空间扰动均能在压缩后存活(Table 4)。在 Opus 128 kbps 下,EnCodec 达到 100.0%,Mimi 达到 36.8%(受限于去除投影层的干净信道上限 36.8%),DAC 达到 36.8%。音频质量上,DAC 生成的对抗样本质量最佳(PESQ-WB 3.16,SNR 13.73 dB),Mimi 代价最大(PESQ-WB 1.95,LSD 9.35 dB),EnCodec 居中(PESQ-WB 1.90,LSD 5.86 dB)(Table 5)。
- 作者解读:作者称隐空间扰动耐受压缩并非 EnCodec 特有的现象,而是神经编解码器的共有特性;DAC 的结果表明在投影器损失更小的编解码器上存在更高音频质量的操作点。
频谱放置与编码器残差机理分析
- 测了什么:对隐空间扰动与波形扰动的频带能量分布、解码器雅可比矩阵以及 AAC-LC 压缩下的归一化编码器漂移 R 进行分析(Figure 3、Figure 7、Table 6)。
- 结果:隐空间攻击将 88.4% 的扰动能量集中在 4 kHz 以下(Figure 9),EnCodec 解码器的所有 128 个隐维度在 1.8–2.5 kHz 达到峰值且 4 kHz 以上几乎无能量(Figure 6);对抗损失进一步将 42% 的能量压入 400 Hz 以下(随机隐变量仅 21%,Figure 3)。在 AAC-LC 下,音乐载体在 400 Hz 以下的能量比语音载体高 1.4 倍(Figure 7),对应的编码器漂移 R 明显更低(Qwen2-Audio 上音乐为 0.060,语音为 0.103,Table 6)。
- 作者解读:作者称隐空间扰动存活是因为其能量分布与编解码器分配比特的低频区域一致,波形攻击失效是因为能量散布至被丢弃的高频;音乐载体宽带低频能量提高了 AAC-LC 的心理声学掩蔽阈值,从而保留了更多扰动。
其他消融与分析
- 多码率 EoT 训练消融:去除 EoT 后,在 Opus ≤32 kbps 下 ASR 均降至 0.0%,AAC-LC 64k 下从 47.5% 降至 15.0%(Figure 4)。
- 目标文本长度影响:在 S3a 音乐载体上,目标长度在 ≤8 个词时各码率均达到 3/3 饱和,15–20 个词逐步下降,32 个词时 PGD 损失上升约 5 倍(从 0.011 升至 0.052,Figure 5)。
- 扰动预算 ϵ 消融:在 S1 场景 Qwen2-Audio 上,ϵ 从 0.5 增加至 1.0 和 1.5 时,干净信道 ASR 从 58.0% 升至 88.0% 和 92.0%,Opus 64k ASR 从 48.0% 升至 80.0% 和 92.0%(Table 8)。
- 语言对齐消融:S2 场景切换为中文载体后,Qwen2-Audio 在 ϵ=1.0 下干净信道 ASR 从英文的 92.0% 降至 29.2%,Opus 64k 从 88.0% 降至 20.8%(Table 9、Table 10)。
- 音频质量与预算权衡:语音载体(S1)在 ϵ=0.5、1.0、1.5 时,PESQ-WB 分别为 2.63、1.69、1.33,STOI 分别为 0.959、0.904、0.847(Table 12)。
负面结果与例外
- 在 AAC-LC 信道下,当输入为语音载体(S1)时,Qwen2-Audio 和 AF3 在 ϵ=1.0 下 ASR 均降至 ≤2.0%(Table 8),而 Qwen2.5-Omni 仍能保持 54.0%–66.0%;作者将其归因于语音在 AAC-LC 下归一化编码器漂移 R 超过 0.09 阈值(Table 6),以及 Qwen2.5-Omni 更广泛的音频训练分布。
- AF3 在 S1 包含复杂多子句的银行指令目标上表现欠佳(ϵ=1.0 干净信道 ASR 仅 44.0%,Opus 128k 仅 48.0%,Table 8),但在 S3 单子句目标上能达到 97.5%–100.0%(Table 11);作者认为这是目标文本复杂度所致,而非模型架构缺陷。
有什么可以进一步探索的点?
作者指出了攻击的模型特异性以及针对隐空间攻击的防御评估缺口,未来方向包括多模型集成优化与新型防御构建。
作者指出的局限与后续方向
- 模型特异性优化与跨模型迁移:作者在 6.2 节指出,针对单一受害模型生成的对抗扰动在未经重新优化的情况下无法迁移至其他模型;后续方向是探索集成受害模型优化(Ensemble-victim optimization),通过在多个候选模型上平均损失来提升通用性。
- 缺乏针对隐空间攻击的专门防御评估:作者在 6.2 节指出,传统基于编解码器的防御被该攻击直接绕过;作者列出了针对隐空间攻击的潜在防御方向,包括对抗训练、利用不同架构编解码器重合成进行检测、以及在音频预处理层进行输入随机化,但对自适应攻击者的系统评测留待未来工作。
- 目标长度评测样本量较小:作者在 5.4 节指出,在目标长度容量消融实验中,每个长度仅测试了 3 个样本(n=3),样本量较小限制了关于词数与码率失效边界的结论置信度。
实验覆盖范围
- 被测目标模型:评测覆盖 Qwen2-Audio-7B-Instruct、Audio Flamingo 3、Qwen2.5-Omni 共 3 款开源音频大模型,均为白盒单模型优化,未测试黑盒商业模型或多模型集成优化。
- 应用场景与音频载体:评测覆盖金融客服(S1,25条英文语音)、面试筛选(S2,25条英文与24条中文语音)、音乐检测(S3,40条S3a与45条S3b音乐片段)三类场景;目标指令长度在主实验中均处于 20 个词以内。
- 编解码器通道覆盖:训练优化仅使用 Opus 的 5 个码率(16、24、32、64、128 kbps);测试信道包含 Opus 192 kbps 以及 MP3 和 AAC-LC 的 4 个码率(64、96、128、192 kbps),传输均为纯数字信道,未包含空气传播(Over-the-Air)声学信道。
- 神经编解码器参数化:主实验全部基于 EnCodec(24 kHz)连续隐空间进行扰动优化;跨架构泛化实验在 S3b 场景的 19 个样本子集上覆盖了 Mimi 和 DAC。
- 未报告与评估信息:评测采用严格子串匹配规则,论文未报告下游自动化工具调用执行的实际端到端完成率;AAC-LC 编码器残差分析中因运行环境兼容性问题未报告 AF3 的中间嵌入漂移数值(Section D.1)。
总结一下论文的主要内容
论文提出在神经编解码器隐空间优化对抗音频的CodecAttack,穿透多种有损压缩信道实现高成功率指令注入。
CodecAttack 是一项针对音频大模型(Audio LLM)的编解码器鲁棒对抗注入攻击研究。
- 问题定位:在实际语音智能体部署中,音频必然经过有损编解码器(如 Opus、MP3、AAC)传输。既有基于波形域的对抗扰动在压缩过程中易被消除,使得外部攻击者难以在不修改受害者模型的前提下穿透真实信道实施目标指令注入。
- 核心方法:作者发现有损编解码器丢弃波形扰动的同时会主动保留其自身隐空间表征,据此提出在外部神经编解码器 EnCodec 的连续隐空间中构建扰动;通过直通估计器(STE)结合多码率 Opus 的变换期望(EoT),并采用预热与交替硬化的两阶段优化调度,在不改动受害模型的情况下生成对抗波形。
- 主要实验结果:
- 在 Qwen2-Audio 的 S1 金融场景中,CodecAttack 在匹配 SNR(≈5.8 dB)下,Opus 128 kbps 达到 88.0% ASR,MP3 128 kbps 达到 88.0%,而经过相同 EoT 训练的波形基线在任何码率下均未超过 26.0%(Table 2)。
- 在三款目标模型与三类真实部署场景下,CodecAttack 在 Opus 中等码率下取得 85.5% 的平均 ASR,并在留出 MP3 上保持 74.0%–90.0% 的无损迁移(Table 3)。
- 在 S3 音乐产业场景中,目标指令注入在 Opus 和 MP3 上最高达到 100.0% ASR;在架构相异的 Mimi 和 DAC 编解码器上重实例化依然验证了隐空间扰动的压缩存活性(Table 4)。
- 频谱分析表明,EnCodec 解码器在结构上将扰动限制在 4 kHz 以下,且对抗损失将 42% 的能量集中在编解码器分配最多比特的 400 Hz 以下,从而实现了压缩鲁棒性(Figure 3)。
- 作者结论与启示:作者认为编解码鲁棒性是扰动参数化空间固有的属性,而非优化流程的产物;有损音频压缩非但不能作为防御对抗音频的可靠屏障,反而构成了容易被利用的攻击面。