AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
AudioHijack利用梯度估计与卷积混响注入音频,在13款LALM上非工具BMSR达0.84-0.94。
第三方攻击者仅能接触并篡改输入给 LALM 的音频数据,无法获知或控制用户的文本或语音指令;已知目标模型架构与参数;目标是在用户在场且听觉不可感知的前提下,诱导预定义的异常行为或工具调用。
- 在第三方攻击者仅能接触音频数据且受严格听觉不可感知性约束下,端到端大音频语言模型容易遭受听觉提示注入,导致下游行为被劫持甚至触发未经授权的工具调用。
- 提出 AudioHijack 框架:通过 Gumbel-Softmax 采样梯度估计穿透离散 tokenization,结合 EoT 多上下文训练与显式注意力边际损失将模型注意力导向对抗音频,并用可学习房间脉冲响应卷积扰动模拟真实混响。
- 在 13 个 LALM 上诱导 6 类异常行为,非工具类平均 PISR 为 0.89-0.95、BMSR 为 0.84-0.94;在 3 个工具使用模型上单步与级联工具滥用 BMSR 为 0.79-0.96;成功迁移至微软与 Mistral 商用语音智能体。
- 假定掌握目标 LALM 架构与参数以计算梯度,黑盒跨模型迁移受限;6 类行为未覆盖所有恶意意图;评测仅限于单体模型和简易语音智能体,未涵盖真实设备与集成系统;长音频实验受显存限制仅测至 10 分钟。
- 被测模型
- SpeechGPTGLM-4-VoiceVITA-AudioLlama-OmniLlama-Omni2SALMONNQwen-AudioQwen2-AudioGemma-3nUltravox-v5Phi-4-MultimodalVoxtral-MiniKimi-AudioPhi-4-Multimodal-instructVoxtral-Mini-latest
- 基准
- AirBenchVoiceBenchEarnings-22RVB2014
- 指标
- PISRBMSRSNRMCDPESQSTOIAUCEERPrecisionRecall
研究者提出 AudioHijack,一个在仅能篡改音频数据、且要求人耳难以察觉的约束下,对大型音频语言模型(LALM)实施提示注入的通用框架。方法上,它用基于采样的梯度估计绕过不可微的音频 tokenization,用注意力监督与多上下文训练让攻击跨未知用户上下文泛化,并用卷积扰动混合把扰动伪装成自然混响。在 13 个 LALM(含 Kimi-Audio、Qwen2-Audio、GLM-4-Voice、Gemma-3n、Voxtral-Mini、Phi-4-Multimodal 等)上覆盖 6 类不良行为,PISR 与 BMSR 平均为 0.89-0.95 和 0.84-0.94,对 SpeechGPT 效果明显下降。
推荐理由研究者在仅能篡改音频数据、且要求人耳难以察觉的约束下,对 13 个语音语言模型实施了统一的越狱注入,并验证了商业语音 Agent 的工具调用风险。
深度解读
这篇论文试图解决什么问题?
研究第三方攻击者在仅能篡改音频且受隐蔽性约束下,劫持 LALM 行为的听觉提示注入威胁。
大音频语言模型(LALM)在仅有音频数据访问权与强听觉隐蔽性约束下的听觉提示注入(Auditory Prompt Injection)安全威胁。
- 场景与重要性:现代 LALM 端到端处理音频与文本,甚至具备工具调用能力以执行外部操作。音频既作为输入数据又可承载指令,第三方攻击者若通过篡改音频数据劫持模型行为,将带来严重现实危害(Section 1、Section 2.2)。
- 现有防御与攻击的不足:现有音频越狱攻击假设攻击者即用户,完全控制指令且无需隐蔽;唯一探索听觉间接提示注入的前人工作仅针对两款全模态模型进行概念验证,依赖无约束的明显扰动且泛化性弱(Section 1、Section 2.3)。
- 核心观察与假设:攻击泛化受阻源于 LALM 自回归生成时的注意力偏差——模型过度关注用户上下文而忽视音频数据;此外离散 token 化的非可微操作阻断了梯度反向传播(Section 4.2、Section 4.3.3)。
- 提出的方法:提出 AudioHijack 攻击框架,结合采样梯度估计、注意力引导的上下文泛化与卷积扰动混合,生成与上下文无关且听觉不可感知的对抗音频(Section 4.3)。
- 威胁模型:
- 攻击者目标:篡改音频数据诱导预定义的 6 类异常行为(听觉失明、提示拒绝、虚假信息、钓鱼链接投递、人设控制、工具滥用),同时保持隐蔽不被用户察觉(Section 3)。
- 攻击者知识:掌握目标 LALM 的架构与模型参数(Section 3)。
- 攻击者能力:仅能修改输入给 LALM 的音频数据,无法获知也无法控制用户说出或输入的上下文指令(Section 3)。
- 受害系统:基于端到端 LALM 的语音助手或商业语音智能体(Section 3)。
有哪些相关研究?
梳理了音频越狱、间接提示注入、音频对抗样本等工作,对比了多类攻击变体与防御基线。
音频越狱与直接攻击
- 文本越狱迁移:VoiceJailbreak(Shen 等,2024)与 Ying 等(2024)——将文本越狱提示词转换为语音以诱发有害回复;论文指出这类方法依赖全模态访问且属于直接越狱(Section 2.3)。
- 信号编辑与对抗扰动:BoN-Jailbreak(Hughes 等,2024)与 JAB(Cheng 等,2025)通过信号编辑与增强增加有害语音逃避性;AdvWave(Kang 等,2025)、SpeechGuard(Peri 等,2024)与 AudioJailbreak(Chen 等,2025)优化对抗后缀或扰动以诱导肯定回答;SSJ(Yang 等,2025)将有害词汇按字母拼读嵌入语音中;论文指出这些方法均假设攻击者完全掌控用户指令,缺乏隐蔽性要求(Section 2.3)。
间接提示注入
- 多模态间接指令注入:Bagdasaryan 等(2023)——探索利用对抗性图像与声音在多模态 LLM 中植入恶意指令;论文指出其局限在两个全模态模型的概念验证案例,依赖无约束的明显扰动,且仅在文本上下文无关上进行了初步探索(Section 2.3)。
对抗性音频与物理隐蔽扰动
- 判别式音频对抗样本:Carlini 与 Wagner(2018)、Devil's Whisper(Chen 等,2020)、AdvPulse(Li 等,2020)——主要针对语音识别或音频分类等判别式模型诱导分类错误;论文指出 LALM 属于开域生成的复杂生成模型,受部分输入控制与严格上下文制约(Section 2.4)。
- 混响感知对抗扰动:AdvReverb(Chen 等,2024)——重新思考人类听觉感知的对抗样本隐蔽性;本文借鉴其思想设计了可学习卷积混合方法(Section 4.3.4)。
基线与对比定位
- 消融基线方法:CSA w/o Latt(单上下文无注意力损失)、CSA w/ Latt(单上下文带注意力损失)、CAA w/o Latt(多上下文无注意力损失)(Section 5.3)。
- 隐蔽性对比基线:PGD 攻击(L_infinity 约束)、C&W 攻击(L2 惩罚)(Section 5.4)。
- 防御与检测基线:在上下文防御(In-context defense)、自我反思检测(Self-reflection detection)、UniGuardian(token 掩码 logits 散度检测)、WaveGuard(信号失真 logits 散度检测)(Section 7)。
- 基准数据集:AirBench-chat(SpeechQA、SoundQA、MusicQA)、VoiceBench-wildvoice、Earnings-22(Section 5.1、Section 5.5)。
- 与既有工作区别定位:作者称本文提出了首个系统且实用的 LALM 听觉提示注入攻击,在音频数据访问受限和感知隐蔽约束下实现了上下文无关的端到端攻击(Section 1、Section 2.3)。
论文如何解决这个问题?
提出 AudioHijack,集成 Gumbel-Softmax 梯度估计、注意力边际损失与可学习卷积混响扰动。
AudioHijack 采用输出层注入策略,通过优化微小音频扰动操纵自回归生成的 token 概率分布,使模型响应中嵌入攻击者指定指令并自发执行(Section 4.2)。
采样梯度估计穿透离散 Tokenization
针对离散与混合架构中向量量化(VQ)硬选择和嵌入查找阻断梯度的挑战(C1),设计了基于 Gumbel-Softmax 的可微梯度估计:
- 前向硬选择与反向软平滑:令声学特征与码本距离的负值为分类 logits πt = −|et − ck|2。前向传播中使用 one-hot 硬选择模拟真实推理,反向传播中使用 Gumbel-Softmax 软权重:
zt = (exp((log(πt) + gt)/τ))/(∑i=1T exp((log(πi) + gi)/τ))其中 gt ∼ Gumbel(0, 1),τ 为温度超参数(设为 10)。通过加权嵌入 ẽt = ∑k=1K zt,k Φk 计算关于输入音频的梯度 ∇x̂d L(Section 4.3.2、Section 5.1)。
注意力引导的上下文泛化
针对用户上下文未知且敏感的挑战(C2),结合隐式上下文扩充与显式注意力监督:
- 隐式 EoT 优化:基于小规模辅助指令集 X̂c,优化期望损失 Ladv = 𝔼x̂c ∼ X̂c L(M(x̂d, x̂c), rt),抑制周围上下文干扰(Section 4.3.3)。
- 显式注意力边际损失:计算目标响应 token 到音频数据 token 的多层多头平均注意力权重 Wd,引入边际注意力损失:
Latt = max{κ − Wd, 0}其中 κ 为注意力下限阈值(设为 0.015),强制模型将注意力重定向至对抗音频(Section 4.3.3、Section 5.1)。
卷积扰动混合保障听觉隐蔽性
针对用户在场时的隐蔽性约束(C3),放弃传统加性噪声,采用可学习卷积核将扰动能量重分配至真实混响模式中:
- 分帧卷积与边界平滑:将音频分为约 0.2s 的短帧,分别与初始化自真实房间脉冲响应(RIR,来自 RVB2014)的短核 δk 进行卷积;采用 0.02s 汉宁窗与 0.01s 步长进行重叠相加(OLA)消除边界伪影(Section 4.3.4、Section 5.1)。
- 能量归一化与惩罚约束:利用 RMS 归一化维持响度一致;定义损失函数 Lpen = |x̂d − xd ∗ δ0|2 约束扰动形态贴近自然混响(Section 4.3.4)。
- 总联合优化目标:最小化 Ltotal = Ladv + α Lpen + β Latt,超参数分别设为 α=1、β=50(Section 4.3.4、Section 5.1)。
论文做了哪些实验?
在 13 款模型与商业智能体上评测,非工具成功率超 0.84,工具滥用最高 1.00,并分析了防御与检测。
实验设置
- 被测模型:共 13 款 LALM,包括离散架构 SpeechGPT(7B)、GLM-4-Voice(9B)、VITA-Audio(7B);连续架构 Llama-Omni(8B)、Llama-Omni2(7B)、SALMONN(7B)、Qwen-Audio(7B)、Qwen2-Audio(7B)、Gemma-3n(2B)、Ultravox-v5(8B)、Phi-4-Multimodal(5B)、Voxtral-Mini(3B);混合架构 Kimi-Audio(7B)(Table 2)。
- 商用语音智能体:Microsoft Azure 的 Phi-4-Multimodal-instruct(3B),以及 Mistral AI 的 Voxtral-Mini-latest(3B)和 Voxtral-Small-latest(24B)(Section 6)。
- 数据集与规模:AirBench-chat 中抽取 600 个音频-文本对(SpeechQA、SoundQA、MusicQA 各 200 对);VoiceBench-wildvoice 中抽取 200 个真实人声样本;长音频扩展使用 Earnings-22(Section 5.1、Section 5.5)。
- 基线方法:对抗攻击对比加性 PGD(L_infinity)与 C&W(L2);泛化对比 CSA w/o Latt、CSA w/ Latt、CAA w/o Latt;防御对比 In-context defense、Self-reflection、UniGuardian、WaveGuard(Section 5.3、Section 5.4、Section 7)。
- 指标与判定方式:提示注入成功率 PISR(严格字符串匹配);行为匹配成功率 BMSR(非工具类使用 GPT-5.1、Gemini-2.5-Flash、Qwen3.5-Flash 作为评委取均值;工具类计算 Pi × Ps × Pe);隐蔽性指标 SNR、MCD、PESQ、STOI(Section 5.1)。
- 样本量与训练细节:每个目标响应采用 15s 音频载体,100 条指令训练,100 条未见指令测试,非工具类共 13,000 次攻击试验;连续/混合模型迭代 2,000 步,离散模型 3,000 步,步长 0.001,batch size 为 4(Section 5.1、Section 5.2)。
主结果
下表汇总了 3 款具备工具调用能力的 LALM 在工具滥用任务上的 PISR 与 BMSR(单步任务列出 JSON 格式结果,级联任务为文本格式):
表格较宽,可左右滑动
模型 search_web (JSON) PISR search_web (JSON) BMSR download_file (JSON) PISR download_file (JSON) BMSR list_calendar + send_email (Text) PISR list_calendar + send_email (Text) BMSR Ultravox-v5 0.99 0.99 1.00 1.00 0.95 0.95 Phi-4-Multimodal 0.92 0.92 0.85 0.83 0.85 0.83 Voxtral-Mini 0.97 0.96 0.98 0.95 0.89 0.59 出处:据 Table 3。注:表中省略了文本格式的单步工具结果(文本格式下三款模型的 search_web BMSR 分别为 1.00、0.91、0.91;download_file BMSR 分别为 0.86、0.78、0.89)。
- 多模型广度有效性:作者报告,13 款 LALM 在 5 类非工具异常行为上的平均 PISR 为 0.89-0.95、BMSR 为 0.84-0.94;除 SpeechGPT 外各模型平均 PISR 和 BMSR 均超过 0.91 和 0.90(Figure 5,Section 5.2)。
- 结构化输出偏好:作者称,JSON 格式目标响应的 PISR 和 BMSR 一致高于文本格式;模型过度针对结构化输出进行优化,反而更容易受到工具滥用攻击(Table 3,Section 5.2)。
- 级联调用阻力:Voxtral-Mini 在级联工具滥用下的 BMSR 降至 0.59;作者称其在调用发邮件工具前频繁要求用户确认,表现出一定的抵御能力(Table 3,Section 5.2)。
注入隐蔽性评估
- 声学质量对比:如 Table 4 所示,卷积混合在语音、声音、音乐载体上分别取得 29.27 dB、28.61 dB、30.05 dB 的 SNR,以及 4.16、2.37、2.80 的 MCD;语音载体的 PESQ 达到 3.16、STOI 为 0.92。相较加性 L_infinity 约束(语音 SNR 9.87 dB,MCD 8.36)和加性 L2 惩罚(语音 SNR 22.15 dB,MCD 5.56),卷积混合的声学保真度更高(Table 4)。
- 频谱特征:Figure 9、Figure 17 与 Figure 18 显示加性扰动产生高能电子噪声伪影,而卷积扰动能量分布贴近自然混响(Section 5.4)。
- 作者解读:作者认为卷积混合有效重分配了时频能量,模拟自然混响,显著提升了注入隐蔽性,音乐是极佳的隐蔽载体(Section 5.4)。
商业语音智能体黑盒迁移攻击
- 迁移结果:在 Microsoft Azure 和 Mistral AI 商业智能体上(Table 6),本地生成的对抗音频迁移至 P4MM-instruct 的 BMSR 为 0.53-0.98;迁移至 VM-latest 的 BMSR 为 0.52-0.97;跨模型迁移至 VS-latest(24B)除钓鱼链接(0.14)外 BMSR 均在 0.37-0.65(Table 6)。
- 实际危害:成功诱导商业智能体执行敏感搜索、恶意文件下载及邮件信息窃取等未经授权的单步或级联工具调用(Section 6)。
- 作者解读:作者认为这表明开源 LALM 可作为攻击已部署商业智能体的有效载体(Section 6)。
对抗防御与检测评测
- 上下文与自我反思防御:上下文防御仅使 Voxtral-Mini 的 BMSR 下降不到 0.07(Figure 13);自我反思检测的假阳性率(FPR)为 0.04,但真阳性率(TPR)仅为 0.28(Section 7)。
- Logits 与信号失真检测:UniGuardian(音频 token 掩码)取得 0.71-0.85 的 AUC,但等错误率(EER)高达 0.21-0.36;WaveGuard 四种信号失真检测的 AUC 均低于 0.6(Figure 14,Section 7)。
- 注意力偏离检测:基于注意力的 PCA+SVM 分类取得 0.98 精确率与 0.93 召回率;自适应攻击者调小注意力阈值后,召回率降至 0.69,表明存在有效性与可检测性的权衡(Figure 15,Section 7)。
其他消融与分析
- 上下文无关与注意力损失:Voxtral-Mini 上加入注意力损失使单上下文攻击 BMSR 提升 0.11-0.33,使多上下文攻击 BMSR 提升 0.01-0.14(Figure 7)。
- 辅助数据规模:辅助上下文由 50 减至 20 时,PISR 和 BMSR 仍分别维持在 0.81 和 0.64 以上(Figure 10)。
- 载体音频时长:载体时长为 7.5s 时 PISR 和 BMSR 高于 0.71 和 0.63;达 10s 时分别升至 0.87 和 0.75 以上(Figure 11)。
- 采样温度变化:Voxtral-Mini 温度由 0.7 降至 0.1 时成功率微升,升至 1.3 时 BMSR 仍维持在 0.60 以上(Figure 12)。
- 长音频扩展:Earnings-22 数据集上优化 15s 片段,音频总长从 1 分钟增至 10 分钟时 BMSR 从 0.97 降至 0.58;若优化 30s 片段可回升至 0.89(Table 5)。
负面结果与例外
- SpeechGPT 攻击成功率低:PISR 与 BMSR 分别降至 0.23-0.57 和 0.15-0.42;作者解释其音频 token 词表仅 1,000,搜索空间过度受限(Figure 5,Section 5.2)。
- 虚假信息诱导率偏低:VITA-Audio 和 Llama-Omni 在虚假信息上的 BMSR 略低;作者人工检查称模型倾向于在后续回复中纠正虚假信息(Figure 5,Section 5.2)。
- 跨模型迁移钓鱼链接困难:Voxtral-Mini 生成的对抗音频迁移至 VS-latest 时,钓鱼链接 BMSR 仅为 0.14;作者称跨模型难以精确诱导特定链接(Table 6,Section 6)。
有什么可以进一步探索的点?
作者指出白盒假设、跨模型迁移及单体模型评测等局限,未来需探索无梯度方法与系统级验证。
作者指出的局限与后续方向
- 白盒知识假设:当前框架假设已知目标 LALM 的架构与参数以计算梯度,限制了其在参数不公开模型上的应用(Section 8)。
- 无梯度优化探索:针对黑盒跨模型迁移泛化不足的问题,未来可探索利用响应级反馈来细化对抗优化的无梯度方法(Section 8)。
- 行为类别多样性:已定义的 6 类行为仅代表了潜在恶意意图的一个子集,需要更广泛的分类体系与基准来反映现实攻击多样性(Section 8)。
- 系统级与真实设备评测:评测集中在单体模型和简易语音智能体,未考察集成平台;未来应扩展到结合手机、智能音箱等真实设备和系统级应用场景(Section 8)。
实验覆盖范围
- 被测模型范围:涵盖 13 款开源/开放权重 LALM,以及 3 款来自 Microsoft Azure 和 Mistral AI 的商业语音智能体(Table 2、Table 6)。
- 音频载体类型与规模:主实验固定使用 15s 音频载体;隐蔽性评估覆盖语音、环境音、音乐各 5 个载体(共 15 个)(Section 5.1、Section 5.4)。
- 任务与行为定义:覆盖 6 类预定义异常行为,非工具类定义 10 个目标响应,工具类定义 4 个工具(search_web、download_file、list_calendar、send_email)(Section 5.1、Section 5.2)。
- 长音频时长覆盖:长音频拓展实验在 Earnings-22 上测试了 1 至 10 分钟音频(优化其中 15s 或 30s 片段)(Table 5)。
- 防御与检测评测种类:涵盖提示级(In-context)、响应级(Self-reflection)、音频 logits 级(UniGuardian、WaveGuard)以及内部注意力表征级(PCA+SVM)防御(Section 7)。
总结一下论文的主要内容
提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
- 研究定位:针对大音频语言模型(LALM)的听觉提示注入(Auditory Prompt Injection)攻击研究,揭示了第三方攻击者在仅能篡改音频数据且受隐蔽性约束下的严重安全漏洞。
- 解决的问题:解决了跨异构架构梯度阻断、未知用户上下文的注意力敏感性,以及传统加性噪声缺乏听觉隐蔽性的三大技术挑战。
- 方法核心:构建了 AudioHijack 框架,采用 Gumbel-Softmax 采样梯度估计穿透离散 tokenization,结合 EoT 与显式注意力边际损失将注意力强制导向对抗音频,并利用可学习房间脉冲响应(RIR)卷积核实现自然混响伪装。
- 关键实验结果:在 13 款不同架构与规模的 LALM 上诱导 6 类异常行为,非工具类平均 PISR 为 0.89-0.95、BMSR 为 0.84-0.94(Figure 5);在 3 款工具调用模型上诱导工具滥用的平均 PISR 为 0.90-0.96、BMSR 为 0.79-0.96(Table 3);卷积混合取得超过 28.6 dB 的 SNR 与 3.16 的 PESQ(Table 4);成功跨模型迁移至微软 Azure 与 Mistral AI 的商业语音智能体执行未授权工具调用(Table 6)。
- 作者结论与启示:作者认为 LALM 普遍对听觉提示注入脆弱,过度针对结构化输出进行优化进一步加剧了工具滥用风险;提示级、响应级与传统信号级防御收效甚微,需要从注意力动态等模型内部机理层面进行深入检测。