跳到正文
原文
论文追踪· arXiv:2605.18168· Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu·本站收录 · 原文发表

研究者提出声学干扰攻击 AIA,可通用越狱 10 个大型音频语言模型

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

AIA用声学潜语义干扰对齐;表2里Gemini-2.5-Pro于WildJailbreak的ASR-M为98.33%。

威胁模型作者将AIA定义为免优化、基于查询的通用黑盒攻击。

问题
现有LALM音频越狱把恶意内容写进音频,靠语义优化、显式声学参数或加性扰动,并常需逐样本优化或在线生成。作者要看:内容良性、只带特定声学潜语义的音频,能否单独干扰安全对齐。
方法
用Bark对固定中性文本无条件采样,过滤后以CLAP和WavLM嵌入做分层聚类,再用GPT-4o与规则打出12维ALS索引。离线按弱、中、强子集加权排序;AIA先查纯文本,失败后按序附加通用干扰音频。
实验与结果
10个LALM上,JBB与WildJailbreak的AIA两种ASR都高于纯文本。表2的JBB ASR-M为32.26%至100.00%。作者称优于九个基线并达SOTA;表3查询次数记为11.7。
局限与可以继续做的
论文未设局限专节。第5节提出后续可对干扰音频做更强优化,或把ALS索引交给攻击用LLM。自跑主结果为10个LALM;护栏与人工核验各2个模型;排序用Qwen2.5-Omni-7B。
实验设置Qwen3-Omni、Qwen2.5-Omni 等 · JBB-Behaviors、WildJailbreak 等 · ASR-R、ASR-M 等
威胁模型
作者将AIA定义为免优化、基于查询的通用黑盒攻击。攻击者向LALM提交标准恶意文本,并附加内容良性、带特定ALS的通用干扰音频,以偏移安全对齐;攻击循环不调用在线AGM,也不做逐样本优化。成功由GPT-4o按1–10分判定,仅10分计越狱。排序所用音频来自对Qwen2.5-Omni-7B的探索。
被测模型
Qwen3-OmniQwen2.5-OmniQwen2-AudioLLaMA-OmniKimi-AudioOmniVinciMiMo-AudioGPT-4o-AudioGemini-3-ProGemini-2.5-Pro
基准
JBB-BehaviorsWildJailbreakHH-RLHFAdvBenchHarmBench
指标
ASR-RASR-MQuery Time
AI 导读研究者提出声学干扰攻击(AIA),将音频的角色从恶意内容载体转为安全对齐干扰源,用内容无害但带有特定声学潜在语义(ALS)的干扰音频作为通用越狱触发器。AIA 将攻击载荷与音频解耦,使用一组通用、与指令无关的干扰音频,使标准恶意文本查询无需针对具体实例优化即可绕过安全对齐。在 5 个数据集、10 个大型音频语言模型(LALM)上的实验显示,AIA 取得当前最优的攻击成功率。可解释性分析进一步发现 AIA 引发的推理路径漂移,并识别出 ALS 中的有效模式,指向 LALM 跨模态对齐的脆弱性。该工作已被 ICML'26 接收。

研究者提出声学干扰攻击(AIA),将音频的角色从恶意内容载体转为安全对齐干扰源,用内容无害但带有特定声学潜在语义(ALS)的干扰音频作为通用越狱触发器。AIA 将攻击载荷与音频解耦,使用一组通用、与指令无关的干扰音频,使标准恶意文本查询无需针对具体实例优化即可绕过安全对齐。在 5 个数据集、10 个大型音频语言模型(LALM)上的实验显示,AIA 取得当前最优的攻击成功率。可解释性分析进一步发现 AIA 引发的推理路径漂移,并识别出 ALS 中的有效模式,指向 LALM 跨模态对齐的脆弱性。该工作已被 ICML'26 接收。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者称良性音频里的声学潜语义即可干扰LALM安全对齐,无需把恶意内容写入音频。

    内容良性、只携带特定声学潜语义的音频,能否单独干扰大音频语言模型(LALM)的安全对齐,让标准恶意文本绕过拒绝。

    • 场景:LALM把文本与音频放进端到端推理。作者称RLHF等对齐仍以文本恶意语义为中心,音频因此扩大了可绕过语义护栏的攻击面。
    • 既有不足:作者将既有音频越狱分为语义优化、显式声学参数控制、加性扰动,且都以恶意音频为载荷。作者称前两类常需逐样本优化,不适于黑盒商业API;预定义风格参数过粗;加性扰动未针对音频特征。
    • 观察:作者称,指令中性且内容良性、但含特定声学潜语义(Acoustic Latent Semantics, ALS)的音频,可作为通用触发器。ALS来自生成式音频先验的原生流形,不是性别、情绪等标签的人工组合。
    • 提出:Acoustic Interference Attack(AIA)。恶意载荷留在文本,文本失败后再附加一套通用干扰音频,不做逐样本优化。作者并分析其引起的推理路径偏移。作者称这是首次把Acoustic Interference识别为一种脆弱性。
    • 威胁模型:
      • 目标:使LALM对标准恶意文本输出被判为越狱的回复。
      • 知识:作者将AIA定为免优化、基于查询的通用黑盒攻击,不使用目标权重或梯度。干扰音频的离线排序来自Qwen2.5-Omni-7B上的探索。
      • 能力:攻击者提交恶意文本,并附加内容固定为良性指令的音频。音频由Bark按预存history prompt离线合成,攻击循环不再调用AGM。
      • 受害系统与判定:受害系统为LALM。GPT-4o以1–10分评分,仅10分计成功;ASR-R会先剔除含标准拒绝前缀的回复。
  2. 有哪些相关研究?

    作者把既有工作分成三类音频载荷路线,并把AIA放在不在线生成、不改音频语义的一侧。

    附录A先把对抗样本、后门、数据投毒和文本越狱列为深度模型威胁,再集中评述黑盒LALM越狱。作者按是否逐样本优化分成实例级与通用两类,并在引言里把载荷构造分成三条路线。

    三类载荷路线

    • 语义优化:Shen等(2024)、Chiu等(2025)先用叙事或人物包装恶意文本,再经音频生成模型(AGM)合成。
    • 声学控制:Hughes等(2025)、Roh等(2025)调节AGM里性别、情绪等预定义参数,用来修饰越狱音频。
    • 加性扰动:Cheng等(2025)、Gupta等(2025)把音频当一般信号,在生成后加对抗噪声。作者称①和③常要昂贵的逐样本优化;②缺少高维灵活性;③未考虑音频特有特征。三条都要在攻击时在线调用AGM。

    实例级音频越狱

    • BoN与AJailBench:BoN反复采样增强提示,音频侧含音高修改;附录A指出其查询代价远高于其他工作,表3记为600。AJailBench含1495条对抗音频、10个违规类别,并用贝叶斯优化做时频与混合扰动;论文称代价高,查询记为10+B。
    • AdvWave与Speech-Specific Jailbreak:AdvWave黑盒用外部LLM按评审反馈改写文本再合成音频。论文称这一部分只是文本越狱迁移,未用音频特有特征。Speech-Specific Jailbreak红队五个LALM,但需人工为每条查询选一个有害词。
    • 显式音频条件:Jailbreak-AudioBench注入音调、语速、情绪和背景噪声;Multi-AudioJail使用多语言、多口音以及混响、回声、耳语;SACRED-Bench组合有害/良性语音、非语音和多说话人对话,并提出SALMONN-Guard。论文称Jailbreak-AudioBench的显式控制与ALS不同。

    通用音频越狱

    • VoiceJailbreak与Flanking Attack:前者测量GPT-4o-Audio对叙事操纵的反应。论文称其策略从文本越狱迁移而来,未用音频特有特征,且未报告其他LALM。后者把恶意音频夹在良性查询之间,评测仅Gemini-1.5-Flash,攻击时仍要逐样本生成。
    • AMSE与“I am bad”:AMSE调节tone、accent、emphasis、intonation、speed、noise。论文称设置可跨提示复用,但仍需攻击时生成,且显式参数不同于ALS。“I am bad”用梯度下降优化通用对抗音频前缀;论文称只在SALMONN-7B上讨论。
    • AudioJailbreak:先在代理模型上优化通用音频后缀再迁移。论文称其目标是拒绝服务或匹配预定义有害前缀,与标准LALM越狱不完全对齐。

    基线与本文定位

    • 基线方法:表3对比七个实例级方法(BoN、Speech-Specific Jailbreak、AdvWave黑盒、Jailbreak-AudioBench、Multi-AudioJail、AJailBench、SACRED-Bench)和两个通用方法(AMSE、AudioJailbreak)。VoiceJailbreak、“I am bad”、Flanking Attack因只报告较少使用或私有数据而未纳入。对比数字来自原论文在JBB、AdvBench、HarmBench上的记录;灰色数字来自JALMBench。作者自跑评测还用WildJailbreak与HH-RLHF。

    作者把AIA放在上述路线之外:不使用①②③,攻击时不在线调用AGM,恶意载荷留在文本,触发器是从AGM原生流形挖出的ALS。表1称因此效率更高、现实威胁更大;该表未给查询次数或耗时。

  3. 论文如何解决这个问题?

    用Bark采样建ALS武器库并离线排序,文本失败后再附加通用、内容良性的干扰音频。

    整体做法是把音频从恶意内容载体改成对齐干扰。作者先建ALS武器库,再实现AIA:文本载荷与良性音频触发器分开,排序离线完成,攻击时只查询。

    攻击设定

    • 受害系统是接受文本和音频的LALM。查询先是越狱文本;若被拒绝,再变成同一文本加一条干扰音频。
    • 音频内容固定为三条语义中性指令,使观察变化来自ALS,而不是额外恶意语义。第2.2节列出原文,此处不复述。
    • 探索阶段用五次纯文本的GPT-4o均分划分强集(>8)、弱集(<2)和其余中集,供观察干扰方向和离线排序。这不是主实验的成功定义。

    ALS武器库

    • 声学空间的代理生成模型是Bark。history prompt为空时,它随机采样风格嵌入并与音频一起输出。温度从均匀分布U(0.8, 1.2)抽取。输入固定为一条语义中性的英文pangram。此步生成5000条候选。
    • 按正常时长做质量过滤。嵌入是CLAP语义向量与WavLM第6–12层声学向量各自归一化后拼接,再归一化。作者用CLAP对齐固定pangram,以降低该文本对后续聚类的影响。
    • 对嵌入做两阶段k-means,再在每个叶簇中保留质心,以及簇边界内离中心较远的样本。论文未给出k,也未给出最终代表条数。
    • 每条代表音频有12维索引,分Persona、Delivery、Signal。GPT-4o按0–9打分,规则侧使用谱熵、基频等物理量。融合为 s[d]=Bucket0−9(wd· Z(sllm[d])+(1−wd)· Z(srule[d])),即两侧Z-score后加权,再等频分到10档。论文未给出维度权重。附录D给出评分细则。

    干扰效应与AIA

    • 干扰音频用代表history prompt、温度固定为1,对三条中性指令分别合成。作者在Qwen2.5-Omni-7B与JBB文本上称效应是双向的:强文本加音频后变差,中、弱文本变好。作者据此认为ALS不是在叠加恶意信息,而是使推理路径偏移。加音频后的子集ASR没有给出数值。
    • 排序分覆盖弱、中、强子集的ASR与归一化GPT分:S(x)=∑bλbASRb(x)+Norm(SGPT,b(x))。论文举例权重为3、2、1,弱子集更大。同一history prompt的三条指令取最大分后降序。排序只计算一次。
    • 攻击时先用纯文本查询m次;仍拒绝则按序取前n条干扰音频,成功即停。论文未给出m、n;表7称标准设置使用top 30。流程见附录B的算法1。作者称同一套音频可用于未见过的越狱目标,且新的成功来自声学干扰。

    成功判定

    • ASR-R沿用PAIR:先去掉含标准拒绝前缀的回复,再由GPT-4o打1–10分,仅10分成功。评审系统提示来自PAIR。
    • ASR-M不做拒绝前缀过滤,对全部回复离线重评。GPT-4o连续拒评三次则换GPT-4o-mini;仍失败则记无效并单独统计。作者引入ASR-M,是因为AIA不优化固定合规前缀,ASR-R可能低估。
  4. 论文做了哪些实验?

    表2:10个模型上AIA的ASR-R、ASR-M均高于纯文本。

    实验设置

    • 目标模型:开源Qwen3-Omni、Qwen2.5-Omni、Qwen2-Audio、LLaMA-Omni、Kimi-Audio、OmniVinci、MiMo-Audio;闭源GPT-4o-Audio、Gemini-3-Pro、Gemini-2.5-Pro。第2.2节的探索与排序写明使用Qwen2.5-Omni-7B。
    • 数据:JBB-Behaviors中,black-box PAIR针对GPT-4-0125-preview的64条有效记录;WildJailbreak的前100条adversarial harmful样本。HH-RLHF消融取前100条有效记录里最长的单轮人类提示。作者称有五个数据源,并把AdvBench、HarmBench计入,经由JBB中既有产物使用,不做额外挑选。
    • 基线:表3列入BoN、Speech-Specific Jailbreak、AdvWave(black-box)、Jailbreak-AudioBench、Multi-AudioJail、AJailBench、SACRED-Bench、AMSE、AudioJailbreak。这些数字来自原论文或JALMBench,不是作者统一重跑。
    • 指标:ASR-R先滤拒绝前缀,再由GPT-4o打1–10分,10为成功。ASR-M重评全部回复;GPT-4o连续拒评三次则改用GPT-4o-mini,仍拒评记无效。主实验剔除无效样本。表2另报平均查询次数。论文未说明失败样本是否计入该平均,也未报告独立重复次数。
    • 核验:HarmBench-Llama-2与Llama Guard 3重判JBB回复;10名志愿者按1–10分给有害目标及回复打分。论文未报告人工一致性系数。
    • 攻击侧模型:Bark合成音频;CLAP与WavLM第6–12层做嵌入;武器库各维由GPT-4o与规则分数融合。

    主结果

    下表为表2的ASR-M(%)。WJ即WildJailbreak。查询次数取该表JBB列。Qwen2.5-Omni一行也是第2.2节排序所用模型,不是未参与排序的迁移目标。

    表格较宽,可左右滑动

    模型JBB文本JBB AIAWJ文本WJ AIAJBB查询
    Qwen3-Omni45.0069.0541.3374.6711.7
    Qwen2.5-Omni(排序)50.98100.0047.8995.779.7
    LLaMA-Omni9.6832.2623.4043.6224.7
    Kimi-Audio14.5472.7317.8647.6216.5
    GPT-4o-Audio56.1075.6129.8552.2410.7
    Gemini-3-Pro34.4893.1037.1485.7112.2
    Gemini-2.5-Pro50.00100.0035.0098.3311.9
    • 表中省略Qwen2-Audio、OmniVinci、MiMo-Audio。三者JBB的AIA ASR-M为96.30、98.25、95.24,WJ为87.64、96.59、84.85;OmniVinci的JBB查询次数为4.7。表2里两种ASR、两个数据集、10个模型的AIA都高于同格纯文本。ASR-R在JBB上的AIA最低为22.45%(LLaMA-Omni),最高为90.38%(OmniVinci)。表2给出的绝对增益中,最小是LLaMA-Omni在JBB上ASR-R的14.29个百分点,最大是Gemini-2.5-Pro在WJ上ASR-M的63.33个百分点。
    • 作者称文本遇到瓶颈后,声学干扰会引起推理路径偏移。作者并称AIA在通用LALM越狱上达到SOTA,且在多数情况下优于实例级方法。表3的AIA列与表2的JBB ASR-M相同;论文未说明各基线是否使用同一子集和同一评审。反例是LLaMA-Omni的32.26低于AdvWave的100.00和AJailBench的64.80,Qwen2-Audio的96.30低于AdvWave的96.70。灰色分数来自JALMBench,量程1–5且4和5都算成功;作者称灰色分更低则可判定该方法更弱,更高则不能反推更强。
    • 作者称查询次数在三种通用方法中居第二、十种方法中居第五。表3把AIA的Query Time记为11.7,与表2中Qwen3-Omni的JBB查询次数相同;论文未说明该列是否为跨模型平均。表2的JBB查询次数从4.7到24.7。作者称攻击循环不调用在线AGM,现实效率会更好;论文未另报墙钟时间。

    外部护栏与人工核验

    • 表4用两个护栏重判JBB回复。Qwen2.5-Omni有效样本上,HarmBench-Llama-2的AIA ASR为98.04(增益25.49个百分点),Llama Guard 3为96.08(增益13.93个百分点);无效样本增益为38.47与30.77个百分点。GPT-4o-Audio有效样本增益为4.88与4.87个百分点。作者称无效样本上的提升不低于有效样本,因此主实验剔除无效样本不会高估AIA。论文未给出valid/invalid条数。
    • 一致性按判断是否一致的样本比例计算。Qwen2.5-Omni在AIA条件下,ASR-M与两护栏为98.04%和96.08%,ASR-R为80.85%和70.21%。作者称ASR-M与外部护栏更一致。
    • 表5是10名志愿者的回复均分,不是ASR。Qwen2.5-Omni的人工均分从5.43到8.63,介于ASR-R的5.71与ASR-M的10.00之间。GPT-4o-Audio的ASR-R均分从5.77降到4.44,人工从6.78到6.86,ASR-M从7.19到7.74。作者称人工分更靠近ASR-M。

    推理路径与ALS模式

    • 第4.1节把拒绝logit margin定义为拒绝类token最大logit减去合规类最大logit,再比较加音频与纯文本。作者称差值在全部JBB子集上为负。正文和图注未给差值数值,也未说明分析用的是哪一个LALM。
    • 拒绝方向取层号满足i % 4 = 0的层,用纯文本拒绝与合规隐状态的均值差。图注称早期层偏移接近0,后期层沿拒绝方向负向偏移,箭头指向合规。文本转换看不到具体坐标。
    • 作者称把音频激活补进纯文本流会使margin塌缩,反向补丁恢复正margin。第4.2节称Pitch、Valence、Speed、Gender的分布差异最大。附录C给出Peak Shift:Pitch +9、Speed +8、Energy +5、Standardization +4、Age −8。作者认为Persona与Delivery比Signal更影响对齐,并假设高音高/快语速、正向语气、低年龄和合成故障与越狱偏好有关。Wasserstein Distance被作者用作显著性检验,正文未给p值或阈值。

    其他消融与分析

    • 弱文本(HH-RLHF,表6):Qwen2.5-Omni的ASR-M从4.23到11.27、ASR-R从13.89到41.67;Qwen2-Audio分别为3.85到11.54、3.85到12.82;GPT-4o-Audio两种都从0.00到1.10;表6写作Gemini-2.5,两种都从2.94到23.53。作者称通常提升数倍,该表的GPT-4o-Audio不是这一幅度。
    • ALS质量(表7,JBB):Qwen2.5-Omni的Top/Bottom/Non,ASR-M为100.00、97.96、85.19,ASR-R为74.47、75.61、58.33。GPT-4o-Audio的ASR-M为75.61、67.50、71.11,ASR-R为65.71、55.56、63.89。作者称Top 30总体上最好,Non-ALS在Qwen2.5-Omni上下降更多;其Bottom 30的ASR-R高于Top 30。
    • 子集基线(第2.2节,五次纯文本):强集12条、ASR约76%;中集19条、约55%;弱集33条、约8%。作者称加强音频后强集变差、中弱集变好;加音频后的ASR未给出。
    • 排序权重:论文举例为3、2、1,未说明实验是否只使用这一组。合成干扰音频的温度固定为1;武器库采样温度为U(0.8, 1.2),候选5000条。
    • 附录E给出Qwen2.5-Omni与GPT-4o-Audio的三则对照,用于展示纯文本被拒绝而AIA继续生成;此处不转述回复。
  5. 有什么可以进一步探索的点?

    论文未设局限专节;第5节的后续是优化干扰音频,并把ALS索引用于自动化。

    作者指出的局限与后续方向

    • 论文没有Limitations专节,也未在Discussion中逐条写出不足。
    • 更强优化(第5节):作者称后续可对干扰音频使用更高级的优化。
    • 自动化(第5节):作者称可把可解释的ALS索引提供给攻击用LLM,使音频越狱像文本越狱一样自动化。
    • 社区方向(第5节):作者希望这项工作促使后续探索LALM对齐的脆弱性与防御机制。

    实验覆盖范围

    • 主结果覆盖7个开源与3个闭源LALM,数据为JBB的64条PAIR记录和WildJailbreak的前100条(第3节、表2)。
    • HH-RLHF使用前100条中每段对话最长的单轮人类提示,模型为Qwen2.5-Omni、Qwen2-Audio、GPT-4o-Audio和表6所写的Gemini-2.5。
    • 表3的基线数字引自原论文在JBB、AdvBench、HarmBench上的记录或JALMBench;AIA行未报告Gemini-2.5-Flash、Gemini-2.0-Flash、Gemini-1.5-Pro。
    • 两个护栏与10人评分只覆盖Qwen2.5-Omni和GPT-4o-Audio的JBB记录(表4、表5)。论文未给出valid/invalid条数,也未报告主结果的独立重复次数。
    • 干扰音频排序来自Qwen2.5-Omni-7B(第2.2–2.3节)。论文未说明第4.1节机理分析的模型,也未给出算法1中m、n的取值;表7称标准AIA使用top 30 ALS。
  6. 总结一下论文的主要内容

    AIA把恶意载荷留在文本,用通用良性音频的潜语义干扰对齐,并报告高于纯文本的ASR。

    AIA是一种针对LALM的通用黑盒越狱:恶意内容留在文本里,音频只携带从生成模型先验中取出的副语言特征,用来干扰安全对齐。

    • 问题:既有音频越狱把恶意音频当载荷,依赖语义改写、显式风格参数或加性噪声,并常要逐样本优化和在线生成。作者假设,AGM原生流形上的特征本身就能使推理离开安全子空间。
    • 方法:Bark对固定中性文本无条件采样,经时长过滤、CLAP与WavLM嵌入、两阶段聚类和12维混合标注,形成ALS武器库。排序按弱、中、强文本子集加权,只算一次。AIA先查纯文本,失败再按序附加内容良性的干扰音频。成功主要看GPT-4o是否打出10分;ASR-R另有拒绝前缀过滤,ASR-M重评全部回复。
    • 结果:表2的10个LALM上,JBB与WildJailbreak的两种ASR都高于纯文本。JBB的AIA ASR-M从LLaMA-Omni的32.26%到Qwen2.5-Omni与Gemini-2.5-Pro的100.00%;后者也用于排序。WildJailbreak上,Gemini-2.5-Pro的ASR-M为98.33%,增益63.33个百分点;GPT-4o-Audio为52.24%。作者称相对九个音频越狱基线达到SOTA。表3有反例:LLaMA-Omni的32.26低于AdvWave的100.00。10人评分中,Qwen2.5-Omni的AIA均分为8.63,GPT-4o-Audio为6.86。
    • 作者结论:作者称跨模态对齐可被内容良性的音频偏移,并希望后续研究这种脆弱性和防御。第5节写出的后续是对干扰音频做更强优化,以及把ALS索引交给攻击用LLM。
阅读原文arxiv.org