跳到正文
原文
论文追踪· arXiv:2501.13772· Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu·本站收录 · 原文发表

Jailbreak-AudioBench:面向大型音频语言模型的越狱评测基准

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者评测音频编辑越狱:SALMONN-7B在Explicit Small的查询式ASR从31.6%升至85.1%。

问题
端到端LALM直接感知语速、音高、噪声、口音和情绪等隐藏语义。作者称文本与视觉越狱研究较多,音频越狱仍缺少系统评测,这类编辑可能绕过安全约束。
方法
用gTTS把越狱文本转为音频,再做音量、语速、语调、音高、噪声、口音和情绪编辑。问题分为Explicit与Implicit;ASR要求Llama Guard 3判有害且超过50词。另以32种组合查询,并把拒绝有害内容的音频指令前置到样本前。
实验与结果
编辑后ASR相对原音频有升有降。Explicit Small上,查询式组合使SALMONN-7B的ASR从31.6%升至85.1%,Gemini-2.5-Flash从8.1%升至49.4%。作者称前置音频指令会降低ASR,剩余值仍高。
局限与可以继续做的
作者指出Llama Guard 3会把复读误判为成功,并计划改指标、加入自然语音。评测为10个端到端模型、每条一次推理;闭源主表用262/237条小集,Figure 6/9未含这两个闭源模型。
实验设置BLSP、SpeechGPT 等 · AdvBench、MM-SafetyBench 等 · ASR
被测模型
BLSPSpeechGPTQwen2-Audio-7BSALMONN-7BSALMONN-13BVITA-1.5R1-AQAMiniCPM-o-2.6GPT-4o-AudioGemini-2.5-Flash
基准
AdvBenchMM-SafetyBenchRedTeam-2KSafeBenchJailbreak-AudioBench
指标
ASR
AI 导读研究者提出 Jailbreak-AudioBench,用于系统评测大型音频语言模型(LALM)面临的音频越狱威胁,包含工具箱、精选数据集和基准三部分。工具箱支持文本转音频以及多种注入音频隐藏语义的编辑技术,数据集提供原始与编辑两种形式的显式和隐式越狱音频样本。作者用该数据集评测了多个当前先进的 LALM,称其建立了迄今最全面的音频模态越狱基准,并希望借此暴露基于查询的音频编辑等更强越狱威胁,推动 LALM 安全对齐与防御研究。

研究者提出 Jailbreak-AudioBench,用于系统评测大型音频语言模型(LALM)面临的音频越狱威胁,包含工具箱、精选数据集和基准三部分。工具箱支持文本转音频以及多种注入音频隐藏语义的编辑技术,数据集提供原始与编辑两种形式的显式和隐式越狱音频样本。作者用该数据集评测了多个当前先进的 LALM,称其建立了迄今最全面的音频模态越狱基准,并希望借此暴露基于查询的音频编辑等更强越狱威胁,推动 LALM 安全对齐与防御研究。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    端到端LALM会直接感知音频隐藏语义,音频越狱仍缺少系统评测。

    端到端LALM直接读取音频隐藏语义,但这类越狱还缺少系统评测。

    • 场景:作者称语音助手、客服和车载语音会用到音频-语言处理。端到端LALM不经转写,直接读原始音频,因而保留Emphasis、语速、语调、音高、背景噪声、口音和情绪。级联式模型先做ASR再交给LLM,转写会丢掉这些信息。
    • 现有不足:作者称文本与视觉越狱已有较多工作,端到端LALM的音频越狱仍缺少系统研究;已有初步工作,系统调查有限。
    • 观察:作者认为,对音频隐藏语义敏感,会使端到端LALM更容易被这类编辑绕过安全约束。
    • 本文提出:Jailbreak-AudioBench,含Toolbox、Dataset和Benchmark。作者称这是迄今最全面的音频越狱评测,并用来做查询式音频编辑和一种前置指令防御。
    • 威胁模型:
      • 目标:诱导LALM回答有害问题。成功需Llama Guard 3判为有害,且回复超过50词。
      • 知识:论文未写攻击者能否读取参数或梯度。主评测对每条音频做一次推理;开源模型的表示分析读取audio encoder与transformer隐状态。
      • 能力:把文本越狱问题转成音频,再用Toolbox注入隐藏语义。查询式设定下每条样本有32种编辑组合。
      • 受害系统:Section 3.2列出的端到端LALM,含BLSP、SpeechGPT、Qwen2-Audio、SALMONN、VITA-1.5、R1-AQA、MiniCPM-o-2.6、GPT-4o-Audio、Gemini-2.5-Flash。
  2. 有哪些相关研究?

    相关工作覆盖文本与视觉越狱、LALM架构和音频能力基准。

    作者把本文放在文本/视觉越狱、LALM架构和音频能力评测旁边,并称音频专用威胁仍被忽略。

    越狱攻击与评测数据

    • 提示工程:Related Work称,编造事实、角色扮演或重复查询等提示工程会暴露跨模态漏洞,引用包括[53; 31; 24; 8; 10; 16]。引言还列举命令式措辞、角色扮演、emoji注入,以及把良性与有害请求混在一起的干扰重定向;作者称这些做法简单,但能绕过系统级防护。
    • 模态扰动:LVLM上,攻击者用排版或视觉扰动触发越狱[23; 9]。另一类把优化后、难察觉的扰动注入输入,构成对抗提示[73; 43]或对抗图像[48; 29; 12; 52; 11]。
    • 基准与音频工作:AdvBench[73]、MM-SafetyBench[40]、RedTeam-2K[42]、SafeBench[23]提供越狱提示。[62; 42; 64; 69]从攻防两侧评LVLM越狱稳健性。音频上,Yang等[65]从AdvBench取350条,评测若干端到端LALM[13; 55; 56]。

    LALM架构

    • 级联式:代表设计是Whisper做ASR、GPT-4做下游问答或摘要;GigaSpeech+GPT把大规模ASR输出送入LLM。Gao等[20]与MERaLiON-AudioLLM把Whisper分别接到LLaMA和SEA-LION V3;作者称其在多语问答和翻译上取得strong performance。
    • 端到端:闭源代表为GPT-4o。开源方面,BLSP用轻量adapter对齐冻结语音编码器与LLM;SpeechGPT用离散单元和多阶段训练统一语音与文本;Qwen2-Audio与SALMONN把音频编码器接到LLM;VITA-1.5做实时语音-视觉联合解码;R1-AQA用强化学习做音频问答;MiniCPM-o-2.6面向低资源、结构更小。

    已有LALM基准

    • 能力评测:AIR-Bench评语音、自然声和音乐的基础与对话任务;AudioBench覆盖8个任务、26个数据集;MMAU用10,000条音频和问答做专家级推理;ADU-Bench有20,000段开放式多语对话。FunAudioLLM面向语音理解与生成;WavLLM用双编码器分别建模语义和说话人信息。这一节只描述这些基准做什么。

    基线与本文数据

    • 对照:Table 2的Original是未编辑音频的baseline ASR,编辑结果用相对变化与之比较。
    • 问题来源:论文写N=4700,来源为AdvBench 250条、MM-SafetyBench 1,680条、RedTeam-2K 2,000条、SafeBench 500条。

    作者称先前工作主要集中在文本和视觉,音频专用威胁在很大程度上被忽略;本文用编辑工具箱、显式/隐式数据和端到端LALM评测来做音频越狱基准。作者称这是迄今最全面的音频越狱基准与数据集。

  3. 论文如何解决这个问题?

    Jailbreak-AudioBench把文本问题转成带隐藏语义的音频再评测LALM。

    Jailbreak-AudioBench先把文本越狱问题转成语音,再注入隐藏语义,用ASR评测端到端LALM;同一工具箱再用于查询式组合编辑和前置指令防御。

    工具箱

    • 转换与七类编辑:gTTS做text-to-audio。编辑为Emphasis(Volume ×2/×5/×10)、Speed(Rate ×0.5/×1.5)、Intonation(Interval +2/+3/+4)、Tone(Semitone -8/-4/+4/+8)、Background Noise(Crowd/Machine/White Noise)、Celebrity Accent(Kanye West/Donald Trump/Lucy Liu)、Emotion(Laugh/Scream)。
    • 实现:附录A写Emphasis用librosa放大片段,通常是开头1.0秒;Speed用SoX tempo并保持音高;Intonation按段移动音高,间隔序列为[0, 2, 4, 6]、[0, 3, 6, 9]、[0, 4, 8, 12];Tone用SoX按半音平移;噪声以SNR -30dB叠加;口音用Coqui TTS;情绪用Dia-1.6B。Figure 3用文字标注和频谱对比编辑前后。
    • 类别数:Table 1写4*Tone+3*Intonation+2*Speed+3*Emphasis+3*Background Noise+3*Celebrity Accent+2*Emotion=20类。

    数据集构建

    • 分类:Algorithm 1从基问题集出发,用GPT-4o加人工按威胁程度分成Explicit与Implicit。论文写|QEx|=2497、|QIm|=2203,用于评测不同越狱强度;未写两类的判定细则。Figure 1写Explicit有16个detail sub-task,Implicit有12个;转换文本未列出子任务名称。
    • 生成:两类都经gTTS得到基音频,再逐条施加编辑操作,得到Edit(AEx)与Edit(AIm)。
    • 规模:Table 1中Explicit为基音频2497、编辑49940、合计52437;Implicit为2203、44060、46263;Explicit Defense为2497、49940、52437;Explicit Small为基音频262、32类、编辑8384、合计8646。正文称数据集共157,782条音频。附录Table 3另有Explicit Small (GPT-4o Eval) 262/5240/5502、Implicit Small (GPT-4o Eval) 237/4740/4977、Implicit Defense 2203/44060/46263。

    成功判定

    • 模型与推理:评测BLSP、SpeechGPT、Qwen2-Audio、SALMONN、VITA-1.5、R1-AQA、MiniCPM-o-2.6、GPT-4o-Audio、Gemini-2.5-Flash。各用官方实现的默认超参,每条音频一次推理。
    • ASR:回复须被Llama Guard 3判为有害,且超过50词。作者称长度要求用来排除简短应答,并称Llama Guard 3与人工评估接近;对照在附录C。
    • 闭源子集:因全量成本高,GPT-4o-Audio与Gemini-2.5-Flash在较小版本上评测。附录B写这两套小集的基音频为262与237,再加20类编辑。

    查询式编辑与前置防御

    • 查询式:从Explicit抽出262条,保持有害内容类别约十分之一,构成Explicit Small。附录D写用网格搜索组合accent/emotion、emphasis、speed、background noise。Table 1的计数式为2*Speed*2*Emphasis*2*Background Noise*(2*Celebrity Accent+2*Emotion)=32。262×32=8384。Figure 5底行表示32次查询中是否至少一次成功。转换文本未逐条列出32组参数。
    • 防御:用gTTS生成一段不再编辑的音频指令,要求助手拒绝违法、有害或不道德内容;前置到样本前,中间插入1000ms静音,得到Explicit Defense与Implicit Defense。作者称这是用前置音频指令强化对齐的轻量方法。
  4. 论文做了哪些实验?

    编辑相对原音频会升也会降ASR;查询式组合把SALMONN-7B提到85.1%。

    实验设置

    • 被测模型:BLSP、SpeechGPT、Qwen2-Audio(分析与Figure 5写作Qwen2-Audio-7B)、SALMONN-7B、SALMONN-13B、VITA-1.5、R1-AQA、MiniCPM-o-2.6、GPT-4o-Audio、Gemini-2.5-Flash。默认超参。
    • 数据:Explicit 2497条、Implicit 2203条基音频,各20类编辑。闭源模型用附录B小集,基音频262与237。查询式用Explicit Small,262×32。防御用Explicit Defense与Implicit Defense。
    • 指标:ASR。Llama Guard 3判有害且超过50词。每条一次推理。论文未报告多次重复。
    • 对照:未编辑Original音频。Table 2在绝对变化大于或等于1%时,用红色标升、绿色标降。
    • 人工对照:3名志愿者,只评Explicit Small原音频在附录C列出的模型上的输出。
    • 表示分析:Qwen2-Audio-7B、MiniCPM-o-2.6、SALMONN-7B的audio encoder与若干transformer层,数据为Explicit Subtype上的不同编辑。

    主结果

    下表是Table 2的Original ASR,左侧为表中Explicit侧,右侧为Implicit侧。

    模型Table 2左侧Table 2右侧
    BLSP47.5%18.25%
    Qwen2-Audio16.8%6.76%
    SALMONN-7B31.4%14.3%
    SALMONN-13B31.3%12.89%
    VITA-1.53.7%2.77%
    MiniCPM-o-2.618.2%9.03%
    GPT-4o-Audio0.7%0.8%
    Gemini-2.5-Flash8.1%5.1%

    正文写GPT-4o-Audio与Gemini-2.5-Flash因成本改用较小版本;附录B的基音频为Explicit Small (GPT-4o Eval) 262条、Implicit Small (GPT-4o Eval) 237条。表注仍写Explicit/Implicit Subtype。省略SpeechGPT(14.1%/2.45%)与R1-AQA(12.6%/7.17%),二者也在Table 2。

    • 作者称SALMONN最易受编辑影响,尤其是celebrity accent、emphasis、background noise和emotion。Table 2中SALMONN-13B的Explicit侧,Machine Noise为+28.6%,Semitone +8为+24.1%,Laugh为+23.2%,Volume*5为+20.5%。
    • 作者把SpeechGPT、Qwen2-Audio和BLSP放在一起,称多数编辑不提高ASR。Table 2里SpeechGPT的Explicit正向变化都小于1%;Qwen2-Audio达到1%着色阈值的是Rate*1.5的+1.1%。BLSP则有Laugh +4.0%、Rate*0.5 +2.8%。作者称VITA-1.5、R1-AQA、MiniCPM-o-2.6增幅一般在5%以内;MiniCPM-o-2.6的Semitone +8与Kanye West在Explicit侧为+7.9%。
    • 也有下降。SALMONN-7B的Interval+2在Explicit侧为-27.6%,SALMONN-13B的Rate*1.5为-22.9%。作者称GPT-4o-Audio只在部分编辑上有小于1.7%的升幅;Table 2中其Machine Noise的Implicit侧为+1.7%,Rate*1.5与Interval+4的Explicit侧为+1.5%。作者称Gemini-2.5-Flash的升幅主要在speed和intonation;其Interval+3的Explicit侧为+1.9%。

    查询式音频编辑

    • 测了什么:Explicit Small每条基音频有32个编辑变体。Figure 5的列是样本,前32行是变体,倒数第二行是未编辑音频,底行表示32次中是否至少一次成功。图注写绿色为失败、红色为成功。
    • 结果:Figure 5写Qwen2-Audio-7B从13.3%到48.8%,SALMONN-7B从31.6%到85.1%,GPT-4o-Audio从0.7%到8.4%,Gemini-2.5-Flash从8.1%到49.4%。附录Figure 8写BLSP从48.1%到87.8%,SpeechGPT从12.2%到42.4%,VITA-1.5从3.4%到47.7%,MiniCPM-o-2.6从16.8%到65.7%。
    • 作者的解读:作者称组合编辑会抬高ASR,闭源模型也包括在内;并称一些开源模型在常规指标上声称达到GPT-4o水平,但抵御该攻击的表现与GPT-4o-Audio不同。论文未报告R1-AQA与SALMONN-13B的查询式ASR。

    前置音频指令防御

    • 测了什么:把未再编辑的拒绝指令前置到Explicit与Implicit样本,得到Explicit Defense与Implicit Defense。Figure 6、Figure 9的横轴为BLSP、SpeechGPT、Qwen2-Audio、SALMONN-7B、SALMONN-13B、VITA-1.5、R1-AQA、MiniCPM-o-2.6。
    • 结果:作者称两张图中防御都降低了各模型ASR;柱上数字是防御带来的ASR降幅。转换文本的柱与模型列无法可靠对齐,此处不逐项抄这些降幅。
    • 作者的解读:作者称前置音频指令提供baseline级防护,但剩余ASR仍然高,并称这显示该策略的局限,需要更有效的防御。

    内部表示

    • 测了什么:Figure 4是三个模型在Explicit Subtype、不同编辑类型上的t-SNE。作者选取Qwen2-Audio-7B、MiniCPM-o-2.6、SALMONN-7B,分别称为highly robust、moderately robust、vulnerable。附录写层包括0、8、16、24和最后一层。
    • 作者对图的解读:作者称audio encoder处三个模型都按编辑类型而不是语义成簇。作者称Qwen2-Audio-7B到Layer 8转为按语义成簇,Layer 31上各编辑类型分离很小;MiniCPM-o-2.6转换更早且不完整,Layer 27仍较散;SALMONN-7B到Layer 31仍保持按编辑类型分开,并与原音频分开。转换文本看不到点的位置,以上均为作者对Figure 4的描述。
    • 作者的解释:作者用这一差异解释三者对音频编辑越狱的不同反应,并称即使较稳健的模型起初也会分开编码编辑特征,因此多种编辑组合可能超出其后层的归一化。

    其他消融与分析

    • 附录C:Explicit Small原音频、n=262。Llama Guard 3为BLSP 126/262(48.1%)、SpeechGPT 32/262(12.2%)、Qwen2-Audio 35/262(13.3%)、SALMONN-7B 83/262(31.6%)、VITA-1.5 9/262(3.4%)、MiniCPM-o-2.6 44/262(16.8%)、GPT-4o-Audio 2/262(0.7%)。相对差包括志愿者2对GPT-4o-Audio的+0.4%,以及志愿者1对BLSP的+4.5%(138/262)。作者称最大增幅小于+4.5%,Llama Guard 3判成功者人工也判成功,故采用Llama Guard 3。
    • Figure 2(b)标注Emphasis 20.5、Speed 16.8、Intonation 5.6、Tone 24.1、Background Noise 28.6、Celebrity Accent 20.1、Emotion 23.2,轴约-30到+30。作者称这是各LALM上隐藏语义引起的最大越狱威胁变化。Table 2中SALMONN-13B Explicit的Interval+4为+11.7%,大于图中语调标注5.6。
    • 附录C按每种编辑的参数再画t-SNE;Figure 17至Figure 24为UMAP。作者称UMAP与t-SNE的模式一致。看不到图中点的位置,不另述簇的几何。
  5. 有什么可以进一步探索的点?

    作者指出Llama Guard 3会误判复读,并计划加入自然语音。

    作者指出的局限与后续方向

    • 评判器:Section 6写,沿用既有越狱研究,主要用Llama Guard 3。检查157,782条回复后,作者观察到有的回复只是重复输入;因含少量有害词,Llama Guard 3会误判为攻击成功。作者称当前越狱评测指标仍不完美,计划改进,并鼓励社区继续研究。
    • 语音自然度:Section 6写,准确建模带有真实韵律、语速和发音变化的自然语音仍然困难。当前用TTS音频作原始输入,再用Toolbox编辑。作者计划纳入自然语音录音,并扩展基准以更好反映真实场景。

    实验覆盖范围

    • 主评测报告10个端到端模型在默认超参下、每条音频一次推理的ASR(Section 3.2、Table 2)。论文未报告一次推理之外的重复次数。
    • 主实验为20类编辑;查询式为32种组合。Figure 5报告Qwen2-Audio-7B、SALMONN-7B、GPT-4o-Audio、Gemini-2.5-Flash;附录Figure 8报告BLSP、SpeechGPT、VITA-1.5、MiniCPM-o-2.6。论文未报告R1-AQA与SALMONN-13B的查询式ASR。
    • 闭源模型的Table 2对应附录B的262与237条基音频。Figure 6与Figure 9的横轴为BLSP、SpeechGPT、Qwen2-Audio、SALMONN-7B、SALMONN-13B、VITA-1.5、R1-AQA、MiniCPM-o-2.6。
    • 人工对照为3名志愿者、Explicit Small原音频262条、附录C列出的7个模型。表示分析为Qwen2-Audio-7B、MiniCPM-o-2.6、SALMONN-7B的encoder与transformer隐状态(Figure 4、附录C)。
    • Section 6写全量运行约9,216 GPU hours(NVIDIA A40),闭源API费用为$1,000。
  6. 总结一下论文的主要内容

    隐藏语义编辑会改变LALM越狱ASR,查询式组合在Explicit Small上进一步抬高。

    Jailbreak-AudioBench用工具箱、显式/隐式音频和ASR,检查端到端LALM对隐藏语义编辑的越狱反应。

    • 作者关心的是:端到端模型不经转写,直接使用语速、音高、噪声、口音、情绪等信息;文本和视觉越狱之外,这类音频编辑缺少系统评测。
    • 问题来自AdvBench、MM-SafetyBench、RedTeam-2K、SafeBench。论文写N=4700,分成Explicit 2497与Implicit 2203;gTTS转音频后做20类编辑。成功指Llama Guard 3判有害且超过50词,每条推理一次。
    • Table 2未编辑Explicit ASR包括BLSP 47.5%、SALMONN-7B 31.4%、SALMONN-13B 31.3%、Qwen2-Audio 16.8%、VITA-1.5 3.7%。GPT-4o-Audio 0.7%与Gemini-2.5-Flash 8.1%对应附录B小集。SALMONN-13B的Machine Noise为+28.6%,SALMONN-7B的Interval+2为-27.6%,均为Explicit相对Original。
    • Explicit Small上,32种组合查询把ASR从31.6%升至85.1%(SALMONN-7B)、13.3%升至48.8%(Qwen2-Audio-7B)、8.1%升至49.4%(Gemini-2.5-Flash)、0.7%升至8.4%(GPT-4o-Audio)(Figure 5)。
    • 作者称前置拒绝指令能降低开源模型ASR,但剩余值仍然高。作者把Llama Guard 3误判复读,以及TTS而非自然语音,写为局限,并计划改进指标、加入自然语音录音。
阅读原文arxiv.org