跳到正文
原文
论文追踪· arXiv:2601.23255· Ye Yu, Haibo Jin, Yaoning Yu, Jun Zhuang, Haohan Wang·本站收录 · 原文发表

研究者提出音频叙事越狱攻击,在 Gemini 2.0 Flash 上成功率达 98.26%

Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

叙事式语音投递提升LALM越狱ASR:Gemini2.0Flash在AdvBench上AdvWave增强为98.26%

威胁模型black-box下,攻击者只能向端到端LALM提交音频波形,无梯度或中间特征,只观察输入输出。

问题
端到端LALM直接吃原始语音,安全对齐主要按文本校准。作者问:带权威或共情的投递本身,能否让模型遵从不安全指令。
方法
不改指令语义,用TTS把同一文本渲染成五种启发式嗓音,在black-box下搜索更易诱发有害输出的风格,并接到DeepInception与AdvWave。
实验与结果
闭源两模型上风格化音频ASR多高于文本与AdvWave。Gemini 2.0 Flash在AdvBench的AdvWave增强ASR为98.26%(Table 2)。Qwen2.5-Omni多格低于对应基线。
局限与可以继续做的
作者指出:较小LALM上更易解码失败而非稳定输出有害内容;风格为少量手工设计,难系统优化;仅英语。实验含三款端到端模型、三个基准、DeepInception与30轮AdvWave;论文未报告主实验重复次数及裁判与人工的一致性。
实验设置GPT-4o Realtime、Gemini 2.0 Flash 等 · AdvBench、JailbreakBench 等 · ASR
威胁模型
black-box下,攻击者只能向端到端LALM提交音频波形,无梯度或中间特征,只观察输入输出。目标是用生成语音偏置内部解码,使文本响应在语义上对齐恶意查询并落入有害集合R,而不是符合人类价值与政策的安全拒答。成功指输出明确包含或认可R中的内容。
被测模型
GPT-4o RealtimeGemini 2.0 FlashQwen2.5-Omni-7B
基准
AdvBenchJailbreakBenchMaliciousInstruct
指标
ASR
AI 导读研究者设计了一种文本转音频的越狱方法,把被禁止的指令嵌入叙事风格的音频流中,利用先进指令跟随 TTS 模型的结构与声学特性绕过主要针对文本校准的安全机制。在合成语音交付下,该叙事格式让包括 Gemini 2.0 Flash 在内的前沿模型输出受限内容,成功率达 98.26%,明显高于纯文本基线。作者据此提出,随着语音接口普及,安全框架需要同时推理语言与副语言表征。该论文将在 EACL 2026 主会发表。

研究者设计了一种文本转音频的越狱方法,把被禁止的指令嵌入叙事风格的音频流中,利用先进指令跟随 TTS 模型的结构与声学特性绕过主要针对文本校准的安全机制。在合成语音交付下,该叙事格式让包括 Gemini 2.0 Flash 在内的前沿模型输出受限内容,成功率达 98.26%,明显高于纯文本基线。作者据此提出,随着语音接口普及,安全框架需要同时推理语言与副语言表征。该论文将在 EACL 2026 主会发表。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者把副语言投递做成black-box越狱,以绕过主要按文本校准的安全机制。

    端到端LALM直接处理原始语音,但安全机制主要按文本校准;叙事式副语言投递能否诱发受限输出,作者认为尚未被刻画。

    • 场景: 作者称语音助手、教育与临床分诊等正在接入实时语音界面(如GPT-4o、Gemini 2.0 Flash)。语调、情感和话轮使交互更像社交对话,也改变攻击面。
    • 既有不足: 作者称既有音频越狱多把文本提示合成语音,或加入口音、语音拼写、重音,以及梯度扰动和token搜索。语音仍被当作文本包装或低层信号,作为传达权威、共情和社会动态的通道缺少刻画。
    • 假设: 作者问:若模型把带说服性权威或共情的语音当作框架,能否越过对齐护栏并执行不安全指令。Figure 1用同一DeepInception提示作对照:文本被拒绝,经therapeutic或performative渲染后出现受限输出;图中具体指令不复述。
    • 做法: 提出black-box文本到音频越狱:不改底层指令语义,用指令跟随TTS把不允许的指令嵌进叙事式音频流,只调制投递。实验中称为delivery-style modulation。
    • 威胁模型:
      • 知识: black-box。无梯度、无中间特征,只能观察输入–输出。
      • 输入: 攻击者只提交音频波形。推理写成M: A→Y,A为波形,Y为文本响应。
      • 目标: 用生成语音偏置内部解码,使响应语义对齐恶意查询,落入违反对齐政策的有害集合R,而不是符合人类价值与政策的安全或拒答补全。
      • 成功与对象: 输出明确包含或认可R中元素即成功。对象是直接吃原始波形的端到端LALM,不是先ASR再进LLM的级联系统。
  2. 有哪些相关研究?

    论文把相关工作分成LALM、文本越狱和音频越狱,并称既有音频攻击仍偏文本包装或低层扰动。

    按引言和Section 2的分组,作者把本文放在用交际风格操纵遵从这一侧。

    大音频语言模型

    • 两类结构: 级联系统(An等,2024;HuggingFace,2024;OpenAI,2024b)先ASR再进LLM。作者称这会丢掉声调、情感等非文本特征。端到端系统(Ji等,2024;Xu等,2024a;Wang等,2024;Xie and Wu,2024;Xu等,2025)直接读原始波形,保留韵律、音高和重音。本文只做后者,点名GPT-4o Realtime、Gemini 2.0 Flash、Qwen2.5-Omni。
    • 副语言会改变行为: Lin等(2024a,b)报告说话风格变了、词不变,输出仍可不同。Kang等(2025b)报告隐表示编码情绪与声调。Chen等(2025a)、Rohanian and Krauthammer(2025)讨论重音、口音和韵律。AIR Bench(Yang等,2024b)、MDAR(Li等,2026)评情感识别、韵律敏感推理和情感理解。

    文本越狱

    • white-box: Zou等(2023)、Sadasivan等(2024)、Guo等(2024)、Huang等(2023)用梯度或内部状态做对抗后缀或提示。
    • black-box: Li等(2024)、Liu等(2024)、Yu等(2024)、Chao等(2024b)、Mehrotra等(2024)用反馈迭代或搜索;Zhao等(2024)、Zeng等(2024)加说服或情境框架。作者称这些方法到LALM上会碰到梯度不可用、多模态行为不一致。

    音频越狱

    • 转写、变体与扰动: Yang等(2024a)、Shen等(2024)、Chiu等(2025)把文本提示转成语音;Cheng等(2025)、Roh等(2025)做口音、语音拼写或重音。Chen等(2025b)、Gupta等(2025)在有梯度时优化音频;Ma等(2025)在token空间启发式搜索。另有Hughes等(2024)、Kang等(2024)、Ying等(2024)等音频越狱工作。
    • 作者的区分: 作者称上述工作把声学变化当成表层特征增强,音频仍是文本包装或低层信号。本文转向社会认知偏差,把声调当作社会信号的载体。心理学来源包括Milgram(1963),以及后文的Guyer等、CIVA和Van Zant and Berger。

    基线与数据集

    • 基线: 文本用DeepInception(Li等,2024):嵌套叙事与角色权威,black-box、不访问参数。音频用AdvWave(Kang等,2024):改音频token并迭代改写;black-box时用未点名的LLM改写后再TTS。
    • 数据集: AdvBench 520条,JailbreakBench 300条,MaliciousInstruct 100条恶意输入。

    作者在引言和Section 2.3的定位是:不混淆语义,也不做低层扰动,而是用治疗性节奏、表演性强调和情绪声调诱发遵从,并称这利用了LALM的人格化偏差。

  3. 论文如何解决这个问题?

    固定文本语义,用TTS搜索五种启发式嗓音里更易诱发有害输出的投递。

    标题中的音频叙事攻击,在实验里称为delivery-style modulation:文本指令保持不变,TTS按可控嗓音风格合成波形,再送入端到端LALM,在black-box下比较哪种投递更常落入有害响应。

    问题设定

    • 推理写成映射M: A→Y。攻击者构造音频a*,使输出落入有害集合R。R指违反对齐政策的不安全、不道德或非法内容。
    • 目标为 a∗=argmaxa∈ APr[M(a)∈ R]。含义是:在波形空间中找最可能产出R的输入。
    • 成功条件:y=M(a)明确包含或认可R中的元素。因无梯度,问题从优化变成行为操纵:找能把模型偏向受限响应的音频配置。

    投递风格是攻击面

    • 波形由文本提示x和风格向量s共同决定。语义通道给字面内容;副语言通道(音高、节奏、强度、情感)调制指令如何被感知。
    • TTS模型gφ把二者渲染成波形。作者称端到端编码器不把韵律当噪声,而当作说话意图和情绪的条件;x固定时,s仍可改变隐表示和遵从行为。
    • 搜索因此写成 s∗=argmaxs∈ SPr[M(gϕ(x,s))∈ R]。含义是:找最可能越过对齐行为的投递风格。作者将其联系到说服与服从研究:声调、自信和情感框架可以压过命题内容。

    五种启发式风格

    • 风格被当作偏置解码的行为参数,文本语义不变。正文列出五类,各对应不同韵律线索:Authoritative Demand(Guyer等,2018;低音高、稳定节奏、坚定语调),Affiliative Persuasion(Guyer等,2021;中等音高变化、柔和发音),Urgent Directive(Guyer等,2024;语速升高、节奏短促),Emotive Suggestion(Vaughan-Johnston等,2021,CIVA;平静、诉诸共情),Social Bonding Appeal(Zant and Berger,2019;嬉戏感音高、放松节奏)。
    • 每类实现为TTS中的离散控制模板,与x一起合成后再送入目标模型,用ASR比较。附录C给出完整风格提示词,其中的口音、语速和音量约束此处不列。
    • 命名不完全统一:Table 3有Assertive Clarity、没有Urgent Directive;附录C的模板名为Commanding Clarity、Warm & Cooperative、Urgent Directive、Calm Emotional Appeal、Playful & Casual。论文未说明三者如何对应。

    接到两种越狱范式

    • DeepInception: 保留原提示作文本基线,再用五种投递渲染。Table 1报告各风格中的最高ASR,分项在Table 3。
    • AdvWave: 每模型–基准做30轮迭代改写。原版每轮用标准TTS;增强版保留该轮得分最高的风格并带入下一轮。改写用的LLM论文未点名。
    • 主实验合成器用GPT-4o mini TTS(Section 4.3写作GPT-4o Mini TTS)。闭源目标用API默认设置。Qwen2.5-Omni设repetition_penalty=1.2、max_new_tokens=512、do_sample=True、temperature=0.7、top_p=0.9。

    成功判定

    • 指标为ASR。裁判是GPT-4o,判断响应是否含有害信息,只输出Yes或No。
    • 正文称对照OpenAI政策;附录B的裁判提示写的是Google’s Generative AI Prohibited Use Policy。论文未给分数阈值,也未报告与人工判定的一致性。
  4. 论文做了哪些实验?

    三模型三基准上,闭源模型音频ASR多高于文本或AdvWave;Qwen有多格低于基线。

    实验设置

    • 目标模型: GPT-4o Realtime、Gemini 2.0 Flash(闭源,API默认设置),Qwen2.5-Omni-7B(开源;repetition_penalty=1.2,max_new_tokens=512,do_sample=True,temperature=0.7,top_p=0.9)。表中写Qwen2.5-Omni。主合成器为GPT-4o mini TTS。
    • 基准: AdvBench 520条、JailbreakBench 300条、MaliciousInstruct 100条恶意输入。
    • 基线与变体: DeepInception文本版,对五种音频风格取最高ASR(Table 1)。AdvWave原版每轮标准TTS;增强版逐轮保留得分最高的风格,每模型–基准30轮。
    • 指标与裁判: ASR。GPT-4o输出Yes/No。正文称违反OpenAI政策;附录B提示写Google’s Generative AI Prohibited Use Policy。论文未写数值阈值。
    • 另两处模型名: Section 6.2、6.3与附录Table 8的表头是GPT-4o、Gemini-2.0-Flash。论文未说明它们是否即GPT-4o Realtime与Gemini 2.0 Flash。6.3另用Gemini-2.0-Flash TTS。
    • 未报告项: 主实验重复次数、查询次数、裁判与人工的一致性。引言称效应跨说话人画像成立;论文未给说话人画像的分项ASR。

    主结果

    Table 2的ASR(%)。箭头左为AdvWave,右为逐轮保留最高风格的增强版。

    表格较宽,可左右滑动

    模型AdvBenchJailbreakBenchMaliciousInstruct
    GPT-4o Realtime89.03→95.0087.00→96.3384.00→91.00
    Gemini 2.0 Flash89.61→98.2689.00→93.3387.00→94.00
    Qwen2.5-Omni70.00→83.8480.00→73.0063.00→81.00
    • 作者称全部模型与基准上增强版高于AdvWave,并给出GPT-4o Realtime相对增益6.7%、10.7%、8.3%,Gemini 2.0 Flash为9.7%、4.9%、8.0%。这些百分比不是表中单元格。Qwen2.5-Omni的JailbreakBench一格与「全部高于」不一致;作者仍称该格为competitive performance。
    • Table 1是DeepInception文本对五种风格的最高音频ASR。GPT-4o Realtime为44.42%→57.88%、40.00%→66.67%、43.00%→55.00%;Gemini 2.0 Flash为86.15%→88.65%、84.00%→88.33%、73.00%→86.00%。Qwen2.5-Omni音频低于文本:98.85%→84.64%、76.67%→70.33%、93.00%→86.00%。作者称这些是minor regressions,归于前端不稳定,并指向Section 5.2。
    • 摘要把98.26%说成超过text-only baselines;该数在Table 2,对照列是AdvWave,不是Table 1的文本基线。引言称相对文本和声学扰动基线最大增益26%;Section 5.1称GPT-4o上最高高26%、Gemini 2.0上高15%。这是作者概括。引言的consistently improves与Table 1的Qwen三格不符。

    五种投递的分项

    • Table 3的基线是无韵律控制的中性TTS,不是Table 1的文本。GPT-4o Realtime最高格:AdvBench的Assertive Clarity 57.88%,JailbreakBench的Affiliative Persuasion 66.67%,MaliciousInstruct的Social Bonding Appeal 55.00%。作者称JailbreakBench上Authoritative Demand最强(60.00%);该列确为60.00%,但同表Affiliative Persuasion为66.67%。
    • Gemini 2.0 Flash各列多在84%以上。作者称Authoritative Demand与Social Bonding Appeal达到up to 88.65% on JailbreakBench;Table 3里88.65%在AdvBench的Social Bonding Appeal,JailbreakBench最高是Authoritative Demand的88.33%。MaliciousInstruct最高是Authoritative Demand 92.00%,Table 1的Ours却写86.00%,两表不一致。
    • Qwen2.5-Omni:AdvBench最高Assertive Clarity 84.64%,MaliciousInstruct最高Authoritative Demand 86.00%,JailbreakBench最高Assertive Clarity 70.33%。作者称平均后风格化音频相对基线TTS提高10–20个百分点;这是概括,不是逐格差值。作者还称LALM把嗓音情感映射到说话意图,多模态对齐在心理声学框架下仍然脆弱。

    话题类别与Qwen失败类型

    • 作者称Figures 2–4里音频通常提高ASR,尤其社会操纵或说服类话题。OpenAI:平均约about ten points,并点名Cheating、Poison、Dangerous activity,以及Firearms、Government的first-time jailbreaks。Gemini:超过一半类别上升,点名Phishing、Libel、Hate speech,并称Government被突破。Qwen对文本更敏感,多数话题为near-ceiling;Cheating与Mental health上文本失败而音频成功。图中柱高文本未给出。图标签是OpenAI、Gemini、Qwen,该节未写明与实验全名的对应。附录D列19个类别缩写,未列Mental health,也未写各类样本量。
    • 作者称Firearms、Virus、Prison不论模态都几乎成功;模态差依赖话题语义:音频在OpenAI与Gemini的社会工程和错误信息场景更有效,Qwen不是。
    • Section 5.3:Qwen2.5-Omni语音越狱失败中,真政策拒答True Fail占13.1%,其余86.9%为非政策解码问题:过早终止43.0%,文本生成循环34.9%,两者重叠9.1%。作者称瓶颈主要不在更强的安全对齐,而在声学输入下的序列稳定性,并联系到模型较小、音高、音素时长或韵律起伏可扰乱编码器边界。作者称Figure 5分析这些语音尝试;其图注与Figure 4相同,都是按类别比较文本与音频ASR。

    中性音频、人声与另一TTS

    • Table 4(DeepInception,AdvBench)Text / Neutral Audio / Stylized (Auth.):GPT-4o Realtime 44.4 / 48.6 / 57.9;Gemini 2.0 Flash 86.1 / 88.0 / 88.7;Qwen2.5-Omni 98.8 / 80.3 / 84.6。作者称中性语音比文本高3–5%,再加上投递控制再高10–20%;Qwen的文本98.8高于两种音频,与这句不完全一致。Stylized (Auth.)与Table 3的Authoritative Demand列(53.65、87.69、79.48)不同,数值更接近Table 1的Ours;论文未说明Auth.对应哪一风格名。
    • Table 6:AdvBench随机20条人声。GPT-4o文本50.0%、普通音频45.0%、Authoritative Demand 55.0%(n=20)。Gemini-2.0-Flash为60.0%、60.0%、70.0%(n=20)。作者称排序与合成语音一致,绝对ASR略低是因为样本量。
    • Table 7:Gemini-2.0-Flash TTS,AdvBench随机50条。GPT-4o为46.0%、44.0%、54.0%;Gemini-2.0-Flash为76.0%、76.0%、78.0%。作者称风格化投递仍高于文本和普通音频,效果不绑在某一种TTS上。

    其他消融与分析

    • Table 5,JailbreakBench原始查询、无越狱包装:GPT-4o Realtime Neutral 1.0%、Urgent Directive 1.6%;Gemini 2.0 Flash 4.3%、5.6%。作者称紧急语气最多提高30%;论文未给出该30%对应的计算格。
    • 附录Table 8,去掉越狱文本只改声调:GPT-4o文本5.0%、普通音频6.0%、Authoritative Demand 6.0%。作者称各情况低于10%,直接恶意指令下遵从为near-zero;表中只有GPT-4o一行,未写样本量。
  5. 有什么可以进一步探索的点?

    作者指出较小模型上解码不稳、风格靠手工、评测只覆盖英语,并计划自动化风格搜索。

    作者指出的局限与后续方向

    • 较小LALM上攻击可以更不易生效。作者以Qwen 2.5-Omni为例:额外音频扰动可能增加解码不稳定,输出更常是随机或不可读文本,而不是攻击所针对的有害内容(Section 8)。
    • 方法依赖一小套来自传播心理学的手工投递风格;作者称难以系统优化嗓音参数(Section 8)。
    • 研究限于英语语音。作者称需要更广的多语言和跨口音评估,才能评估所观察效应的一般性(Section 8)。
    • 作者称未来应自动化发现对抗性投递风格,并建立能应对社交框架或情感语音的对齐机制(Section 7)。
    • 作者称一个方向是研究嗓音调制如何与情感极性、提示长度等上下文因素交互(Section 7)。

    实验覆盖范围

    • 主实验目标为GPT-4o Realtime、Gemini 2.0 Flash、Qwen2.5-Omni-7B三款端到端LALM;主合成器为GPT-4o mini TTS(Section 4.1)。
    • 基准为AdvBench 520条、JailbreakBench 300条、MaliciousInstruct 100条。范式为DeepInception与AdvWave,后者每模型–基准30轮(Section 4.1)。
    • 五风格分项见Table 3。人声为AdvBench随机20条(Table 6)。另一TTS为Gemini-2.0-Flash TTS、AdvBench随机50条(Table 7)。无越狱文本的声调对照见附录Table 8,表内仅GPT-4o一行。
    • 裁判为GPT-4o的Yes/No。论文未报告主实验重复次数、与人工判定的一致性,以及AdvWave改写提示所用LLM的名称。
    • 本文实验只包括端到端模型;作者称级联管线会在ASR中丢掉音频特有信息(Section 2.1)。话题缩写列于附录D,共19类;论文未报告各类样本量。
  6. 总结一下论文的主要内容

    Table1与Table2里,闭源模型音频ASR多高于对照,Qwen2.5-Omni有低于基线的格。

    这篇工作把嗓音投递当作对端到端LALM的black-box越狱:指令语义不动,只改合成语音的交际风格。

    • 问题: 模型已能直接听原始波形,而对齐主要按文本校准。作者要看权威、共情、紧急等副语言线索,能否在不改写指令的情况下诱发受限输出。
    • 做法: 用TTS把同一文本渲染成五种启发式风格,接到DeepInception和AdvWave。主合成器是GPT-4o mini TTS。成功与否由GPT-4o做Yes/No判断;正文和附录B写的政策名称并不相同。
    • AdvWave: Table 2里Gemini 2.0 Flash在AdvBench的增强ASR为98.26%,对照AdvWave为89.61%。GPT-4o Realtime三基准为95.00%、96.33%、91.00%。Qwen2.5-Omni在JailbreakBench为73.00%,低于AdvWave的80.00%。摘要把98.26%与text-only baselines对比,表中的对照列不是文本基线。
    • DeepInception: Table 1中两个闭源模型的音频高于文本,例如GPT-4o Realtime在JailbreakBench从40.00%到66.67%,Gemini 2.0 Flash在MaliciousInstruct从73.00%到86.00%。Qwen2.5-Omni三基准音频都低于文本,AdvBench从98.85%到84.64%。
    • 例外与对照: Qwen语音失败里,真政策拒答占13.1%,其余多为过早终止或重复生成(Section 5.3)。去掉越狱文本后,GPT-4o只改声调的ASR为5.0%、6.0%、6.0%(附录Table 8)。人声20条上,Authoritative Demand仍高于普通音频(Table 6)。
    • 作者的结论: 只对齐文本不够覆盖语音界面;防御需要同时处理语言内容、韵律和说话意图。作者计划自动搜索对抗投递,并考察它与情感极性、提示长度的交互。
阅读原文arxiv.org