StyleBreak:利用风格化音频越狱揭示大型音频语言模型的对齐漏洞
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
StyleBreak对LAM做风格化音频越狱,摘要称三次查询内ASR提升7.1%–22.3%。
攻击者对目标LAM仅有black-box查询、不能访问参数。
- LAM把音频编码器接到LLM上做语音交互,但音频越狱研究少。现有做法多把文本越狱转成语音,或加噪声、改音高、换口音,没有系统看情感、年龄、性别等属性会不会影响对齐。
- StyleBreak先用GPT-4按情感改写查询,再用CosyVoice2-0.5B按参考音频合成语音,风格组合为70种。多头策略按查询抽样,奖励为ARR、ASR、PV、TS的平均。附录给了改写模板。
- 200条训练策略、50条对比四类基线,各重复5次。摘要称三次查询内ASR提升7.1%–22.3%,Table 1另有指标下降。迁到GPT-4o后作者称ASR上升2.1%~9.5%。
- 作者计划以后考虑噪声、多语言和前端处理差异,并因缺少公开音频越狱防御而打算自行设计评测。实验覆盖四个开源LAM加GPT-4o与Gemini-2.5-flash;论文未报告与人工判定的一致性。
- 威胁模型
- 攻击者对目标LAM仅有black-box查询、不能访问参数。目标是构造带人类语音属性的有害音频,诱导恶意回答而非拒答。音频由可控TTS生成,可搭配固定文本模板。设置包括Text-only基线与Audio-based(语言、副语言、语言外)。
- 被测模型
- Qwen2-Audio-7B-InstructMERaLiON-AudioLLM-Whisper-SEA-LIONUltravox-v0.4.1-Llama-3.1-8BQwen2.5-Omni-7BGPT-4o (gpt-4o-audio-preview-2024-10-01)Gemini-2.5-flash (gemini-2.5-flash-preview-04-17)
- 基准
- AdvBenchGigaSpeech
- 指标
- ARRASRPVTS
研究者提出 StyleBreak,一个风格感知的音频越狱框架,系统考察人类语音属性如何影响大型音频语言模型(LAM)的对齐稳健性。该框架采用两阶段风格感知变换管线,同时扰动文本内容与音频,以控制语言、副语言和超语言属性,并设计查询自适应策略网络自动搜索对抗性风格,提升越狱探索效率。评估显示,LAM 在多样人类语音属性下表现出关键漏洞,StyleBreak 在多种攻击范式上均提升了攻击效果与效率,作者据此指出 LAM 需要更稳健的对齐。该工作已被 AAAI 2026 接收。
深度解读
这篇论文试图解决什么问题?
作者用StyleBreak考察人类语音属性对黑盒LAM对齐的影响。
黑盒LAM的音频越狱尚未系统考察人类语音的语言、副语言与语言外属性如何影响对齐稳健性。
- 场景:作者称LAM把音频编码器与LLM联合训练,用于语音问答和情感检测等交互,但可能生成不当内容,并会被对抗音频提示绕过对齐。
- 现有不足:作者称针对LAM的越狱研究很少;现有做法多把文本越狱转成语音,或做噪声、音高、口音等浅层扰动,停留在文本语义或信号层。
- 观察:作者把语音信息分为语言(口语语义)、副语言(情感)和语言外(说话人特征)。作者认为表达变化扩大了输入空间,但其对音频越狱的影响仍未被考察。
- 本文提出:作者提出StyleBreak。两阶段流水线同时扰动文本与音频以控制三类属性,再用query-adaptive policy按查询搜索对抗风格。作者称这是首个系统考察该影响的style-aware音频越狱框架。
- 威胁模型:
- 目标:绕过目标LAM的安全对齐,诱导恶意回答而非拒答。
- 知识:black-box。可提交音频和/或文本,不能访问参数。
- 能力:用可控TTS按嗓音特征合成对抗音频,并可搭配固定文本模板。
- 设置:Text-only看原始或风格化文本能否绕过对齐;Audio-based通过音频(可与文本模板组合)考察三类属性。
有哪些相关研究?
相关工作分LAM、对齐与越狱;作者批评转语音和浅层扰动。
LAM与访问
- 音频接入:Chu et al. 2024用音频编码器把原始语音映射为语义表示,使LLM处理音频。
- 通用框架:Xu et al. 2025与Fixie.ai 2025把LAM做成可用音频提示处理多种下游任务的框架。
- 黑盒理由:Murad, Khaleel, and Shakor 2024讨论经API或在线服务提供、用户通常无内部参数的情况;作者因此只研究black-box LAM。
对齐
- 训练手段:Shen et al. 2023把对齐定义为使行为符合预期意图。作者列举RLHF(Ouyang et al. 2022)和DPO(Rafailov et al. 2023)作为减少恶意回答的训练。
- LAM缺口:作者称相对LLM安全文献(Li, Ye, and Wu 2025),把LLM扩到音频后的对齐稳健性在越狱情境中仍不足(Peri et al. 2024; Wang et al. 2024)。
越狱
- 文本越狱:手工模板(Wei, Haghtalab, and Steinhardt 2023; Li et al. 2023)或token级优化(Zou et al. 2023; Liu et al. 2024b),用来绕过对齐并引出不当内容。
- 文本转语音:Ying et al. 2024、Shen et al. 2024用商用TTS把对抗文本转成音频。作者批评其忽略文本与语音的语义和感知差异,难以暴露模态特异脆弱性。
- 浅层扰动:噪声注入(Kang, Xu, and Li 2024; Xiao et al. 2025)、音高变化(Peng et al. 2025)、口音转换(Roh, Shejwalkar, and Houmansadr 2025)。作者批评其通常缺少语义意图,也未覆盖人类语音的表达变化。
基线与数据
- 基线:Vanilla(Ying et al. 2024)、GCG∗、AutoDAN∗、SSJ(Yang et al. 2024)。正文把前两者标为先改文本再合成的语义层攻击,SSJ为音频层扰动;GCG∗与AutoDAN∗先在LLaMA2上优化再迁移。
- 数据:AdvBench含520条有害文本查询;本文取200条,另用50条不重叠查询做对比。风格参考音频来自GigaSpeech(Chen et al. 2021)。
作者把StyleBreak与上述工作的区别写成:不忽略语音语义,也不只用浅层扰动,而是用两阶段变换和自适应策略建模语言、副语言与语言外线索。
论文如何解决这个问题?
两阶段控制语言、副语言与语言外属性,多头策略按查询选风格。
StyleBreak先把有害文本查询变成可控的风格化对抗音频,再由策略按查询选风格,提交目标LAM看是否越狱。
问题设定
- 访问:目标模型接收音频和/或文本并输出文本。攻击者无参数,只能查询。
- 生成:有害文本查询与嗓音描述交给可控TTS,得到对抗音频,再与固定文本模板一起送入模型。目标是得到符合作者所谓对抗意图的肯定性回答。
- 两类场景:Text-only看原始或风格化文本能否绕过对齐;Audio-based看三类属性,音频可与文本模板组合。
- 模板:附录给出固定文本模板的全文,此处不复述其措辞。
两阶段风格变换
- 风格空间:离散空间为情感、性别与年龄的组合。论文写情感7类、年龄5组、性别2类,共70种配置。Figure 1列出的情感为Neutral、Happy、Angry、Sad、Surprised、Fearful、Disgusted;年龄为Child、Teenager、Young Adult、Middle-aged、Elderly;性别为Male、Female。
- 参考音频:从GigaSpeech取带标注语音。每个风格实例含自然语言描述和一条参考音频。每种配置随机抽5条参考。
- 语言属性:GPT-4按情感指令把原始查询改写成带表达性线索、且作者要求保持意图的文本,一条查询对应多个变体。附录A给出完整提示词,其中的句式与改写约束不在此列出。
- 副语言与语言外:TTS用CosyVoice2-0.5B,同时条件于改写文本和参考音频的声学风格,以控制情感语气以及年龄、性别。
自适应策略
- 为何不穷举:70种配置逐一配对受计算与API速率限制。Figure 2在Qwen2-Audio上给出6条有害查询、20种风格的成功率曲线。作者称峰值随查询移动,效果是查询特异的,而不是各查询同一趋势。转写看不到各点数值。
- 网络:多头策略把查询映到风格配置上的分布。共享两层MLP,三个线性头分别预测情感、年龄、性别(附录B)。
- 优化:风格化音频由所选配置、改写文本和对应参考实例合成。论文最大化 maxθ Eq ∼ Q, s ∼ πθ(q)[J(M(aps, ti))],即在查询上最大化目标LAM回答的越狱奖励。
- 奖励:附录把评判写成 J(ap)=1/4(ARR(y)+PV(y)+TS(y)+ASR(y)),即四项指标平均。训练是奖励加权的多任务分类。论文未给出学习率或训练步数。
提交与判定
- 流程:选出风格后合成音频,提交LAM并收集回答。作者称实验里还把风格搜索接到其他越狱策略上。
- 四项指标:ARR看是否非拒答,ASR看是否直接回答有害输入,PV看是否违反预定义安全策略,TS看高毒性。具体判定放在实验设置。
论文做了哪些实验?
四开源LAM三次查询后ASR多上升,但AutoDAN∗有指标下降。
实验设置
- 被测模型:本地四个开源LAM为Qwen2-Audio-7B-Instruct、MERaLiON-AudioLLM-Whisper-SEA-LION、Ultravox-v0.4.1-Llama-3.1-8B、Qwen2.5-Omni-7B,2×A100。前三个因VoiceBench上报告的ARR较低而被选入;Qwen2.5-Omni被作者当作综合能力较强的代表。另测gpt-4o-audio-preview-2024-10-01与gemini-2.5-flash-preview-04-17,风格从Qwen2-Audio上的策略直接迁移、不做微调。
- 数据:AdvBench的200条用于属性分析和策略训练;另50条不重叠查询用于与基线对比。
- 基线:Vanilla把原始查询合成语音。GCG∗与AutoDAN∗先改文本再合成。正文把AutoDAN∗标为Zou et al. 2023、GCG∗标为Liu et al. 2024b;附录写GCG采用Zou et al. 2023的官方实现并在LLaMA-2-7B上做可迁移优化,AutoDAN遵循Liu et al. 2024b。SSJ遮住一个有害词并按字符合成语音,再与含遮挡查询的提示组合。
- 指标:ARR为非拒答比例,用预定义拒答模式。ASR用RoBERTa二分类器判断是否直接回答有害输入。TS来自LLaMA3-Guard-based框架,分数0–9,高于4记为1。PV=1表示违反预定义安全策略。作者称ARR、ASR越低,对齐越稳。
- 协议:默认设置、不做修改;统一TTS为CosyVoice2-0.5B;每项测试重复5次。Table 1为三次查询迭代。论文未报告与人工判定的一致性,也未报告显著性检验。
- 其他模型:情感改写用GPT-4。跨TTS实验把合成器换为VoxInstruct。
主结果
下表为Table 1中三次查询的ASR,单位为%。未列入的基线原值在表后说明。
表格较宽,可左右滑动
模型 Vanilla Vanilla+Ours GCG∗+Ours AutoDAN∗+Ours SSJ+Ours Qwen2-Audio 10.0 30.5 33.3 16.7 41.7 Qwen-Omni 0.0 22.2 18.8 16.7 8.3 MERaLiON 4.0 37.8 39.6 47.9 47.9 Ultravox 4.0 16.9 16.7 14.6 4.1 - 摘要称多种攻击范式、三次查询内ASR提升7.1%–22.3%。Table 1括号内的逐格变化并不都落在该区间,既有更大的上升,也有下降。
- 下降与高ARR:Qwen2-Audio上AutoDAN∗+Ours的PV为16.7(基线20.3)、TS为78.0(基线82.4)。MERaLiON上AutoDAN∗+Ours的ASR为47.9(基线52.8)、PV为29.2(基线32.9)、TS为62.5(基线66.5)。MERaLiON的SSJ ARR在叠加前后均为100.0。Ultravox的Vanilla、GCG∗、AutoDAN∗ ARR已为96.0、100.0、100.0。
- 作者称SSJ平均ASR为4.5%、平均ARR为57.5%,因为模型倾向于复读拼写内容而非直接作答;作者称叠加StyleBreak后ASR变为原来的4.7倍。作者把GCG∗、AutoDAN∗与Vanilla接近(MERaLiON除外)归因于长音频处理能力有限或文本变换中的语义损失。作者称Ultravox更多出现肯定性回复,ARR上升而其他指标变化较小;多属性组合下MERaLiON最脆弱,与Figure 3单属性结果相反,作者认为可能与其多文化泛化较强有关。
语音属性
- 语言:作者报告情感改写后四个LAM的越狱指标都上升;作者称最稳健的Qwen-Omni平均ASR从0%升至9.1%。MERaLiON上surprised变体的ASR比次高者高8.57%(Figure 3(a)正文)。
- 副语言:保持原文语义、只改声学情感时,相对Vanilla指标上升。作者称Ultravox的ASR为原始输入的4.6–6.8倍,且平均比其语言属性对应结果高21.6%;语言层情感改写的ARR为副语言控制的3.9倍,副语言仍使ASR平均上升9.1%。
- 语言外:作者称四个模型、各项指标上,年龄与性别各自趋势一致。儿童嗓音ASR最低,老年嗓音平均比儿童高13.3%;男声ASR平均比女声高8.3%。作者称Qwen2-Audio对语言外变化最稳,Ultravox最易受影响。Figure 3转写未保留可读柱高,数字来自正文。
效率、消融与商用模型
- 迭代:Figure 4横轴为query iteration(1、3、5、7、10),纵轴ASR(%),四模型分面。作者称Vanilla与SSJ只重复查询并不能提高ASR,叠加后在10次迭代内分别获得30.5%与40.5%的增益;该句未点名对应哪一个LAM。附录Figure 7中作者称各StyleBreak变体在五次查询后ARR接近100%。
- 消融:Table 2为三次查询ASR(%),顺序为Qwen2-Audio、Qwen-Omni、MERaLiON、Ultravox。纯文本原始查询为1.1、0.0、1.5、1.0,加情感改写后为8.9、4.1、12.1、9.6。音频Vanilla为10.0、0.0、4.0、4.0;加EPT为15.3、7.0、20.5、5.4;再加EAG为17.2、9.6、35.1、14.8;再加QP为30.5、22.2、37.8、16.9。作者称完整方法高于各变体,音频侧ASR高于对应纯文本。
- 商用迁移:Figure 6使用Qwen2-Audio上的策略、不做微调。作者称各基线的攻击表现都提高;在作者称为最稳健的GPT-4o上,ASR上升2.1%~9.5%。作者称两个模型上TS平均上升4.7%与9.7%,未说明各自对应哪一个模型。转写未保留可对齐柱高。
其他消融与分析
- Table 3,三次查询:Qwen2-Audio的ARR从Vanilla 58.00到+EPT 76.32、+EAG 92.05、+QP 98.01;TS从24.00到47.02。
- Table 3:Ultravox音频+EPT的ARR为92.69,低于Vanilla的96.00;+EPT, EAG的PV为3.28,低于Vanilla的6.00。
- Table 4,换成VoxInstruct:Vanilla ASR为0.0、0.0、4.2、0.0;Vanilla+Ours为20.8、16.7、23.0、10.4(模型顺序同Table 2)。
- Figure 8:作者称四个LAM上策略少选disgusted与angry,偏好surprised与happy;少选child;性别上更常选male。
- Figure 5:Qwen-Omni不提供embedding,故对其余三个LAM取骨干LLM最后一层最后隐状态做t-SNE。作者称同内容的文本与音频表示差异大,Qwen2-Audio跨模态差距最小;文本模态尚能分开有害与无害,音频模态两类常重叠。转写只见Audio Queries、Text Queries等标签,簇分离无法核对。
- 论文未报告各条件的查询次数以外的墙钟耗时,也未报告策略学习率与训练步数。
有什么可以进一步探索的点?
作者计划纳入噪声、多语言与前端差异,并设计音频越狱防御。
作者指出的局限与后续方向
- 真实条件:作者计划在后续工作中考虑噪声、多语言和前端处理差异,以增强真实条件下的泛化(Discussion, Limitations and future work)。
- 防御:作者写明当前缺少公开的音频越狱防御,并计划设计、评测相应防御(同节)。
- 对齐用途:作者称最终目的是找出LAM对齐盲点并改进对齐;计划用该框架扫描目标模型、收集数据,并把生成的越狱提示用于后续对抗训练(Discussion)。
实验覆盖范围
- 被测模型为四个开源LAM,另加GPT-4o(gpt-4o-audio-preview-2024-10-01)与Gemini-2.5-flash(gemini-2.5-flash-preview-04-17);商用模型使用Qwen2-Audio上训练的策略、不做微调(Experiments Settings;Figure 6)。
- 属性分析与策略训练用AdvBench 200条;与Vanilla、GCG∗、AutoDAN∗、SSJ的对比用另外50条;每项测试重复5次;Table 1为三次查询(Experiments Settings;Table 1)。
- GCG与AutoDAN的对抗文本在LLaMA-2-7B上优化后迁移;情感改写用GPT-4,主TTS为CosyVoice2-0.5B(Experiments Settings;附录)。
- 指标为ARR、ASR、PV、TS。ASR由RoBERTa二分类器判定,TS用LLaMA3-Guard-based框架、高于4记为1(Experiments Settings)。论文未报告评审与人工的一致性。
- Table 4报告了换成VoxInstruct后Vanilla与Vanilla+Ours的ASR。t-SNE只覆盖提供embedding的三个LAM(Figure 5)。论文未报告策略学习率、训练步数和查询耗时。
总结一下论文的主要内容
StyleBreak以风格化音频做黑盒越狱,摘要称三次查询内ASR提升7.1%–22.3%。
StyleBreak是面向黑盒LAM的style-aware音频越狱框架,用来考察情感、年龄、性别一类语音属性下的对齐表现。
现有音频越狱多把文本攻击转成语音,或只加噪声、改音高、换口音。作者认为这没有细控语言、副语言和语言外属性。攻击者不能访问参数,只能提交由可控TTS合成的对抗音频,并可搭配固定文本模板,目标是诱导恶意回答而非拒答。
做法分两步:GPT-4按情感改写有害查询,CosyVoice2-0.5B再按GigaSpeech参考音频合成语音。风格空间为7种情感、2种性别、5个年龄组,共70种配置。多头策略按查询选风格,奖励是ARR、ASR、PV、TS的平均。主实验用AdvBench的200条分析属性并训练策略,用另50条对比Vanilla、GCG∗、AutoDAN∗和SSJ,每项重复5次。
- 摘要称三次查询内ASR提升7.1%–22.3%。Table 1里Qwen-Omni的Vanilla ASR为0.0,加StyleBreak后为22.2;MERaLiON的Vanilla+Ours ASR为37.8。同表也有下降,例如MERaLiON上AutoDAN∗的ASR从52.8到47.9。
- 作者称儿童嗓音ASR最低,老年嗓音平均高13.3%,男声平均比女声高8.3%。
- Table 2中完整方法的ASR高于只改写、只加声学风格或未用策略的变体,音频侧也高于纯文本。
- 策略不微调迁到GPT-4o后,作者称ASR上升2.1%~9.5%。换成VoxInstruct后,Vanilla+Ours的ASR仍高于Vanilla(Table 4)。
作者的结论是:LAM对情感、年龄、性别等语音属性扰动缺少稳健性,广泛部署前需要更稳的对齐。作者计划以后纳入噪声、多语言和前端差异,并设计音频越狱防御。