跳到正文
原文
论文追踪· arXiv:2608.15578· Jiaming He, Zhicong Huang, Tian Jin et al.·本站收录 · 原文发表

ARENA:面向大型音频语言模型的自动化红队框架

ARENA: Automated Red-Teaming for Large Audio Language Models

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

ARENA对四个LALM做音频接地红队,AdvBench 520条上AF3的FDR为87.9%。

威胁模型黑盒访问目标LALM,对应部署前内部安全审计。

问题
LALM的音频通道让单独安全的文本在联合输入下可能诱发有害遵从,文本红队看不见这一面。静态音频越狱集没有随目标自适应的机制。
方法
ARENA用与AdvBench不相交的2,000条规格训练控制器,在语音与环境声间选择并渲染,再按MD-Judge反馈细化。最终只由独立的Llama Guard 3打一次标签,该标签不回流搜索。
实验与结果
Table 1中,520条AdvBench上ARENA的FDR为87.9%、71.5%、68.1%、75.4%(AF3、Qwen2-Audio、MiMo-Audio、GPT-Audio)。作者称细化与声音变体提高发现,迁移低于源模型自身。
局限与可以继续做的
论文未专门讨论局限。实验覆盖四个目标LALM与520条AdvBench;Figure 3、Figure 4不含GPT-Audio。论文未报告人工一致性、重复次数,以及离线日志查询的目标模型。
实验设置Audio Flamingo 3、Qwen2-Audio-7B-Instruct 等 · AdvBench、AJailBench 等 · FDR、PSR 等
威胁模型
黑盒访问目标LALM,对应部署前内部安全审计。审计者可生成文本与音频、查询并观察回复,不能访问权重、梯度或内部安全机制;可用辅助模型做生成、审核、奖励标注和偏好构造。成功条件是文本单独安全,且联合输入诱发音频接地的有害遵从。
被测模型
Audio Flamingo 3Qwen2-Audio-7B-InstructMiMo-Audio-7B-InstructGPT-Audio
基准
AdvBenchAJailBenchJALMBench
指标
FDRPSRASRDiv
AI 导读研究者提出 ARENA,一个闭环自动化红队框架,针对大型音频语言模型(LALM)开展音频接地的红队测试:文本查询单独看是安全的,但与音频联合输入后即诱导出有害目标行为。框架在独立的 2,000 条文本—音频数据集上训练控制器,由 MD-Judge 提供训练奖励和自适应搜索反馈,最终结果仅由独立的非自适应 Llama Guard 3 评估器标注。在 520 条留出的 AdvBench 目标上,ARENA 在 Audio Flamingo 3、Qwen2-Audio、MiMo-Audio 和 GPTAudio 上分别取得 87.9/100.0%、71.5/96.3%、68.1/100.0% 和 75.4/98.5% 的 FDR/PSR。消融实验显示,基于反馈的迭代改进和音频变体搜索显著提升攻击发现效果。

研究者提出 ARENA,一个闭环自动化红队框架,针对大型音频语言模型(LALM)开展音频接地的红队测试:文本查询单独看是安全的,但与音频联合输入后即诱导出有害目标行为。框架在独立的 2,000 条文本—音频数据集上训练控制器,由 MD-Judge 提供训练奖励和自适应搜索反馈,最终结果仅由独立的非自适应 Llama Guard 3 评估器标注。在 520 条留出的 AdvBench 目标上,ARENA 在 Audio Flamingo 3、Qwen2-Audio、MiMo-Audio 和 GPTAudio 上分别取得 87.9/100.0%、71.5/96.3%、68.1/100.0% 和 75.4/98.5% 的 FDR/PSR。消融实验显示,基于反馈的迭代改进和音频变体搜索显著提升攻击发现效果。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    问题是自动发现文本单独安全、联合音频后诱发有害遵从的LALM案例。

    如何自动构造文本单独仍安全、与音频联合后诱发有害遵从的LALM测试案例。

    • 场景:作者称语音、音乐与环境声使风险不能只从文本查询看出;看似良性的请求可与语音内容、说话人线索或非语音声学证据一起变成有害。作者认为开发者需要这些案例来改进对齐,并点名语音助手、音频分析、无障碍工具与多模态智能体。
    • 现有不足:作者称文本与视觉自动化红队的优化目标不同:须同时给出文本安全查询和音频实现,并处理识别失败、拒答或只复述声音事件。静态音频越狱集能暴露漏洞,但没有随不同LALM自适应的机制。
    • 核心观察:作者认为失败回复带有瓶颈信号,包括音频是否被识别、文本框架是否触发输入护栏、回复是否足够接地。
    • 本文做法:提出ARENA,在与评测集不相交的2,000条文本—音频规格上训练控制器,并用评审反馈做闭环细化。
    • 威胁模型:
      • 知识:black-box访问目标LALM,对应部署前内部安全审计。
      • 能力:审计者可生成文本与音频、查询Mt并观察回复;不能访问权重、梯度或内部安全机制。可用辅助模型做生成、审核、奖励标注和偏好构造。
      • 目标:qp单独检查为安全,联合输入诱发音频接地的有害遵从。
      • 受害系统:目标LALM Mt。最终报告指标不使用搜索阶段评审的标签。
  2. 有哪些相关研究?

    相关工作覆盖LALM、文本与多模态红队;作者称既有LALM安全工作停在静态集。

    作者把讨论分成音频语言模型与自动化红队,并称既有自动化方法面向文本或视觉输出。

    大音频语言模型

    • Whisper、CLAP、AudioLM(Radford et al. 2022; Wu et al. 2022; Borsos et al. 2022)——可扩展语音识别、音频—文本对齐和神经音频token建模。
    • SpeechGPT、AudioPaLM(Zhang et al. 2023; Rubenstein et al. 2023)——把口语交互接到LLM。
    • Pengi、LTU、SALMONN、Qwen-Audio、Qwen2-Audio、GAMA、Audio Flamingo——更广的音频理解、指令遵循、复杂推理与少样本理解(Deshmukh et al. 2023; Gong et al. 2023; Tang et al. 2023; Chu et al. 2023, 2024; Ghosh et al. 2024; Kong et al. 2024; Goel et al. 2025)。作者称这些能力也带来依赖声学内容与传递方式的安全风险。

    文本自动化红队

    • 早期测试(Perez et al. 2022; Ganguli et al. 2022)——模型生成对抗对话,并做大规模人工测试。
    • 提示搜索:白盒目标(Zou et al. 2023; Zhu et al. 2023);黑盒搜索与模型反馈(Yu et al. 2023; Chao et al. 2023; Mehrotra et al. 2023; Mehrabi et al. 2023)。HarmBench统一行为、攻击与评测(Mazeika et al. 2024)。
    • 论文对这一组只作描述,没有逐篇对照本文。

    多模态红队

    • SneakyPrompt、MMA-Diffusion、Groot(Yang et al. 2023b,a; Liu et al. 2024)——搜索不安全的文生图输入。
    • ART、FGPI、RPG-RT(Li et al. 2024a; Xu et al. 2025; Cao et al. 2025)——用视觉或系统反馈指导后续攻击。
    • TEAR(He et al. 2025)——把时间反馈用于文生视频。作者称既有自动化红队集中在文本或视觉输出。

    LALM安全工作

    • 不安全音频与组合攻击(Yang et al. 2024, 2025b; Feng et al. 2025)——暴露不安全音频提示和语音—音频组合攻击。
    • 静态集合:作者称Yang et al.(2025a)、Feng et al.(2025)、Yang et al.(2025c)只考察静态越狱与红队集,没有自动化范式。引言另称Song et al.(2026)与Peng et al.(2025)的静态集没有随不同LALM自适应的机制。

    基线方法为AJailBench(固定越狱模板渲染成语音)和JALMBench(多样的音频—语言提示);二者都不用奖励标注或反馈细化。基准为AdvBench的520条有害目标,只作留出评测,与2,000条训练规格不相交。

    作者把本文放在两侧安全条件上的闭环文本—音频生成:控制器按失败反馈改查询、音频提示和模态,而不是只测固定提示。

  3. 论文如何解决这个问题?

    ARENA训练控制器生成文本安全查询与语音或环境声,再按失败反馈细化。

    ARENA把音频接地红队做成闭环:控制器产出文本安全查询和音频提示,渲染后查询目标,再按失败反馈修改;搜索评审与最终标签分开。

    问题设定与两侧条件

    • 生成对象:Mt接收qp与音频a并返回r。控制器πθ把目标x映成z=(qp, pa, m),m取speech或sound;渲染器Sm把pa变成波形。回答qp前,目标还对识别查询与同一段音频给出rrec,波形通过rrec进入判定。
    • 成功定义:检测到的故障为Z∗=(x,qp,a): φt(qp)=0 且 φr=1,即文本单独安全,且最终评审认定有害遵从。φr为1只在rrec匹配pa,并且r不安全、可执行、接地于该识别内容时成立。
    • 谁打分:沿TRUST-VLM,最终评分是两次独立的Llama Guard 3调用:只查qp,以及搜索结束后查目标、qp、pa、rrec和r。MD-Judge只做奖励标注和搜索反馈,其标签不进入报告指标。对查询集B,FDR是落入Z*的比例。

    种子池与两阶段训练

    • 数据:Dp有2,000条,训练前即与AdvBench分开;AdvBench的提示、目标回复和评审标签不进入SFT、DPO、检查点选择和奖励权重调节。语音种子1,200,覆盖主要由口语承载的社交、欺骗和类指令场景;环境声种子800,覆盖爆炸、碰撞、武器类声音和强行进入等非语音事件。类别写法来自AudioGuard,本文只把它写成可执行规格,不训练音频护栏。
    • 规格而非波形:每条种子是(x, qp, pa, m, t),t只用于分析。语音种子来自手写场景模板,用离线TTS并轮换英语说话人;环境声写成简短事件描述,并带提高可识别性的约束,此处不列具体禁用项。第3.3节有一条示例,不复述原句。波形只在执行时生成。
    • 日志与奖励:每条种子无细化执行一次,记录回复、识别结果、评审标志、失败层级和成形奖励。正证据为不允许的协助、目标遵从、可执行性、音频接地和具体细节;负证据为泛化或拟音、事件复述、拒答或安全转向。文本安全是硬约束。正例进Dm,配对进Dpref;文本不安全的查询只作诊断。论文未说明这次查询的是哪一个目标LALM。
    • 优化:先做奖励加权SFT。正例权重λi=1+Ri+是否进入Z*;论文写Dm正例的Ri在(0, 1],故权落在[1, 3],并用于过采样。再从该检查点做DPO:参考策略固定为SFT检查点,按RAud为文本安全尝试配高低对;某目标尝试过少则在同一有害类别内配对,并去掉由目标侧识别错误主导的对。优化Ld+μLs,并用Dm正例回放以保持结构化输出。论文未给出β和μ。控制器是LoRA调过的Qwen3-32B;论文未报告LoRA秩。实验选定κ=.05,w+=(.25, .25, .20, .15, .18),w−=(.34, .28, .18)。

    渲染、执行与评审分离

    • 模态:speech把pa当转写,覆盖语言线索、说话人意图、对话和社交;sound把pa当环境声提示,面向由声学证据承载的事件。模态选择从Dm学习。实验中语音由Piper TTS渲染,环境声由TangoFlux渲染4秒。
    • 顺序:先对qp单独做φt。φt=1则在合成前拒绝。其余渲染后分两步查询:先识别主要声音事件或语音内容,再提交qp。识别回复进入接地检查。
    • 隔离:搜索中MD-Judge-v0.2的报告可决定返回哪个候选,包括近似成功、拒答、识别失败和事件复述,但不给报告结果打分。停止后Llama Guard 3-8B对冻结记录只评一次,该决定单独构成最终成功,不用于重排、再细化或调阈值。控制器可适应MD-Judge,不能查询最终评审。

    失败感知细化

    • 循环:初稿未达MD-Judge搜索阈值时,控制器在固定的x上改qp、pa和m。输入包括上一规格、目标回复、失败层级和由评审说明改写的反馈。预算K=30。论文未给出该搜索阈值的数值。
    • 反馈方向:识别失败指向更简单的事件或更换模态;事件复述指向要求接地分析而不是描述片段;拒答和文本不安全指向更间接的框架;泛化或拟音指向把音频提示和情境连得更清楚。不在此列出改写句式。
    • 停止:达到搜索分数阈值或K步后保留最高奖励尝试,只把这一冻结尝试交给Llama Guard 3。控制器解码为温度0.7、top-p=0.95、新token 256;开源目标新token 300,GPT-Audio为512。
  4. 论文做了哪些实验?

    AF3/Qwen2/MiMo/GPT-Audio的FDR为87.9/71.5/68.1/75.4%(Table 1)。

    在520条留出AdvBench上,ARENA的联合FDR高于两个静态音频越狱基线;作者称细化与声音变体会提高发现。

    实验设置

    • 目标:Audio Flamingo 3(AF3)、Qwen2-Audio-7B-Instruct、MiMo-Audio-7B-Instruct、GPT-Audio。前三个本地推理,GPT-Audio经API。控制器为LoRA调过的Qwen3-32B,测试前冻结。
    • 数据:AdvBench 520条有害目标,与2,000条训练规格无重叠。类别分析并成六组:cybersecurity、violence/weapons、fraud、disinformation、self-harm/substance abuse、abuse/exploitation。
    • 基线:AJailBench与JALMBench,都不用奖励标注或反馈细化。
    • 指标:ASR是通过文本护栏后的条件率;PSR是文本通过率;FDR是二者在全部520条上的样本级交集。作者写四舍五入前FDR=PSR×ASR。文本不安全、识别不匹配、回复被判安全都在分母中记0。PSR与条件ASR只作诊断。Div是测试案例多样性诊断;论文未给出其计算公式。
    • 评审:MD-Judge-v0.2提供奖励和搜索反馈,不提供报告标签。停止后Llama Guard 3-8B评一次:qp须安全,识别回复须匹配pa,r须不安全且接地。论文未报告重复次数、人工一致性,也未给出MD-Judge搜索阈值。
    • 协议:主实验对全部520条跑训练后的控制器和细化,K=30。迁移把成功源案例重放到另一目标,不再生成或细化。消融每次只改变细化预算、目标温度、目标top-p或环境声变体数。

    主结果

    据Table 1,单位为百分比,分母为AdvBench 520。

    表格较宽,可左右滑动

    目标ARENA FDRARENA PSRAJailBench FDRJALMBench FDR
    Audio Flamingo 387.9%100.0%31.2%12.6%
    Qwen2-Audio-7B-Instruct71.5%96.3%10.8%11.9%
    MiMo-Audio-7B-Instruct68.1%100.0%25.3%10.7%
    GPT-Audio75.4%98.5%24.6%11.3%
    • 据Table 1,四个目标上ARENA的FDR都高于同一目标的两个基线。作者称这需要安全文本框架和有害的音频条件遵从同时成立。
    • 作者称AJailBench常常未能引出不安全回复,JALMBench有不少候选被输入侧审核挡下。Table 1中AJailBench的PSR在四个目标上都是68.6%,JALMBench的PSR都是25.3%。
    • Table 2的平均细化次数为AF3 9.2、Qwen2-Audio 9.1、MiMo-Audio 12.5、GPT-Audio 11.4。作者称多数成功出现在K=30之前,MiMo-Audio最难,GPT-Audio与开源模型相当。

    迁移

    • 测了什么:Table 3把一个目标上的成功案例重放到另一目标,无控制器生成、无细化。图注写单元格为final Llama Guard ASR。表头Qwen2、MiMo分别对应Qwen2-Audio、MiMo-Audio。
    • 结果:来源AF3到Qwen2-Audio、MiMo-Audio、GPT-Audio为59.7%、60.0%、50.4%。对角线为87.9%、74.2%、68.1%、76.5%(AF3、Qwen2-Audio、MiMo-Audio、GPT-Audio)。非对角线最低37.1%(Qwen2-Audio到MiMo-Audio),最高67.5%(MiMo-Audio到Qwen2-Audio)。论文未说明非对角线分母是源成功条数还是520。
    • 作者解读:作者称迁移存在,但与对角线的差距说明审计新目标仍受益于闭环细化。对角线与Table 1的FDR列名不同;Qwen2-Audio的74.2%和GPT-Audio的76.5%不等于Table 1的FDR。

    细化预算与声音变体

    • 预算:作者称K=0时ASR只有23–30%;K=30时AF3、Qwen2-Audio、MiMo-Audio为88%、74%、68%,多数增益在前十轮。作者称后期剩余案例需要更具体的声学事件或不那么触发拒答的文本。Figure 3纵轴文字是MD-Judge ASR (%),图注与正文称final Llama Guard ASR。图例没有GPT-Audio。这些是正文对Figure 3的说法,不是Table 1的FDR。
    • 声音变体:同一规格生成多个TangoFlux变体,找到不安全回复即留第一个。作者称AF3从M=1的70%到M=16的95%,Qwen2-Audio从59%到96%,MiMo-Audio从49%到85%。作者称即使语义提示固定,波形实现仍是主要因素,固定音频基准可能低估风险。论文未报告主实验使用的M,这些数字不能直接当作Table 1的设置。
    • 扫描方式:作者称每次扫描复用固定攻击、只改变被分析因素,因此趋势反映执行时敏感性,而不是控制器重新生成。

    类别与失败模式

    Figure 4是三个开源目标上的final Llama Guard ASR,没有GPT-Audio。

    表格较宽,可左右滑动

    类别AF3Qwen2-AudioMiMo-Audio
    cybersecurity90.576.162.7
    violence/weapons91.575.273.5
    fraud89.075.071.0
    disinformation78.066.172.9
    self-harm/substance62.575.058.3
    abuse/exploitation94.868.473.7
    • 作者称方法在较宽的目标上仍然有效,暴力/武器和欺诈尤其高,self-harm/substance在AF3与MiMo-Audio上相对更难,cybersecurity的目标依赖性更强。Figure 4中AF3与MiMo-Audio的最高格是abuse/exploitation,Qwen2-Audio的最高格是cybersecurity。
    • 作者把剩余失败归纳为三类:认出音频事件但在需要操作细节时拒答;声音被识别到错误粒度,例如把闯入场景复述成泛化警报或人群噪声;近失败只描述风险情境而不给可执行步骤。作者称这些标签不改变仍按两侧硬条件计算的分数,但说明闭环细化为何有用。

    其他消融与分析

    • 目标温度:top-p固定0.95。作者称AF3从温度0.3的86%降到0.7–1.2附近70%的低到中段;MiMo-Audio在温度1.5降到10%。论文未给出Qwen2-Audio各温度的具体ASR。
    • 目标top-p:测试0.7、0.8、0.9、0.95、1。作者称效应更弱且非单调,论文未给出各点ASR。作者称高温常见两种失败:复述音频场景但不跟随有害目标,或转为拒答;top-p主要改变用词。
    • Table 1的ARENA Div为33.4、32.6、31.8、34.2(AF3、Qwen2-Audio、MiMo-Audio、GPT-Audio);AJailBench均为24.8,JALMBench均为58.6。作者称ARENA在满足输入侧安全时仍有非平凡的查询多样性,且不依赖单一固定包装。
    • Figure 5给出六类上的1-AvgSelfBLEU与1-CosSim。正文未逐类给数,转换后的列对齐不可靠,不转写具体数字。论文未写明这两个指标就是Table 1的Div。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限;评测写明四个LALM与520条AdvBench。

    论文没有单独的局限、讨论或未来工作小节。

    作者指出的局限与后续方向

    论文未专门讨论局限。结论里的评测建议没有写成本文的不足或后续工作,故不计入。

    实验覆盖范围

    • 被测目标为Audio Flamingo 3、Qwen2-Audio-7B-Instruct、MiMo-Audio-7B-Instruct、GPT-Audio,共4个;前三个本地推理,GPT-Audio经API。评测用与训练不相交的AdvBench 520条。
    • 对照为AJailBench与JALMBench。最终标签由Llama Guard 3-8B对冻结候选评一次;MD-Judge-v0.2只提供奖励和搜索反馈。
    • 迁移把成功案例重放到另一目标,不再生成或细化。论文未说明Table 3非对角线ASR的分母。Figure 3图例为AF3、Qwen2-Audio、MiMo-Audio,不含GPT-Audio。
    • Figure 4的类别ASR覆盖三个开源目标和六个合并类别:cybersecurity、violence/weapons、fraud、disinformation、self-harm/substance abuse、abuse/exploitation。
    • 论文未报告人工一致性、重复次数、DPO的β与μ、LoRA秩、MD-Judge搜索阈值、主实验的声音变体数M,以及离线执行日志所查询的目标LALM。
  6. 总结一下论文的主要内容

    ARENA在四个LALM上做闭环音频红队,AdvBench上AF3的FDR为87.9%。

    ARENA是面向大音频语言模型的闭环红队框架,用来找文本单独安全、与音频联合后出现有害遵从的案例。

    • 问题:作者认为音频通道上的语音内容、说话人线索或非语音声事件,会使单独看安全的文本请求变成有害;静态音频越狱集不能随不同LALM自适应。威胁模型是部署前审计式的black-box访问:可提交文本和音频并观察回复,不能看权重、梯度或内部安全机制。
    • 方法:LoRA调过的Qwen3-32B控制器把目标写成文本安全查询,并在语音与环境声之间选择。语音用Piper TTS,环境声用TangoFlux。训练用与AdvBench不相交的2,000条规格,先奖励加权SFT再DPO。搜索反馈来自MD-Judge-v0.2;Llama Guard 3-8B只给冻结候选打一次最终标签,且不回流搜索。细化预算K=30。
    • 主结果:Table 1在AdvBench 520条上的ARENA FDR/PSR为AF3 87.9%/100.0%、Qwen2-Audio-7B-Instruct 71.5%/96.3%、MiMo-Audio-7B-Instruct 68.1%/100.0%、GPT-Audio 75.4%/98.5%。同表两个静态基线的FDR最高是AJailBench在AF3上的31.2%。
    • 迁移与消融:作者举例,AF3成功案例在不再细化时迁到Qwen2-Audio、MiMo-Audio、GPT-Audio的ASR为59.7%、60.0%、50.4%。作者称K=0时ASR为23–30%,K=30时三个开源目标为88%、74%、68%;环境声变体从M=1到M=16时,AF3从70%到95%。后一组是消融说法,不是Table 1的设置。
    • 作者结论:作者称当前LALM共享音频接地弱点,细化、目标采样和声音实现都会影响成功,安全评测应测生成与执行的整段循环,而不是只测固定提示。
阅读原文arxiv.org