SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱
Sirens' Whisper: Inaudible Near-Ultrasonic Jailbreaks of Speech-Driven LLMs
SWhisper通过商用设备发送近超声波越狱语音LLM,在GLM-4-Air上黑盒NR达0.940、SC达0.925。
黑盒攻击语音驱动LLM(仅可观测音频输入输出);攻击者拥有白盒代理模型进行离线优化;利用商用扬声器在受害者环境中发射17–22 kHz近超声波,经麦克风非线性解调为基带语音;单轮音频查询,无受害者设备物理访问权限;目标是在语音接口时长限制内诱导违规回复。
- 语音交互为大语言模型引入了开放声学信道攻击面。现有文本越狱转为语音后常因不合语言习惯导致识别错误或超出接口时长限制,而现有超声注入缺乏信道建模,难以保真传输长结构化提示词。
- SWhisper采用文本与声学双层协同设计:文本层使用包含规则指令与语义正则化后缀的短模板,在发音与扰动约束下优化;声学层通过信道求逆预补偿麦克风非线性,调制为17–22 kHz近超声单边带信号。
- 在黑盒商用模型GLM-4-Air上NR达0.940、SC达0.925(Table 1);端到端音频模型GLM-4-Voice上NR达0.980、SC达0.813(Table 2)。用户听觉实验中受试者区分率与机会水平无统计差异(Table 4)。
- 信道建模采用平均传递函数,未实现在线自适应;后缀优化未显式针对跨模型迁移设计;被测模型涵盖4个开源、3个商业与2个端到端音频模型;基准测试采用AdvBench中精选的50条有害提示词。
- 被测模型
- Meta-Llama-3.1-8B-InstructGemma-3-4BQwen2.5-7B-InstructMistral-7B-Instruct-v0.3DeepSeek (Non-Thinking Mode)GLM-4-Air (glm-4-air-250414)Grok-4GLM-4-VoiceQwen-Omni-Turbo
- 基准
- AdvBenchStrongREJECTFreesound
- 指标
- Non-refusal score (NR)Specific-convincing score (SC)Word error rate (WER)
研究者提出 SWhisper,一个在商品级扬声器和麦克风条件下对语音驱动 LLM 实施隐蔽提示注入与越狱的框架。它把任意目标基带音频编码进 17–22 kHz 近超声频段,利用麦克风非线性解调还原,并通过建模麦克风与信道传递函数、求解正则化逆问题做频谱预补偿,使长而结构化的提示词也能高保真还原。文本层则用结构化模板加语义正则化的对抗后缀优化,在可懂度、时长和跨模型迁移之间取得平衡。在商用模型上,SWhisper 的非拒答(NR)和具体说服(SC)分数最高达 0.94 和 0.925;在端到端 LALM GLM-4-Voice 上 NR 0.980、SC 0.813。32 人用户研究显示,注入的越狱音频与纯背景播放难以区分。
推荐理由论文给出近超声隐蔽声学通道的完整建模与补偿方法,并报告了跨商用与开源语音模型的攻击成功率,语音接口的部署方可据此评估物理层风险。
深度解读
这篇论文试图解决什么问题?
针对语音驱动LLM,利用商用硬件通过近超声隐蔽信道实现黑盒单轮越狱提示词注入。
论文试图解决如何在无白盒模型参数访问、仅使用商用硬件的现实条件下,通过物理声学信道向语音驱动大语言模型隐蔽注入有效越狱提示词的问题。
- 语音接口引入的新攻击面:语音驱动系统依赖开放声学信道,语音输入经环境传播、麦克风捕获、语音转文本或端到端音频模型处理,且交互过程缺乏用户可见记录,使得恶意输入难以被审计或干预(Section 1)。
- 现有越狱方法的局限:基于优化的文本对抗后缀缺乏语言学含义,转化为语音后词错误率高;启发式越狱生成的提示词冗长,超出语音接口普遍限制的一分钟时长(Section 2.1)。
- 现有近超声注入的不足:以往非线性声学注入主要针对简短控制指令,缺乏对复合声学信道特性的建模与补偿,难以保真还原越狱所需的较长结构化基带信号(Section 2.2)。
- 威胁模型:
- 攻击者目标:隐蔽注入越狱提示词以绕过安全机制诱发违规输出,且音频需满足语音接口的时长限制(Section 4)。
- 攻击者知识:对受害者模型仅具备黑盒访问权限,但拥有可离线优化的白盒代理模型(Section 4)。
- 攻击者能力:仅使用消费级扬声器发射17–22 kHz近超声信号,实施单轮音频查询,无受害者设备物理访问权限(Section 4)。
- 受害系统:基于语音转文本流水线或端到端音频原生架构的语音驱动大语言模型系统(Section 4)。
有哪些相关研究?
论文讨论了启发式与优化式文本越狱、非线性声学注入以及针对端到端音频模型的对抗攻击。
论文从文本越狱和声学物理注入两个领域梳理了相关研究。
大语言模型文本越狱攻击
- 手工模板与启发式方法:DAN(Shen等,2024)、AutoDAN(Liu等,2024)、PAIR(Chao等,2025)等利用规则指令、自动改写或多轮对话引导模型。作者指出这类方法往往提示词过长或需要多次交互,不适于具有严格时长限制的语音接口(Section 2.1)。
- 基于优化的对抗后缀:GCG(Zou等,2023)、Faster-GCG(Li等,2024)、I-GCG(Jia等,2025)通过搜索生成对抗后缀。作者指出生成的 token 缺乏语言学含义,转化为语音后难以被正确转录或识别(Section 2.1)。
- 混合方法:结合启发式模板与优化后缀的方法(Andriushchenko等,2025)。作者指出其模板与后缀均未针对语音优化,在语音场景下发音不自然且超出接口时长(Section 2.1)。
非线性声学注入攻击
- 传统超声注入:DolphinAttack(Zhang等,2017)及其扩展(Roy等,2017;Yan等,2020)利用麦克风前端非线性效应将高频载波解调为可听命令,但通常依赖专用超声硬件(Section 2.2)。
- 商用扬声器近超声攻击:NUIT(Xia等,2023)利用商用扬声器在近超声频段注入控制指令。作者指出其缺乏对隐蔽信道的建模与补偿,难以保真重建越狱所需的较长结构化基带语音(Section 2.2)。
- 考虑信道失真的注入:VRIFLE(Li等,2024)在优化过程中通过超声变换模块模拟失真。作者指出该机制接近数据增强而非主动补偿,且需要额外的模型训练开销(Section 2.2)。
基线方法与评测基准
- 对比基线与基准:论文选取 GCG、I-GCG、PAIR、Auto-DAN 作为越狱对比基线,评测基准采用 AdvBench 的有害行为子集(Section 6.1.1、6.1.3)。
与已有工作的定位区别 作者认为,SWhisper 是首个在现实黑盒条件及商用硬件下,将通用近超声隐蔽信道与语音适配越狱生成相结合的端到端框架(Section 1、2.1)。
论文如何解决这个问题?
构建文本层语义正则化短后缀混合模板,并在声学层通过信道求逆预补偿与近超声单边带调制生成音频。
论文提出 SWhisper 框架,采用文本层越狱生成与声学层近超声传输的双层架构,兼顾语音界面的时长与可理解性约束及物理声学信道的非线性补偿。
攻击初始化与提示词构造
- 预训练后缀集合筛选:采用先前成功的越狱序列构建初始候选池,并过滤保留自动语音识别词错误率(WER)较低的候选,以保证语音合成与转录的发音有效性(Section 5.1.1)。
- 结构化混合模板设计:模板由四个部分组成:基于规则的指令、越狱目标、引导回复以及待优化的对抗后缀。该设计利用大模型遵循结构化指令的倾向,同时压缩整体长度以适配接口限制(Section 5.1.2)。
对抗后缀多约束优化
- 语义正则化目标:为兼顾对抗攻击效果与语言流畅度,在代理模型上优化目标函数:
xn+1:n+H⋆ = argminxn+1:n+H Ladv + λ · Lsem 该式中 L_adv 为引导模型输出目标回复的负对数似然损失,L_sem 为后缀在上下文下的负对数似然语言模型损失,权重系数平衡攻击强度与自然度(Section 5.2)。
- 词表约束与并行更新:将候选 token 限制在排除不可发音词的语义词表中;在每个位置筛选前 top-k(k=256)候选并构造笛卡尔积候选集,结合模拟退火策略评估提议,批大小设为 64,优化 500 轮(Section 5.2.1、5.2.2、6.1.5)。
- 优化中的失真扰动注入:在离线优化过程中将模板和候选后缀转为语音,施加噪声扰动模拟信道偏差后再转录回文本,强制在恢复文本上计算损失,提高对未知信道失真的抗干扰能力(Section 5.2.3)。
声学信道建模与近超声信号生成
- 非线性传递矩阵测量:在 0 至 5 kHz 范围内发送步进基带测试单频信号,经 17–22 kHz 单边带调制后由商用扬声器播放并由麦克风接收,对稳态信号进行 1024 点 FFT,计算基带输入到输出频段的经验传递矩阵并平均得到传递矩阵(Section 5.3.1)。
- 正则化信道求逆预补偿:针对麦克风非线性响应的求逆不稳定性,通过正则化最小二乘求解预补偿频谱:
Wattack = argminX | M̄nl X − Wtarget |22 + λ | X |22 该式在补偿目标语音频谱 W_target 的同时抑制噪声放大与高频谐波泄漏,增强跨设备表现(Section 5.3.2)。
- 近超声载波调制:对补偿频谱执行逆短时傅里叶变换(ISTFT),利用基于希尔伯特变换的单边带(SSB)调制搬移至 17–22 kHz 近超声频段,并施加 Tukey 窗抑制频谱泄露(Section 5.3.3)。
论文做了哪些实验?
评测涵盖9个模型,在商用模型上NR达0.940,在不同距离、角度、噪声及设备下保持稳定,且人耳无法分辨。
实验设置
- 被测模型:开源指令模型 Meta-Llama-3.1-8B-Instruct、Gemma-3-4B、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3(均同时作为代理与目标);商用模型 DeepSeek(Non-Thinking Mode)、GLM-4-Air、Grok-4;端到端音频模型 GLM-4-Voice、Qwen-Omni-Turbo(Section 6.1.2)。
- 测试基准与规模:AdvBench 有害行为子集,选取精选的 50 条代表性提示词评估攻击有效性(Section 6.1.1)。
- 对比基线:GCG、IGCG、PAIR、Auto-DAN,均在相同语音传输路径及时间限制下评估(Section 6.1.3)。
- 评测指标:StrongREJECT 的非拒绝率(NR)与具体说服力得分(SC),取值范围归一化至 [0, 1];词错误率(WER)评估转录保真度(Section 6.1.4)。
- 评审方式:采用 GPT-4o-mini 作为自动评判模型,依据包含拒绝、具体性、说服力三个维度的提示词打分(Section 6.1.4、Appendix C)。
- 物理部署设置:默认播放设备为 HiVi M200MKIII+ 扬声器,录音设备为 iPhone 14 Pro,距离 1 米、角度 0°,环境噪声 36–38 dB,TTS 使用阿里云 Lucy 音色(Section 6.1.6)。
主结果
在默认物理设置下,以 LLaMA-3.1-8B-Instruct 为代理模型,不同文本目标模型上的攻击表现对比如下:
表格较宽,可左右滑动
目标模型 Auto-DAN NR Auto-DAN SC SWhisper NR SWhisper SC LLaMA-3.1-8B(目标即代理) 0.300 0.298 0.960 0.945 Gemma-3-4B 0.400 0.193 0.620 0.435 Qwen2.5-7B 0.680 0.638 1.000 0.935 Mistral-7B 0.880 0.835 0.960 0.943 DeepSeek 0.680 0.638 0.780 0.745 GLM-4-Air 0.560 0.555 0.920 0.885 Grok-4 0.660 0.658 0.780 0.733 注:数据源自 Table 1。表中对比了表现最强的基线 Auto-DAN 与 SWhisper。
- 黑盒迁移表现:SWhisper 在多数目标模型上取得最佳表现,并在黑盒商业模型上实现有效迁移,例如在 GLM-4-Air 上达到 0.920 的 NR 和 0.885 的 SC(Table 1)。
- 白盒与黑盒差距:在 LLaMA-3.1-8B 上存在较大的白盒与黑盒差距(白盒 NR/SC 为 0.960/0.945,而其他代理迁移至该模型时最好为 0.580/0.578)(Table 1)。
- 基线表现对比:GCG 与 IGCG 转化语音后几乎完全无效,NR 与 SC 多数接近 0;Auto-DAN 是最强基线,但在 LLaMA-3.1-8B 和 Gemma-3-4B 上表现较弱;在 DeepSeek 上,以 Gemma-3-4B 为代理的 Auto-DAN(NR/SC 为 0.820/0.820)略高于 SWhisper 的结果(0.780/0.745)(Table 1)。
端到端音频模型评测
- 评测对象与设置:针对直接处理原始音频的 GLM-4-Voice 和 Qwen-Omni-Turbo,以文本模型 LLaMA-3.1-8B-Instruct 为代理模型进行跨模态迁移评测(Table 2)。
- 实验数值:在 GLM-4-Voice 上,SWhisper 的 NR 达到 0.980、SC 达到 0.813,分别比 Auto-DAN 高出 0.240 和 0.270;在 Qwen-Omni 上,SWhisper 的 NR 为 0.580、SC 为 0.503,高于 Auto-DAN 的 0.520 与 0.475(Table 2)。
- 作者解读:作者认为这展现了从文本代理向原生音频架构的跨模态迁移有效性(Section 6.2.2)。
真实物理与声学环境表现
- 环境噪声与人声干扰:在办公室、公园、餐厅、街道四类场景分别加入 50dB 与 60dB 干扰声,SWhisper 在 Grok-4 上的 NR 维持在 0.720–0.780 之间,SC 维持在 0.693–0.723 之间(Table 3)。
- 攻击距离与角度变化:距离从 1 米增加至 4 米时,NR 仅从 0.780 轻微下降至 0.760,SC 保持在 0.730 附近(Figure 5);角度从 0° 增至 90° 时,NR/SC 从 0.780/0.733 逐渐降至 0.700/0.690(Figure 6)。
- 不同录音设备测试:在海康威视麦克风、红米 Note 12 和 iPhone 14 Pro 上的 NR/SC 分别为 0.780/0.715、0.680/0.635、0.780/0.733(Figure 7)。
人耳听觉隐蔽性实验
- ABX 测试设置:招募 32 名受试者(21 男 11 女,年龄 21–63 岁),在安静、办公室、餐厅、公园、街道五种背景音下,以约 70 dB 声级播放,判断测试样本属于纯背景音还是混入近超声的音频(Section 6.5)。
- 统计检验结果:双侧精确二项式检验显示各场景平均识别准确率为 0.475–0.525,p 值均大于等于 0.516,受试者辨别表现与机会水平无统计差异(Table 4)。
- 主观评分结果:5 分制李克特量表(5 代表完全无法区分)中,各环境平均感知得分均在 4.920–4.995 之间(Table 4)。
其他消融与分析
- 移除对抗后缀:Grok-4 上 NR 从 0.780 降至 0.740,SC 从 0.733 降至 0.703(Section 6.4、Figure 8)。
- 移除结构化模板:Grok-4 上 NR 降至 0.178,SC 降至 0.169(Section 6.4、Figure 8)。
- 移除语义正则化:Grok-4 上 NR 降至 0.660,SC 降至 0.645(Section 6.4、Figure 8)。
- 词错误率分析:GCG 与 IGCG 转录后的 WER 普遍在 0.75 以上,而 SWhisper 在各代理模型上 WER 均维持在最低水平(Figure 4)。
- 文本纯净攻击对比:在无语音转换的纯文本设置下,SWhisper 与 Auto-DAN 的表现在各模型上保持相对一致的水平(Table 10)。
有什么可以进一步探索的点?
作者指出信道模型缺乏环境自适应、模板通用但未定制、以及后缀优化未显式针对跨模型迁移等局限。
作者指出的局限与后续方向
- 信道建模依赖静态平均:当前系统依赖跨设备和环境的平均传递函数,作者指出未来可结合自适应或环境感知信道建模以应对动态声学变化(Section 7.2)。
- 提示词模板缺乏任务定制:当前使用结构化但通用的模板设计,作者指出探索上下文感知或任务专用的模板可能提升泛化能力(Section 7.2)。
- 后缀优化未显式考虑迁移性:当前优化侧重于语音兼容性与语义保真度,作者指出引入迁移感知目标或多模型联合优化可进一步提升黑盒有效性(Section 7.2)。
实验覆盖范围
- 被测模型范围:实验测试了 4 个开源文本模型(Meta-Llama-3.1-8B-Instruct、Gemma-3-4B、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3)、3 个商业模型(DeepSeek 非思考模式、GLM-4-Air、Grok-4)以及 2 个端到端音频模型(GLM-4-Voice、Qwen-Omni-Turbo)(Section 6.1.2)。
- 数据集与测试规模:评估使用来自 AdvBench 的 50 条精选有害行为提示词,语音合成固定使用阿里云女性音色 Lucy(Section 6.1.1、6.1.6)。
- 声学硬件与环境覆盖:播放设备测试了 HiVi M200MKIII+ 扬声器,录音设备测试了 iPhone 14 Pro、Redmi Note 12 和 HIKVISION-DS-VM1 麦克风,测试距离覆盖 1m 至 4m,角度覆盖 0° 至 90°,背景噪声覆盖 4 类场景及 50dB/60dB 声级(Section 6.1.6、6.3)。
- 防御机制分析范围:防御讨论仅覆盖了基于特征跟踪与包络相关的信号层检测,以及基于大模型评审的文本层防御(Section 7.1)。
- 未报告信息情况:论文未报告攻击在非英语语言下的表现,未报告多轮交互场景下的攻击表现,且主实验未报告多次重复运行的统计方差或标准差(Section 6.1、6.2)。
总结一下论文的主要内容
提出软硬件结合的近超声隐蔽越狱框架,实现商用设备上黑盒针对语音LLM的高成功率攻击与人耳不可感知。
- 研究定位:SWhisper 是针对语音驱动大语言模型、在黑盒设置下利用商用扬声器与麦克风实现物理层隐蔽提示词注入与越狱的端到端框架。
- 核心挑战与思路:针对语音接口严格的时长限制以及物理声学传播与麦克风非线性失真,采用文本层语音适配越狱提示词生成与声学层近超声信道求逆预补偿相结合的协同设计。
- 方法关键机制:文本层基于包含规则指令与语义约束后缀的紧凑模板,在并行搜索与信道扰动模拟下优化;声学层通过测量经验传递矩阵并求解正则化逆问题补偿麦克风非线性,调制至 17–22 kHz 近超声波发射。
- 主要实验结果:在商用模型 GLM-4-Air 上取得 0.940 的非拒绝率(NR)与 0.925 的具体说服力得分(SC)(Table 1);在端到端音频模型 GLM-4-Voice 上 NR 达 0.980、SC 达 0.813(Table 2);在 1–4 米距离及各类噪声下保持稳定攻击表现(Table 3、Figure 5)。
- 隐蔽性证据:针对 32 名受试者的 ABX 听觉实验显示,近超声注入音频与纯背景音频的平均辨别准确率接近机会水平(p ≥ 0.516),主观评分均值在 4.92 以上(满分 5 分),证实其在人耳听觉上的隐蔽性(Table 4)。
- 作者结论与启示:作者指出,硬件非线性特性与模型对齐缺陷的相互作用开辟了新的物理层脆弱面,单纯依赖麦克风前端滤波或文本防护不足以防御此类攻击,未来语音智能体需建立跨物理层与语义层的协同防御体系。