研究审计 Qwen2-Audio 音频越狱 AdvWave-P 的频率与解码层归因
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
- arXiv
- 2610.07005
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- Qwen2-Audio-7B-Instruct、LLaMA-Omni
摘要AdvWave-P 的八频带排序与能量相关。
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
提出 RECAST,本地改写图表与语音并做可逆数值映射以保护远程推理隐私
提出 PMPA,经外部源向 Agent 持久记忆投毒并跨会话泄露隐私
摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出 ARENA 音频红队框架,自动构造文本安全且音频接地的越狱输入
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示
提出音频叙事越狱,以嗓音投递风格绕过端到端语音模型拒答
提出 StyleBreak 风格化音频越狱,利用语音属性绕过音频语言模型对齐
提出 Jailbreak-AudioBench 评测音频语言模型的音频编辑越狱