跳到正文
原文
论文追踪· arXiv:2504.01094· Jaechul Roh, Virat Shejwalkar, Amir Houmansadr·本站收录 · 原文发表

研究者提出 Multi-AudioJail,多语言多口音音频越狱攻击成功率最高提升 57.25 个百分点

Multilingual and Multi-Accent Jailbreaking of Audio LLMs

AI 导读

研究者提出 Multi-AudioJail,这是首个系统利用多语言与多口音音频越狱漏洞的框架,包含一个对抗性扰动的多语言、多口音音频越狱提示词数据集,以及一套分层评测流程。结果显示,混响、回声、耳语等声学扰动与跨语言音系相互作用,可使越狱成功率最高提升 57.25 个百分点,例如对 MERaLiON 使用带混响的肯尼亚口音攻击。作者称多模态大模型比单模态系统更易受攻击,攻击者只需利用最薄弱环节(如非英语音频输入)即可攻破整个模型,实验中纯音频多语言攻击的成功率是纯文本攻击的 3.1 倍。作者计划公开数据集以推动跨模态防御研究。

阅读原文arxiv.org