攻击arXiv 2604.14604
AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
- arXiv
- 2604.14604
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出 AudioHijack,用不可感知对抗音频对语音模型实施听觉提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。