防御arXiv 2609.29287
AEGIS:用内部信号在中间层拦截大型音频语言模型越狱
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
- arXiv
- 2609.29287
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Qwen2-Audio-7B、VITA-1.5、Ultravox v0.5 等 6 个
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
用 MMPIBench 评测多模态提示注入对 Agent 框架的影响
摘要论文提出 MMPIBench 评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。
提出针对微调 TTS 的黑盒成员推断攻击
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
提出嵌入推断攻击 EIA,在黑盒 IR 中识别所用嵌入模型
EIA 是在黑盒 IR 上识别所用嵌入模型的攻击。。