防御arXiv 2609.29287
AEGIS:用内部信号在中间层拦截大型音频语言模型越狱
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
- arXiv
- 2609.29287
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Qwen2-Audio-7B、VITA-1.5、Ultravox v0.5 等 6 个
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱
提出 PALS,用潜空间平滑防御全双工语音对话的对抗扰动
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型
GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。