攻击arXiv 2609.30383
研究者提出技能级联攻击
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
- arXiv
- 2609.30383
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出多图越狱框架 DMN,把有害意图拆进图像序列绕过安全护栏
提出纯视觉越狱攻击 VJA,把有害编辑指令编码进图像
提出多轮多模态越狱,并用 FragGuard 拦截有害响应
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出 RedDiff,用强化扩散生成图像审计 VLM 情境安全失效
RedDiffuser 是黑盒审计框架:有害内容不是显式攻击指令,而是固定的部分有毒文本,再配上扩散模型生成的图像,看 VLM 的开放续写会不会变得不安全。