攻击arXiv 2609.30383
研究者提出技能级联攻击
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
- arXiv
- 2609.30383
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令
PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。
提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器