攻击arXiv 2610.05943
CRIME 框架利用良性 Agent 技能组合诱发恶意行为
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
- arXiv
- 2610.05943
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GPT-4o-mini、GPT-4o 等 6 个
摘要良性技能经 DCA 或 ACA 组合后可产生恶意环境后果,单独审查对不上。
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。