评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- Claude Code、Codex、Hermes 等 6 个
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 TRUSTFORK,评测展示身份如何劫持多智能体编排的操作权限
摘要论文提出了多智能体安全基准 TRUSTFORK,揭示展示身份如何劫持操作权威,并证明事后验证无法弥补已发生的执行破坏。
提出技能级联攻击,把恶意目标拆进多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。