评测与基准arXiv 2608.12851
研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
- arXiv
- 2608.12851
- 发表
- 层
- 应用层
- 被测模型
- Claude Code、Codex、Hermes 等 4 个
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。