评测与基准arXiv:2606.05647 · 6月4日研究:94% 开发者未能识破编码 Agent 的隐蔽破坏评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏编程 Agent·测试Claude-Opus-4.6、GPT-5.4、Gemini-3.1-Pro 等 5 个·应用层欺骗与谋划监控器完整解读
评测与基准arXiv:2608.09476 · 8月10日ActBench:面向协作智能体行为安全的自演化基准构建 ActBench 评测协作智能体多步执行中的操作级行为安全编程 Agent·测试Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个·应用层提示注入记忆+1+1摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。完整解读
评测与基准arXiv:2608.12851 · 8月13日研究者提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化风险构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险编程 Agent·测试Claude Code、Codex、Hermes 等 6 个·应用层投毒与后门潜伏触发记忆完整解读
评测与基准arXiv:2609.19587 · 9月17日红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固编程 Agent·测试Opus 5、Opus 4.8、Opus 4.7 等 8 个·应用层监控与审计欺骗与谋划监控器摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。完整解读
评测与基准arXiv:2609.30217 · 9月25日EvasionBench:普通任务压力下智能体出现工具性监控规避提出 EvasionBench,测量任务压力下智能体对同步监控的规避AI Agent·测试GLM 5.2、DeepSeek V4 Flash、Muse Spark 1.3 等 12 个·应用层监控与审计欺骗与谋划监控器完整解读