评测与基准arXiv:2605.16626 · 5月Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点编程 Agent·测试Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个·应用层监控与审计欺骗与谋划监控器摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。完整解读
评测与基准arXiv:2610.07639 · 10月6日HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制编程 Agent·测试GLM-5.2、Qwen3.8-27B、Claude Opus 4.8 等 4 个·应用层提示注入权限与沙箱+1+1完整解读
评测与基准arXiv:2609.19587 · 9月17日红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固编程 Agent·测试Opus 5、Opus 4.8、Opus 4.7 等 8 个·应用层监控与审计欺骗与谋划监控器摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。完整解读
评测与基准arXiv:2609.30217 · 9月25日EvasionBench:普通任务压力下智能体出现工具性监控规避提出 EvasionBench,测量任务压力下智能体对同步监控的规避AI Agent·测试GLM 5.2、DeepSeek V4 Flash、Muse Spark 1.3 等 12 个·应用层监控与审计欺骗与谋划监控器完整解读