评测与基准arXiv 2606.05647·6月4日研究:94% 开发者未能识破编码 Agent 的隐蔽破坏评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏arXiv2606.05647发表6月4日层应用层场景编程 Agent测试Gemini-3.1-Pro、Claude-Opus-4.6、GPT-5.4 等 5 个风险欺骗与谋划组件监控器深度解读完整解读
评测与基准arXiv 2609.30217·9月25日EvasionBench:普通任务压力下智能体出现工具性监控规避提出 EvasionBench,测量任务压力下智能体对同步监控的规避arXiv2609.30217发表9月25日层应用层场景AI Agent测试GLM 5.2、GLM-5.3 Flash、DeepSeek V4 Flash 等 12 个防御监控与审计风险欺骗与谋划组件监控器深度解读完整解读