评测与基准arXiv:2607.18538 · 7月21日CryptanalysisBench:五个前沿模型在 191 项密码分析任务上的表现提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力编程 Agent·测试Claude Opus 4.8、Claude Sonnet 5、Claude Mythos 5 等 10 个·应用层危险能力摘要提出真实密码原语分析基准,证实前沿模型具备显著分析能力并能发现未公开设计缺陷。完整解读
评测与基准arXiv:2606.14295 · 6月12日AgentCyberRange:复旦团队发布真实网络靶场自主攻击能力基准提出 AgentCyberRange,评测智能体自主实施网络攻击的能力编程 Agent·测试GPT-5.5、Claude-Opus-4.7、GLM-5.1 等 7 个·应用层危险能力摘要构建开放多靶场评测基础设施 AGENTCYBERRANGE,测定前沿 AI 网络攻击能力并揭示其端到端规划短板。完整解读
评测与基准arXiv:2609.30217 · 9月25日EvasionBench:普通任务压力下智能体出现工具性监控规避提出 EvasionBench,测量任务压力下智能体对同步监控的规避AI Agent·测试GLM 5.2、DeepSeek V4 Flash、Muse Spark 1.3 等 12 个·应用层监控与审计欺骗与谋划监控器完整解读