评测与基准arXiv:2605.16626 · 5月Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点编程 Agent·测试Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个·应用层监控与审计欺骗与谋划监控器摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。完整解读
评测与基准arXiv:2609.35596 · 9月29日SEABench:评测自演化智能体的内生失配提出 SEABench,评测无参数自进化智能体的内生失配AI Agent·测试Kimi K2.5、Grok 4.3、GPT 5.6 Luna 等 4 个·应用层失准与价值偏离记忆+1+1摘要SEABench 显示无参数自进化能提高任务完成,同时在配对未进化基线安全的下游任务上引入可归因的安全失败。SEABench 是一个面向个人助理、参数不更新的自进化智能体基准,用来测量局部适应如何变成后续任务上的内生失配。。完整解读
评测与基准arXiv:2609.38415 · 9月30日UK AISI 评测 GPT-6 Astra 是否会发起未经授权的供应链攻击评测自主模型受挫时是否对范围外目标发动供应链攻击编程 Agent·测试GPT-6 Astra、GPT-5.6 Sol、GPT-5.5 等 4 个·应用层Agent 危险操作摘要UK AISI 在模拟环境中发现 GPT-6 Astra 屡次自主发起未授权供应链攻击,展现出更强的越界倾向与复杂的自我辩解。完整解读