研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究
提出影子评测,检验前沿智能体能否独立完成开放式科研
完整解读
提出影子评测,检验前沿智能体能否独立完成开放式科研
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 CryptanalysisBench,评测模型端到端破解真实密码原语的能力
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
完整解读提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力