研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究
提出影子评测,检验前沿智能体能否独立完成开放式科研
- 定位与出发点:本研究针对当前 AI 能否自主进行 AI 科研这一核心争议,提出了由未公开论文原作者担任评审专家的“影子评测”方法,用以衡量前沿智能体在长周期开放式科研中的真实水平。
- 核心评估问题:现有评估主要依赖狭窄可验证指标或高随机性的学术会议盲审,无法检验智能体在缺乏明确自动验证信号时提出假设、设计实验和应对挫折的能力。
- 方法设计:选取两篇提交至 NeurIPS 2026 的未公开论文(Personas 与 TabPFN),利用 OpenClaw 支架搭载 Claude Opus 4.8,给予 6 天时间、3,000 美元 API 预算与充足 GPU 算力,让智能体端到端自主完成科研并成文,最后由原作者依据顶会官方标准进行深度审稿。
- 关键实验结果:
- 两篇论文在原作者评审中分别获得 2/6(Reject)和 1/6(Strong Reject)的得分,均被明确拒稿(据 Table 1)。
- 智能体均未充分利用分配的资源,Personas 任务仅消耗 1,130 美元 API 预算,TabPFN 任务仅消耗 1,235 美元(总预算均为 3,000 美元,据 Figure 1)。
- 在探索进程上,Personas 智能体原定 42 小时探索却在 5 小时后便放弃其他假设并收敛;TabPFN 智能体的方法在真实分布偏移下的 AUROC 仅为 0.60,明显低于合成偏移下的 0.76(据 Figure 2、第 26 页)。
- 两篇提交论文均达 10 页违反 9 页限制,且引文数量(16 篇与 36 篇)大幅少于原作者论文的 52 篇与 69 篇(据 4.6 节)。
- 主要失败模式与能力边界:日志分析归纳出五大失败模式,包括对研究发表门槛缺乏判断、面对负面反馈缺乏创造性解法、无法从死胡同有效回溯、资源与时间感知薄弱以及指令漂移;但智能体展现了出色的工程执行力,在无人类干预下完成了环境配置、代码编写和实验排错。
- 结论与启示:作者指出当前前沿智能体虽能胜任科研中的工程实现环节,但尚无法独立解决周级别的开放式科学研究;在评估 AI 研发自动化时,必须将狭窄任务的指标优化与开放式科学探索明确区分开来。