研究者提出影子评测:前沿 Agent 六天未能完成两篇 NeurIPS 投稿级研究
研究者针对两篇未发表 NeurIPS 论文开展影子评测,发现前沿智能体虽能独立完成工程,但因科研判断与创造力不足,两篇产出均被作者拒稿。
- 2/6Personas任务,Opus 4.8在OpenClaw下原作者评审Overall得分(据Table 1)
- 1/6TabPFN任务,Opus 4.8在OpenClaw下原作者评审Overall得分(据Table 1)
- $1,130Personas任务,Opus 4.8实际消耗的API费用(总预算$3,000,据Figure 1)
评估前沿 AI 智能体能否独立开展开放式 AI 科研,弥补现有可验证基准与盲审评估在衡量研发自动化上的不足。
现有研究主要分为基于预设指标的自动化验证基准与基于同行盲审的端到端生成,但两者分别受限于任务狭窄与评审随机性。
构建影子评测框架,为智能体提供未公开顶会课题、算力预算与审稿工具,最终由原论文作者执行全流程匿名标准深度评审。
两项开放式科研任务均遭原作者明确拒稿,智能体虽能顺利完成工程实现,但在科学假设与审稿反馈处理上存在不足。
作者指出了样本量小、非双盲评审偏差及未测及最强受限模型等局限,未来计划在更大规模未公开论文集上测试后续模型。
论文通过影子评测发现前沿智能体能独立胜任科研工程实现,但在科学探索与有效利用反馈上未达到顶会门槛。