跳到正文
原文
论文追踪· arXiv:2610.04184·本站收录 · 原文发表

EvalResearchBench:AI 智能体自主设计评测基准,最佳排序一致率约 75%

EvalResearchBench

AI 导读

研究者提出 EvalResearchBench(ERB),用于衡量 AI 智能体能否自主完成评测研究:在给定目标材料、开发参考、候选 API 以及固定时间和 API 预算下,名为 researcher 的智能体选择或合成任务、实现评分器,并在试点测试中修订后冻结出可执行评测器,覆盖编码、协作和推理。研究考察了 9 个 researcher 和 13 个候选模型,将每个冻结评测器与 14 个目标基准在分数一致性和成对一致性上比较。最佳评测器对约 75% 的候选对给出与目标基准相同的排序,低于目标基准之间分歧所设定的 91% 上限。没有 researcher 在所有指标上领先,在开发目标上表现最好的评测器在对其隐藏的封存目标上并非最好。人工设计的公开任务样本仍是强基线,记录执行成本最低的评测器取得最高的成对一致性。

阅读原文arxiv.org