跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.05140·本站收录 · 原文发表

AutoSciBench:自动生成科学智能体评测基准的框架

AutoSciBench: Autonomous Benchmark Generation for Evaluating Scientific Agents

AI 导读

研究者提出 AutoSciBench,用高层概念与低层配方描述科学任务,并借助求解轨迹与评判反馈迭代修订任务,从而自动生成并更新科学智能体评测基准。该框架在计算生物学、材料科学和临床成像三个领域进行评测,生成基准相较人工构建基准使平均求解准确率分别下降 22.4 和 25.5 个百分点,同时生成任务在三个领域都获得更高的平均质量评分。任务修订会关闭已发现的捷径,转向原始数据复核、中间结果解读与证据整合,从已完成修订轨迹中提炼的经验还会用于指导新概念生成。

阅读原文huggingface.co