跳到正文
原文
Generality Labs· Jeff Mohl·本站收录 · 原文发表 精选关注度53

Generality Labs 审计 LABBench2,发现多数任务集饱和且评分器不可靠

LABBench2 Audit

AI 导读

Generality Labs 对生物能力基准 LABBench2 的 11 个任务集做了审计,认为多数文献任务集已饱和,ProtocolQA2 的分数难以信任。该基准共 1,912 道任务,七个文献任务集中有五个已饱和或接近饱和,分子生物学的 SeqQA2 也已饱和。审计指出 ProtocolQA2 的构念效度存疑,换用四个评分模型后通过率从 GPT-5.6 Terra 的 47% 到 Gemini 3.7 Flash 的 59%,相差 12 个百分点。DbQA2 从基准的 tools 设置换到智能体沙箱后,GPT-5.6 Luna 从 42% 升到 73%,Terra 从 45% 升到 70%。CloningQA 仅 14 道题,无法用于模型间比较。

推荐理由

审计逐项列出 LABBench2 各任务集的饱和、构念效度与评分器问题,为解读前沿模型生物能力分数提供参照。

阅读原文generality.org