Generality Labs 审计 LABBench2,发现多数任务集饱和且评分器不可靠
LABBench2 Audit
AI 导读
Generality Labs 对生物能力基准 LABBench2 的 11 个任务集做了审计,认为多数文献任务集已饱和,ProtocolQA2 的分数难以信任。该基准共 1,912 道任务,七个文献任务集中有五个已饱和或接近饱和,分子生物学的 SeqQA2 也已饱和。审计指出 ProtocolQA2 的构念效度存疑,换用四个评分模型后通过率从 GPT-5.6 Terra 的 47% 到 Gemini 3.7 Flash 的 59%,相差 12 个百分点。DbQA2 从基准的 tools 设置换到智能体沙箱后,GPT-5.6 Luna 从 42% 升到 73%,Terra 从 45% 升到 70%。CloningQA 仅 14 道题,无法用于模型间比较。
推荐理由
审计逐项列出 LABBench2 各任务集的饱和、构念效度与评分器问题,为解读前沿模型生物能力分数提供参照。