跳到正文

METR 的前沿模型自主能力评估、任务时长研究与第三方评测。

最新精选

第 21–22 条 · 共 22 条
3月10日周二
  1. METR · 66

    METR:约半数通过 SWE-bench Verified 的 AI 补丁不会被维护者合并

    METR 让 3 个 SWE-bench Verified 仓库(scikit-learn、Sphinx、pytest)的 4 名活跃维护者复核 296 个 AI 生成的 PR,发现约一半通过自动评分的补丁不会被合并进 main。以人工 golden patch 的 68% 合并率做基线归一后,维护者合并率平均比自动评分低约 24.2 个百分点(标准误 2.7);按每年提升幅度看,维护者合并决定比自动评分慢约 9.6 pp/yr(标准误 5.5),但该趋势结果较弱,仅在 10% 显著性水平上成立,且限制为 SOTA 模型后不再显著。

    推荐理由METR 用真实维护者复核 SWE-bench Verified 的通过补丁,量化了基准分数与真实可用性之间的落差。

2月19日周四
  1. METR · 67

    METR 复盘 AI 生物 RCT:五个关于证据型 AI 政策的经验

    METR 作者复盘其参与组织的 AI 生物随机对照试验(RCT),总结出五条面向证据型 AI 政策的经验。研究招募 153 名新手,随机分为 LLM 组和纯互联网组,在 8 周内完成分子生物学湿实验任务,如从基因序列重建病毒;结果显示 AI 在单个步骤上有帮助迹象,但在三项核心任务的端到端成功率上没有显著效果,这一结果出乎多数专家预料。

    推荐理由作者以亲历者身份复盘 AI 生物 RCT 的组织经验,为理解基准与真实能力差距提供了可迁移的方法视角。