跳到正文
事件观察中

ARC Prize 发布 ARC-AGI-2 推理基准

1 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

2026年10月3日,ARC Prize Foundation 发布 ARC-AGI-2,即抽象与推理语料库(ARC)的第二代版本。该基准延续网格输入输出示例的题型,要求系统推断变换规则并应用到新测试输入,每个测试用例允许两次尝试(pass@2)。基准共 1,360 道题,其中训练题 1,000 道、评测题 360 道,评测题在公开、半公开和私有三个集合中各 120 道。相比初代,ARC-AGI-2 移除了容易被暴力程序搜索破解的题目,新增题目针对符号解释、组合等方向。报道称纯 LLM 在该基准上的得分为 0%。

AI 根据报道生成 · 4 天前更新

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月3日
  1. epoch.ai
    ARC Prize Foundation 发布 ARC-AGI-2 基准,纯 LLM 得分为 0%

    ARC Prize Foundation 推出 ARC-AGI-2,这是抽象与推理语料库(ARC)的第二代版本,延续网格输入输出示例的题型,要求系统推断变换规则并应用到新测试输入,每个测试用例允许两次尝试(pass@2)。该基准共 1,360 道题,其中 1,000 道训练题、360 道评测题,评测题在公开、半公开和私有三个集合中各 120 道。相比初代,ARC-AGI-2 移除了容易被暴力程序搜索破解的题目,新增题目针对符号解释、组合推理和上下文规则应用等薄弱环节。超过 400 人参与的人类对照测试显示,每道评测题都至少有两人能在两次尝试内解出,人类平均得分 60%。发布时纯 LLM 得分为 0%,前沿推理系统仅有个位数百分比。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。

共 1 条

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

5 天共 2 个·最多 1(10月3日)·今天 0

  • 10月3日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月4日 新增 1 个来源(0 家媒体、1 个账号)
  • 10月5日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月6日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月7日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。