跳到正文
事件观察中

Epoch AI 调整 EBR-bench 评测规则

1 篇报道1 个报道来源最近报道

先了解这件事

AI 综述

Epoch 更新了用于测试模型长时程任务能力的桌游基准 EBR-bench。起因是 GPT-6 Astra 在原版基准上取得 100% 满分,且其所有最高分都依赖一张可绕过游戏回合限制、配合其他卡牌实现无限回合的卡牌。Epoch 决定在默认实验设置中禁用该卡牌,并称禁用后 Astra 最高分为 21 个目标中的 20 个,仍比此前最强模型平均表现高出约 50%,但疲劳控制能力仍属中等,未见随时间改善。多智能体实验基于 UK AI Sec。

AI 根据报道生成 · 1 天前更新

后续时间线

10月7日
  1. epoch.ai
    Epoch 更新 EBR-bench:禁用可无限延长回合的卡牌,GPT-6 Astra 不再满分

    Epoch 更新了用于测试模型长时程任务能力的桌游基准 EBR-bench,起因是 GPT-6 Astra 在原版基准上取得 100% 满分,且其所有最高分都依赖一张可绕过游戏回合限制、配合其他卡牌实现无限回合的卡牌。Epoch 决定在默认实验设置中禁用该卡牌,并称禁用后 Astra 最高分为 21 个目标中的 20 个,仍比此前最强模型平均表现高出约 50%,但疲劳控制能力仍属中等,未见随时间改善。多智能体实验基于 UK AI Security Institute 的 Inspect Deep Agent 框架,最多四个子智能体,结果显示多数模型牌组探索有所增加,但仅 Claude Opus 5 达到统计显著,且对总分无显著影响。 Epoch 将该策略视为规则内的玩法,称未发现直接作弊或记忆证据;默认规则调整也会影响新旧分数的可比性。

相关讨论

本站还没有收集到这件事的讨论链接。

关注度走势

每天新增来源

4 天共 1 个·最多 1(10月8日)·今天 0

  • 10月8日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月9日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月10日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月11日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 51·可比范围峰值 55(10月8日 11:00)·近 24 小时可比范围变化 -1%

020406010月8日10:0010月9日07:0010月10日03:0010月11日00:00