跳到正文
原文
epoch.ai·本站收录 · 原文发表

Epoch 更新 EBR-bench:禁用可无限延长回合的卡牌,GPT-6 Astra 不再满分

EBR-bench update

AI 导读

Epoch 更新了用于测试模型长时程任务能力的桌游基准 EBR-bench,起因是 GPT-6 Astra 在原版基准上取得 100% 满分,且其所有最高分都依赖一张可绕过游戏回合限制、配合其他卡牌实现无限回合的卡牌。Epoch 决定在默认实验设置中禁用该卡牌,并称禁用后 Astra 最高分为 21 个目标中的 20 个,仍比此前最强模型平均表现高出约 50%,但疲劳控制能力仍属中等,未见随时间改善。多智能体实验基于 UK AI Security Institute 的 Inspect Deep Agent 框架,最多四个子智能体,结果显示多数模型牌组探索有所增加,但仅 Claude Opus 5 达到统计显著,且对总分无显著影响。 Epoch 将该策略视为规则内的玩法,称未发现直接作弊或记忆证据;默认规则调整也会影响新旧分数的可比性。

阅读原文epoch.ai