Learn2Play Bench 发布:用规则陌生的文本游戏评测 LLM Agent 从经验中学习的能力
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
Learn2Play Bench用20款新文本游戏评测从经验学习;作者称Kimi K3上MEMORY四项指标均领先。
- 现有评测很难把“从交互学到新规则”和“调用预训练知识”分开。作者因此问:LLM智能体在不熟悉环境中,能多有效地从经验学习。
- Learn2Play Bench含20个新设计文本游戏,规则隐藏且可反直觉。智能体不更新权重,靠文本反馈反复尝试;其中10个游戏跨局改变可见实例。比较backbone、六种经验保留方式、harness和人类玩家。
- 在20个游戏的加权指标上,OpenCode配Opus 5.5的Max为80.1,Qwen 3.8 Max的LG为+25.2。Kimi K3上MEMORY的Max为63.3,四项均高于同骨干的另五种方法。Human Top-1的Max为84.3。
- 作者在§5提出三个后续方向:平衡探索与利用、把规则连回原始交互以便修订、在表面变化中识别不变规则。实验包含11个backbone、六种经验保留方法、两种部署harness对照,以及每游戏21–30名大学生;分数由游戏自动计算。
- 被测模型
- Claude Opus 5.5GPT-6 AstraClaude Opus 5Qwen 3.8 MaxGemini 3.5 FlashKimi K3Gemini 3.7 FlashGPT-5.6-SOLClaude Sonnet 5DeepSeek V4 ProGPT-5 Mini
- 基准
- Learn2Play Bench
- 指标
- MaxMeanLearning Gain (LG)Learning Slope (LS)
研究者提出 Learn2Play Bench,用新设计的文本游戏评测 LLM Agent 从经验中学习的能力,这些游戏的规则新颖或反直觉,要求 Agent 通过交互获取知识,而非依赖预训练知识。基准提供可复现的反馈与自动评分,支持在重复尝试中受控地评测学习过程,并通过变换游戏实例测试 Agent 能否把学到的内容迁移到新情境。研究评估了基座模型、自演化方法和 Agent harness 对学习能力的影响,得出三点发现:保留完整的动作与反馈记录比把经验总结成规则或策略更有利于学习;表现最好的人类玩家峰值分数高于受测 Agent,且人类探索的策略更多样、重复动作更少;在固定基座模型的情况下,更换 harness 可以提升表现并降低估算推理成本。项目网站为 https://liushiliushi.github.io/learn2play-bench-website/。
深度解读
这篇论文试图解决什么问题?
要测的是智能体能否在规则陌生的文本游戏里,靠交互而不是预训练知识改进行为。
LLM 智能体在规则陌生、不能直接套用预训练知识的环境里,能否靠交互经验学到新规则并改进行为。
- 为何重要:作者认为,通过交互获取新知识并用来改进行为,是通向 AGI 的核心能力(Hendrycks et al., 2025)。部署中智能体常遇到预训练未覆盖的规则,例如不熟悉的机器人指令接口,需要试命令、观察结果,再用于后续决策。
- 现有评测的缺口:self-evolving 方法常在不同模型、任务和协议下研究,难以直接比较。熟悉任务上的分数上升,也分不清是从交互学到新规则,还是调用预训练中已有的知识。
- 作者的处理思路:用规则新颖或故意反直觉、反馈确定、可自动评分的环境,把从经验学习与调用已有知识分开;并在核心规则不变时改变可见情境,检查能否迁移。
- 本文提出什么:Learn2Play Bench,20 个新设计的文本游戏。智能体不更新权重,通过行动和文本反馈发现隐藏规则。作者比较 backbone、self-evolving 方法、agent harness,并与人类玩家对照。
- 评测约束:经 black-box 命令接口交互,不能访问游戏源码或 oracle。各 trial 开始时没有其他 trial 的记忆;trial 内保留哪些经验取决于 harness。
有哪些相关研究?
相关工作分测试时适应方法与既有学习基准;作者用隐藏规则新游戏区分新学习与已有知识。
论文把相关工作分成测试时适应的智能体,以及用来评估这类适应的基准。
测试时适应的智能体
- Reflexion(Shinn et al., 2023)、ExpeL(Zhao et al., 2024)、Voyager(Wang et al., 2024):不更新权重,分别用言语反思、抽取洞察并检索轨迹、积累可复用的可执行技能。
- AWM(Wang et al., 2025)、Dynamic Cheatsheet(Suzgun et al., 2026)、ACE(Zhang et al., 2025b):把经验整理成动作 workflow、紧凑策略与代码片段,或结构化 playbook,而不是保留原始记录。
- ReasoningBank 与 ERL(Ouyang et al., 2025; Allard et al., 2026)把轨迹蒸馏成可复用推理模式或启发式。JitRL(Li et al., 2026)检索轨迹估计动作优势,并在推理时调整 logits、不做梯度更新。GEPA、Agents of Change、EvoTest、Meta-TTL 分别演化提示词、提示词与代码、更广配置,以及经验如何更新智能体的策略;TT-SI(Acikgoz et al., 2026)在测试时微调。
评测学习或经验复用的基准
- StreamBench(Wu et al., 2024)、MemoryBench(Ai et al., 2025)、Evo-Memory(Wei et al., 2025):在输入–反馈流、累积用户反馈和任务流上,看后续行为是否改善。
- LifelongAgentBench(Zheng et al., 2025)、SWE-Bench-CL(Joshi et al., 2025)、MemoryArena(He et al., 2026):分别测相关任务上的技能积累、连续编程问题上的学习,以及相互依赖会话中的记忆使用。
- AutoEnv(Zhang et al., 2025a)也构造新环境。作者认为,J-TTL(He et al., 2025)在 Jericho 上测重复改进,但公开内容可能已进入预训练;ARC-AGI-3(Foundation, 2026)测不熟悉的视觉环境,但表现也依赖视觉能力。
基线与评测环境
- 在 Learn2Play Bench 的 20 个游戏实例上,作者比较 NAIVE、MEMORY、Reflexion、EvoTest、ReasoningBank、AWM,以及 OpenCode、Claude Code、Codex。比较聚焦不更新权重的学习。
作者称,目标不是再提出一种适应方法,而是在受控条件下评估现有方法学得如何;并用新设计的隐藏规则文本游戏,以及同一游戏的固定实例与重排实例,检查提升是否来自新规则,以及规则能否用到新的可见情境。
论文如何解决这个问题?
不更新权重,在20个隐藏规则文本游戏中比较模型、经验保留和harness。
不更新模型权重,让智能体在 Learn2Play Bench 里反复玩规则隐藏的文本游戏,用自动分数看经验是否带来提升,并比较 backbone、经验保留方式和 harness。
游戏设计
- 四条原则:规则新颖,包括与常见游戏知识冲突的隐藏规则(文中例子:偷同事午餐有助于晋升,努力工作则否);每局自动评分;结果确定,可回放;跨 episode 改变可见情境时保持核心规则。
- 规模与划分:20 个手工模板,可用不同随机种子改变布局、角色或隐藏规则参数。10 个 fixed 游戏重复同一实例;10 个 re-shuffled 游戏改变可见实例、保留核心规则。试点标出 5 个 challenge 游戏:CATNIP、DREAMGARDEN、MOLA TEA、REDEYE、ROADSIDE OBSERVATORY。论文未说明试点使用的具体智能体。
- 交互:智能体得到目标和可用动作,通过文本行动与反馈发现隐藏规则,episode 结束得到自动分数。规则不写进说明。Appendix A 列出每个游戏要学的内容,不另设能力分。
协议、归一化与指标
- 接口与重复:经 black-box 命令接口评测,不能访问源码或 oracle。主实验 20 个实例各用一个固定 seed(Table 6)。normal 游戏评 5 个 episode,challenge 游戏评 10 个。协议要求每游戏 3 次独立 trial,trial 之间无记忆。
- 归一化:记原始分为 xg,r,t、参考分为 Cg,归一化分数为 zg,r,t=100xg,r,t/Cg。参考分分 exact(oracle 或证明)、partial(已证明值但无完整最优性结果)和 estimated(合法参考搜索或分数上限),见 Table 6。这些等级描述参考分,不是智能体对游戏的知识。
- 四个指标:Max 是各 trial 在计分窗口内峰值的平均,不是三次里的全局最高。Mean 是全部评测 episode 的平均。LG 比较最后与最前 kg 个 episode,kg = min(3, floor(Tg/2))。LS 是对 episode 均值曲线线性拟合的每 episode 斜率。
- 跨游戏汇总:challenge 权重 3,其余权重 1,两组各占总权重 50%。作图时把 episode 映射到 0–100% 进度,线性插值只用于可视化,不用于四个指标。
经验保留与 harness
- Backbone 对照:11 个模型都走 OpenCode,即带 shell 和文件工具的编程智能体 harness,共用智能体循环、回放协议和记忆格式。
- 六种方法(在 Kimi K3、Claude Opus 5、GPT-5 Mini 上分别固定 backbone):NAIVE 只保留本 episode 对话。MEMORY 把此前完整、未改写的交互历史累加进新提示词,超出 context budget 时丢掉最旧 episode;论文未给出该 budget 的数值。Reflexion 把每局反思成简短教训。EvoTest 演化引导提示词和状态抽取程序。ReasoningBank 把成功或失败局变成少量推理教训。AWM 只从成功历史归纳多步 workflow,失败局不用。
- Harness 对照:Opus 5 上比较 OpenCode 与 Claude Code,GPT-5.6-SOL 上比较 OpenCode 与 Codex。Claude Code 关闭持久 auto-memory,Codex 使用 --ephemeral,OpenCode 新开 session。其他推理设置用 CLI 或提供方默认值。
- 作者对差异的描述:OpenCode 允许模型决定何时回看反馈、做计算或先检查计划;被评的 self-evolving 方法按预设步骤选动作和更新经验。
迁移与人类对照的测法
- 迁移:7 个 OpenCode backbone,以及 Claude Code(Opus 5)、Codex(GPT-5.6-SOL),比较“每局同一实例”与“每局换可见实例、规则不变”,用 10 个 episode 的 LS,每游戏 3 次 trial。Appendix B.4 另报 Opus 5 的六种方法,含不保留跨局记忆的 NAIVE。
- 人类:大学生使用同一界面,每游戏 21–30 人,游戏中不用 AI 工具或代码;参与有报酬,最高分另有奖励。按计分窗口内最高分选 Top-1、Top-3、Top-5。行为对照用 fixed 游戏上的 Human Top-3 与六种 Opus 5 方法。
论文做了哪些实验?
作者报告Opus 5.5的Max最高而Qwen 3.8 Max的LG最高;Kimi K3上MEMORY四项领先。
实验设置
- 被测 backbone:GPT-6 Astra、Claude Opus 5.5、Claude Opus 5、Claude Sonnet 5、Gemini 3.5 Flash、Gemini 3.7 Flash、GPT-5.6-SOL、GPT-5 Mini、DeepSeek V4 Pro、Kimi K3、Qwen 3.8 Max。Backbone 对照统一用 OpenCode。
- 方法与 harness:NAIVE、MEMORY、Reflexion、EvoTest、ReasoningBank、AWM,在 Kimi K3、Claude Opus 5、GPT-5 Mini 上固定 backbone 比较。Harness 为 OpenCode、Claude Code(Opus 5)、Codex(GPT-5.6-SOL)。
- 数据:Learn2Play Bench 的 20 个实例,每模板一个固定 seed(Table 6)。fixed 与 re-shuffled 各 10 个。challenge 为 CATNIP、DREAMGARDEN、MOLA TEA、REDEYE、ROADSIDE OBSERVATORY,权重 3,其余权重 1。
- 指标与判定:归一化后的 Max、Mean、LG、LS(§4.1)。分数由游戏自动计算,论文未使用 LLM 评审。
- 重复:协议要求每配置、每游戏 3 次独立 trial。Appendix C 称 31 个智能体配置与 20 个游戏的 620 个格子都有三条完整计分轨迹。人类每游戏 21–30 人。
- 成本:除 GPT-6 Astra 使用确认账单外,其余为标准价格估计(Appendix B.5)。
主结果
下表为 OpenCode、20 游戏加权归一化分数(Table 1)。11 个 backbone 中省略 Gemini 3.7 Flash(Max 58.3)、GPT-5.6-SOL(Max 57.0)、Claude Sonnet 5(Max 55.9)。
表格较宽,可左右滑动
模型 Max Mean LG LS Claude Opus 5.5 80.1 61.0 +23.0 +5.22 GPT-6 Astra 76.2 56.1 +23.8 +5.88 Claude Opus 5 74.5 53.8 +21.3 +5.13 Qwen 3.8 Max 72.5 51.1 +25.2 +6.30 Gemini 3.5 Flash 72.0 52.2 +19.8 +5.37 Kimi K3 68.5 50.2 +17.1 +4.24 DeepSeek V4 Pro 54.2 38.2 +14.7 +3.66 GPT-5 Mini 34.0 22.3 +9.2 +1.83 - 作者称峰值与提升不是同一排序:Max、Mean 领先的模型,与 LG、LS 领先的模型不是同一个。Figure 2(A) 是这些 backbone 的归一化学习曲线。
- 作者对日志的解读:Opus 5 与 Qwen 3.8 Max 会在观察与预期不符时更新对隐藏规则的理解;较弱模型有时重复失效动作,或一次改多个因素。Poisoner 的一次 GPT-5 Mini 运行按菜单位置选菜,Kimi K3 用反馈决定下一步测哪个属性。Appendix B.1.4 称这是个案,不代表全部 trial 的频率。
经验保留方法
下表为 Kimi K3、20 游戏加权结果(Table 1)。作者称 MEMORY 在该骨干上四项都高于另外五种方法:加工可能把不完整理解写成后续仍遵守的规则,而原始历史保留了可修订的证据。
表格较宽,可左右滑动
方法 Max Mean LG LS MEMORY 63.3 48.0 +16.9 +4.69 EvoTest 62.4 48.0 +1.8 +1.01 Reflexion 61.6 40.4 +14.8 +3.35 ReasoningBank 59.9 40.1 +8.3 +2.59 AWM 56.1 37.0 +4.8 +0.62 NAIVE 54.7 31.9 +0.3 +0.42 - 换骨干后排序不同:Claude Opus 5 上,EvoTest 的 Max、Mean 为 66.1、51.3,高于 MEMORY 的 60.9、48.2;ReasoningBank 的 LG 为 +12.3,高于 MEMORY 的 +11.4(Table 1)。三骨干等权平均后,Reflexion 的 Max 为 60.0,MEMORY 的 Mean、LG、LS 为 44.5、+11.4、+3.04(Table 7)。
- OpenCode 不是在每个骨干上都更高:同一 Opus 5 上 OpenCode 的 Max 为 74.5,高于这六种方法。GPT-5 Mini 上 OpenCode 的 Max 为 34.0,低于 Table 7 中该骨干六种方法,其中 Reflexion 为 53.5。作者仍称 OpenCode 允许模型在意外结果后先调查再改计划。
- 作者给出的停滞情形:找到部分有效策略后可能停止探索,或知道规则却不提前规划。例子是 GEMFORGE 中重复已知配方,以及 HAUNTED INN 中说出禁忌仍贪心分房(§4.2.3)。Appendix B.1.3 记录 EvoTest–Opus 5 在 GEMFORGE 的原始分为 46、81、83、83、83,且后来的提示禁止未试过的 tier-2、tier-3 融合。
Harness、成本与实例迁移
- 同骨干换 harness:Claude Code 配 Opus 5 为 81.8、62.3、+27.1、+6.59,OpenCode 为 74.5、53.8、+21.3、+5.13。Codex 配 GPT-5.6-SOL 为 74.3、54.8、+22.2、+5.66,OpenCode 为 57.0、41.1、+14.5、+3.71(Table 2,顺序为 Max、Mean、LG、LS)。作者称原因是模型在其 harness 上训练过,且 harness 也按模型能力做了适配。
- 成本:作者称同一 OpenCode 下,Kimi K3 的 token 单价高于 Claude Sonnet 5,但 Max 更高、估计总成本更低;总 token 为每 episode 0.56M 对 0.73M(Table 12,Max 为 68.5 与 55.9)。作者报告 OpenCode 比 MEMORY 少 56% 输入 token,比 EvoTest、ReasoningBank 少 71% 和 41% 生成 token(Table 11)。Claude Code+Opus 5 为 0.647 美元/episode,OpenCode+Opus 5 为 2.57 美元(Table 12)。Astra 的确认账单为 0.25 美元/episode(150/600),不进入标准价格前沿。
- 重排实例:作者称可见实例每局变化时,Sonnet 5 与两个 Gemini Flash 的学习变慢幅度大于 Opus 5 和 Kimi K3。Table 3 的 LS drop(对照减重排)为:Claude Sonnet 5 为 2.67(4.90 到 2.23),Gemini 3.7 Flash 为 2.15,Gemini 3.5 Flash 为 1.73,GPT-5.6-SOL 为 1.94,Kimi K3 为 0.88,Claude Opus 5 为 0.59;Qwen 3.8 Max 为 -0.41,Codex 为 -0.19。Qwen 行覆盖 9 个游戏,其余行覆盖 10 个。作者称,若只记住什么奏效、不知道为何奏效,过去的成功会误导迁移。
人类玩家对照
- 峰值与平均:Human Top-1 为 84.3、53.5、+21.6、+7.33;Top-3 为 79.1、50.1、+18.9、+5.54;Top-5 为 75.1、47.1、+17.1、+4.62(Table 1,顺序为 Max、Mean、LG、LS)。作者称 Top-1 的峰值高于实验中的模型和 self-evolving 方法;§5 称高于所评每一个智能体配置(Tables 1、2)。其 Mean 53.5 低于 Claude Code 的 62.3(Table 2)。全体合格参与者均值为 Max 43.6、Mean 31.2、LG +10.4、LS +2.72(Appendix B.3.2)。
- 行为:fixed 游戏上,连续动作序列平均相似度为人类 0.5379(150 对)、智能体 0.6575(918 对)。分数下降后下一局创个人新高的比例为人类 13/39(33.3%)、智能体 52/238(21.8%)(Appendix B.3.3)。作者称这是描述性比较,不是因果检验,并认为人类更常改策略,智能体更常重复已经奏效但未必更优的策略。
- 作者对任务差别的说法:Human Top-1 在 GEMFORGE 和 GRAPEVINE 上更高,OpenCode–Opus 5.5 在 REDEYE 和 MODEL AUDITOR 上更高。作者认为,成功依赖寻找新策略时人类更好,依赖长动作序列或精确计算时智能体更好。MODEL AUDITOR 中两份最高 Max 的人类记录,第 1–5 局探测次数为 40、17、17、1、0 与 17、40、0、0、0;作者称这显示测试减少,但不能确定原因(Appendix B.3.4)。
其他消融与分析
- Opus 5 的 NAIVE:Max 53.4,Mean 36.6,LG -5.1,LS -1.08(Table 1)。
- GPT-5 Mini 六方法中 Reflexion 的 Max 为 53.5;AWM 的 LG、LS 为 -2.9、-0.98;EvoTest 的 LG、LS 为 +7.4、+1.61(Table 7)。
- Opus 5 方法的重排 LS drop:MEMORY 0.88,EvoTest 0.85,Reflexion 0.63,ReasoningBank 0.40,NAIVE -0.08,AWM -0.37(Table 9)。
- 加入额外预算对照后,对照 LS 为 Opus 5 的 4.10 对 4.07,Qwen 3.8 Max 的 3.16 对 3.34,Kimi K3 的 4.19 对 4.33(Table 10);作者称这不替代 Table 3。
- Kimi K3 上 Reflexion、AWM 的估计成本为 0.300、0.224 美元/episode,低于 OpenCode 的 0.313,Max 也更低(Table 11)。
- Appendix D 不给 Opus 5.5 和 GPT-6 Astra 规则发现标签,并称仅有分数不能确立规则已被发现。
有什么可以进一步探索的点?
作者在讨论中提出探索与利用、规则存储,以及表面变化下如何识别不变规则。
作者指出的局限与后续方向
论文没有单独的 Limitations 节。§5 把发现写成三个开放问题,并写出后续方向。
- 探索与利用:作者问应如何平衡二者。所依据的是 Human Top-1 的 Max 高于所评全部智能体配置(Tables 1、2),以及人类跨局策略更多样、智能体更常复用已奏效策略(Appendix B.3.3)。作者称后续应让智能体在当前策略已经高分时仍测试新策略(§5)。
- 规则如何存储:作者问应如何存储学到的规则。所依据的是作者称 Kimi K3 上 MEMORY 总体优于其他 self-evolving 方法(Table 1),以及 GEMFORGE 中 EvoTest 把一次失败写成禁止其他未试组合的确定规则(Appendix B.1.3)。作者称后续可把每条规则连回原始交互,以便新反馈到来时修订(§5)。
- 什么在变化中保持不变:作者问智能体如何学会哪些东西不变。所依据的是布局或角色变化会降低学习斜率,即使底层规则相同(Table 3)。作者称后续方法可以帮助比较不同情境、区分共享规则与实例细节,并检查规则何时仍适用(§5)。
实验覆盖范围
- 主评测使用 Learn2Play Bench 的 20 个游戏实例,每模板一个固定 seed;fixed 与 re-shuffled 各 10 个,challenge 5 个,权重分别为 3 和 1(§4.1,Table 6)。
- OpenCode 下比较 11 个 backbone;六种经验保留方法在 Kimi K3、Claude Opus 5、GPT-5 Mini 上比较(Table 1、Table 7)。Harness 对照是 Claude Code 对 OpenCode(Opus 5)和 Codex 对 OpenCode(GPT-5.6-SOL)(Table 2)。
- 迁移实验含 7 个 OpenCode backbone 以及上述两个部署组合;Qwen 3.8 Max 一行覆盖 9 个游戏,其余覆盖 10 个(Table 3)。实验中的学习不更新模型权重(§2、§6)。
- 人类为大学生,每游戏 21–30 人,同一界面,游戏中不用 AI 或代码(§4.4)。协议要求每个配置、每个游戏 3 次独立 trial;Appendix C 报告 620 个配置–游戏格子均有三条完整轨迹。
- 分数由游戏自动计算。论文未报告 LLM 评审,也未报告评审与人工的一致性。规则发现标签按游戏记录,不聚合成总体百分比;Opus 5.5 与 GPT-6 Astra 没有这类标签(Appendix D)。除 Astra 的确认账单外,成本是标准价格估计(Appendix B.5)。论文未说明标出 challenge 游戏的试点用了哪些智能体。
总结一下论文的主要内容
用隐藏规则游戏把新学习与预训练知识分开,并比较模型、记忆方式和人类。
Learn2Play Bench 用新设计的隐藏规则文本游戏,评测 LLM 智能体在不更新权重时从交互中学习的能力。
- 问题:熟悉任务上的分数上升,分不清是新学到的规则,还是预训练里已有的知识。作者要看不熟悉、规则反直觉的环境里,经验能否改进行为,以及规则能否用到新的可见情境。
- 做法:20 个文本游戏,fixed 与 re-shuffled 各 10 个,其中 5 个 challenge 权重更高。智能体经 black-box 接口反复尝试,游戏自动评分。比较 11 个 backbone、六种经验保留方式、OpenCode / Claude Code / Codex,以及大学生玩家。指标是归一化后的峰值、平均、前后段增益和全程斜率。
- 模型排序:OpenCode 下 Claude Opus 5.5 的加权 Max、Mean 为 80.1、61.0;Qwen 3.8 Max 的 LG、LS 为 +25.2、+6.30;GPT-5 Mini 的 Max 为 34.0(Table 1)。
- 经验与 harness:Kimi K3 上 MEMORY 四项都高于另外五种方法,Max 为 63.3。Opus 5 上 EvoTest 的 Max 为 66.1,高于 MEMORY 的 60.9,但仍低于同骨干 OpenCode 的 74.5。GPT-5 Mini 的 OpenCode Max 34.0 低于其 Reflexion 的 53.5(Table 1、Table 7)。Claude Code 配 Opus 5 的 Max 为 81.8,Codex 配 GPT-5.6-SOL 为 74.3,均高于对应的 OpenCode(Table 2)。
- 人类与迁移:Human Top-1 的 Max 为 84.3,Mean 为 53.5(Table 1)。作者称其峰值高于所评智能体配置,并认为人类探索更多样、重复动作更少。可见实例变化后,Sonnet 5 的 LS 从 4.90 到 2.23,Opus 5 从 4.10 到 3.51(Table 3)。
- 作者的结论:更精细的 self-evolving 加工并不总是带来更强学习;保留原始证据、harness 和探索方式都会影响结果。后续方向是平衡探索与利用、让规则能回到原始证据并修订,以及在表面变化中识别不变规则。