跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.08902·本站收录 · 原文发表

论文提出 agent plasticity 指标衡量智能体通过经验自我改进的效率

Agent Plasticity: Measuring Self-Improvement Through Experience

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者用冻结权重测可塑性:三棋曲线上 GPT-5.6 Sol 的 Psat 为 298,Claude Fable 5 为 57。

问题
固定时点的能力评测分不清起点强和后来学会。作者要同时回答:留出性能是否提升并迁出学习交互、新能力习得有多省、改进回路在何处断开。
方法
权重冻结。行动使用新上下文,只把通过结构与可执行校验的工具、技能、策略和文本记忆留给后续实例。可塑性是估计饱和前的留出 ID 增益除以学习成本。
实验与结果
在 Chess、Go、Hex 与 NetHack 上,改进轨迹随模型和任务分化。三棋等权曲线里 GPT-5.6 Sol 的 Psat 为 298,Claude Fable 5 为 57,但作者称后者拟合终点最高。留出 ID 的增益常常只部分转到更强对手。
局限与可以继续做的
作者称可塑性依赖于学习协议、分数余量、学习时域、饱和拟合和供应商定价,且未分离环境反馈与修订制品的计算。失败诊断是观察性的。论文未报告棋类重复次数。
实验设置Claude Fable 5、Claude Opus 5 等 · Chess (Hard)、Chess (Easy) 等 · Psat、held-out ID score 等
被测模型
Claude Fable 5Claude Opus 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GPT-5.6 LunaClaude Opus 4.6Gemini 3.1 ProClaude Opus 5.5Claude Sonnet 5
基准
Chess (Hard)Chess (Easy)5×5 Go6×6 HexNetHack Challenge v0
指标
Psatheld-out ID scoreheld-out OOD score100(W+0.5D)/N
AI 导读论文提出 agent plasticity 概念,即智能体将经验转化为未来留存性能提升的效率,用于衡量自改进能力而非固定时点的能力。研究在受控环境中让智能体把过往经验固化为可复用产物并由后续实例继承,在每个检查点同时测量训练与留存环境交互上的表现并计入学习成本。结果显示,多个前沿模型在同等学习机会下改进轨迹差异明显,部分模型获得持续提升,另一些则接近或低于初始水平,训练环境内的收益向分布外条件迁移时往往只部分保留。最终表现最好的智能体未必是改进效率最高的,失败追踪还显示低可塑性智能体常无法复用相关产物,而高可塑性智能体即使复用了产物仍可能因产物质量、泛化或应用环节受限而失败。

论文提出 agent plasticity 概念,即智能体将经验转化为未来留存性能提升的效率,用于衡量自改进能力而非固定时点的能力。研究在受控环境中让智能体把过往经验固化为可复用产物并由后续实例继承,在每个检查点同时测量训练与留存环境交互上的表现并计入学习成本。结果显示,多个前沿模型在同等学习机会下改进轨迹差异明显,部分模型获得持续提升,另一些则接近或低于初始水平,训练环境内的收益向分布外条件迁移时往往只部分保留。最终表现最好的智能体未必是改进效率最高的,失败追踪还显示低可塑性智能体常无法复用相关产物,而高可塑性智能体即使复用了产物仍可能因产物质量、泛化或应用环节受限而失败。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    固定时点评测不够,作者用可塑性衡量经验转成留出增益的效率。

    现有评测主要看固定时点能做什么,而不是经验如何变成可泛化、可计成本的后续能力。

    • 场景:作者称智能体可以诊断失败、构造工具、积累记忆、形成可复用技能并改策略。今天能力相近的两个智能体,在相似学习机会之后的轨迹可能很不同。
    • 终点不够:作者认为高分可能来自起点而非提升;相近增益对应的经验或计算可以差很多;提升也可能出不了产生它的那些交互。
    • 三个问题:未来性能是否提升,并超出供学习使用的交互;新能力习得有多省;自我改进在何处断开。
    • 观察:作者称前沿模型在相近机会下轨迹分化,有的留出增益持续,有的接近或低于起点;训练难度内的增益往往只部分转到更强对手。终点能力与习得效率也不重合。
    • 本文提出什么:在权重冻结、未来实例继承自建制品的协议下,定义 agent plasticity(智能体可塑性),即经验转化为留出性能增益的效率,并沿改进回路追踪失败。作者称可塑性不是自我改进本身,而是改进过程的一个性质。
  2. 有哪些相关研究?

    作者把本文放在测量一侧,对照的是改进机制、长上下文和序列学习评测。

    附录 A 按方向分组。作者多写成互补,而不是逐篇否定。

    可塑性与持续学习

    • 神经网络训练:Nikishin 等(2022)、Lyle 等(2023)、Dohare 等(2024)研究 primacy bias 与训练过程中的 loss of plasticity。
    • 持续学习效率:Lopez-Paz 与 Ranzato(2017)把习得和新任务上的稳定性、迁移放在一起;A-GEM(Chaudhry 等,2019)同时看样本、计算和记忆效率,以及新技能习得有多快。
    • 语言智能体基准:CL-Bench(Asawa 等,2026)区分变体内适应与跨变体保留;AgentCL(Shu 等,2026)在受控任务流上评可塑性、经验复用的稳定性和泛化。Harrington 等(2026)比较提示、参数更新、强化学习和基于上下文的适应。

    持久制品与自进化

    • 经验外化:Reflexion(Shinn 等,2023)、ExpeL(Zhao 等,2024)、Agent Workflow Memory(Wang 等,2025)、Contextual Experience Replay(Liu 等,2025),以及 Dynamic Cheatsheet、ReasoningBank,把反馈或轨迹收成反思、知识、工作流或策略。
    • 可执行制品:LATM(Cai 等,2024)、CREATOR(Qian 等,2023)、Voyager(Wang 等,2024)、SkillWeaver(Zheng 等,2025a)生成可复用工具或技能库。
    • 改智能体本身:STOP(Zelikman 等,2024)、ADAS(Hu 等,2025)、Gödel Agent(Yin 等,2025)、Darwin Gödel Machine(Zhang 等,2026b)修改或搜索智能体实现。DSPy、GEPA、ACE、Meta-Harness 用反馈优化提示词、上下文或外围实现。

    长上下文与经验学习评测

    • 长上下文:RULER(Hsieh 等,2024)、HELMET(Yen 等,2025)等测长输入中的检索、推理和指令遵循。作者称上下文管理看的是信息是否被保留或用上,可塑性看的是经验是否变成相对学习成本的持久能力增益。
    • 序列学习基准:StreamBench(Wu 等,2024)、EvaLearn(Dou 等,2025)、LifelongAgentBench(Zheng 等,2025b)、EvoTest(He 等,2026)把评测扩到反馈下的持续改进或测试时学习。NetHack Learning Environment 与 BALROG 提供长时程环境。
    • 单次精炼与参数更新:Self-Refine(Madaan 等,2023)改进单次输出,不必跨新交互保留。SEAL(Zweiger 等,2025)等通过参数更新获得持久能力。作者把本文放在中间:改进必须跨交互保留,但权重冻结。

    比较对象

    • 基线与环境:论文没有把 Reflexion 等既有方法当作基线。同一固定接口下的前沿模型互为对照。环境是 Chess(Hard/Easy)、5×5 Go、6×6 Hex 和 NetHack。

    作者称相关工作主要发展改进机制,本文测改进是否持续并泛化、习得有多省、过程在何处失败。作者把 agent plasticity 定义为相对某一学习协议的系统性质,并称这不同于神经网络持续训练里的 loss of plasticity。

  3. 论文如何解决这个问题?

    权重冻结,后续实例只继承过检制品;可塑性是饱和前留出增益除以学习成本。

    协议把 固定权重谱系 和可继承制品分开:模型 M 不变,自我改进只写进清单;每个检查点同时记录训练分、留出分和学习成本(Figure 2)。

    谱系与三种划分

    • 状态:检查点 t 的智能体是固定语言模型 M 加清单 I_t,含可执行 Python 工具、自然语言策略或技能、文本记忆。每局从新上下文开始,对话历史和临时文件不保留。
    • 更新:训练回合产生轨迹、结果、执行痕迹、错误和着法质量反馈。反思提议下一份清单。更新须通过结构与可执行检查才持久;被拒的尝试不改变已提交清单,但可影响以后的尝试,并计入成本。拒绝次数用尽则保留原清单。连续清单可以相同;接受的修订可以提升、保持或降低性能。
    • 划分:训练交互的轨迹和反馈可供反思。留出 ID 处于预定训练难度。留出 OOD 使用更强对手。留出轨迹和分数都不进入反思。作者称 OOD 测的是对手难度上的迁移,不是任意新任务。
    • 分数:棋类为 100(W+0.5D)/N,范围 0 到 100。行动者未下完(模型调用或输出预算耗尽、工具超时、无动作),以及达到着法上限的棋局,计为负;Go 和 Hex 的未完成同样计为负。

    学习成本

    • 计入什么:获得训练经验的环境交互调用,以及修订制品的调用,包括因畸形输出或非法 Python import 等被拒绝的反思。
    • 怎么汇总:到检查点 t 的累计成本是此前各轮训练阶段成本与反思阶段成本之和,起点为 0。作者用 token 用量换成美元,作为计算成本的代理,并称这量的是学习成本,不是物理计算量。附录 F 的学习 token 不计留出对局。

    可塑性

    • 到某一检查点的平均可塑性:Pscorem,e,s,T=(Sm,e,s,T−Sm,e,s,0)/Cm,e,T。实验报告为每 1000 美元学习成本的分数点。可以为负;性能进入平台后继续累计成本,该量会下降。
    • 到估计饱和:对每条模型–环境的留出 ID 曲线,用四参数单调饱和形式联合做二项最大似然拟合,刻画总体上升,而不是单点波动或回落。C* 是拟合首次达到升幅 90% 的已观测检查点的成本。Psatm,e=(Ŝ(C∗)−S0)/C∗。若该 90% 升幅低于 10 个百分点,Psat 记为 0。若没有检查点达到阈值,最多外推到最终观测成本的三倍;再超出则饱和不能确立,改报截至目前的可塑性,即最终成本处的拟合升幅除以该成本。区间用参数自助法。

    改进回路诊断

    • 三类失败:对每个已识别的决策失败,看有没有覆盖它的制品,以及执行证据是否显示被实质使用。Fabsent 是没有覆盖制品;Fmissed 是有但未用;Fused 是用了仍失败。这三类以失败为条件,不表示总体失败频率。
    • 决策级复用:相关决策指至少有一个已保存制品与选择或执行该着相关,不论用没用。西洋棋在检查点 0 之后约 98% 的着法属于此类。每个决策只计一次;已经用了另一个相关制品时,未用的备选不算错过复用。另报每个相关决策的已识别失败数,这是归一化计数,不是概率。
    • 谁来判:制品可以宽泛相关,却不针对某次具体失误。语义判断由 Gemini 3.1 Pro 做,并与文件读取、持久 Python 调用等执行证据结合(附录 G)。作者称诊断是观察性的:使用不确立因果有效性,用了仍失败也不能区分制品不足和应用不当。

    运行约束

    • 隔离:棋类、Go、Hex 的行动者在隔离 Python 容器里,经受限棋盘 API 与受信任的对局进程交互,不能访问对手进程、模型凭证、留出评测、网络或其他运行。
    • 回合:Chess 主实验从裸 harness 的检查点 0 起,更新 20 轮。Hard 每检查点 16 局训练、12 局留出 ID、12 局留出 OOD,均从标准开局开始;Stockfish 每步搜索节点上限 20,000。Hard 训练对手 skill 1–8,留出 ID 为 3–8,留出 OOD 为 12。Easy 的训练与留出 ID 为 skill 2–5,留出 OOD 为 8–10,局数为 16/16/12。
    • 另外两款棋:5×5 Go 的训练与 ID 用 GNU Go 5–9 级,OOD 为 10 级,每检查点 20/20/12 局,75 步上限。6×6 Hex 的训练与 ID 为每步 10k–1M 节点的 alpha–beta,OOD 为 10M,每检查点 40/40/32 局。
    • NetHack 与调用:NetHack 从 Claude Code 或 Codex 的原生 harness 起步,检查点 0–40,每点 10 局新的确定性种子对局;局间可改 CLAUDE.md 或 AGENTS.md、SKILL.md、Python 工具、策略和记忆。行动与反思用同一模型。附录 I 写明 Chess 反思被拒后最多 6 次尝试,Go 与 Hex 最多 3 次;Chess 每局最多 64 次模型调用,Go 与 Hex 为 32 次,反思最多 50 次。
  4. 论文做了哪些实验?

    四类环境里轨迹分化:拟合终点最高与 Psat 最高不是同一模型。

    实验设置

    • 被测模型:Chess 为 Claude Fable 5、Claude Opus 5、Claude Opus 4.8、Claude Opus 4.6、GPT-5.5、Gemini 3.1 Pro、GPT-5.6 Sol、GPT-5.6 Luna。Go 与 Hex 用其中 6 个:去掉 Claude Opus 4.6 与 Gemini 3.1 Pro。NetHack 为 Claude Opus 5.5、Claude Opus 5、GPT-5.6 Sol、Claude Opus 4.8、Claude Sonnet 5、GPT-5.6 Luna,各一条谱系。
    • 规模:Hard chess 每检查点 16/12/12 局;Easy 为 16/16/12;Go 为 20/20/12;Hex 为 40/40/32。NetHack 每检查点 10 局,检查点 0–40;附录 C 称六条谱系共 2,460 局。棋类、Go、Hex 的性能与成本比较覆盖检查点 0–20;失败分析汇总检查点 1–20。
    • 对照:没有既有自我改进方法作基线。检查点 0 在棋类是裸 harness;NetHack 从各原生 harness 开始。作者称因此测的是所得 Claude Code 与 Codex 智能体的可塑性。
    • 指标与反馈:棋类分数为 100(W+0.5D)/N。留出 ID 看超出训练交互的泛化,留出 OOD 看更强对手。Psat 的单位是每 1000 美元的分数点。西洋棋学习环内有独立引擎的着法价值损失;Go 与 Hex 的反思只收到较轻的确定性诊断,更强的 KataGo 与更深 alpha–beta 只用于离线失败分析,不能改进被评智能体。NetHack 无最优动作预言机。
    • 评审:胜负由规则和对局引擎判定,不用 LLM 给胜负打分。失败与复用标签由 Gemini 3.1 Pro 离线生成;声称使用须有运行或读取日志(附录 G)。论文未报告该标注与人工的一致性。
    • 重复:NetHack 写明每个模型一条谱系。论文未报告 Chess、Go、Hex 的独立重复次数。

    主结果

    三棋等权曲线把 Hard 与 Easy chess、Go、Hex 等权平均,只含三款游戏都评过的模型(Section 3.4、Figure 1)。

    模型Psat(百分点/每1000美元)出处
    GPT-5.6 Sol298Section 3.4、Figure 1
    Claude Opus 5233同上
    Claude Fable 557同上
    Claude Opus 4.814同上
    GPT-5.6 Luna0同上,准则下记 0
    GPT-5.5未报告Section 3.4:饱和无法确立
    • 作者解读:终点与效率分开。Claude Fable 5 的拟合性能水平最高,GPT-5.6 Sol 的估计可塑性最大。作者称 Sol 起点低于 Claude Opus 4.8,最终在留出性能和估计可塑性上都超过它。GPT-5.5 在运行结束时仍在缓慢上升,饱和因而 Psat 不能由这些运行确立。表未列入 Claude Opus 4.6 与 Gemini 3.1 Pro,因为它们没有进入三款游戏的等权曲线;也未列入只出现在 NetHack 的模型。
    • Hard chess 留出 ID:Claude Fable 5 从检查点 0 的 37.5% 到检查点 16–20 均值 73.3%;Claude Opus 5 从 25.0% 到 66.4%;GPT-5.6 Sol 从接近 0% 到 36.9%。Easy 条件下 Claude Opus 4.8 从 0% 到 19.0%。作者称 Sol 落后的是绝对分而不是提升幅度,并称若干其他模型接近起点,少数下降。
    • 迁移:作者称较强改进谱系的留出 ID 增益大体伴随训练增益;因留出轨迹和分数不进入反思,作者把这当作制品超出反思所见交互仍有用的证据。对更强 OOD 对手的增益通常更小或更不一致。这些比较不把环境经验从制品开发所用计算中分离出来。

    跨游戏与 NetHack

    • Go 与 Hex:Claude Fable 5 的 Go 留出 ID 从检查点 0 的 20% 到检查点 20 的 80%,留出 OOD 从 0% 到 50%。GPT-5.6 Sol 的 Hex 留出 ID 从 40% 到 77.5%,留出 OOD 从 28.1% 到 78.1%。作者称 Claude Opus 4.8 在 Go 退步、在 Hex 提升;Claude Opus 5 在 Go 大幅提升后,末检查点的工具制作错误使性能下降。
    • NetHack:Claude Opus 5.5 的均值从检查点 0–2 的 2,019 到 36–40 的 5,831;正文写约 2k 到约 6k。对检查点 0–40 的拟合在检查点 11 达到升幅的 90%,Psat 为 61.75 归一化分数点/每 1000 美元。拟合总升幅 68.95(p = 8.23×10−7),此前学习成本 1,072.73 美元,拟合增益 66.25。归一化锚点是 213.6 对应 0、6,526.98 对应 100,作者称锚点定义单位而不是上下界。
    • 作者解读:作者称其余五个 NetHack 模型没有可记入的上升。同窗口下 Claude Opus 5 约 1.5k 到 1.9k,Claude Sonnet 5 约 680 到 800,Claude Opus 4.8 约 700 到 730,GPT-5.6 Luna 约 210 到 120,GPT-5.6 Sol 约 570 到 420。三棋曲线上 Psat 最高的 Sol 在 NetHack 上下降。作者称这不能给出与任务无关的模型排序。

    制品复用与失败构成

    • 低复用:Hard 与 Easy chess 合并后,不用制品的相关决策份额约为:GPT-5.6 Luna 98%,Gemini 3.1 Pro 87%,Claude Opus 4.6 51%,GPT-5.5 28%;Claude Fable 5、Claude Opus 5、Claude Opus 4.8、GPT-5.6 Sol 为 2–6%,即复用率 94–98%。Go 中 GPT-5.6 Luna 的复用率约 1%。作者称在 Chess(Hard)、Go、Hex 的 19 个模型–游戏格子里,留出 ID 复用与检查点 0 到 16–20 的留出 ID 增益相关,因此把复用视为候选瓶颈。论文未给出相关系数。
    • 高复用仍有缺口:上述四个高复用模型的棋类分数仍差很多。作者称复用率,以及“用了相关制品且无已识别失败”的条件成功率,都不能解释这一缺口。用制品几乎覆盖每个相关决策的模型整体失败更少,约 0.16 对其他模型约 0.38 次已识别失败/相关决策,但剩余失败的 83–99% 发生在相关制品使用期间。
    • 时间:Hard chess 中,GPT-5.6 Sol 与 Claude Opus 4.8 的复用率从检查点 1 的低于 20% 到检查点 3 的 93–99%,留出 ID 分数分别到检查点 12 和 5 才到峰。两条棋条件下合并后,Claude Opus 4.6 的留出 ID 失败中“用了仍失败”的份额从检查点 1–5 的 6.5% 到 16–20 的 52%,每相关决策失败数从 0.42 到 0.41。作者称失败类型的变化本身不是进展的标志。

    其他消融与分析

    • Hard chess,GPT-5.5:检查点 2–8 在 96–100% 的相关决策上使用制品,检查点 9 起为 32–50%,制品未改。
    • Go,Claude Opus 4.8:成功复用份额从 59–65% 升到 93%,留出 ID 从检查点 0 的 40% 降到检查点 15–20 的 10–25%。
    • Go 与 Hex:失败仍分布在三类;27 条谱系中 25 条至少 99% 的决策有相关制品,但其中 67–100% 的“无覆盖制品”失败发生在已有宽泛相关制品的决策上。
    • NetHack 检查点 10、同一批十局的均值:Claude Opus 5.5 为 9,015,Claude Opus 5 为 1,919,Claude Opus 4.8 为 933,GPT-5.6 Sol 为 417,Claude Sonnet 5 为 402,GPT-5.6 Luna 为 239(Table 3)。附录称代码量或工具调用解释不了 Opus 5.5 的领先,且它在检查点 0 已是其他模型的 2.6–25 倍。
    • 定性例(Section 3.5、Figure 8):一条 Claude Fable 5 谱系自写引擎,并在具体失误后改搜索与和棋估值;一条 Claude Opus 5.5 谱系把祈祷限制到自建控制器。一条 GPT-5.5 运行里,反思要求立即加载已存着法程序,行动仍先列出并阅读文件。
    • 作者称效率估计依赖供应商定价和饱和拟合,外推饱和增加不确定性,因此把可塑性解释为依赖协议的度量,不是普遍模型排序。
  5. 有什么可以进一步探索的点?

    作者称测量依赖协议与定价,且未把环境反馈和额外计算分开。

    作者指出的局限与后续方向

    • 不是模型内禀标量(Section 4):可塑性是某一学习协议下的智能体性质,不是底层模型的内禀标量。实验没有分离长上下文指令遵循对制品构造或应用的贡献。
    • 诊断不是因果(Section 4;Section 3.5):失败分析是观察性的。作者提出可以用制品移除、替换或强制调用来区分机制,并把“制品不泛化”与“应用不当”的分离留给后续工作。作者还称,持久制品的校验应评估行为效果,而不只看结构合法或可执行。
    • 经验贡献未分开(Section 4):新上下文和冻结权重把持久适应限制在自建制品上,但没有把环境反馈的价值与分析经验、修订制品所用的额外计算分开。作者提出无反馈的预算匹配反思,以及受控的行动者–制品比较。
    • 泛化与标量(Section 4):分任务训练的谱系不能确立制品或改进策略的跨任务迁移。作者称评测集必然有限,因而有检查点级噪声;可塑性估计依赖分数余量、学习时域、饱和拟合假设和供应商定价。作者因此主张同时报告完整学习曲线,而不把可塑性的小差异解释成普遍排序。
    • 后训练(Section 4、Section 5):实验测量可塑性,而不是优化它。作者提出后续可以问后训练能否提高从后续经验中学习的能力,并研究哪些训练目标、反馈信号和课程会提高这种可塑性。

    实验覆盖范围

    • Chess 评测 8 个模型、检查点 0–20;Go 与 Hex 为其中 6 个,不含 Claude Opus 4.6 与 Gemini 3.1 Pro;NetHack 为另外 6 个模型、检查点 0–40,各一条谱系,共 2,460 局。
    • 环境为 Hard/Easy chess、5×5 Go、6×6 Hex 与 NetHack Challenge v0。OOD 按论文写法是更强对手,不是任意新任务。
    • 失败与复用分析覆盖 Chess、Go、Hex 的训练与留出 ID,检查点 1–20,标注模型为 Gemini 3.1 Pro。论文未报告该标注与人工的一致性。
    • 论文未报告 Chess、Go、Hex 每个模型的独立重复谱系数。学习成本含被拒绝的反思;附录 I 写 Chess 最多 6 次尝试,Go 与 Hex 最多 3 次。正文未给出各模型的查询次数,附录 F 用学习 token 和美元成本画曲线。
    • 西洋棋学习环内有逐着价值损失;Go 与 Hex 的更强引擎裁决只在离线分析中使用;NetHack 没有最优动作预言机。
  6. 总结一下论文的主要内容

    作者用固定权重协议比较前沿模型把经验写成制品后的留出增益与习得效率。

    作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。

    • 要分开的是某一时刻的能力和习得过程。只看终点分不清起点强和后来学会,也分不清增益是否超出学习所用的交互,以及花费了多少学习成本。
    • 每个行动回合使用新上下文。跨检查点保留的是通过结构与可执行校验的工具、技能、策略和文本记忆。留出轨迹和分数不进入反思。Psat 取估计饱和前的留出 ID 增益除以美元成本;拟合升幅不足 10 个百分点则记 0。
    • 在 Hard/Easy chess、Go、Hex 等权平均的曲线上,GPT-5.6 Sol 的 Psat 为 298,Claude Opus 5 为 233,Claude Fable 5 为 57,Claude Opus 4.8 为 14,GPT-5.6 Luna 为 0。作者称 Fable 5 的拟合终点最高,所以终点与效率不是同一个问题。
    • Hard chess 留出 ID 上,检查点 16–20 的均值是:Fable 5 为 73.3%(起点 37.5%),Opus 5 为 66.4%(起点 25.0%),GPT-5.6 Sol 为 36.9%(起点接近 0%)。Go 上 Fable 5 的留出 ID 从 20% 到 80%。NetHack 上 Claude Opus 5.5 的 Psat 为 61.75,同窗口均值从 2,019 到 5,831;三棋上 Psat 最高的 Sol 在这里下降。
    • 作者称训练难度内的增益往往只部分转到更强对手。低可塑性模型常不复用相关制品;高复用仍可能失败,候选瓶颈包括检索、制品质量与应用。作者的结论是:评长寿命智能体不能只看某一时刻能做什么,还要看能力如何随经验变化,以及这种变化有多省。
阅读原文huggingface.co