Salesforce AI Research 重测自改进 Agent:多次运行方差增大、打乱任务顺序后性能下降 4.5%
On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
作者重新评测了基于记忆的自改进智能体,发现其受任务顺序和多轮运行方差影响大,打乱顺序后性能不升反降。
- 基于文本记忆的自我改进智能体在单次运行评测中表现良好,但在多次运行中的方差、对任务输入顺序的依赖以及规约不完备下的脆弱性此前被忽视,影响真实高风险场景的部署。
- 作者对 AWM 与 ReasoningBank 开展拓展评测,设计了量化跨轮次方差的多次重复运行机制与乱序压力测试;并通过质检智能体记忆,设计了包含细则、反馈与提示词约束的记忆修正方案。
- 测试显示自改进方法在 71% 的案例中放大方差;打乱任务顺序会导致性能下降(WebArena 上 AWM 从 54.8% 降至 49.1%);补充规约信息可弥补 31% 的退化。
- 评测主要集中于单模型和网页浏览任务的特定文本记忆方法;记忆人工检查为定性抽样;规约不完备仅能解释部分性能退化,其余 69% 的差距原因仍未查明。
- 模型
- GPT-5-miniGemini-2.5-ProGPT-OSS-120BGPT-5.4-mini
- 基准
- WebArenaVisualWebArenaSCUBAEnterpriseOps-Gym
- 指标
- pass@1pass@3pass^3milestone scorestandard deviationbest-worst gap
Salesforce AI Research 对两类基于记忆的自改进 Agent(Agent Workflow Memory 与 ReasoningBank)在 WebArena、VisualWebArena、SCUBA 三个网页浏览基准上做了扩展重测,发现其可靠性被此前工作忽视。作者在两条轴上扩大评测范围:多次自改进运行以量化方差,随机打乱任务顺序以考察任务顺序的影响。结果显示,加入自改进循环后,71% 的情况下运行间方差增大,同一实验最好与最差运行的差距可达 10 个百分点;在 WebArena GitLab 子集(180 个任务)上,无记忆基线的运行间差距为 4.4%,应用 ReasoningBank 后扩大到 7.8%。任务顺序方面,默认顺序隐含了由易到难的课程,ReasoningBank 在该顺序下平均提升 1.5%,而在随机打乱顺序下反而下降 4.5%。
推荐理由论文用多次运行与打乱任务顺序重测两类记忆型自改进 Agent,量化了被单次评测掩盖的方差与顺序依赖。
深度解读
这篇论文试图解决什么问题?
论文探究基于记忆的自改进智能体在方差、任务顺序敏感性及环境规约不完备下的可靠性脆弱问题。
这篇论文试图解决基于记忆的自我改进智能体(memory-based self-improving agents)在多轮运行中评估方差大、对任务输入顺序过度敏感以及因规约不完备导致性能退化的可靠性问题。
- 问题场景与重要性:基于文本记忆的自我改进智能体通过从在线任务流中维护经验来持续优化策略,具有自动化日常工作流的潜力;作者认为在企业部署等高风险场景中系统容错空间小,初始错误可能在长期运行中产生级联效应。
- 现有评估实践的不足:作者指出以往智能体评测通常仅汇报单次运行结果(single-run pass rate),且依赖默认的任务排列;这种默认顺序预先施加了由易到难的隐式课程(curriculum),掩盖了多次运行间的随机方差以及真实场景下请求乱序带来的负面影响。
- 核心观察与假设:作者观察到智能体本身在复杂网页环境中存在固有的评估噪声,而自我改进循环会进一步放大方差;同时作者假设任务与环境的规约不完备(underspecification)会导致智能体生成看似合理但无法执行的错误记忆(如推荐调用 API 或等待人工确认),并在后续任务中传播。
- 论文的解决方案:作者拓展了评测维度,通过在多个网页浏览与工具基准上引入 3 轮重复运行以量化方差,并随机打乱任务顺序以压力测试智能体;进而提出在记忆构建阶段引入评估细则、环境执行反馈和提示词规范来缓解规约不完备问题。
有哪些相关研究?
论文梳理了智能体持续学习、记忆机制与可靠性评测相关研究,以 AWM 和 RBank 等为对比基线。
论文梳理了以下三类相关研究,并明确了本文与已有工作的界限:
- 智能体持续学习与自我改进:早期工作探索了监督微调(Zelikman 等人, 2022; Chen 等人, 2024)与强化学习自我博弈(Silver 等人, 2018);近期研究转向推理阶段免微调的自改进,涵盖数学、推理和代码智能体优化(Hu 等人, 2025; Zhou 等人, 2026),以及长期个性化对话(Maharana 等人, 2024; Shaikh 等人, 2026)。
- 智能体技能与记忆机制:相关工作探索非参数化文本记忆(Xu 等人, 2026; Zhong 等人, 2024; Packer 等人, 2023; Chhikara 等人, 2025)与工作流技能沉淀(Zhang 等人, 2025; Li 等人, 2026; Tian 等人, 2026);另有工作探索参数化稀疏记忆微调(Lin 等人, 2025)及模型架构级记忆机制(Behrouz 等人, 2026)。
- 智能体评测与可靠性科学:社区构建了工具使用、网页浏览(Zhou 等人, 2024; Koh 等人, 2024)与企业场景基准(Dai 等人, 2025; Malay 等人, 2026);Rabanser 等人(2026)倡导将可靠性作为与能力并列的核心评测维度。
- 基线方法与使用基准:论文选取的基线方法包括 Agent Workflow Memory(AWM, Wang 等人, 2025)、ReasoningBank(RBank, Ouyang 等人, 2025)、Synapse(Zheng 等人, 2024)及基于 Letta Code(Packer 等人, 2023; Lin 等人, 2025)的文件系统记忆;评测基准为 WebArena、VisualWebArena、SCUBA 及 EnterpriseOps-Gym。
作者指出,以往工作大多在单次运行和固定由易到难的任务序列下评估,本文将可靠性评测从单会话智能体拓展至多会话自我改进智能体,量化了多次运行方差与任务顺序依赖性,并揭示了规约不完备这一瓶颈。
论文如何解决这个问题?
论文建立了包含多轮方差与乱序评测的拓展协议,并提出融合细则、反馈与提示词约束的记忆修正方案。
作者针对自改进智能体的可靠性瓶颈,建立了拓展评测协议并提出了补充规约信息的改进方法。
问题设定与形式化
智能体按顺序处理在线任务流,并在各任务结束时依据轨迹和环境奖励更新文本记忆。
- 任务形式化:智能体以策略 at ← πL(o0:t−1, a0:t−1; M, A) 结合历史观测、历史动作与文本记忆生成当前动作,该式表示语言模型智能体在记忆指导下决策的过程。
- 记忆构建机制:在任务结束时,智能体接收真实奖励 r(其中 1 表示通过任务),由记忆构建模块生成或筛选工作流与推理洞察并存入记忆库,在后续任务中由检索器或上下文拼接调用。
- 基线系统配置:作者升级了基础语言模型与评测脚手架,以 GPT-5-mini 作为默认骨干模型与记忆构建模型,并在记忆生成时使用真实的判定奖励,而非噪声较大的 LLM-Judge 代理奖励。
拓展评测协议设计
为克服以往单次运行与固定顺序评测的局限,作者构建了两维度的测试协议。
- 多轮独立运行量化方差:对每个测试配置开展 3 轮完整的自改进运行(每轮依次执行基准中的所有任务),计算跨运行的 pass@1 平均值、标准差以及最差与最好运行间的差距(best-worst gap)。
- 任务顺序随机打乱:除原基准默认的任务 ID 递增顺序(Default)外,额外构建两种随机打乱的任务顺序(Shuffle-1 与 Shuffle-2),打破原基准隐含的由易到难课程安排。
记忆构建故障机理分析
作者通过人工质检 ReasoningBank 在多轮运行中生成的记忆条目,归纳出导致系统脆弱的三种主要故障模式:
- 环境规约不完备:记忆构建模块未获知环境能力边界(如不支持代码执行或外部 API),导致生成推荐 API 调用的不可行记忆,并在多领域任务中频繁检索和引用;类似地,智能体因无法与真人交互而在记忆中建议等待人工确认,导致多次执行超时。
- 任务规约不完备:任务描述本身存在歧义,导致智能体产生偏差理解并构建无关记忆(例如将牙齿磨损商品搜索误判为医疗咨询,进而沉淀出收集病史的记忆并在后续任务传播);评估器缺陷(如 strict string-match 误判 0.00 与 0)也会诱发智能体反思出错误记忆。
- 非预期策略强化与传播:在地图任务中,网页加载延迟导致智能体偶然使用球面距离(Haversine 公式)估算成功,该偶发策略被写入记忆后被频繁检索,进一步加剧不同运行之间的表现分歧。
缓解规约不完备的附加信息方案
作者在记忆构建模块中补充上下文信息,提出三种针对性的修正策略及组合方案:
- 评分细则与分数(+Rub):在任务完成后向记忆生成模块输入基于规则的判定函数(如 must_include、exact_match),帮助澄清任务真实意图,减少因歧义产生的错误记忆;智能体执行任务过程中不可见该细则。
- 环境执行反馈(+Env):将网页环境的操作报错(如点击后元素不存在导致输入失败)传入记忆构建模块,使智能体能够记录 UI 交互避坑经验。
- 提示词修正(+PMod):在记忆生成提示词中明确环境约束,明确指示禁止生成 API 调用、外部网页访问或等待人工确认的记忆,引导其关注可复用的流程知识与导航结构。
- 组合方案(+All):同时启用上述三项改进,全面提升记忆构建的规约完备度。
论文做了哪些实验?
实验覆盖 4 个模型与 4 个基准,显示自改进方法在多数案例中放大方差且乱序下表现退步。
实验设置
- 被测模型:主实验采用 GPT-5-mini 作为智能体骨干模型与记忆构建模型;附录补充测试了 Gemini-2.5-Pro、GPT-OSS-120B 以及 GPT-5.4-mini。
- 评测基准与规模:WebArena(812 个网页浏览任务,涵盖 Shopping、Admin、GitLab、Map、Reddit、Multisite 六个领域);VisualWebArena(910 个多模态任务,涵盖 Classifieds、Shopping、Reddit 三个领域);SCUBA(企业 CRM 任务,人工剔除失效任务后共 267 个任务);EnterpriseOps-Gym(附录测试企业工具调用任务,共 8 个领域)。
- 对比方法:无记忆基线(Baseline,基于 WALT 和 SCUBA 的 agent harness)、AWM(Agent Workflow Memory)、ReasoningBank(RBank)、Synapse(在 SCUBA 上)以及基于 Letta Code 的文件系统记忆方法(在 EnterpriseOps-Gym 上)。
- 评测指标:3 轮运行的平均 pass@1、标准差(std)、最好与最差运行差距(best-worst gap);SCUBA 上额外报告里程碑得分(milestone score);无记忆基线在单任务上评测 pass@3 与 pass^3。
- 评审与环境:任务完成判定使用各基准自带的真值函数(如 string_match、must_include、exact_match、fuzzy_match 等);向记忆模块提供真值奖励 r(0 或 1),不采用噪声较大的 LLM-Judge;使用 64 核 CPU 服务器执行。
- 样本量与重复次数:每个实验配置均完整执行 3 轮独立自改进运行(每轮历经该基准全部任务);附录中对部分配置扩展至 6 轮运行。
主结果
下表呈现了三种基准在默认任务顺序下 3 轮运行的平均 pass@1 表现:
表格较宽,可左右滑动
方法 WebArena(812 任务) VisualWebArena(910 任务) SCUBA(267 任务) 出处 无记忆基线(Baseline) 54.8% 54.9% 29.7% Table 3 AWM 54.1%(-0.7%) 54.5%(-0.4%) 28.0%(-1.7%) Table 3 ReasoningBank 56.3%(+1.5%) 55.6%(+0.7%) 31.1%(+1.4%) Table 3 - 强基线下的自改进收益微弱:作者指出当使用性能较强的骨干模型(GPT-5-mini 基线达到 54.8%)时,AWM 在三个基准上均较基线出现小幅退步(降幅 0.4%–1.7%),ReasoningBank 虽在 WebArena 上平均提升 1.5%,但双侧 Welch's t-test 的 p 值为 0.23,未达到统计显著性差异。
- 多轮运行方差明显放大:据 Table 1,自改进方法在 24 个细分领域案例中有 17 个(约 71%)增加了 3 轮运行的标准差,11 个案例相对增幅超过 50%;在 WebArena 的 Map 领域,ReasoningBank 的最好与最差运行差扩大至 8.26%,Multisite 领域达到 10.42%。
- 初期随机性在状态化记忆中累积:作者认为记忆构建依赖前期任务结果与模型随机采样,早期偶发成功或失败会导致不同运行构建出明显不同的记忆库,使得单次运行结果无法可靠评估真实能力。
任务顺序扰动实验
- 评测内容:在 WebArena 和 VisualWebArena 上,对比默认顺序(Default)与两种随机打乱顺序(Shuffle-1、Shuffle-2)下的 3 轮平均 pass@1(Figure 3 与 Table 7、8)。
- 实验结果:在 WebArena 上,打乱顺序导致性能下降,AWM 在 Shuffle-1 和 Shuffle-2 下平均 pass@1 分别降至 49.1% 和 49.8%,ReasoningBank 分别降至 49.8% 和 50.7%,均落后于无记忆基线的 54.8%;在 VisualWebArena 上,AWM 在 Shuffle-1 下降至 52.4%,而 ReasoningBank 保持在 56.0%–56.4%(据 Table 8)。
- 作者解读:默认任务顺序客观上存在从高通过率向低通过率过渡的隐式由易到难课程;打乱顺序后智能体不仅未能从历史中学习,表现反而不如无记忆基线,表明自改进收益依赖人为任务编排。
规约不完备缓解消融实验
- 评测内容:在 WebArena 的 Shuffle-1 任务顺序下,针对 ReasoningBank 分别测试引入评分细则(+Rub)、环境反馈(+Env)、提示词规范(+PMod)及其组合(+All)的效果(Figure 5(a) 及 Section 4.2)。
- 实验结果:原始 RBank 的 pass@1 为 49.8%,单独加入 +Rub 提升至 52.3%,单独加入 +Env 为 50.9%,单独加入 +PMod 为 50.9%,三者结合的 +All 达到 52.7%(提升 2.9 个百分点);在 Shuffle-2 下 +All 也从 50.7% 提升至 51.8%(Figure 5(b))。
- 作者解读:补充规约信息弥补了乱序设置下 31% 的性能降幅,且在默认顺序下保持 56.3% 的表现,证明了细化规约的有效性;但 +All 仍未恢复至无记忆基线的 54.8%,表明仍有 69% 的差距来自其他未查明因素。
扩展模型与工具使用基准评测
- 评测内容:在附录中将评测扩展至 Gemini-2.5-Pro 和开源权重模型 GPT-OSS-120B,并在企业工具基准 EnterpriseOps-Gym 上评估 Letta Code 文件系统记忆智能体(Table 12、13)。
- 实验结果:在 WebArena 上,GPT-OSS-120B 的 RBank 乱序后整体成绩从基线的 40.6% 降至 37.0%,并在 Reddit 出现 13.2 个百分点的最好与最差运行差;在 EnterpriseOps-Gym 上,启用文件系统记忆使整体成功率从 24.5% 降至 22.3%(GPT-OSS-120B)和从 30.5% 降至 29.7%(GPT-5.4-mini),并在 16 个领域中 10 个出现方差增加。
- 作者解读:跨运行大方差和乱序性能退步并非局限于单一模型或网页环境,文件系统级自改进机制同样未能带来稳定正向收益。
其他消融与分析
- 扩展运行轮次(n=3 扩至 n=6,GPT-5-mini,WebArena):ReasoningBank 的 6 轮平均 pass@1 为 55.6%(std 2.8%),对比无记忆基线 54.2% 的 Welch's t-test p 值为 0.07(Table 11)。
- 任务级方差分析(无记忆基线单任务重复 3 次):WebArena 的 pass@3 为 65.4%,pass^3 为 43.3%,二者差距达到 22.1 个百分点(Table 5)。
- 检索记忆中不适用关键词频次统计:API 关键词在 3 轮运行中多领域被频繁检索,人工确认(user confirmation)在 WebArena 出现 26 次、VisualWebArena 出现 22 次(Section 4.1)。
- 地图任务中的策略传播:由于网络延迟偶发引入 Haversine 估算公式并获得奖励后,其在后续任务被重复检索并在各轮次呈现不同传播模式(Figure 4(c) 与 Table 16)。
例外与相对稳健表现
作者指出,在 VisualWebArena 的打乱任务顺序测试中,ReasoningBank 的表现相对平稳(Shuffle-1 为 56.0%,Shuffle-2 为 56.4%),未出现大幅退步;此外在方差放大方面,Gemini-2.5-Pro 仅在 12 个领域中的 5 个出现标准差增加,GPT-OSS-120B 仅在 7 个出现增加,作者称系统性放大方差的现象在这两个模型上较弱,但三者各轮次间的绝对差距均处于较高水平。
有什么可以进一步探索的点?
作者指出了核心评测局限于单模型特定记忆方法、记忆检查为人工抽样以及规约仅解释部分退化等局限。
作者指出的局限与后续方向
- 模型与基准覆盖范围:正文核心评测聚焦于单一模型(GPT-5-mini)应用于网页浏览任务的特定文本记忆自改进方法,受限于该领域的快速发展,未能评估最新引入的记忆管理技术(附录 A)。
- 人工质检的抽样性:对智能体生成记忆的人工检查属于定性分析,且仅覆盖了生成记忆的子集;面对实验中产生的大规模记忆条目无法进行穷尽式审查,未来工作需要构建大规模智能体记忆分析流程及人工复审界面(附录 A)。
- 退化原因的归因不完备:规约不完备仅能解释乱序性能退化的一部分,其余 69% 的性能差距成因仍未查明,可能涉及底层任务质量、自改进与记忆机制设计以及基础大语言模型特性等多个因素的交织作用(附录 A)。
- 记忆验证机制的缺失:当前智能体生成的记忆本质上是未经证实的假设而非经验教训,缺乏过滤有缺陷记忆的验证机制,容易随时间产生负面级联影响(第 6 节)。
- 人工干预与迭代规约界面:真实世界部署往往是单次且不可逆的过程,而任务与环境规约难以预先穷尽,因此需要开发支持有效人类监督和适时干预的交互系统(第 6 节)。
实验覆盖范围
- 被测模型:实验测试了 GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 和 GPT-5.4-mini 共 4 个模型。
- 测试基准与任务类型:覆盖了 WebArena(812 任务)、VisualWebArena(910 任务)、SCUBA(267 任务)以及 EnterpriseOps-Gym(8 领域工具使用)。
- 评估方法变体:测试了无记忆基线、AWM、ReasoningBank、Synapse 以及基于 Letta Code 的文件系统记忆方法。
- 任务排序设置:评测了默认任务顺序(ID 递增)和两种随机打乱顺序(Shuffle-1、Shuffle-2)。
- 未报告信息:论文未报告执行步骤的具体时间延迟指标,亦未在真实生产环境中接入人类用户开展长程交互测试。
总结一下论文的主要内容
论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
- 核心问题:现有智能体评测过度依赖单次运行指标,忽视了多次运行的随机方差以及预设理想化任务顺序对性能的潜在影响,作者旨在评估自我改进机制在真实环境中的可靠性。
- 评测设计与方法:建立了两维度的拓展评测框架,通过 3 轮独立运行追踪跨轮次方差(标准差与最好最差差距),并通过任务随机打乱打破默认的隐式课程;针对质检发现的规约不完备问题,提出了融合评分细则(+Rub)、环境报错(+Env)与提示词规范(+PMod)的改进方案。
- 多轮运行方差放大:在 WebArena、VisualWebArena 和 SCUBA 的 24 个细分领域中,自改进方法使 17 个案例(约 71%)的运行方差较基线有所上升,在 WebArena 的 Multisite 领域 ReasoningBank 的最好与最差运行差达到 10.42%(Table 1)。
- 任务乱序引发性能退化:在 WebArena 上随机打乱顺序后,GPT-5-mini 下 AWM 和 ReasoningBank 的 pass@1 分别退步至 49.1% 和 49.8%,均低于无记忆基线的 54.8%(Table 7);而在默认顺序下 ReasoningBank 的 1.5% 增益经双侧 t 检验并不具备统计显著性(p=0.23)。
- 规约增强的缓解效果与瓶颈:在 Shuffle-1 乱序设置下引入全部规约信息(+All)使 ReasoningBank 的 pass@1 从 49.8% 回升至 52.7%(Figure 5),弥补了 31% 的退化幅度,但仍未达到无记忆基线水平。
- 作者结论与建议:作者认为自我改进智能体生成的记忆本质上是未经校验的假设,若缺乏规约约束会引发错误级联;呼吁研究社区弃用单次运行汇报,采用多轮与乱序压力测试,并在系统中构建记忆校验机制与人机交互监督界面。