AgentRewind:面向长周期 LLM Agent 的可恢复执行框架
AgentRewind: Recoverable Execution for Long-Horizon LLM Agents
AI 导读
研究者提出 AgentRewind,一个运行时恢复框架,通过记录 Agent 上下文与受控环境对齐的检查点,让 Agent 能回到较早状态并利用此前尝试的信息继续执行,以应对长周期任务中早期错误在上下文和环境状态中传播、后续动作难以逆转的问题。作者同时构建 MettleBench,用于评估包含一系列相关需求的长周期工程任务上的任务完成度与部分进展。在多种任务、多个模型、执行策略和 Agent harness 上的实验显示,AgentRewind 相比对比基线提升了任务成功率和平均清单进度。论文共 19 页、5 张图,发布于 arXiv(2608.14380)。