跳到正文
原文
论文追踪· arXiv:2609.37968·本站收录 · 原文发表

SelfSearch:无需奖励信号的自改进 Agent 搜索方法

SelfSearch: Reward-Free Search for Self-Improving Agents

AI 导读

研究者提出 SelfSearch,一种无奖励信号的搜索流程,让 LLM Agent 利用此前自改进过程的记录来修改自身的指令、工具和执行流程,这些记录包含推理、工具动作和结果。在六个模型与基准组合上,SelfSearch 都提升了群体平均成功率,单个 Agent 在 Terminal-Bench 2.1 上最高提升 11.2 个百分点;在 SWE-bench Multilingual 上,一个 Agent 成功率提升 5.0 个百分点,同时在初始与进化后 Agent 都能解决的任务上把执行成本降低 38.5%。

阅读原文arxiv.org