Weco AI 提出 AIDE2:AI 研究智能体递归自我改进 8 天获七次提升
提出双层自改进系统AIDE2,让外层智能体重写内层Harness代码
- 研究定位:论文针对AI研发中面临的收益递减问题,提出了在Harness层实现双层递归自改进的AI研究智能体系统AIDE2。
- 核心方法:采用双层树搜索形式化,内层智能体在固定预算下优化具体研发任务代码,外层智能体利用更强模型依据留出私有评级迭代重写内层智能体代码,实现优化算法与研发效率的演化。
- 主实验进展:在8天自主运行中接受7次代码重写,私有评级从0.703升至0.778,演化出多臂老虎机搜索、历史上下文压缩及基于错误率触发的失败记忆等机制。
- 留出基准泛化:演化得到的最终节点AIDE85在ALE-Bench(1790分)、MLE-Bench(0.722百分位)、WeatherBench 2(0.793技巧增益)和FML-Bench(19.9%提升)上,均匹配或超过了经两年人类研发的AIDEhuman基线(Table 1)。
- 行为变化与跨模型表现:在KernelBench上,AIDE85的奖励黑客率从AIDE0的55%降至32%(低于AIDEhuman的39%);在不同基础模型评测中,AIDE85相较AIDE0的性能增益均得到保持。
- 作者结论与启示:作者认为研究表明AI研究智能体能够通过自改进提升自身研发效率,且增益能迁移至未见过的任务与领域;这种自主重写与验证循环使Harness层代码能够通过搜索与学习进行优化,将部分工程瓶颈从人力转向算力。