Memento 3 提出基于规则手册的递归自我改进方法
Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks
AI 导读
论文提出 Memento 3,让冻结的大语言模型智能体通过外部记忆持续学习显式的世界模型。智能体维护一份自然语言规则手册作为持久语义记忆,记录关于环境动态的可修订假设,并将规则手册编译为可执行代码用于预测和规划。通过观察、反思、规则修订、编译与验证的持续循环,智能体利用预测误差同时改进规则手册和代码;只有当 LLM 判断代码忠实于规则手册,且逐格重放能复现观测到的状态转移时,更新后的代码才会被接受。作者将这一过程视为通向递归自我改进的基于模型的路径,底层 LLM 保持固定。群体扩展版本并行维护多个世界模型,共享交互证据并用其预测引导探索。