FAR.AI 复现 Sokoban 中 RNN 的规划行为并开源智能体
Pacing Outside the Box: RNNs Learn to Plan in Sokoban | FAR.AI
AI 导读
FAR.AI 复现并扩展了 Guez 等人 2019 年的工作,训练一个 128 万参数的 Deep Repeating ConvLSTM(DRC)智能体玩 Sokoban,发现推理阶段给予额外思考步数能提升规划能力与解题效率。研究显示,思考步数增加到 6 步时成功率上升,之后趋于平台或略降;DRC 的表现明显优于参数量超过其两倍的非循环 ResNet 基线,且额外思考步数解决的多为最优解更长的较难关卡。行为分析发现,智能体在解决 6 步而非 0 步的关卡中,放置前三个箱子的时间变长、放置第四个箱子的时间变短,说明它采取了长期更优而非即时最优的动作;当让网络在开始 N 长度循环前先思考 N 步时,82.39% 的循环或踱步行为消失,表明这些循环用于制定计划。