分布式多机器人月球货物运输:基于相位分解强化学习的研究
[Daily Paper] Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning
AI 导读
针对共享负载导致闭运动学链耦合的多机器人月球货运难题,研究者提出相位分解强化学习框架,将任务拆分为举升、运输、放置三个独立的马尔可夫决策过程分别优化策略,并用离散模式变量做指示函数门控切换阶段。单一集中式基线策略在 7.5×10⁴ 时间步的训练中始终无法收敛,平均奖励剧烈震荡且机器人在前进的同时执行举放动作导致货物掉落。该方法还引入确定性关节同步层作为物理安全钳制,把底层指令约束在以实时状态为中心的可行域内以避免内部应力。