基于模型预测控制的思路实现安全强化学习
[Daily Paper] Safe Reinforcement Learning using Ideas from Model Predictive Control
AI 导读
Schäfer 等人提出将 MPC 用作离线安全预言机来预先计算可行状态-动作空间的安全强化学习框架,使机器人与赛博物理系统的探索保持在数学验证过的边界内。该方法通过网格搜索加二分搜索映射连续动作空间的凸区间,并用投影过滤器拦截不安全动作。作者在 Quanser Aero 2 单自由度俯仰平台上做了验证。 补充说明: - 该工作针对标准 RL 在高惯性硬件上的无约束探索风险,定义了不可逆的"临界点"——即可行集边界。 - 安全性判定依赖 MPC 优化器在未来预测视野内找到有效动作序列,且视野需超过系统停止距离以保证递归可行性。