ATACOM-DC:面向高效探索的安全强化学习方向约束
[Daily Paper] Directional Constraints for Efficient Exploration in Safe Reinforcement Learning
AI 导读
Magliano 等人提出 ATACOM-DC,通过只在动作朝违反约束方向发展时才施加投影的方向性约束,缓解现有安全过滤器的策略停滞问题。该方法依据约束导数符号筛选活跃集,仅对有负向风险的动作做缩放,放行远离边界的动作。在 KUKA iiwa 气垫球、平面机械臂和气动四旋翼三个仿真环境中取得帕累托占优表现,同时维持安全性。