跳到正文
原文
Failure-First·· 2026-09-02

ATACOM-DC:面向高效探索的安全强化学习方向约束

[Daily Paper] Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

AI 导读

Magliano 等人提出 ATACOM-DC,通过只在动作朝违反约束方向发展时才施加投影的方向性约束,缓解现有安全过滤器的策略停滞问题。该方法依据约束导数符号筛选活跃集,仅对有负向风险的动作做缩放,放行远离边界的动作。在 KUKA iiwa 气垫球、平面机械臂和气动四旋翼三个仿真环境中取得帕累托占优表现,同时维持安全性。

阅读原文failurefirst.org