跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.31855· Hang Yu·· 6 天前

PHIRL:将学习到的奖励与任务进度对齐的逆强化学习框架

PHIRL: Aligning Learned Rewards with Task Progress for Inverse Reinforcement Learning

AI 导读

PHIRL 是一种数据高效的逆强化学习框架,通过联合利用人类演示与反馈来学习鲁棒奖励函数。它用描述任务累积完成度的"进度"反馈,迭代地从演示中推断奖励函数,并将学习到的奖励在四个维度上与进度标注对齐。在真实与模拟机器人任务上,PHIRL 显著优于基线,仅用 20% 的演示标注即获得更高的环境回报与任务成功率,且学到的奖励函数能抵御奖励作弊。

阅读原文arxiv.org