PHIRL:将学习到的奖励与任务进度对齐的逆强化学习框架
PHIRL: Aligning Learned Rewards with Task Progress for Inverse Reinforcement Learning
AI 导读
PHIRL 是一种数据高效的逆强化学习框架,通过联合利用人类演示与反馈来学习鲁棒奖励函数。它用描述任务累积完成度的"进度"反馈,迭代地从演示中推断奖励函数,并将学习到的奖励在四个维度上与进度标注对齐。在真实与模拟机器人任务上,PHIRL 显著优于基线,仅用 20% 的演示标注即获得更高的环境回报与任务成功率,且学到的奖励函数能抵御奖励作弊。