跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.27068· Haoyi Niu·· 9 天前

HiRE:用事后奖励编辑为策略微调突破奖励瓶颈

HiRE: Hindsight Reward Editing for Policy Finetuning

AI 导读

HiRE 是一种免训练框架,通过事后对比成功与失败轨迹,识别被基础表征模型误判为高奖励的"陷阱状态"并显式惩罚,从而把基础表征的广泛知识与物理控制感知结合起来。该方法可兼容任意基础表征与 RL 算法,实验显示其持续优于其他奖励方案,能防止价值函数崩溃与奖励作弊,实现更优样本效率与稳定策略更新,性能至少达到基础策略的 3 倍。

阅读原文arxiv.org