跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.12459· Weiyuan Li·· 21 天前

EvoRS:面向开放式强化学习的奖励系统在线自演化框架

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

AI 导读

EvoRS 是一个让奖励系统随策略在线自演化的强化学习框架,用于开放式任务中基于评分标准的奖励。作者指出策略与奖励系统构成动态反馈回路,策略优化当前奖励后,原本有效的奖励系统可能因奖励作弊或响应区分度下降而变得不可靠,因此奖励系统应在训练中持续演化而非固定不变。EvoRS 将奖励系统表示为可执行的 Reward-DAG,由智能体式设计器根据在线 rollout 和奖励轨迹更新该系统,以维持训练期的可靠性。在写作和角色扮演任务上,EvoRS 在三种评判模型下均取得最佳质量,分别比策略高出 2.107 分和 4.767 分,同时减少了奖励作弊和覆盖失败,并保持奖励信息量。

阅读原文arxiv.org