跳到正文
原文
DeepMind Safety Research· DeepMind Safety Research·原文 · 入选 精选关注度76

DeepMind 提出 MONA:缓解多步奖励作弊的 RL 训练方法

MONA: A method for addressing multi-step reward hacking

AI 导读

Google DeepMind 提出 MONA(Myopic Optimization with Non-myopic Approval),一种用于训练 LLM 智能体的强化学习替代方法,通过短视优化避免多步奖励作弊。MONA 对训练循环做两处改动:不再把后续奖励回传到先前动作,并引入前瞻审批奖励项,反映操作者对系统长期任务成功的预期,实验中该奖励项由人工定义或 LLM 评分器给出。

推荐理由

DeepMind 提出用短视优化加前瞻审批约束多步奖励作弊,并给出三个可复现实验环境与性能对比。

阅读原文deepmindsafetyresearch.medium.com