防御arXiv 2609.12459
EvoRS:面向开放式强化学习的奖励系统在线自演化框架
提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化
- arXiv
- 2609.12459
- 发表
- 场景
- 模型与 API
- 测试
- GLM-5.2、Qwen3-4B、Qwen3-8B 等 7 个
摘要EvoRS 用 on-policy 证据演化完整奖励系统,在写作和角色扮演上同时提高质量并降低黑客与覆盖失败。
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。