防御arXiv 2608.25460
用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
- arXiv
- 2608.25460
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek v3.1、Claude Haiku 4.5、Claude Opus 4.6 等 15 个
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化
EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。
提出 DoM 激活探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊
RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆