防御arXiv 2608.25460
用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
- arXiv
- 2608.25460
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Haiku 4.5、Claude Opus 4.6、Claude Opus 4.7 等 15 个
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。