用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
- 论文定位:该研究探索了利用强化学习提升自动化语言模型对齐审计器调查能力的方法。
- 核心问题:现有自动化审计系统在排查模型隐蔽行为时存在调查浅显、缺乏真实感的问题,且在优化绝对严重性或二元检出奖励时容易产生对抗施压与虚构指控等作弊行为。
- 核心方法:采用参考成对比较奖励,由具备真实基准信息的裁判模型评估两条轨迹的相对优劣,并在训练批次中引入 50% 无隐蔽行为的干净目标进行假阳性校准训练。
- 关键实验结果:训练 3 轮后的参考成对审计器在综合评分上达到 48.7,追平 Opus 4.6(48.4);其审计质量得分达 72.7 ± 2.6,真实感胜率达 14.0 ± 3.1%,假阳性校准保持在 99.6 ± 0.7%;在 AuditBench 的 KTO 微调加固目标与 Claude Code 脚手架中,检出率从未训练的 11.5% 提升至 15.6%(多目标版本达 28.1%)。
- 作者结论与启示:作者认为合理的奖励结构是提升审计能力的关键,系统性假设检验策略能够通过成对比较涌现,但自动化审计在绝对真实感和更强加固目标上面临持续挑战。