防御arXiv 2608.25460
用强化学习训练对齐审计员:成对奖励加校准让 Haiku 4.5 追平 Opus 4.6
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
- arXiv
- 2608.25460
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Llama 3.3 70B、Claude Haiku 4.5、Claude Opus 4.6 等 15 个
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
用强化学习与成对比较奖励训练对齐审计模型并校准假阳性
摘要系统总结了强化学习训练对齐审计器的核心问题、成对奖励与校准方法及主要结果。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。