DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架
Predicting When RL Training Breaks Chain-of-Thought Monitorability
AI 导读
DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。
推荐理由
提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。