跳到正文
原文
DeepMind Safety Research· DeepMind Safety Research·· 2026-04-01精选关注度82

DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架

Predicting When RL Training Breaks Chain-of-Thought Monitorability

AI 导读

DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。

推荐理由

提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。

阅读原文deepmindsafetyresearch.medium.com