DeepMind 提出预测 RL 训练何时破坏思维链可监控性的框架
DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。
推荐理由提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。
思维链的可监控性与忠实性,以及用思维链发现不良行为的研究。
DeepMind Safety Research 提出一个概念框架,按输出奖励与思维链奖励的关系把训练环境分为冲突、正交、对齐三类,用于在训练前预测 RL 是否会破坏思维链可监控性。
推荐理由提出按奖励冲突类型预判 RL 训练是否破坏思维链可监控性的框架,并在代码后门与抛硬币任务上验证。
Redwood Research 发文认为,COCONUT、full-bandwidth transformers、looped transformers 等潜在推理架构会让模型在潜在状态中完成大量推理,从而削弱思维链作为当前最有价值监控工具的作用。
推荐理由Redwood Research 系统论证了潜在推理架构为何会削弱思维链监控,并给出区分必要性与倾向性的分析框架,适合关注 AI 控制与可解释性路线的人参考。