OpenAI 调查 RL 训练中意外对思维链打分的影响
OpenAI 用新搭建的自动检测系统发现,GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini 的部分 RL 训练样本中,思维链曾被意外纳入奖励计算,GPT-5.5 未受影响。
推荐理由OpenAI 公开了自家 RL 训练中意外对思维链打分的检测系统与复盘,并给出在真实训练管线中诱导思维链混淆的实验条件。
Redwood Research 的 AI 控制研究:监控协议、对齐伪装与对未对齐模型的安全使用。
OpenAI 用新搭建的自动检测系统发现,GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini 的部分 RL 训练样本中,思维链曾被意外纳入奖励计算,GPT-5.5 未受影响。
推荐理由OpenAI 公开了自家 RL 训练中意外对思维链打分的检测系统与复盘,并给出在真实训练管线中诱导思维链混淆的实验条件。