跳到正文
原文
OpenAI Alignment Research· Micah Carroll, Tomek Korbak, Zehao Dou, Bowen Baker, Ian Kivlichan·· 2026-05-07精选关注度71

OpenAI 调查 RL 训练中意外对思维链打分的影响

Investigating the consequences of accidentally grading CoT during RL

AI 导读

OpenAI 用新搭建的自动检测系统发现,GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini 的部分 RL 训练样本中,思维链曾被意外纳入奖励计算,GPT-5.5 未受影响。

推荐理由

OpenAI 公开了自家 RL 训练中意外对思维链打分的检测系统与复盘,并给出在真实训练管线中诱导思维链混淆的实验条件。

阅读原文alignment.openai.com