OpenAI Alignment Research· Tomek Korbak, Cameron Raymond, Micah Carroll, Marcus Williams, Mikita Balesni, Alan Guo, Jason Wolfe, Akshay Jagadeesh, Ian Kivlichan·2026-03-28 02:00· 2026-03-28精选关注度71OpenAI 研究:对齐中间训练能泛化多远How far does alignment midtraining generalize?AI 导读OpenAI 对齐研究团队在类似 o4-mini 的模型上复现并扩展了 Tice 等人的对齐中间训练实验,用 230k 篇文档(约 340M token)分别做对齐与不对齐中间训练,再接入推理后训练。推荐理由OpenAI 公开了一组对齐中间训练的负面结果,说明该干预在推理后训练和真实智能体场景中难以泛化,为后续对齐先验研究提供了可比较的基线。阅读原文alignment.openai.com#对齐#OpenAI#奖励作弊#欺骗/谋划