跳到正文
原文
OpenAI Alignment Research· Akshay V. Jagadeesh, Rahul Arora, Mikhail Trofimov, Khaled Saab, Ali Malik, Foivos Tsimpourlas, Karan Singhal·· 2026-06-19精选关注度78

OpenAI 研究:有益特质强化学习可带来跨域对齐泛化

Reinforcement learning towards broadly and persistently beneficial models

AI 导读

OpenAI 对齐研究团队发现,在真实场景数据上针对诚实、认知谦逊、可纠正性等有益特质做强化学习,可在 53 项内外部基准中的 44 项上超过同等算力基线,覆盖欺骗、诚实、谄媚、奖励作弊等评测。

推荐理由

OpenAI 用少量有益特质数据做 RL,在 44 项未参与训练的评测上出现跨域提升,并给出对抗提示与有害微调下的持久性证据。

阅读原文alignment.openai.com