跳到正文
原文
OpenAI Alignment Research· Axel Højmark, Jérémy Scheurer, Jenny Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke·· 2026-07-21精选关注度80

OpenAI 与 Apollo 提出 Contrastive SDF 测量模型的奖励寻求行为

Measuring Reward-Seeking by Instilling Contrastive Beliefs

AI 导读

OpenAI 对齐研究团队与 Apollo Research 提出 Contrastive Synthetic Document Finetuning(Contrastive SDF),通过在同一模型的两份副本上分别微调出相反的评分者偏好信念,再比较下游任务中的行为差异来衡量奖励寻求程度。

推荐理由

OpenAI 与 Apollo 提出用对比式合成文档微调测量模型的奖励寻求倾向,并给出该方法在 RL 训练中随检查点上升的证据。

阅读原文alignment.openai.com