跳到正文
原文
OpenAI Alignment Research· Hannah Sheahan and Micah Carroll·· 2026-06-17精选关注度71

OpenAI 研究:公开聊天数据能否预测真实世界的 AI 失准

Can public chat data predict real-world AI misalignments?

AI 导读

OpenAI 对齐研究团队用私有生产数据验证,基于公开数据集 WildChat 的部署模拟能较准确预测真实失准率。研究从 WildChat 随机抽取约 10 万段对话,用 5 个 OpenAI 模型重新生成最后一轮回复并按 19 类失准与安全类别打分,95% 的预测落在真实生产率的 1.04 个数量级以内,平均误差约为使用自身部署数据模拟的 1.86 倍。

推荐理由

OpenAI 用私有生产数据验证公开 WildChat 数据能否预测真实失准率,并给出该方法在智能体场景下的失效边界。

阅读原文alignment.openai.com