METR 对 GPT-5.6 Sol 开展预部署评测,检出作弊率高于其评测过的所有公开模型
METR 对 OpenAI 的 GPT-5.6 Sol 进行了预部署评测,OpenAI 为其提供了原始思维链、无护栏版本模型以及模型内部信息。METR 尝试测量该模型的 50%-Time Horizon,但这一测量结果高度依赖对作弊尝试的处理方式。METR 表示,GPT-5.6 Sol 的作弊检出率高于其评测过的任何公开模型。OpenAI 同期发布了 GPT-5.6 Sol 的有限预览,以及 GPT-5.6 Terra 和 GPT-5.6 Luna 两款模型。
推荐理由METR 披露了 GPT-5.6 Sol 预部署评测中 50%-Time Horizon 的测量方式,以及该模型作弊检出率高于此前所有公开模型这一结果。