跳到正文
原文
SPY Lab Blog·原文 · 入选 精选关注度71

SPY Lab 提出用一致性检查评测超人类模型

Evaluating superhuman models with consistency checks

AI 导读

SPY Lab 提出一套基于蜕变测试的评测框架,在无法获得真值的情况下通过输入域的一致性约束检验超人类模型。方法对棋盘镜像、旋转等语义等价变换施加约束,测试超人类国际象棋 AI Leela Chess Zero,发现多处明显违反一致性的大偏差,包括镜像后胜率估计截然不同、唯一合法走法前后胜率不一致。在 GPT-4 上,作者用自建预测数据集测试单调性与概率互补等约束,发现其预测常不满足单调性,且在贝叶斯定理约束上违反率超过 50%;GPT-4 相比 GPT-3.5-turbo 一致性有明显提升。

推荐理由

提出用一致性约束在无真值领域评测超人类模型,并给出黑盒与白盒搜索的效率对比数据。

阅读原文spylab.ai