NIST CAISI 发布 NIST AI 800-3,用统计模型扩展 AI 评测工具箱
New Report: Expanding the AI Evaluation Toolbox with Statistical Models
AI 导读
NIST 下属的 Center for AI Standards and Innovation(CAISI)与 Information Technology Laboratory 发布 NIST AI 800-3《Expanding the AI Evaluation Toolbox with Statistical Models》,提出用统计模型提升 AI 基准评测的统计效度。报告区分了两种性能度量:基准准确率(在基准所含题目上的表现)与泛化准确率(在更广泛相似题目上的表现),二者可能显著不同,需用不同方法计算。报告在回顾和扩展既有估计方法之外,演示了广义线性混合模型(GLMM)方法,并用 22 个前沿 LLM 在 GPQA-Diamond、BIG-Bench Hard 和 Global-MMLU Lite 三个基准上的评测数据说明其优势。
推荐理由
NIST CAISI 提出用 GLMM 区分基准准确率与泛化准确率,为解读 LLM 评测结果和不确定性提供可迁移的统计方法。