Stanford CRFM 将基于 IRT 的自适应测评集成进 HELM
Reliable and Efficient Amortized Model-Based Evaluation
AI 导读
Stanford CRFM 提出基于 IRT 中 Rasch 模型的两阶段自适应测评方法并集成进 HELM 框架,用以降低大语言模型的评测成本同时保持可靠性。该方法先在校准阶段估计各 LLM 的能力参数和各问题的难度参数,再据其动态选取最具信息量的问题进行自适应测试,从而减少所需题目数。在来自 5 个 HELM 排行榜的 22 个数据集、涵盖 183 个 LLM 和超过 78000 道题目的实验中,该模型平均取得训练集 0.85、测试集 0.83 的 AUC-ROC;在 Civil Comments 上对未参与校准的 Llama 3.1 8B 做自适应测试,前 200 题的能