跳到正文
原文
Stanford CRFM· Jialiang Xu·· 2025-03-20

Stanford CRFM 发布 HELM Capabilities,按单项能力评测语言模型

HELM Capabilities: Evaluating LMs Capability by Capability

AI 导读

Stanford CRFM 推出 HELM Capabilities v1.0.0,这是一个按能力维度组织场景的语言模型基准与排行榜,共覆盖 5 个能力场景并测评 22 个模型。该榜单沿用 HELM 框架,提供完整的提示级透明度且结果可完整复现,场景选取综合考虑饱和程度、发布时间和质量。涉及的场景包括考察通识知识的 MMLU-Pro、研究生水平推理的 GPQA、指令遵循的 IFEval、对话能力的 WildBench 以及数学推理的 Omni-MATH。

阅读原文crfm.stanford.edu