跳到正文
原文
Stanford CRFM· Yifan Mai·本站收录 · 原文发表

Stanford CRFM 将 Unitxt 集成进 HELM,实现可定制化基准评测

Advancing Customizable Benchmarking in HELM via Unitxt Integration

AI 导读

Stanford CRFM 宣布将 IBM Research 开发的开源数据处理与基准定制平台 Unitxt 集成进 HELM 评测框架,使 HELM 用户可以运行可共享、可定制的评测流水线。Unitxt 目录目前提供超过 24 项 NLP 任务、400 个数据集、200 个提示模板和 80 个指标(含 LLM as a judge),令 HELM 可用数据集翻倍以上。该集成分解为数据加载、预处理、提示模板化和指标计算四个模块阶段,并可与 Hugging Face Datasets、Hugging Face Evaluate、LM Evaluation Harness 互操作,从而更容易复现相同提示词的评测流程。

阅读原文crfm.stanford.edu