跳到正文
原文
研究者论文追踪· arXiv:2609.08812· Meera Desai, Sang T. Truong, Hanna Wallach, Alex Chouldechova, A. Feder Cooper, Jean Garcia-Gathright, Daniel E. Ho, Abigail Z. Jacobs, Sanmi Koyejo, Nicholas Pangakis, Angelina Wang·本站收录 · 原文发表 精选关注度31

研究团队用收敛与区分效度检验 56 个 AI 基准,发现安全基准相关性普遍偏弱

What AI Benchmarks Actually Measure: Adapting Convergent and Discriminant Validity to Interrogate Fifty-Six AI Benchmarks

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

作者在53个模型上评测56个基准,发现能力基准跨概念相关度与概念内相当,而安全基准同概念间相关度低且易受评测格式主导。

问题
AI基准分数常被当作模型能力和安全性的量化总结,但缺乏构念效度验证,难以明确基准是否真正测出了其声称衡量的概念。
方法
借鉴社会科学的聚合效度与区分效度框架,在53个模型上收集56个基准的输出与得分,通过模型排名的Spearman相关矩阵与项目反应理论(IRT)检验基准间的概念一致性、区分度及评测格式效应。
实验与结果
能力基准跨概念相关度与概念内相当;安全基准概念内相关度普遍偏弱且更易受评测格式主导;个别基准(如BBQ准确率与DecodingTrust公平性)与声称概念相比更贴近推理或知识。
局限与可以继续做的
基准所测概念常缺乏精确界定;分析假设基准近似单维且未分离主导的一般能力维度;数据覆盖48个无饱和与格式合规基准及53个模型,项目级IRT分析覆盖37个二元响应基准。
实验设置Qwen 1.5 110B Chat、Qwen 2.5 32B Instruct 等 · BBQ、DecodingTrust 等 · Spearman rank correlation (rho)、Delta AUC (AUCM2 - AUCM1) 等
模型
Qwen 1.5 110B ChatQwen 2.5 32B InstructQwen 3 4B InstructOLMo 2 7B Instructclaude-3-5-haiku-20241022claude-sonnet-4-5-20250929DeepSeek V3Gemma 2 9B ITGemma 3 4B ITLlama 2 7B ChatLlama 3.3 70B InstructPhi-3.5 Mini InstructMistral 7B Instruct v0.2gpt-4o-mini_2024-07-18gpt-5-nano-2025-08-07
基准
BBQDecodingTrustCALMHarmBenchOR-BenchSORRY-BenchWildGuardXSafetyXSTestSG-BenchAEGISGSM8KMATHMMLUTruthfulQA
指标
Spearman rank correlation (rho)Delta AUC (AUCM2 - AUCM1)Relabeling statisticPartial Mantel betaRMSE
AI 导读和推荐理由全文 378 字

斯坦福、微软研究院等机构的研究者将社会科学中的收敛效度与区分效度方法引入 AI 基准评估,用 53 个模型在 56 个能力与安全基准上的排名相关性来检验这些基准是否真的测量了它们声称测量的概念。研究发现,同一安全概念下基准之间的模型排名相关性往往很弱,说明这些概念在不同基准中的定义可能并不一致;而能力概念(如推理、知识)下,同一概念内与不同概念间的相关性几乎一样强,说明这些概念之间缺乏区分度。部分基准的相关性更多由设计要素(任务结构、评分格式)而非概念决定,使用 LLM-judge 评分是比共享概念更强的相似性预测因子。个别基准可能测的是别的概念,例如 BBQ-accuracy 与推理基准的相关性强于与偏见基准的相关性,DecodingTrust-Fair 与知识基准的相关性强于与偏见基准。团队公开了 item 级与基准级的模型输出和分数数据集。

推荐理由论文用 53 个模型在 56 个基准上的排名相关性检验基准是否真的测了它声称的概念,并公开了 item 级数据。

深度解读

6 个问题,约 7,900 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    现有AI基准缺乏构念效度验证,论文检验56个基准是否真正测出了其声称衡量的能力与安全概念。

    当前AI评测基准缺乏构念效度(construct validity)验证,难以确定基准得分是否真正反映了其声称衡量的能力或安全概念。

    • 评测场景与现实重要性:模型在基准上的得分常被直接作为能力(如推理、摘要)和安全性(如违规生成、偏见)的量化总结,直接影响模型采用、监管评估以及技术发展的宏观叙事。
    • 现有基准定义的不明确性:基准所声称衡量的概念往往缺乏明确界定(underspecified),且几乎没有任何现有基准经过系统的构念效度检验;单个基准间的低相关性无法区分是测量失效还是概念理解的分歧。
    • 论文的核心观察与假设:若基准具备良好的聚合与区分特性,声称衡量相同概念的基准之间的模型排名应高度相关,而声称衡量不同概念的基准间相关性应较低;同时,评测结果不应受到评测格式或任务结构等设计要素的过度主导。
    • 论文提出的解决方案:借鉴社会科学中的聚合效度(convergent validity)与区分效度(discriminant validity)视角,构建涵盖53个模型和56个基准的数据集,在基准级排名相关性与项目级项目反应理论(IRT)两个层面系统检验基准的有效性。
  2. 有哪些相关研究?

    相关工作涵盖构念效度理论、基准间一致性分析以及项目反应理论应用,本文将聚合与区分分析扩展至56个基准。
    • 构念效度与基准有效性审视:Blodgett et al. (2021)、Reuel et al. (2024)、Bean et al. (2025) 指出基准测量概念有效性的长期问题,探讨基准在多大程度上能够测出其声称的能力或安全概念;Wallach et al. (2025)、Alaa et al. (2025)、Salaudeen et al. (2025) 提出将社会科学中的构念效度(包括聚合效度与区分效度)引入大模型基准的评测设计与审视。
    • 基准间一致性与潜在结构的实证分析:Ren et al. (2024) 发现许多安全基准上的模型排名与模型的通用能力得分强相关,作者指出本文研究范围更广,系统考察了能力与安全类别内多概念的基准相关结构;Burnell et al. (2023a) 采用因子分析探索模型能力的潜在结构,发现BBQ在推理因子上的载荷强于偏见因子,作者指出其侧重于模型能力的潜在结构,而本文聚焦于构念效度与基准究竟在衡量什么;Qian et al. (2026) 通过分析同类能力基准的模型排名来研究题目质量,作者指出其局限于能力领域且重在精简题目,而本文扩展至安全领域并评估基准本身的效度。
    • 心理测量学与项目反应理论(IRT)在AI中的应用:Martínez-Plumed et al. (2019)、Liu et al. (2025) 在AI研究中利用IRT表征模型能力;Hempstead et al. (2004)、Martínez-Plumed et al. (2022) 利用IRT进行题目挑选或难度分析以构建更高效的基准。作者指出本文将IRT用作诊断工具,检验联合估计潜变量是否能提升对题目级得分的预测。
    • 基准来源与数据集:论文以 SafetyPrompts(Röttger et al., 2025)和 HELM(Liang et al., 2022)为初始基准池,扩展收集了56个基准(48个进入主分析),涵盖推理(GSM8K、MATH等)、知识(MMLU、TruthfulQA等)、拒答(HarmBench、SorryBench等)、过度拒答(OR-Bench、XSTest等)、偏见(BBQ、CALM等)等11个分配概念。

    作者将本文定位为将聚合效度与区分效度框架系统性应用于大模型基准评测的研究,通过基准级排名相关与题目级IRT双重分析,跨56个基准和53个模型全面审视基准实际衡量的概念。

  3. 论文如何解决这个问题?

    论文构建涵盖53个模型和56个基准的数据集,结合等级相关矩阵与1PL IRT模型评估基准聚合度、区分度与格式效应。

    作者借鉴多特质-多方法矩阵(MTMM)与项目反应理论(1PL IRT),提出了基于聚合与区分效度的AI基准审视方法,在基准级排名与题目级响应两个层面进行检验。

    基准与模型收集及概念分配

    • 基准筛选标准:以SafetyPrompts和HELM为基础扩展出56个基准,排除非英语/拉丁字符、需要人工评分、非公开研究许可、非单轮任务的基准;超过1000道题目的基准统一抽样1000题(GenMO保留配对采500题,CALM按17个模板分层采)。
    • 概念标注流程:提取各基准论文中的自述概念短语,HELM基准沿用其定向评估分类,其余基准通过归纳法归并为11个分配概念(4个能力概念共17个基准,7个安全概念共39个基准)。
    • 模型选取:选取31个模型家族共53个指令微调模型,开源模型参数量覆盖0.5B至685B。

    基于排名的聚合与区分分析

    • 聚合度与区分度度量:计算各基准向量之间的Spearman等级相关系数并按概念对取平均;使用按模型家族重采样的聚类自助法(cluster bootstrap)计算置信区间。
    • 重标记统计量:针对潜在误标基准,定义重标记统计量为目标基准与假设替代概念基准的平均绝对相关系数减去与当前概念基准的平均绝对相关系数(排除自身),正值支持重标记。
    • 层次聚类与偏Mantel检验:采用完全连接法对距离矩阵(d = 1 - rho)进行聚类;通过偏Mantel检验同时回归基准相关性在概念相似度与格式相似度上的表现。

    题目级项目反应理论(1PL IRT)分析

    • 响应矩阵与数据划分:对37个具备二元对错标签的基准构建m个模型×n个题目的矩阵,将样本量较大的基准下采样至对齐,保留20%的分层随机样本作为测试集。
    • 单潜变量模型(M1):在两个基准的合并数据上联合训练单个1PL IRT模型,估计单一共享潜变量:

    P(Ymi = 1) = 1/(1 + exp(−(θm − bi))) 其中 θm 为模型 m 的潜变量能力,bi 为题目 i 的难度。

    • 独立潜变量模型(M2)与区分指标:在两个基准上分别独立估计潜变量向量:

    P(Ymi = 1) = 1/(1 + exp(−(θmk − bi))),   k ∈ {A, B} 定义区分指标 Delta AUC = AUC_M2 - AUC_M1,接近0表示单潜变量即可充分描述,正值表示需要基准特异的独立潜变量。

    评测实施细节与可靠性筛选

    • 生成与输出约束:所有模型均在温度1.0下进行零样本评测;对多选和短答题引入系统提示词约束输出格式,减少不可解析回答。
    • LLM裁判:需要大模型打分的基准采用原论文指定裁判,缺失时统一使用Qwen3-30B(温度0);对不可解析比例超过75%的测试组合予以剔除。
    • 基准可靠性双重筛选:排除最高分与中位数分数差归一化后低于0.05的饱和基准(4个),以及在与HELM重合的模型排名上出现逆序的格式敏感基准(4个),最终保留48个基准进入主分析。
  4. 论文做了哪些实验?

    基于53个模型与48个基准的实证表明,能力基准区分度弱、安全基准受格式主导且个别基准概念错位。

    实验设置

    • 被测模型:共53个指令微调模型,包括 Alibaba(Qwen 1.5 110B Chat、Qwen 2 7B/72B Instruct、Qwen 2.5 0.5B/14B/32B Instruct、Qwen 3 4B Instruct、Qwen3-30B-A3B-FP8)、AllenAI(OLMo 2 7B/13B/32B Instruct、OLMoE 1B-7B Instruct)、Anthropic(claude-3-5-haiku-20241022、claude-sonnet-4-5-20250929)、AI21(Jamba Mini)、Databricks(DBRX Instruct)、DeepSeek(DeepSeek V3、DeepSeek V4-flash)、Google(Gemma 2 9B/27B IT、Gemma 3 4B/12B/27B IT)、Meta(Llama 2 7B/70B Chat、Llama 3.2 1B/3B Instruct、Llama 3.3 70B Instruct)、Microsoft(Phi-3.5 Mini Instruct、Phi-3.5 MoE Instruct、Phi-4 Mini Instruct)、Mistral(Mistral 7B Instruct v0.2、Mistral Nemo Instruct、Mistral Small 3.1 24B、Mistral Large 2411、Mixtral 8x7B Instruct)、Moonshot AI(Moonlight 16B-A3B Instruct)、01.AI(Yi 34B Chat、Yi 1.5 6B/9B/34B Chat)、OpenAI(gpt-35-turbo-instruct_0914、gpt-4_turbo-2024-04-09、gpt-4o-mini_2024-07-18、gpt-5-nano-2025-08-07、o1_2024-12-17、o1-mini_2024-09-12、o3-mini_2025-01-31)、TII(Falcon3 1B/3B/7B/10B Instruct)以及 xAI(grok-4-1-fast-reasoning)。
    • 评测数据集:初选56个基准,排除4个饱和基准(DecodingTrust Stereotype、CIVICS、BoolQ、IMDB)与4个格式敏感基准(WikiFact、Dyck、bAbI、Synthetic Reasoning Abstract)后,保留48个基准;其中37个二元响应基准用于题目级IRT分析。
    • 主要指标:模型排名Spearman相关系数(rho)、IRT双模型保留集AUC差值(Delta AUC = AUC_M2 - AUC_M1)、重标记统计量、偏Mantel检验回归系数(beta_format、beta_concept)。
    • 评审与打分方式:多选与短答基准采用精确匹配(exact match);自由文本基准采用指定裁判或默认裁判Qwen3-30B(温度0);客观题目拒答计为错误(例如claude-sonnet-4-5在WMDP上拒答了666题)。
    • 样本量与测试条件:超过1000题目的基准抽样1000题,全模型均在温度1.0下进行零样本评测。

    主结果

    下表呈现论文检验的核心统计量在全体模型以及不同发布年代子集上的表现(据 Table D.4):

    表格较宽,可左右滑动

    分析维度与统计量成立判定条件全体模型 (n=53)2024年10月前 (n=27)2024年10月后 (n=26)
    聚合度差距(能力均值 - 安全均值 rho)> 0+0.29+0.21+0.38
    能力概念内与概念间差距(rho 差)< 0.05-0.00-0.01+0.00
    安全向能力牵引(平均 |rho| 差)> 0+0.04+0.04+0.06
    拒答与过度拒答平均相关(rho)95% CI < 0-0.42-0.51-0.30
    偏Mantel格式对比(beta_format - beta_concept)> 0, p < .05+0.58***+0.43***+0.84***
    同基准跨目标与同目标跨基准差距(rho 差)> 0+0.72+0.66+0.78
    BBQ-accuracy重标记(偏见→推理)> 0, p < .05+0.15***+0.12*+0.18**
    DecodingTrust-Fair重标记(偏见→知识)> 0, p < .05+0.14**+0.14*+0.14*
    • 能力基准与安全基准表现出明显的聚合度差异:作者称能力概念内的平均排名相关度高于安全概念(差距为+0.29),IRT分析中能力概念内Delta AUC为0.012,安全概念内Delta AUC为0.0323(§4.1)。
    • 能力概念间缺乏有效区分:推理与知识等能力概念间的平均排名相关度与概念内相当(差距为-0.00),二者之间的IRT平均Delta AUC仅为0.011(§4.2)。
    • 安全基准与能力基准的相关性高于安全基准自身:伦理、偏见、隐私和不安全行为基准与能力基准的平均绝对相关度高于与其他安全基准(绝对差值+0.04,Table D.4)。

    评测格式与任务结构的影响分析

    • 测了什么:以偏见基准检验相同任务设计(跨人口目标)与相同人口目标(跨任务设计)的相关性;对推理、理解和拒答基准进行层次聚类,并使用偏Mantel检验量化评分格式的作用。
    • 实验结果:偏见基准在同一基准内的跨人口相关性明显高于跨基准的同人口相关性(差距达+0.72,据 Table D.4);偏Mantel检验中,当格式采用三分类编码时,格式效应显著强于概念效应(beta_format=0.275, p < 0.0001 对比 beta_concept=0.138, p=0.003);当采用LLM裁判二元编码时,格式效应进一步上升至 beta_format=0.526 (p < 0.0001),概念效应转为不显著(beta_concept=-0.058, p=0.998,§4.3)。
    • 作者的解读:作者认为基准相似性不仅由其声称衡量的概念决定,更被任务结构与评分格式等设计要素所主导,LLM裁判引入了独立的变异来源。

    个别基准的重标记检验与案例分析

    • 测了什么:针对BBQ-accuracy和DecodingTrust-Fair进行重标记检验,计算其与假设概念(推理或知识)相比于原分配概念(偏见)的平均绝对Spearman相关差异;以OR-Bench(过度拒答)作为负对照。
    • 实验结果:BBQ-accuracy与推理基准的相关性显著高于偏见基准(重标记统计量为0.15,95% CI [0.07, 0.23],p < 0.001);DecodingTrust-Fair与知识基准的相关性显著高于偏见基准(统计量为0.14,95% CI [0.05, 0.24],p = 0.002);负对照OR-Bench更符合原过度拒答标签,对推理、知识、理解的重标记统计量均为负值(-0.62至-0.52,全模型总体为-0.52,§4.4与Table D.4)。
    • 作者的解读:作者认为BBQ题目在模糊情境下要求判断无法回答,模型出错可能反映的是推理能力不足而非偏见;DecodingTrust-Fair要求预测年收入,具备更多真实世界知识的模型可能表现出更大的群体分数差距,导致其更贴近知识基准。

    模型时代与LLM裁判敏感性分析

    • 测了什么:将53个模型按2024年10月为界分为两组(27个与26个),并在4个基准上将默认裁判由Qwen3-30B替换为Llama-3.3-70B-Instruct,检验9项统计量的稳健性。
    • 实验结果:两代模型中8项结论均保持成立(Table D.4),新模型中能力与安全的聚合差距扩大(由+0.21增至+0.38),格式对比也扩大(由+0.43增至+0.84);切换裁判后(Table D.5),所有9项指标均满足判定标准,指标变动幅度不超过0.06。
    • 作者的解读:作者指出主要发现并非由较旧、能力较弱的模型所驱动,新一代模型中这些模式依然稳固;同时LLM裁判格式的主导作用并非单一裁判模型的产物。

    其他消融与分析

    • 提示方式消融(Civil Comments,phi-3-5-mini-instruct):无系统提示时0-shot不合规数接近1000,加入系统提示后0/2/4-shot不合规数均接近0且准确率保持稳定(Figure D.1)。
    • HELM基准一致性对比:4个保留的自由文本基准平均Spearman相关为0.74(中位数RMSE为0.111),4个排除的格式敏感基准平均Spearman相关为0.25(中位数RMSE为0.246,§A.2.2)。
    • 6个重合多选基准复现:多选基准与HELM中位数RMSE为0.071,其中EntityMatching因基础模型与对齐模型差异RMSE为0.403(§A.2.2)。
    • 拒答与过度拒答IRT分离度:refusal与over-refusal基准对之间的平均Delta AUC为0.062(95% CI [0.060, 0.064]),显著高于两类概念内部(§4.2)。
    • 异常基准对的IRT与相关性分歧:CALM与EntityMatching排名相关达r=0.57但Delta AUC高达0.063;SGBench-mcq与Synth reasoning相关r=0.51但Delta AUC达0.035(附录B)。
  5. 有什么可以进一步探索的点?

    作者指出概念定义模糊、未控制通用能力维度及单维性假设等局限,呼吁建立社区级题目数据以实现持续效度监测。

    作者指出的局限与后续方向

    • 概念界定不明确限制效度评估深度(§5):基准声称衡量的概念往往缺乏精准界定,在没有清晰概念范畴和边界文档的情况下,难以判定效度问题属于测量失效还是概念理解分歧。
    • 未分离占主导地位的一般模型能力维度(§5):分析未控制可能驱动多数基准表现的单一主导维度(即通用模型能力),未来工作可通过在基准相关矩阵的第一主成分上进行残差化处理来加以校正。
    • 单维性与特质共享假设在安全基准中可能不成立(§5):分析假设基准近似单维且同概念基准测量充分共享的属性;这在能力基准中较合理,但安全概念可能依赖于任务、用户、环境和规范标准,弱相关可能源于构念本身的多维性而非测量不良。
    • 横截面快照与高昂算力成本(§5):实验需要题目级与基准级的大规模数据收集(耗费约1050个H200 GPU小时),反映的是特定时间节点的快照;作者呼吁建立标准化、社区共建的题目级得分与评测条件文档数据集以实现持续的效度监测。
    • 部分基准对相关性与题目级IRT结论存在分歧(附录B):如CALM与EntityMatching排名相关达0.57但题目级Delta AUC为0.063,表明聚合相关性与题目级潜变量分析在个别基准对上可能给出不同结论,单一分析手段不足以作为判定标准。

    实验覆盖范围

    • 评测基准与模型覆盖:实验共收集56个基准并对53个模型进行评测,排除4个饱和基准与4个格式不合规基准后,48个基准进入主分析;题目级1PL IRT分析覆盖37个具备二元对错标签的基准。
    • 基准语言与任务形式限制:候选基准仅纳入使用英语或拉丁字符且采用单轮交互的基准;超过1000题目的基准统一下采样至1000题。
    • 模型生成与解码设置:所有模型均采用温度1.0的零样本生成;对多选或短答基准统一引入限制输出格式的自定义系统提示词。
    • LLM裁判模型选择:自动评分基准优先采用原论文裁判,未提供时默认使用Qwen3-30B,稳健性分析中对比了Llama-3.3-70B-Instruct。
    • 模型年代划分:模型按2024年10月前(27个)和2024年10月及以后(26个)划分为两个年代子集,未涉及非公开评测参数或动态交互环境。
  6. 总结一下论文的主要内容

    论文系统检验56个基准的效度,揭示能力基准区分度弱、安全基准受格式主导且个别基准概念错位,呼吁规范基准设计。
    • 论文定位:本文将社会科学中的聚合效度与区分效度框架系统引入大模型评测领域,全面检验56个AI能力与安全基准实际衡量的内容。
    • 核心问题:现有AI评测基准缺乏构念效度验证,基准声称衡量的概念界定模糊,外界难以确定基准得分反映的是目标能力还是评测格式等表面要素。
    • 方法架构:作者收集了53个模型在56个基准上的题目级与基准级表现,通过模型排名的Spearman相关矩阵、偏Mantel检验以及基于1PL IRT的单/双潜变量AUC对比(Delta AUC),定量评估基准间的聚合度、区分度与格式偏差。
    • 核心实验发现:
      1. 能力基准在同概念内与跨概念间的平均排名相关度相当(差距为-0.00,Table D.4),知识与推理在IRT分析中的Delta AUC仅为0.011(§4.2),作者认为这提示能力基准间可能未形成有效区分。
      2. 安全基准在同概念内的平均排名相关度偏弱,且伦理、偏见、隐私和不安全行为基准与能力基准的平均绝对相关度高于与其他安全基准(绝对差值+0.04,Table D.4)。
      3. 评测格式对基准相似性的影响显著超越所测概念:在二元偏Mantel检验中,LLM裁判格式回归系数beta_format=0.526 (p < 0.0001),而概念相似性回归系数beta_concept=-0.058 (p=0.998,§4.3)。
      4. 部分基准存在概念错位:BBQ-accuracy与推理基准的相关性高于偏见基准(重标记统计量0.15,p < 0.001),DecodingTrust-Fair与知识基准的相关性高于偏见基准(统计量0.14,p = 0.002,§4.4)。
    • 结论与启示:作者指出当前基准评测结果深受任务形式与LLM裁判等设计选择主导,建议基准开发者明确概念范围边界,采用重标记检验等效度工具审视基准,并呼吁构建社区级题目数据以实现常态化效度监督。
阅读原文arxiv.org