研究者对 HELM Safety 与 HarmBench 做心理测量学审查,质疑其分数能否代表单一属性
Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark
作者审计HELM Safety池中的HarmBench,称单一harmful refusal解释不成立。
- 安全基准常把多套数据合成一个总分。作者问 harmful refusal 是否是 HELM Safety 里可单独测量的单一构念,因为总分相同的模型在具体行为上可以差很多。
- 在 HELM Safety v1.17.0 上,三个候选数据集饱和后,只对 HarmBench 的 398 道题、81 个模型做二值化,再用多维 IRT 与能力匹配后的 DIF 检查单一构念是否成立。
- 作者报告一维 2PL 的留出 log-loss 为 0.470,确认性三维为 0.258、七维为 0.255。单一分数下 OpenAI 与 Anthropic 有 13 个 MH DIF 标记,分范围匹配后大多消失;作者称这与加总效应相符,但未排除领域内的开发者差异。
- 作者指出 81 个模型是方便样本,OpenAI 21、Anthropic 11,且同开发者模型不独立;分数来自两个 LLM 裁判,结论只适用于 HELM 对 HarmBench 的操作化,尚未在其他基准上看到同样结构。
- 基准
- HELM Safety v1.17.0HarmBenchSimpleSafetyTestsAnthropicRedTeamXSTest(harmful subset)
- 指标
- pass rateheld-out log-lossBrier scoreAICBICMantel-Haenszel DIF flags
研究者对 HELM Safety 基准做了心理测量学审查,检验其中的分数是否真的测量了单一属性“有害拒答”(模型拒绝危险或违反政策提示词的倾向)。作者称 HELM Safety 中可能针对有害拒答的四个数据集里有三个已经饱和,只对剩下的 HarmBench 做两项心理测量检验。多维项目反应理论建模的结果强烈提示 HarmBench 并未测量单一属性;项目功能差异分析发现,来自不同开发者的模型在拒答能力相同时部分题目的得分不同,而这些标记在按范围匹配后基本消失,作者认为这一模式与聚合效应一致,但不足以排除领域相关的开发者差异。
深度解读
这篇论文试图解决什么问题?
作者要检查 HELM Safety 的分数能否读成单一 harmful refusal,而不是多种行为的加总。
作者要问的是:被读成模型安全测量的单一分数,是否对应一个可分开比较的属性;他们把候选属性称为 harmful refusal。
- 为何要审计:作者称基准分数影响部署前评测、采购指南和 model card,却很少被审计实际测到什么。按他们采用的框架,构念是分数意图测量的属性;测验能测量它,当且仅当它存在,且改变它会因果地改变测验结果(Borsboom et al., 2004)。
- 复合分数的限制:作者称安全套件把 bias、toxicity、隐私泄露、越狱鲁棒性和 refusal 加在一起。总分仍可给总体安全排序,但相同总分的模型可以在某一行为上差很多,因而不能支持「在某个具体属性上更安全」(Salaudeen et al., 2025)。
- 候选构念:作者把拒绝有害请求的倾向称为 harmful refusal。理由是它由可识别的训练过程诱导,所以可能存在并驱动题目反应。他们注明这是自己的假设,不是 HELM Safety 开发者提出的构念,并按 HELM 博客把 “LM evaluated harmfulness score” 读成与之相近。
- 池内观察:HELM Safety 用五个基准报告一个归一化均值。进入该 harmfulness 分数的四个数据集里,AnthropicRedTeam、SimpleSafetyTests 和有害 XSTest 的平均通过率在 0.92 到 0.94。作者称饱和数据对更弱模型仍可能测得好,但在该池中只有 HarmBench 还有足够变异,能做题目级建模。
- 本文做什么:在「构念必须先存在」这一前提下,对 HarmBench 做多维项目反应理论与差异项目功能。作者主张,分数在用来比较模型之前,应先取得单一属性这一读法。
有哪些相关研究?
相关工作给出构念效度、安全套件和四个 harmfulness 数据集,本文审计分数是否测到单一属性。
构念效度与测量推断
- Borsboom et al. (2004) 与 Borsboom (2005):给出本文采用的效度定义,即构念存在,且改变它会因果地改变测验结果。
- Kane (2013) 与 Truong and Koyejo (2026):前者要求审计分数所支持的推断;后者把推断拆成数据、主张和保证,并被作者用作两项诊断的出处。
- Salaudeen et al. (2025):论文用它说明复合分数不能显示模型在某一属性上更安全,并沿用「先取得单一属性读法,再用来比较模型」。
安全行为与基准套件
- Amodei et al. (2016) 与 Hendrycks et al. (2021):把 AI 安全写成一组问题行为。
- Yu et al. (2026):论文称基准套件按 bias、toxicity、隐私泄露、越狱鲁棒性和 refusal 组织数据集。
- HELM Safety(Kaiyom et al., 2024):五个基准、一个归一化均值;HarmBench、SimpleSafetyTests、AnthropicRedTeam 和 XSTest 的有害子集进入 “LM evaluated harmfulness score”。
被检查的数据集
- HarmBench(Mazeika et al., 2024):题目试图引出有害行为,按服从或拒绝计分。HELM 博客称之为跨越若干危害域、衡量越狱技术效力的测量。
- SimpleSafetyTests(Vidgen et al., 2023)、AnthropicRedTeam(Ganguli et al., 2022)与 XSTest 有害子集(Röttger et al., 2024):同属该 harmfulness 分数;作者报告它们在 HELM 池中饱和。
基线方法是一维 2PL 与作为最强一维对照的一维 3PL。基准/数据集是 HELM Safety v1.17.0 中的 HarmBench;饱和筛查还用了上述三个数据集。
作者把本文放在「先问构念是否存在」这一步:HarmBench 只有在 harmful refusal 存在且单独驱动反应时,才能测量它。他们称两项检验都不专属于 HarmBench;维度性只需要反应矩阵,能力匹配的 DIF 只需要模型家族这类分组。作者称这些检查便宜且快到可以用在任何模型发布上,论文未报告具体耗时。
论文如何解决这个问题?
用构念效度的两项检验:多维 IRT 看维度,DIF 看能力匹配后的开发者差异。
整体是对假设构念 harmful refusal 做构念效度审计。Figure 1 把 HarmBench 的通过/失败连到「更高分则更稳定地拒绝有害请求」。连接二者的保证是:单一 harmful refusal 组织了题目反应。作者称若多个构念在驱动反应,分数仍在,但测到的是混合物,而不是这个构念本身。
数据与计分
- 来源:写作时最近的 HELM Safety 发布 v1.17.0(2026-06-21 访问),使用其中已报告的逐题裁判分。每题是两名 LLM 裁判在五点量表上的平均分,裁判为 gpt-4o-2024-05-13 与 llama-3.1-405b-instruct-turbo。
- 二值化:严格以 1.0 为通过,即只有一致满分算通过。作者称这给出保守的二分反应矩阵。此规则下 HarmBench 由 400 题变为 398 题,通过率 0.67;另外三个数据集的通过率在 0.92 到 0.94。
- 两套标签:功能类为 standard 199、contextual 99、copyright 100。语义类为 cybercrime 67、chemical or biological harm 56、copyright violations 100、misinformation 65、harassment 25、illegal activities 63、general harm 22。两套重叠但不完全;多数语义类同时有 standard 与 contextual,copyright 在两套里是同一批题。
维度性
- 要检查的推论:若一个构念驱动反应,一个潜在维度就应说明模型如何通过和失败。潜在维度是从反应估计的统计轴,构念是打算测量的理论属性。
- 探索性模型:二参数 logistic(2PL)多维 IRT 中,模型 i 通过题目 j 的概率为 P(Yij=1∣θi,aj,bj)=σ(∑k=1dajk(θik−bjk))。theta 是潜在能力,a 是区分度,b 是难度,sigma 是 logistic 函数。探索性拟合不预给题目–因子标签,d 从 1 到 10,主要用来看一维是否太少。
- 确认性模型:三维让 standard、contextual、copyright 各只负荷在自己的反应过程因子上,作者因其更省、且是有名字的结构而当作主模型。七维按危害域加载,用来看 HarmBench 自己的内容分类会不会改变结论。两者都估计因子相关,以看因子是否可互换。
- 为何不看标签就下结论:作者称发散的反应模式有两种竞争解释,题目测的是不同构念,或测同一构念但难度不同。类别标签是内容和反应过程的假设,不能单独说明何种能力解释了通过与失败。
差异项目功能
- 条件比较:DIF 问题目在各组是否同样校准,不是哪个开发者平均更安全。总体安全差异不构成 DIF,DIF 也不确立差异为何出现。若只测 harmful refusal,匹配估计能力后,组身份不应再改变通过概率;否则作者称之为 construct-irrelevant variance。
- 分组与筛查:开发者组事先固定,且至少 8 个模型,因而为 OpenAI 21 个、Anthropic 11 个。作者称这是实用纳入规则,不是经过验证的样本量要求。另一比较是 closed/API 对 open-weight-like。主筛查是三个能力带内的 Mantel-Haenszel;ridge-logistic 用连续拟合能力做敏感性检查。两种筛查都在单一分数、三个反应过程分数和七个危害域分数上做。5,000 个无组差的模拟矩阵给出 family-wise 截止,即最大统计量的第 95 百分位。
- 未扩展的模型:作者没有做到带锚题纯化的多组 IRT。以 21 与 11 个模型,分组题目估计、锚题选择和不确定性校准是否充分,这里没有建立。作者称这对小而相依的 LLM 组仍是开放问题,较简单的筛查也不能免除(Botter, 2026, Problem 2)。
估计与模型选择
- 主反应模型:二值 2PL。作者称等级反应模型能保留分数等级,但会增加由同一小模型池估计的阈值,其在稀疏类别和相依谱系下的恢复需要超出预测拟合的验证。这是在限制范围,不是声称 2PL 避开了这些问题。矩阵为 81 个模型、398 题,n 小于 p,用 py-irt 的变分推断。
- 比较规则:五次重复的 80/20 反应级划分;每个模型–划分用 20 个随机初始,按训练 log-likelihood 留一个,留出反应不参与选择。主准则是留出 log-loss,次准则是 Brier,越低越好;AIC、BIC 是样本内简约检查。
论文做了哪些实验?
在 v1.17.0 的 81 个模型上,确认性三维、七维的留出预测好于一维设定。
实验设置
- 对象:HELM Safety v1.17.0。榜单 87 个模型,6 个因至少一个基准缺少逐题数据被排除,分析池为 81 个;名称在附录 E Table 7。正文结果不按单个模型报告安全分。
- 题目与裁判:HarmBench 在 1.0 二值化下为 398 题。裁判是 gpt-4o-2024-05-13 与 llama-3.1-405b-instruct-turbo,五点量表取平均。饱和筛查还包括 AnthropicRedTeam、SimpleSafetyTests 和 XSTest 有害子集。
- 对照:一维 2PL,以及作者称为最强一维对照的一维 3PL;探索性 2PL 从 2D 到 10D;确认性 3D 反应过程模型与确认性 7D 危害域模型。附录 C 另有 1PL/Rasch 与 3PL。
- 指标与重复:留出 log-loss、Brier、AIC、BIC。五次 80/20 反应级划分,每次 20 个初始(种子 0–19)。附录 A:Adam 学习率 0.01、2,000 epoch;NaN 则改用 0.005 与 3,000 epoch。论文未报告假设检验 p 值。
- DIF:OpenAI 21 对 Anthropic 11;closed/API 48 对 open-weight-like 33。MH 与 ridge-logistic,各 5,000 次无 DIF 模拟。范围包括单一分数、3D 与 7D。
- 范围声明:作者称下面的结果都相对于这一模型池;饱和和维度结构是这些数据集在这些模型上的性质,不是对每一队列的主张。
主结果
据 Table 1,五次划分的均值(SD)。AIC、BIC 为各划分均值并经四舍五入。越低越好。探索性 9D 的 log-loss 也是 0.282(SD 0.005)。表中省略探索性 3D、4D、6D、7D、8D,其 log-loss 为 0.284、0.285、0.284、0.285、0.284。
表格较宽,可左右滑动
设定 Log-loss (SD) Brier (SD) AIC BIC 一维 2PL 0.470 (0.003) 0.156 (0.001) 25,806 32,961 一维 3PL 0.322 (0.007) 0.096 (0.002) 17,600 28,001 探索性 2D 2PL 0.287 (0.004) 0.087 (0.001) 16,112 30,421 探索性 5D 2PL 0.282 (0.007) 0.085 (0.002) 21,329 57,100 探索性 10D 2PL 0.284 (0.006) 0.086 (0.002) 30,300 101,843 确认性 3D 2PL 0.258 (0.006) 0.078 (0.002) 13,707 22,183 确认性 7D 2PL 0.255 (0.006) 0.077 (0.002) 13,961 25,080 - 一维不够,但维数不稳:作者称 2D 到 10D 的平均 log-loss 在 0.28 上下,但探索性序列没有稳定的最佳维数,AIC 与 BIC 随参数变大。作者在 Table 1 把各列最低值加粗,分别落在确认性 7D 的 log-loss、Brier 和确认性 3D 的 AIC、BIC。
- 主模型取三维:作者称三维几乎与七维一样能预测,拟合量更少,故作主模型;七维保留为敏感性检查。相对一维 3PL,确认性 3D 的 log-loss 平均降低 0.064(SD 0.003;范围 0.060–0.067),五次划分都偏向 3D;配对 Brier 降幅 0.0176(SD 0.0005)。划分内 20 次重启的留出 log-loss 标准差均值,一维 3PL 为 0.00037,确认性 3D 为 0.00035,且任一划分内重启区间不重叠。
- 因子相关但不互换:三维中 standard 与 contextual 相关 0.785,copyright 与二者为 0.451 和 0.603。作者称七维里非 copyright 域常常约在 0.65 到 0.85,copyright 对其他域为 0.34 到 0.64。作者认为可解释因子保留了不同的行为模式,尤其在 copyright 复现上。
差异项目功能
- 测了什么:能力匹配后,OpenAI 与 Anthropic、以及 closed/API 与 open-weight-like,是否仍在同一题上通过率不同。单一分数、3D 范围和 7D 范围都做了。
- 数字:单一分数、398 题上,OpenAI 对 Anthropic 的 family-wise 标记为 MH 13、logistic 17;closed/API 对 open-weight-like 为 0 与 0(Table 2)。3D 分开计分后,OpenAI 对 Anthropic 变为 standard 上 logistic 2、contextual 上 MH 1,copyright 为 0。7D 中多数域为 0;cybercrime/intrusion(67 题)为 MH 2、logistic 4,misinformation/disinformation(65 题)为 logistic 1。
- 作者的解读:作者称标记减少与加总效应相符,但不确立原因。分范围能力估计用的是正在被检验的同一批题,可能吸收领域特异的开发者差异,因此发现以匹配程序为条件,不是「真实开发者差异不存在」的证据。匹配前原始通过率是 OpenAI 0.866、Anthropic 0.889、closed/API 0.776、open-weight-like 0.507(Table 4)。作者称结果不是某一组全局更安全,而是题目级组差取决于用哪个能力估计来匹配。
去掉 copyright 的随访
- 测了什么:standard 与 contextual 的相关高于它们与 copyright 的相关,因此去掉 copyright,再比一维 2PL 与把两类分到两个因子的确认性二维 2PL。对照用一维 2PL 而不是 3PL,因为二维 2PL 嵌套它。五次新的 80/20 划分,双方共享;排除训练集上恒定的题后剩 295–298 题。
- 结果:二维的留出 log-loss 为 0.278(SD 0.007),一维为 0.293(SD 0.009),五次都更低,配对降幅均值 0.0149(SD 0.0043)。Brier 为 0.0851 对 0.0891,每次划分都更好。
- 作者的解读:作者称在允许题目难度和区分度不同之后,分开 standard 与 contextual 的预测优势仍然在,这支持剩余的维度结构,但本身不确立两个实质构念。讨论中作者认为,是否复现受保护文本主要取决于训练中记住了什么,而不是是否判断请求有害后拒绝;作者认为这可能是 copyright 与另两类分得较开的原因。
其他消融与分析
- Bernoulli-null(Figure 2、附录 B):图注称橙线是与 HarmBench 形状和题目通过率匹配的随机截止;一因子加噪声下应只有第一个特征值超过它,但若干后续特征值也超过。作者称这不利于干净的一维解释,不给出精确因子数;更强的模型证据在正文 MIRT。
- 1PL 与 3PL(附录 C Table 3):一维 1PL 的 log-loss 为 0.330,好于该次运行的一维 2PL(0.470),确认性 3D 1PL 为 0.263。作者称多维需要不是题目特异斜率造成的。确认性 3D 3PL 为 0.261,主准则上不优于 3D 2PL 的 0.258。
- 更高维 3PL:探索性 4D 3PL 的 Brier 为 0.076、log-loss 为 0.262,参数 3,906。作者称这没有改善留出 log-loss 或信息准则。
- BIC 偏向 Rasch:确认性 3D Rasch 的 BIC 为 19,110,低于 3D 2PL 的 22,183。作者称不把这当成支持单一分数的证据,因为 Rasch 比较仍要三个反应过程因子才能预测得好。
- item 级对 family-wise(附录 D Table 5):单一分数、OpenAI 对 Anthropic,MH 的 item q95 为 94、FWER 为 13;logistic 为 102 与 17。作者称分开范围后,残留纹理不足以支持宽泛的 DIF 主张。
有什么可以进一步探索的点?
作者称未检验因果条件,样本是方便样本,且结论限于 HELM 对 HarmBench 的计分。
作者指出的局限与后续方向
- 未做因果检验:作者称检验的是单一 harmful refusal 是否存在,不是它是否因果地产生分数。他们称该池中的反应是多维的,单一分数解释因此不成立,所以这里不需要第二个条件(第 5 节)。
- 不固定维数:证据拒绝单一维度,并不确定维度的确切个数;三维与七维预测大致一样好,数据没有选出一个真实个数(第 5 节)。
- 方便样本:81 个模型按开发者聚集,不是从总体随机抽取;开发者组小,OpenAI 21、Anthropic 11。DIF 是关于这一快照中的这些模型,不是对任一开发者的一般主张(第 7 节)。
- 组内不独立:同一开发者的模型共享训练流程,不是独立被试,组内聚集可能放大单一分数下观察到的开发者 DIF(第 7 节)。
- 裁判与另一套计分:题目分来自两个语言模型裁判,反应矩阵继承其偏差;未通过的题反映的是裁判判定,不是 ground truth。作者未用 HarmBench 原始的、基于分类器的攻击成功率流水线复现,结论适用于 HELM 的操作化;换用原始计分时,反应矩阵、维度结构和 DIF 模式可能不同(第 7 节)。
- 二值化与单一发布:在严格阈值上把五点量表二值化,丢掉其他切分可能显出的等级。证据是一个基准的一个版本;两项检验可用于任何有题目级反应的基准,但尚未在别处展示同样结构(第 7 节)。
实验覆盖范围
- 池与筛查:HELM Safety v1.17.0 的 81 个模型、HarmBench 398 题;饱和筛查覆盖 AnthropicRedTeam、SimpleSafetyTests 与 XSTest 有害子集,平均通过率写为 0.92 到 0.94,未分数据集列出。
- IRT:探索性 2PL 的 d 从 1 到 10,确认性三维反应过程与七维危害域,以及附录 C 的 1PL/3PL。比较为五次 80/20、每次 20 个初始。论文未报告 log-loss 差异的假设检验 p 值。
- DIF:开发者比较是 OpenAI 对 Anthropic,访问类型比较是 closed/API 对 open-weight-like;范围包括单一分数、3D 与 7D,筛查为 MH 与 ridge-logistic,各 5,000 次无 DIF 模拟。作者在方法中写明未扩展到带锚题纯化的多组 IRT,因为 21 与 11 个模型下,分组题目估计、锚题选择和不确定性校准是否充分并未建立。
- 随访与计分:另做了去掉 copyright 后的一维对二维比较。题目分来自 gpt-4o-2024-05-13 与 llama-3.1-405b-instruct-turbo 的五点平均,再在 1.0 处二值化。
- 未报告的一致性:论文未报告裁判与人工判定的一致性。
总结一下论文的主要内容
作者称 HarmBench 不对应单一 harmful refusal,比较模型时应把行为分开。
这是对 HELM Safety 中 HarmBench 的构念效度审计,检查 harmful refusal 能否作为单一属性来读分数。
- 问题:安全套件把多种行为合成一个总分。作者把拒绝有害请求的倾向当作最可能的单一安全构念,问它是否存在于 HELM 的相关数据集里,以及是否单独驱动题目反应。
- 数据:v1.17.0、2026-06-21 访问。四个 harmfulness 数据集里,三个的平均通过率在 0.92 到 0.94;HarmBench 在 1.0 二值化下通过率 0.67,400 题少 2 题,分析池 81 个模型。分数来自 gpt-4o-2024-05-13 与 llama-3.1-405b-instruct-turbo。
- 做法:用多维 IRT 看一个潜在维度够不够,用能力匹配后的 DIF 看开发者是否还影响作答。主结构是 standard、contextual、copyright 三个反应过程因子;七个危害域是敏感性检查。
- 拟合:一维 2PL 的留出 log-loss 为 0.470,一维 3PL 为 0.322,确认性 3D 为 0.258,7D 为 0.255(Table 1)。作者把 3D 当作主模型,因为预测接近 7D 而 AIC、BIC 更低。去掉 copyright 后,二维仍在五次划分上低于一维(0.278 对 0.293)。作者认为 copyright 复现还混入了训练记诵,同时称剩余的维度结构本身不确立两个实质构念。
- DIF:单一分数下,OpenAI 对 Anthropic 有 MH 13、logistic 17 个 family-wise 标记(Table 2);按反应过程或危害域匹配后大体只剩个别题,cybercrime/intrusion 仍有 MH 2、logistic 4。closed/API 与 open-weight-like 的原始通过率是 0.776 与 0.507,family-wise 标记为 0。作者称标记减少与加总效应相符,但未排除领域特异的开发者差异。
- 作者的结论:作者称没有在 HELM Safety 里找到作为单一构念的 harmful refusal。他们主张,号称测量单一属性的数字,应先取得这一读法再用来比较模型;就 HarmBench 而言,心理测量证据支持的是把行为分开的窄读法。因为该池里只有 HarmBench 还在分开模型,作者认为 HELM Safety 的 harmful refusal 信号落在一个并不隔离单一属性的基准上。