研究者用项目反应理论将安全基准评测成本降低 80% 至 99.9%
Efficient Safety Benchmarking via Item Response Theory
六个安全基准上,IRT自适应选题在AIR-Bench 2024 k=6时Agreement为0.91,作者称节省99.9%
- 安全基准通常对所有模型施测全部题目并做简单平均。作者称全量跑现代基准大约需要10^5次响应,多数题目提供的排序信号很少。
- 用2PL把安全与不安全响应建成潜在能力、难度和区分度。自适应按当前能力选Fisher信息最大的题;静态子集跨模型复用。Agreement用Spearman ρ比较子集表现与全量安全分排序。
- 六个基准上2PL与安全分的Spearman ρ为0.97–1.00。AIR-Bench 2024在k=6时Agreement为0.91,作者称自适应省99.9%、静态省99.8%。HarmBench上随机与IRT相当。
- 作者称安全未必是单一潜在特质,二元化丢掉severity与不确定性,研究限于一次性设定。实验覆盖六个英文基准;论文未报告模型名称与评审模型名。
- 基准
- AIR-Bench 2024Anthropic Red TeamHarmBenchSafetyBenchSimpleSafetyTestWMDP (Bio)
- 指标
- Agreement(Spearman's ρ)safety scorelatent safety ability θRMSEcoefficient of variation(CV)
研究者分析六个常用安全基准,提出用项目反应理论(IRT)提升安全评测效率。IRT 能在原始安全指标上模型聚集于上限时,仍区分出模型间的能力差异。基于模型回答动态选择信息量高的题目的自适应选题,可在 Spearman's ρ > 0.90 的条件下逼近全基准排名,在每个可达该阈值的基准上至少降低 80% 评测成本,在 AIR-Bench 2024 上最高降低 99.9%。作者还给出提取固定高信息量题目子集的流程,作为自适应选题的静态替代方案,在各基准上节省 80% 至 99.8%。
深度解读
这篇论文试图解决什么问题?
安全评测等权计分,大量响应排序信号很少,作者用IRT做自适应与静态选题。
全量安全评测把题目等权处理,多数响应提供的排序信号很少。
- 场景:作者称安全基准混有直接有害请求、对抗提示、拒答稳健性、多语言安全题和生物武器增益知识,题目信息量并不相同。作者称按现行流程跑完现代基准套件,响应数在10^5量级。
- 现有不足:论文所述基准对所有模型统一施测,分数是二元或阈值判断的简单平均。作者称据其所知,此前没有工作用题目级心理测量结构降低安全评测成本。
- 核心观察:只有模型之间会分歧的题目携带有意义的排序信号。能力基准上少于10%的题目决定大部分排行榜(Rodriguez et al., 2021)。作者用IRT的难度与区分度刻画这种不对称。
- 提出的程序:把Hofmann et al.(2025)的Fluid Benchmarking扩到六个安全基准,并增加三种IRT静态子集方法,以及改编自Anchor Points与DISCO的两种非IRT方法。
有哪些相关研究?
相关工作分为安全基准、评测降本与IRT三类,作者把Fluid Benchmarking扩到安全评测。
论文第2节把相关工作分成三类,并把本文放在安全评测降本而不是新伤害基准上。
安全基准
- 拒答与越狱:直接伤害拒答包括Mazeika et al.(2024)、Vidgen et al.(2024)、Wang et al.(2024a)、Xie et al.(2025)、Ganguli et al.(2022);良性提示过度拒答有Röttger et al.(2024);越狱稳健性有Souly et al.(2024)、Zou et al.(2023)、Chao et al.(2024)。
- 分类、毒性与智能体:风险分类覆盖包括Zeng et al.(2024)、Zhang et al.(2024)、Li et al.(2024);真实用户毒性包括Lin et al.(2023)、Ji et al.(2023)、Han et al.(2024);智能体工具使用包括Zhan et al.(2024)、Andriushchenko et al.(2025)。
- 聚合榜:HELM Safety(Liang et al., 2023; Kaiyom et al., 2024)与TrustLLM(Huang et al., 2024)把子集收成多任务榜。论文指出这些基准都统一施测,并用二元或阈值判断做简单平均。作者称据其所知,此前没有工作用题目级心理测量结构降低安全评测成本。
评测降本
- tinyBenchmarks(Polo et al., 2024):在MMLU等榜上拟合IRT,用小锚点集估计全量分数。
- Anchor Points与DISCO:Vivek et al.(2024)按类别条件的模型一致性聚类后取medoid;Rubinstein et al.(2026)选使类别条件概率的Jensen-Shannon散度最大的题。论文称二者依赖这类概率,closed-weight模型往往不提供。
- Fluid Benchmarking(Hofmann et al., 2025):把IRT与计算机化自适应测试用于能力基准,并给出基于跨基准准确率的效度指标。论文称安全设定不同:对齐响应稀疏、天花板效应重;伤害维度异质,跨基准效度不适定;区分度差异大。
IRT与自适应测试
- 经典模型:用潜在能力及题目难度、区分度刻画作答(Lord, 1980; Embretson & Reise, 2000; Baker & Kim, 2004)。
- 语言模型:Lalor et al.(2019)与Rodriguez et al.(2021)用IRT看数据质量、标注者行为和基准信息量。
- CAT:按当前能力估计逐题选择信息最大的题(Meijer & Nering, 1999; Magis et al., 2017)。作者称这种自适应测试在异质安全基准上仍然有效,拟合参数还可诊断冗余、排序分辨率和评测成本。
基线方法为Random(均匀抽样后用安全分)和Random IRT(同样抽样后用MAP能力)。基准为Table 1的六个安全基准。
作者把本文定位为:把Fluid Benchmarking从能力评测扩到安全评测,并补上可跨模型复用的静态子集。
论文如何解决这个问题?
用2PL拟合二元安全矩阵,再按Fisher信息自适应选题或抽出可复用静态子集。
整体用2PL IRT刻画安全/不安全响应,再用Fluid Benchmarking按模型自适应选题,或抽出与模型无关的静态子集。
数据与2PL
- 六个基准:Table 1。形式包括开放生成、选择题和分级政策违规。本文只做一次性、英文题;多语言提示被丢掉。
- 二元化:HELM Safety四个基准中,评审给出最高安全类别记为1,否则为0。选择题把与安全一致的选项记为1。WMDP (Bio)里答对对应不安全,因为题目探测与生物武器增益相关的生物学知识。
- 模型:矩阵X的行是模型、列是题目,xmj=1为安全响应。模型m对题目j安全作答的概率为 P(xmj=1 | θm, aj, bj) = σ(aj(θm − bj)),σ为logistic函数。θm是潜在安全能力,bj越高表示较安全的模型也更常不安全作答,aj越大表示越能分开模型。安全分是经验安全比例;二者都是安全对齐行为的汇总,不是相对标准答案的正确率。
- 不用1PL:1PL强制区分度相同,而安全题的区分度变化大。
自适应选题
- 循环:Algorithm 1从θ̂=0、已选题为空开始,在预算K内选题、观察响应并更新θ̂。选择准则可以是Random或最大Fisher信息,估计器可以是IRT或平均安全分。
- Fluid Benchmarking:在预校准IRT上做MAP,每步选未选题里Fisher信息最大者。信息为aj的平方乘以Pj乘以(1-Pj),因此偏向与当前能力匹配且aj大的题。
- 与效度指标的差别:作者称安全基准并不测量统一的潜在能力,跨基准效度不适定,因此不用Hofmann et al.的跨基准准确率,而改用基准内排序一致性。
静态子集
- 共同设定:子集事先固定,所有模型用同一批题。作者写的交换是,个别模型可能分到信息较低的题。训练模型的θm来自用全部题目做的MAP。
- 三种IRT方法:Total Fisher按训练模型上Fisher信息之和从高到低取前k题。Marginal Fisher贪心加入最能降低各训练模型能力标准误之和的题;标准误用最大似然标准误近似MAP标准误。b四分位版本先按bj分箱,再轮转选取,使难度覆盖大致成比例。
- Anchor Point改编(Appendix D):用训练模型分数向量的Pearson相关建距离,再做K-medoids;子集分数按medoid代表的题目数加权。作者注明该选择不随k单调嵌套。
- DISCO改编:按安全作答率的二元熵从高到低加题。原方法需要类别条件概率,这里改为只用0/1分数。
拟合与Agreement
- 拟合:附录B沿Hofmann et al.(2025),用py-irt(不低于0.7.0)做随机变分推断。论文写训练1.000个epoch,Adam学习率0.1。aj先验为Log-Normal(0, 1),bj为Normal(0, 1)。
- MAP:先验Normal(0, 1),阻尼Newton-Raphson,单步变化不超过1.0;100次内若未收敛,则在[-8, 8]上二分,最多200次。
- 过滤:丢掉跨模型响应方差不高于0.01的题;方差按二项分布计算。
- Agreement:子集表现P与全量安全分R的Spearman ρ。IRT类方法的P是MAP能力,Anchor Point与DISCO的P是安全分,R一律是全量安全分。ρ接近1表示k道题能复现模型间的安全排序。
论文做了哪些实验?
2PL与安全分Spearman ρ为0.97–1.00,AIR-Bench 2024 k=6时Agreement为0.91
实验设置
- 基准规模(Table 1):AIR-Bench 2024为82个模型、5,694题、467k条观测;Anthropic Red Team为77、1,000、77k;HarmBench为77、400、30.8k;SafetyBench为29、11,435、333k;SimpleSafety为77、100、7.7k;WMDP (Bio)为29、1,273、36.9k。
- 分数来源:前四个中除SafetyBench外,以及SimpleSafetyTest,分数来自HELM Safety。SafetyBench与WMDP由作者用zero-shot选择题脚本经OpenRouter自测,29个模型,约100美元,一天。论文未报告模型名称,也未报告LLM评审的名称。
- 编码:只评英文。HELM类基准把最高安全类别记为1;选择题把安全一致选项记为1。WMDP (Bio)中答对记为不安全。
- 方法与基线:Fluid Benchmarking、Total Fisher、Marginal Fisher、b四分位Marginal Fisher、改编Anchor Point、改编DISCO;基线为Random与Random IRT。
- 指标:Agreement定义见第3问。Table 2的数字是70–100次随机训练-测试划分的平均;每次留出10个测试模型,只在测试模型上算Agreement。论文未写哪个基准是70次、哪个是100次。
- 扫描:k按对数间隔扫描,作者称表中k偏保守,真实交叉点可能更小。施测前已丢掉响应方差不高于0.01的题。
主结果
论文未给出分模型分数表。下表为Table 2左列:Fluid Benchmarking首次达到90% Agreement的k;SafetyBench该列因随机方法已优于其他方法而停止扫描。
表格较宽,可左右滑动
基准 左列k k/N Fluid Random Random IRT AIR-Bench 2024 6 0.1% 0.91 0.73 0.74 Anthropic Red Team 51 5% 0.91 0.78 0.79 HarmBench 17 4% 0.90 0.92 0.91 SafetyBench >3,000 >26% 0.82 0.97 0.97 SimpleSafety 20 20% 0.91 0.75 0.75 WMDP 78 6% 0.90 0.86 0.80 - 阈值口径:摘要写自适应选题近似全量排序(Spearman ρ > 0.90)。Table 2把Fluid首次达到90% Agreement的k当作压缩点。作者称Fluid跨基准最一致;如表,HarmBench左列随机不低于Fluid,SafetyBench左列随机高于该列其余方法。
- 作者给出的节省:假设成本与题数成正比。AIR-Bench 2024上,达90% Agreement时自适应节省99.9%、静态节省99.8%。摘要写凡能达到该阈值的基准至少节省80%,静态节省80–99.8%。正文称其余达到90%的基准上,自适应节省80%到95%、Marginal Fisher节省80%到92%,两处均不含HarmBench。引言写若干基准上超过一个数量级;结论写高区分度方差基准上约两个数量级。
- 同表中的其他对比:AIR-Bench 2024右列k=38时,Marginal Fisher为0.95、Fluid为0.94。Total Fisher在Anthropic Red Team左列k上为0.68。HarmBench左列Anchor Point为0.94。作者称HarmBench上模型间方差低,随机也能压到相近Agreement。
能力估计与天花板
- 排序:Figure 2中每个点是一个模型。作者称2PL在每个基准上恢复安全分排序,Spearman ρ在0.97到1.00;图注写安全分高于0.95时,IRT能力仍能分开模型。
- Anthropic Red Team:67/77个模型安全分高于0.95,θ从1.19到6.06。作者举安全分0.957与0.999仍可相差近五个标准差单位。
- 其余基准:HarmBench有19个模型的安全分在0.95到1.00之间,能力值分布更开。AIR-Bench 2024、SafetyBench、WMDP-Bio没有安全分高于0.95的模型。SimpleSafety也有同样的天花板分离,规模更小。
区分度与选题曲线
- CV(Figure 3):WMDP-Bio 0.97、SafetyBench 0.93、AIR-Bench 2024 0.92、Anthropic Red Team 0.69、HarmBench 0.61、SimpleSafety 0.46。作者把前三个称为低中位数加稀疏高区分度尾,中间两个为中等散布,SimpleSafety较均匀。
- 作者的诊断:CV高时,自适应更有机会用到少数高区分度题;CV低时,最大Fisher信息相对随机的空间较小。作者同时写这解释不完全:SimpleSafety的CV低,IRT仍优于随机;HarmBench的CV中等,随机与IRT相当。
- AIR-Bench 2024曲线(Figure 4):作者称自适应在小k上高于其他方法,随机约在k=50与其他方法靠近;Random与Random IRT几乎分不开。阴影是各次划分均值的1个标准差。论文未给出该标准差的数值。
其他消融与分析
- 附录E题目级RMSE:Anthropic Red Team 0.008,SimpleSafety 0.014,HarmBench 0.016,AIR-Bench 2024 0.017,SafetyBench 0.037,WMDP-Bio 0.038;§4.1称各基准至多0.04。
- Table 2右列k(随机追上Fluid之前的最大扫描点):AIR-Bench 2024为38(0.7%),Anthropic Red Team为260(26%),HarmBench为9(2%),SafetyBench为68(0.6%),SimpleSafety为63(63%),WMDP为234(18%)。
- 右列Agreement:SimpleSafety上DISCO为1.00、Anchor Point为0.99、Fluid为0.98;SafetyBench上b四分位Marginal Fisher为0.84、Anchor Point为0.79、Fluid为0.70、Random为0.70。
- SafetyBench左列:b四分位Marginal Fisher为0.91、Anchor Point为0.92、DISCO为0.91,高于Fluid的0.82。
- 作者称SafetyBench上随机约在k=556达到90% Agreement,快于其他方法;k=19时IRT约0.71、随机约0.46(附录F)。
- 附录F给出六个基准的Agreement曲线。作者称自适应通常在低样本区更快靠近全量排序。图注未给出曲线端点数值。
有什么可以进一步探索的点?
作者指出单维潜变量、二元化与范围约束,并希望未来做多维IRT与智能体设定。
作者指出的局限与后续方向
- 单一潜在特质:作者写安全未必是单一潜在特质,例如对直接有害请求稳健仍可能易受提示注入,暴力、自伤、欺骗等类别上的表现也常不同。作者称这促使未来引入多维IRT(§5 Limitations)。
- 二元化:流程把有序安全判断压成0/1,丢掉severity与不确定性。作者称扩展到graded-response或连续IRT会更忠实,并可能改善校准与排序(§5 Limitations)。
- 范围:作者称研究受范围约束,希望未来测试更全面的基准和模型,并探索智能体而非一次性设定。作者称这些结果不是对安全评测的最终评估(§5 Limitations)。
实验覆盖范围
- 实验用Table 1的六个基准:模型数分别为82、77、77、29、77、29,题目数分别为5,694、1,000、400、11,435、100、1,273。
- AIR-Bench 2024、Anthropic Red Team、HarmBench、SimpleSafetyTest的分数来自HELM Safety;SafetyBench与WMDP由作者自测。论文未报告模型名称,也未报告LLM评审名称,以及评审与人工判断的一致性。
- 只使用英文提示。比较对象为Fluid Benchmarking、三种Fisher静态法、改编的Anchor Point与DISCO、Random与Random IRT。
- 每个基准留出10个测试模型,Agreement对70–100次随机划分取平均。论文未写各基准对应的划分次数,也未报告响应耗时;§4.3.1的节省按题目数线性缩放写出。
- 响应被编成一次性的0/1。WMDP (Bio)中答对记为不安全。拟合与静态子集使用训练模型;附录B给出py-irt拟合设置。
总结一下论文的主要内容
作者称IRT可在六个安全基准上以少题近似全量排序,静态子集可跨模型复用。
作者把IRT和计算机化自适应测试从能力评测接到安全基准的降本流程上。
- 问题:统一施测加简单平均会在异质安全题上花掉大量低信息响应。作者称全量规模在10^5量级,有排序信号的主要是模型之间会分歧的题。
- 做法:用2PL拟合安全/不安全矩阵,得到潜在安全能力、难度和区分度。自适应流程每步选Fisher信息最大的题;Total Fisher、Marginal Fisher及其难度四分位约束抽出固定子集。Anchor Points与DISCO被改到只有二元分数的情形。Agreement是子集表现与全量安全分的Spearman ρ。
- 拟合:六个基准上,2PL能力与安全分的Spearman ρ在0.97到1.00。Anthropic Red Team上67/77个模型安全分高于0.95,θ仍从1.19到6.06。题目级RMSE至多0.04。
- 压缩:AIR-Bench 2024上,Fluid Benchmarking在k=6、即全量0.1%时Agreement为0.91;作者称此阈值下自适应节省99.9%、静态节省99.8%。摘要写凡能达到ρ > 0.90的基准至少节省80%。Table 2里,SimpleSafety达到90% Agreement时k/N为20%,WMDP为6%,Anthropic Red Team为5%。
- 例外:HarmBench上随机选题与IRT方法相当。SafetyBench在Table 2左列停止扫描时,Fluid的Agreement为0.82,Random为0.97。作者称CV不能解释全部差异。
- 作者的结论:至少对本文的一次性基准,IRT的潜变量假设看起来合理。区分度方差高时自适应更有空间。作者建议反复、昂贵的评测用IRT;一次性或题目很少时,校准开销可能不值得,直接跑全量可避免引入模型假设。自适应偏向排序保真,静态偏向跨模型复用。