研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败
Prioritizing Repeated LLM Evaluation for Hidden Failure Discovery
作者用浅层评测结果与提示词特征排序未失败提示词,在 AIRBench 上把深评预算集中到更可能出现隐藏失败的提示词。
- 基准通常对每条提示词只做少量随机生成。浅层评测没出现失败,并不等于该提示词的潜在逐次失败概率为零,有限预算下均匀加深采样成本高。
- 作者把可靠性评测写成预算约束下的隐藏失败发现。先对全部提示词做 N0=5 浅层评测,再用试次失败与提示词表示训练 XGBoost,只对零失败的未决提示词排序并优先深评。
- AIRBench 上响应级失败率在加深采样后几乎不变,但失败提示词明显增多。排序后的前 10% 未决提示词,Qwen 的隐藏失败 lift 为 2.54×,Gemma 为 1.87×。StrongREJECT 事件更稀疏,作者将其作为支持性证据。
- 作者称低分不构成安全认证,深评仍有限,且不能外推到新领域、生产流量或变更后的系统配置。证据主要来自 AIRBench 的两个模型;StrongREJECT 隐藏失败很少,bootstrap 区间在四个比较中都包含零富集。
- 模型
- Qwen 2.5 7BQwen/Qwen2.5-7B-Instruct-TurboGemma 3n E4Bgoogle/gemma-3n-E4B-itGPT-4o-miniopenai/gpt-4o-mini
- 基准
- AIRBenchStrongREJECT
- 指标
- hidden-failure lifthidden-failure recallhidden-failure prevalenceunsafe-response rateAUROCaverage precision
研究者把大语言模型的可靠性评测形式化为预算受限的发现问题,认为每个提示词都存在未知的逐次生成失败概率,浅层采样可能漏掉低概率但重要的失败。他们提出的框架先对提示词集合做浅层评测,再用试次级失败结果和提示词表征学习基于特征的失败倾向排序,把深层评测预算优先分配给浅层零失败的提示词。在 AIRBench 和 StrongREJECT 上跨多个模型与 system prompt 条件测试,AIRBench 上排名最高的 10% 未解决提示词对 Qwen 2.5 7B 取得 2.54 倍隐藏失败提升、对 Gemma 3n E4B 取得 1.87 倍,分别找回后续观测到的 25.4% 和 18.7% 隐藏失败,随机分配下预期为 10%。语义邻域与特征消融分析显示该预测信号可从多种提示词内容与关系表征中恢复。
深度解读
这篇论文试图解决什么问题?
浅层评测会漏掉低概率失败,作者要在有限深评预算下优先发现这些隐藏失败。
在推理预算有限时,如何从浅层评测未失败的提示词中,优先找出仍有非零潜在失败概率的提示词。
- 场景:作者指出,LLM 基准常含数百到数千条提示词,但每条只做少量随机生成。某条提示词在浅层样本中没有失败,仍可能在继续推理时失败;作者把固定模型、解码和评测条件下的逐次失败概率称为 latent failure probability。
- 两个目标:聚合失败频率问失败在生成中出现多频繁;提示词级发现问浅层看似成功后,失败风险藏在哪里。作者认为浅层评测或可较好估计前者,却会漏掉许多非零失败概率的提示词;对全体均匀加深采样能发现更多失败,但在大规模基准上代价高。
- 核心假设:未决提示词(unresolved prompts,浅层零失败)之间的潜在失败倾向在提示词空间中有可恢复结构。提示词派生信息因此可能指出,额外采样更可能在哪里出现失败,从而非均匀分配重复评测。
- 本文做法:提出预算化发现框架。先对提示词集合做浅层评测,再用试次级失败结果和提示词表示学习基于特征的失败倾向排序,把深评预算集中到浅层零失败、但排序较高的提示词。深评结果不参与模型拟合。
有哪些相关研究?
相关工作分随机可靠性、稀有事件、主动评测和提示词预测四类,本文转向未决提示词的预算化发现。
论文在第 2 节把相关工作分成四组。
LLM 评测与随机可靠性
- AIR-BENCH(Zeng et al., 2025):按政策导出的风险类别组织安全评测。
- StrongREJECT(Souly et al., 2024):评测有害协助与越狱有效性。
- 重复采样与尾部风险(Angell et al., 2026;Broadwater, 2026):研究随机模型下重复评测结果不同、浅层无失败仍可能有非零失败概率。作者称本文关注浅层观察结果与提示词级潜在失败倾向的区别。
稀有事件与尾部风险估计
- 统计物理稀有事件方法(Dorman et al., 2026)与重要性采样(Angell et al., 2026):把有害输出当作响应分布中的稀有事件,后者用于比直接 Monte Carlo 更高效地估计单查询有害输出概率。
- 尾部风险的统计控制(Chen et al., 2025):研究尾部风险度量的统计控制。作者称这些方法旨在估计或控制单条查询的低概率有害输出,原则上也可指导跨查询分配;本文则问浅层结果和提示词间共享结构能否在不先估计每条 pi 的情况下排序未决提示词。
主动与预算化评测
- Active testing(Kossen et al., 2021):把样本高效的模型评测写成主动测试,后续扩展包括多阶段采样(Huang et al., 2026)、代理引导的采集(Berrada et al., 2025)和近似 Neyman 分配(Liu et al., 2026)。作者称主动测试通常为高效估计模型表现而分配评测量;本文是在已完成浅层评测的提示词之间分配额外推理,以发现初次评测漏掉的失败。
提示词结构与预测特征
- 提示词 perplexity(Gonen et al., 2023):与任务表现相关,并用于提示词选择。
- 语言特征预测表现(Motger et al., 2026):用语言特征直接预测 LLM 表现。
- 对抗子空间相似性(Cox & Bunzel, 2025):在无法穷尽覆盖时,用模型相似性代理对抗子空间重叠,以引导韧性测试。作者据此问自然语言提示词之间的关系能否同样引导评测分配;目标不是预测任务准确率或挑选高表现提示词,而是识别哪些看似成功的提示词更可能在更深重复推理中暴露失败。
基线方法(第 5.1 节):random allocation、prompt length、mean top-5 similarity to shallow positives、kNN positive prevalence(k=20)、logistic regression。基准为 AIRBench(5,694 条)与 StrongREJECT(313 条)。
作者将本文定位为:在固定推理预算下,用浅层结果和提示词空间结构对未决提示词做非均匀深评,以发现浅层评测漏掉的失败,而不是先估计每条提示词的潜在失败概率,也不是估计总体模型表现。
论文如何解决这个问题?
先做 N0=5 浅层评测,用折外 XGBoost 给零失败提示词打分,再把深评预算投到高分提示词。
整体是三阶段的 budgeted discovery:浅层评测与特征构造、折外失败倾向预测、留出的深度确认。深评结果不进入模型拟合。
问题设定
固定模型、解码和评审条件下有 M 条提示词。第 i 条提示词第 j 次生成的失败指示 Yij 服从 Bernoulli(pi),pi 为潜在逐次失败概率。每条先得到 N0 次生成,浅层失败计数 Xi^(0) 为零的集合为未决总体 U。式 (4) 给出 N 次都不失败的概率为 (1−pi)^N,故有限样本中零失败并不意味着 pi=0。对 i∈U,在 Nd 次深评中至少出现一次失败的概率随 pi 增大。
作者不要求精确恢复每条 pi。令 zi 为提示词的语言、语义和关系属性,m(zi)=E[pi|zi],学习打分函数 gϕ(zi) 来近似这一关系,并按分数对未决提示词排序。
浅层评测、标签与表示
- 采样:每条提示词先做 N0=5 次随机生成。AIRBench 的深度确认为独立的 N=150 次;StrongREJECT 把浅层延伸到累计 N=25。预测阶段只能使用浅层结果。
- 二值失败:AIRBench 用 GPT-4o-mini(temperature 0,评审输出最多 200 token)给出五类操作标签。harmful、non refusal、mixed gibberish harmful 计为失败;safe coherent、纯 gibberish 和 generation error 不计。生成前有确定性预处理,把极端短、重复或符号密度高的响应标为 gibberish。提示词在深度 N 上失败,当且仅当这 N 次中至少一次失败。
- StrongREJECT:同时使用上述二值安全结果,以及官方量规 S=(1−r)(c+s−2)/8,主失败准则为 S>0,另保留 S≥0.5 作诊断。量规评审模型为 openai/gpt-4o-mini。两个准则分别建模,不合成共识标签。
- 特征:OpenAI text-embedding-3-large 的 1,024 维嵌入(只嵌入提示词文本,ℓ2 归一化)、35 个确定性文本特征、基准元数据指示(AIRBench 694 个,StrongREJECT 61 个),以及由余弦距离构造的加权对称 union-20NN 图上的 66 个关系特征。社区划分用带种子的 cosine k-means(AIRBench 48 个、StrongREJECT 24 个),社区编号本身不作预测变量。主表示 embedding+text 为 1,059 维;AIRBench 全特征 1,819 维,StrongREJECT 全特征 1,186 维。图与社区在整个已知提示词池上一次性构造,因而是 transductive 的,但不用浅层或深层响应结果。附录 C 给出特征定义。
折外排序与模型
- 主模型:XGBoost 3.2.0,binary:logistic,对数损失。每条提示词贡献 N0=5 条共享同一表示、结果独立的生成级样本,等权,无类别权重。配置固定为 120 轮、学习率 0.05、最大深度 3、最小子权重 1、行与特征子采样各 0.9、ℓ2 为 1、ℓ1 为 0、直方图建树、种子 42。无超参搜索、无早停、无事后校准。XGBoost 特征不做标准化。
- 交叉验证:五折、按 intent 分组、并用 N=5 的是否失败结果平衡折分配。同一 intent 不会同时出现在训练折和留出折。浅层结果只影响 intent 组进哪一折,不作为留出提示词的预测特征。AIRBench 的 Qwen 与 Gemma、以及 StrongREJECT 两种系统提示条件,因平衡标签不同而折分配不同。
- 排序对象:折外打分后只保留 U,即 N0=5 时失败次数为零的提示词,按预测失败倾向降序排列,分数相同用 prompt ID 打破平局。分数用于排序,作者不把它解释为校准后的单条 pi。
- 逻辑回归基线:每条提示词一行,五次浅层结果写成五次试验中的失败计数;训练折内均值填补并标准化;无惩罚截距,ℓ2 的 C=1,L-BFGS-B 最多 1,000 次迭代。邻域基线只使用训练折外的浅层正例:与五个最相似浅层正例的平均余弦相似度,以及 20 个最近训练提示词中的浅层正例比例。
预算分配与指标
对预算比例 b,选取排序最高的 Kb=⌈b|U|⌉ 条未决提示词做深评,并与随机选择及其他排序比较。主指标是入选提示词中的隐藏失败发生率、相对未决总体发生率的 lift,以及固定预算下的隐藏失败召回;AUROC 与 average precision 概括整体排序质量。AIRBench 的隐藏失败指独立 150 次运行中至少一次失败;StrongREJECT 的隐藏失败指共享的前五次无正例、新增 20 次中至少一次正例。置信区间来自对固定折外分数做 2,000 次提示词级 bootstrap 并在每次重复内重排,不重拟合模型。
论文做了哪些实验?
AIRBench 上前 10% 深评预算的 lift 为 Qwen 2.54×、Gemma 1.87×;StrongREJECT 事件稀疏。
实验设置
- 模型与条件:AIRBench 使用 Qwen 2.5 7B(Qwen/Qwen2.5-7B-Instruct-Turbo)和 Gemma 3n E4B(google/gemma-3n-E4B-it),经 Together chat completions 生成,temperature 0.2,最大补全 768 token;top p、top k、种子等未显式设置,沿用服务默认。StrongREJECT 只用 Qwen,比较有基本安全系统提示与无安全提示(后者仍保留实现附带的 /no think)。
- 数据与采样:AIRBench 默认 test 配置全部 5,694 条、314 个 intent/category,浅层与深层是独立运行(各 5 次与 150 次),不是同一次采样的延续。StrongREJECT 全部 313 条,五次浅层是累计 25 次的精确前缀,后续新增 20 次。
- 基线:random、最长优先的 prompt length、mean top-5 similarity、k=20 的浅层正例比例、同一 embedding+text 表示上的 logistic regression;另比较不同特征族。除非另述,AIRBench 主分析用 embedding+text 的 XGBoost。
- 指标与评审:隐藏失败发生率、lift、固定预算召回,以及 AUROC、average precision。AIRBench 失败由 GPT-4o-mini 的二值映射判定;StrongREJECT 另用官方量规、S>0。主验证集 200 条响应(两模型各 100),由一名作者按 AIRBench 量规盲评。
- 重复与区间:排序为五折 intent 分组折外预测;区间为 2,000 次固定分数的提示词级 bootstrap。论文未报告对攻击或评测的多次独立重跑。
主结果
浅层与深层的聚合失败率几乎不变,但被观察到会失败的提示词增多(Table 1)。
指标 Qwen 2.5 7B Gemma 3n E4B 不安全响应率 N=5 / N=150 7.50% / 7.54% 0.63% / 0.63% 正例提示词 N=5 / N=150 771 / 1,554 84 / 290 N=5 未决提示词 4,923 5,610 隐藏失败(占未决) 790(16.0%) 214(3.8%) 据 Table 1。浅层已正例的提示词在独立深评中大多仍正例:Qwen 764/771,Gemma 76/84。另有 7 条 Qwen、8 条 Gemma 在五次采样中为正、在独立 150 次中无正例。
- 十分位:Figure 2 在 N=5 零失败总体内按折外 embedding+text 分数分位。Qwen 最高风险十分位隐藏失败率为 40.8%(201/493),相对未决基线 16.0% 为 2.54×(95% CI 2.30–2.81)。Gemma 为 40/561=7.13%(图中标注 7.1%),相对 3.8% 为 1.87×(95% CI 1.34–2.36)。
- 10% 预算:Figure 3 中,按分数降序选取未决提示词。前 10% 回收 Qwen 隐藏失败的 25.4%(95% CI 23.1–28.2%)和 Gemma 的 18.7%(95% CI 13.4–23.6%),随机分配的期望为 10%。作者称优势在预算范围的相当一部分上保持,全量评测时必然汇合。
- 作者解读:分数用于优先级而非单条潜在概率的校准估计;浅层学到的信息可以把额外推理集中到更可能发现隐藏失败的位置。
基线与特征消融
Table 2 给出未决总体内、仅用 N=5 信息、10% 深评预算下的 lift。
排序方法 Qwen Gemma Random 1.00× 1.00× Prompt length(最长优先) 0.82× 1.64× Mean top-5 similarity 2.40× 1.68× 20-NN 浅层正例比例 2.31× 1.82× Logistic:embedding+text 1.63× 1.54× XGBoost:embedding+text 2.54× 1.87× XGBoost:全特征 2.50× 2.06× 据 Table 2。作者称 Qwen 上 embedding+text XGBoost 的点估计最高,但邻域基线也强;Gemma 上全特征点估计最高。邻域基线强被作者当作提示词空间假设的证据:与浅层失败提示词的关系,可预测该提示词随后是否出现隐藏失败。附录 F 称,因未保留成对方法差异检验,方法比较是描述性的。
特征消融(第 5.5 节,完整比较在附录 Table 6):Qwen 上 text-only 2.48×、语义嵌入 2.44×、关系特征 2.24×,全表示 2.50×,不高于 embedding+text 的 2.54×。Gemma 上嵌入 1.73×、text-only 1.12×,全表示 2.06×。作者称有用表示依赖模型。
StrongREJECT 稀疏事件
同一“未决集内选前约 10%”规则,全表示的结果如 Table 3(与附录 Table 8 一致)。
表格较宽,可左右滑动
条件与终点 n H h/K 入选率 Lift Recall 基本安全提示,二值安全 309 2 1/31 3.2% 4.98× 50.0% 基本安全提示,StrongREJECT-positive 305 8 2/31 6.5% 2.46× 25.0% 无安全提示,二值安全 277 21 3/28 10.7% 1.41× 14.3% 无安全提示,StrongREJECT-positive 279 16 2/28 7.1% 1.25× 12.5% 据 Table 3;Table 8 把入选率写为 3.23%、6.45%、10.71%、7.14%。附录 G 称四个比较的固定分数 bootstrap 区间都很宽且包含零富集,4.98× 来自两个隐藏失败中选中一个。作者将其视为定性旁证,统计强度不同于 AIRBench。
Table 7 的重复评测:基本安全提示下,二值安全从 N=5 的 4/313 条提示词到 N=25 的 6/313,响应从 10/1,565 到 46/7,825;StrongREJECT 终点从 8/313 到 16/313。无安全提示时,二值安全提示词从 36/313 到 57/313,StrongREJECT 终点从 34/313 到 50/313。两种自动终点的同响应一致率:有安全提示 98.8%(κ=0.387),无安全提示 95.8%(κ=0.634);Table 5 与附录 G 的 98.85%、95.82% 对应同一比较。该一致率不是人工验证。
其他消融与分析
- 人工验证(附录 A,主集 n=200):二值映射下自动与人工一致率 80.0%,Cohen’s κ=0.598,失败精度 81.1%、召回 76.0%、F1 78.5%。三档精确一致 49.0%(95% bootstrap CI 42.0–56.0%),未加权 κ=0.240,二次加权 κ=0.448;差半档以内 89.5%,200 条中 21 条为 0 与 1 对调。77 条 non refusal 中仅 3 条对应人工中间类。更早一次验证的二值一致率为 74.1%,κ=0.484。
- 排序质量(附录 F,Table 6):embedding+text 的 AUROC / AP,Qwen 为 0.699 / 0.322,Gemma 为 0.631 / 0.055;全特征 Qwen 0.690 / 0.309,Gemma 0.679 / 0.069。元数据单独在 Qwen 上 lift 1.05×、AUROC 0.534,Gemma 上 1.17×、0.551。
- 长度方向:最长优先对 Qwen 为 0.82×、对 Gemma 为 1.64×;作者称最短优先在两者上都表现差,论文未在正文给出最短优先的倍数。
- 独立采样核对:Qwen 浅层与深层共享的 28,470 个 prompt/trial 键中仅 181 条响应相同,Gemma 为 11/28,470。
- 生成错误:Qwen 的 AIRBench 深评有 4 行,Gemma 浅层有 40 行;这些行保留但不计为不安全。StrongREJECT 最终文件的生成、安全评审和量规错误均为 0。
- 特征比较性质:附录 D.7 称仓库历史不能表明报告用的特征设定是在查看深评结果之前预注册的,因此跨表示比较视为探索性而非确认性。
有什么可以进一步探索的点?
作者称低分不是安全认证,分组折外也不能外推到新领域或变更后的配置。
作者指出的局限与后续方向
- 低分与预算口径(第 6 节):风险引导分配提高固定后续预算下的隐藏失败产出,但低分不确立安全,许多观察到的隐藏失败仍在最高风险十分位之外。所报预算比例针对后续推理,不含浅层评测、表示构造、模型拟合和评审在内的总保障成本。入选提示词内的失败率不应解释为总体可靠性估计。
- 外推范围(第 6 节):证据在 AIRBench 的两个模型上最强,优先级对照的是独立深样本;StrongREJECT 是嵌套设计但事件更稀疏。分组折外预测的是留出 intent 组,不是迁移到新领域、生产流量或改变后的系统配置。观察到的结构可能特定于基准或表示。
- 测量与统计(第 6 节):失败依赖评测准则和评审,评审误差可同时影响训练与确认。深评仍然有限;Bernoulli 设定假设条件平稳且各次生成条件独立。实验确立的是优先级,不是校准的个体失败概率或最优分配规则。Bootstrap 区间以固定折外预测为条件,不捕捉重拟合变异或 intent 组依赖,因此不是成对方法优劣的检验。
- 图结构并非被证明必要(第 6 节):结果并未确立显式图结构是必要的,也未确立语义相似普遍意味着失败概率相似。
- 前瞻应用的条件(第 6 节):作者称可靠性地图可引导额外测试或对不熟悉、较高风险交互的生产控制,但这仍是前瞻应用,需要在未见过的运行数据上验证、做适当不确定性评估,并在流量或系统配置变化时重新评测。预测分数应引导证据收集,而不是替代经验验证。
- 验证与标签(附录 A.5):主人工集 200 条,单个 AIRBench 类别的例子通常少到不足以支持可靠的类别性能估计;标注者对 199/200 给出高置信,置信刻度对含糊案例几乎无区分。自动评审误差仍是测量误差来源,三档分析说明 non refusal 不应解释为 AIRBench 中间分。StrongREJECT 未对照人工判断做直接验证。结论(第 7 节)称,在所评设置内浅层观察和提示词表示可以引导去哪里收集额外可靠性证据,支持更有针对性的评测,而不是替代经验验证或对安全作认证。
实验覆盖范围
- 被测生成模型:AIRBench 为 Qwen 2.5 7B 与 Gemma 3n E4B;StrongREJECT 为同一 Qwen 的有基本安全提示与无安全提示两种条件(附录 B)。评审模型为 GPT-4o-mini / openai/gpt-4o-mini。
- 基准与规模:AIRBench 5,694 条、浅层 N=5 与独立深层 N=150;StrongREJECT 313 条、嵌套的 N=5 与累计 N=25(第 5.1 节、附录 B)。
- 主对比:随机、提示词长度、两种语义邻域启发式、logistic regression,以及多种特征族;主指标在未决提示词的 10% 预算和十分位上报告(Table 2、Figure 2、Figure 3)。
- 人工核对:AIRBench 二值终点有 200 条主验证和一次更早验证;StrongREJECT 量规没有在本研究中直接做人工验证,两个自动准则分开报告(附录 A)。
- 统计报告方式:置信区间为 2,000 次固定折外分数的提示词级 bootstrap;论文写明该区间不包含模型重拟合变异,且未保留成对方法差异检验(第 6 节、附录 F)。
总结一下论文的主要内容
浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。
作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。
做法是先对全体提示词做 N0=5 次生成,用语言、嵌入、元数据和语义邻域特征,以 intent 分组的五折折外 XGBoost 学习失败倾向;深评结果不参与拟合。随后只在浅层零失败的未决提示词中按分数分配更深采样。AIRBench 用独立的 150 次确认,StrongREJECT 用嵌套到 25 次的设计。
在 AIRBench 的 5,694 条上,Qwen 2.5 7B 的不安全响应率从 N=5 的 7.50% 到 N=150 的 7.54%,失败提示词却从 771 增至 1,554;4,923 条未决提示词中 790 条后来失败(16.0%)。Gemma 3n E4B 的响应级失败率保持 0.63%,失败提示词从 84 增至 290,5,610 条未决中 214 条后来失败(3.8%)。embedding+text 排序的最高 10% 未决提示词,lift 为 Qwen 2.54×、Gemma 1.87×,分别回收 25.4% 与 18.7% 的隐藏失败,随机期望为 10%。邻域启发式在 Qwen 上达到 2.40× 与 2.31×。StrongREJECT 上全表示的 lift 为 4.98×、2.46×、1.41× 和 1.25×,对应的隐藏失败只有 2、8、21 和 16 个,bootstrap 区间包含零富集。
作者的结论是:在所评设置内,浅层观察和提示词表示可以指出该把额外可靠性证据收集到哪里;这支持更有针对性的评测,低分并不认证安全,也不能替代经验验证。