跳到正文
原文
arXiv· arXiv:2609.36477· Jonghyun Hong·本站收录 · 原文发表

研究发现护栏模型在基座模型不确定处过度自信

Guard Models Are Overconfident Where Base Models Are Uncertain

论文速读

分析/可解释性

据论文 PDF 整理(AI 生成),以原文为准

五款 guard 在对抗输入上校准变差一个数量级,漏检常为高置信错误;对应 base LM 在多数漏检上仍更不确定。

问题
Guard 常用置信度做审核阈值,但对抗输入下这些分数是否仍可信尚未被系统检查。作者关心:清洁输入上校准较好的 guard,在越狱包装后会不会把漏检变成高置信错误。
方法
对五个 guard 与其 base LM 用同一二元 safe/unsafe 接口(guard 用原生指令,base 用 5-shot),以受限 softmax 计算置信度与 ECE。再比较攻击引起的判决 KL 偏移、漏检上的熵差,并用逐层 logit 差、PCA 与 effective rank 定位分歧。
实验与结果
清洁集上 Llama-Guard-3 与 WildGuard 的 ECE 为 0.013 与 0.004,对抗集上升至 0.308 与 0.196(Table 1)。τ=0.99 时仍有 11%–37% 的对抗有害样本成为高置信 FN(Figure 2)。四对中三对在约 80%–93% 的 guard FN 上 base 熵更高(Figure 4)。
局限与可以继续做的
作者称逐层与表示几何证据是相关性的,未做干预,也未把 base 不确定性做成校准方法。主分析排除 Llama-Guard 7B/Llama-2 对;响应审核只覆盖全为 unsafe 的对抗子集。
实验设置Llama-Guard 7B、Llama-Guard-2 8B 等 · HarmBench、StrongREJECT 等 · ECE、Accuracy 等
模型
Llama-Guard 7BLlama-Guard-2 8BLlama-Guard-3 8BWildGuard 7BShieldGemma 9BLlama-2 7BLlama-3 8BLlama-3.1 8BMistral 7BGemma-2 9B
基准
HarmBenchStrongREJECTAlpacaWildGuardMix
指标
ECEAccuracyASR-style FN fractionKL attack shift ΔASentropy gap ΔHeffective rank
AI 导读全文 254 字

研究评估了五个护栏模型在提示分类任务上的表现,发现它们在干净输入上接近校准,但对抗攻击会让校准误差恶化一个数量级,把假阴性变成与正确检测难以区分的高置信度错误。将每个护栏模型与其对应的基座大模型对比后,作者发现不确定性信号往往仍然存在,基座模型通常会在护栏模型失败的同一批输入上表现出不确定。逐层分析把这种护栏与基座的分歧定位到较后的层,护栏模型在这些层表现出更锐利的安全与不安全分离和更低秩的表示,而对抗性有害输入则更靠近干净安全区域。研究指出,攻击条件下护栏模型的置信度与基座模型的不确定性之间存在错配。

深度解读

6 个问题,约 8,400 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    Guard 在清洁输入上校准较好,对抗包装后却把漏检变成高置信错误。

    Guard 作为外部安全分类器时,其置信度在越狱输入下是否仍能支撑审核决策。

    • 部署场景:作者称,很多管线用 guard 对提示词或回复做 safe/unsafe 判定,并常以置信度阈值而非二元结论决定放行、标记或拦截。置信度与正确性不对齐会直接影响这些决策。
    • 现有不足:作者称,既有工作多关注 guard 能否检出有害内容,而不是其置信度是否可信。Liu et al. (2025) 用事后校准部分缓解越狱下的过度自信;Pinneri and Louizos (2025) 关注语义保持改写下的不稳定。作者认为这些并未通过配对的 guard–base 比较诊断对抗失校。
    • 核心观察:作者借 Nakkiran et al. (2025)、Leng et al. (2025) 等工作,假设预训练 base LM 仍保留较好校准的不确定性,而后训练会推高置信度。因此问:对抗输入本身是否含糊,还是不确定性仍在对应 base 中。
    • 本文做什么:诊断性分析,不提出校正方法。比较五个 guard 与其 base LM 在清洁与对抗提示词上的置信度、判决偏移和逐层表示,并检查响应审核是否有类似现象。
  2. 有哪些相关研究?

    相关工作分为 guard 检测、LLM 校准,以及把 base 当作校准参考的方法。

    Guardrails 与 Guard 模型

    • 内容审核 API:Perspective API(Lees et al., 2022)与 OpenAI moderation API(Markov et al., 2023)检测人类文本中的有毒内容。论文称它们不面向 LLM 交互中的越狱与不安全生成。
    • LLM 专用 guard:Llama-Guard(Inan et al., 2023)、Aegis(Ghosh et al., 2024)、MD-Judge(Li et al., 2024)、WildGuard(Han et al., 2024)、ShieldGemma(Zeng et al., 2024)按安全分类体系判定提示词或回复。评测基准包括 HarmBench、AdvBench、ToxiGen、RigorLLM。
    • 系统级框架:NeMo Guardrails(Rebedea et al., 2023)与 SafeRoute(Lee et al., 2025)处理部署路由与效率。论文称这一类工作关注检测是否正确,而不是置信度是否值得信任。

    LLM 校准与不确定性

    • 自评与后训练:Kadavath et al. (2022)、Lin et al. (2022)、Tian et al. (2023)、Xiong et al. (2024) 研究 LLM 对自身正确性的估计。Leng et al. (2025) 称后训练会系统性地推高置信度。
    • Guard 上的校准:Liu et al. (2025) 称越狱输入下 guard 严重过度自信,温度缩放、contextual calibration 与 batch calibration 可部分缓解。Pinneri and Louizos (2025) 称即使语义保持的改写也会使预测不稳,并提出自监督一致性训练。

    把 base 当作校准参考

    • 预训练保留校准:Nakkiran et al. (2025) 称语义校准是 next-token 预训练的副产物,并在 few-shot 提示下仍在。Luo et al. (2025) 称预训练表示可作为后训练模型的无监督校准器。
    • 校正方法:BaseCal(Tan et al., 2026)把后训练隐藏状态投影到 base 的表示空间;Dual-Align(Luo et al., 2026)纠正预训练与后训练之间的逐层推理漂移。论文称本文共享“base 可作校准参考”这一前提,但只做诊断比较,不提出校正方法。

    基线与数据:比较对象是各 guard 对应的 base LM(Llama-2 7B、Llama-3 8B、Llama-3.1 8B、Mistral 7B、Gemma-2 9B),不是外部防御。清洁有害来自 HarmBench 与 StrongREJECT,良性来自 Alpaca;对抗包装用 GCG、AutoDAN、TAP、PAIR、AutoDAN-Turbo 与自定义 TextGrad 攻击。响应审核用 WildGuardMix。

    作者把本文定位为:用配对的 guard–base 不确定性与内部表示比较诊断对抗失校,并认为 guard 失败反映安全判断中的表层偏置,而不只是校准不好。

  3. 论文如何解决这个问题?

    用受限 softmax 把 guard 与 base 放到同一二元接口,再比较置信度、熵差和逐层表示。

    总体思路是诊断而非校正:把每个 guard 与其对应 base LM 放进同一套二元 safe/unsafe 接口,先看对抗包装如何改变 ECE 与漏检置信度,再看 base 是否在同一输入上仍更不确定,最后用逐层 logit 与隐藏状态几何定位分歧。

    二元接口与校准定义

    • 判定方式:Guard 是建在 LM 上的安全分类器。给定用户提示词 x,预测 ŷ(x)∈{safe,unsafe}。本文只做提示词分类:在送入下游模型之前判断输入本身是否应该被拦截。
    • 受限 softmax:分类由自回归生成实现,模型按指令或安全策略生成 safe/unsafe 或 allow/block 等标签 token。设决策位置上两个标签的 logit 为 z_safe、z_unsafe,则 punsafe(x)=exp zunsafe/(exp zsafe+exp zunsafe),(p_{\mathrm{safe}}=1-p_{\mathrm{unsafe}})。这个分布只衡量二元决策的置信度,不是全词表上的绝对概率质量。
    • 置信度与 ECE:置信度 c(x) 是预测标签的概率。清洁良性标为 safe,清洁有害标为 unsafe;对抗提示词即使被越狱包装,其底层有害行为仍标为 unsafe。ECE 把置信度分成 B 个 bin,对每个 bin 取准确率与平均置信度之差的加权绝对值。
    • 标签词表:Llama-Guard 家族用 safe/unsafe;ShieldGemma 9B 与 WildGuard 7B 用 Yes/No,均按各自官方指令模板。Guard 使用原生安全指令与 chat 模板,有官方策略文本或分类体系时一并使用。

    数据、攻击与 base 接口

    • 清洁池:713 条有害提示词来自 HarmBench 与 StrongREJECT,500 条良性提示词来自 Alpaca,共 1,213 条。标签继承源行为:前两者为 unsafe,Alpaca 为 safe。
    • 对抗池:对有害提示词施加 GCG、AutoDAN、TAP、PAIR、AutoDAN-Turbo 以及自定义 TextGrad 攻击,得到 3,965 条对抗有害提示词。论文称这些攻击覆盖基于梯度、模板与 LLM 的策略。
    • Base 接口:Base LM 用 5-shot 二元分类提示词,含 3 个 safe 与 2 个 unsafe 示范。作者称这是因 Nakkiran et al. (2025):预训练模型在 few-shot 下仍保留校准置信度。对 guard 与 base,置信度都在决策位置对两个标签 token 做受限 softmax。附录 A 给出完整提示词,并分析判决 token 的有效性及换用 base 接口的稳健性。
    • 排除一对:后续配对分析排除 Llama-Guard 7B/Llama-2 7B。作者称 Llama-2 在对抗集上有强烈的 unsafe 预测偏置。

    攻击敏感度与熵差

    • 判决偏移:对清洁有害提示词 x 与其攻击版本 T(x),用 KL(D_M(x) ∥ D_M(T(x))) 衡量偏移,其中 D_M 是 Bernoulli(p_unsafe)。攻击敏感度 AS 是样本上该偏移的均值,差距 ΔAS = AS_guard − AS_base,正值表示 guard 偏移更大。
    • 限制条件:只保留 base 与 guard 都对清洁提示词给出高 unsafe 概率(≥ 0.9)的样本,以减少清洁输入上初始不一致的混淆。
    • 熵差:二元熵 H_M(x) 是判决分布在 {safe, unsafe} 上的香农熵。在 guard 把地面真值为 unsafe 的对抗提示词判成 safe 的样本上,计算 ΔH = H_base − H_guard。正值表示 base 更不确定。

    逐层 logit 与表示几何

    • 逐层 unsafe 概率:在第 ℓ 层,把判决位置的隐藏状态经过最终 RMSNorm 与 LM head,再对两个判决 token 做受限 softmax,得到 p_unsafe^(ℓ)。比较的是 p_base^(ℓ) − p_guard^(ℓ)。
    • 两组输入:一组是清洁有害输入;一组是对抗假阴性,且限定 base 预测 unsafe、guard 预测 safe。
    • PCA:对最后一个 token 的隐藏状态做前两主成分投影,每个子图独立拟合。三类为 clean safe、clean harmful、adversarial harmful。展示 Llama-Guard-3 与 WildGuard 及其 base,取 32 层中的第 3 层与第 30 层。
    • Effective rank:按 Roy and Vetterli (2007),对中心化 Gram 矩阵的归一化特征值计算有效秩。图中比较四对 guard/base、清洁与对抗输入随相对深度的变化。
  4. 论文做了哪些实验?

    五个 guard 的对抗 ECE 升一个数量级;多数 FN 上 base 熵更高,分歧出现在后层。

    实验设置

    • 模型:Guard 为 Llama-Guard 7B、Llama-Guard-2 8B、Llama-Guard-3 8B、WildGuard 7B、ShieldGemma 9B。对应 base 为 Llama-2 7B、Llama-3 8B、Llama-3.1 8B、Mistral 7B、Gemma-2 9B。
    • 提示词数据:清洁池 1,213 条(713 有害来自 HarmBench 与 StrongREJECT,500 良性来自 Alpaca)。对抗池 3,965 条,由六种攻击作用于有害提示词得到。
    • 指标:准确率为预测标签是否与地面真值一致;置信度为预测标签概率;ECE 按第 3 问中的分 bin 定义。另有攻击敏感度 ΔAS、熵差 ΔH、逐层 unsafe 概率差与 effective rank。
    • 评审:不使用外部评审模型。标签由源行为继承;对抗样本仍标为 unsafe。论文未报告 ECE 的 bin 数、重复次数与随机种子。
    • 配对分析范围:Figure 3–7 的逐对分析排除 Llama-Guard 7B/Llama-2 7B。响应审核在附录 D,用 WildGuardMix 响应;规模分析在附录 C。

    主结果

    据 Table 1,同一二元接口下的准确率与 ECE:

    表格较宽,可左右滑动

    模型Clean AccClean ECEAdv AccAdv ECE
    Llama-2 7B(base).634.275.992.051
    Llama-Guard 7B.815.142.284.578
    Llama-3 8B(base).920.023.746.034
    Llama-Guard-2 8B.939.045.478.405
    Llama-3.1 8B(base).903.037.835.062
    Llama-Guard-3 8B.979.013.597.308
    Mistral 7B(base).935.102.802.116
    WildGuard 7B.989.004.767.196

    ShieldGemma 9B 的 clean/adv 准确率为 .622/.216,ECE 为 .325/.684;其 base Gemma-2 9B 为 .906/.930 与 .084/.048(Table 1)。表中省略这一对是为保持行数上限,数字已在此写出。

    • 作者称,安全微调通常提高清洁集准确率,但这一收益不转移到对抗校准。Llama-Guard-3 的对抗 ECE 从 base 的 0.062 升到 0.308;WildGuard 从 0.004 升到 0.196,幅度较小但方向一致。
    • ShieldGemma 是例外:清洁准确率已低于其 base,作者将其视为更广的 guard 失败,而不只是对抗校准效应。Llama-2 在对抗集上准确率 .992、ECE .051,作者称这反映强烈 unsafe 偏置,因此排除该对的后续配对分析。
    • Figure 1 给出五个 guard 的可靠性图:清洁 ECE 依次为 0.142、0.045、0.013、0.004、0.325;对抗 ECE 为 0.578、0.405、0.308、0.196、0.684。作者称过度自信集中在最高置信度 bin。

    高置信度假阴性

    • 测了什么:Figure 2 上半部分是汇总对抗有害集上 TP 与 FN 的置信度密度。作者称五个 guard 的 FN 密度都集中在高置信度一端,与 TP 大量重叠,而不是集中在 0.5 附近。图中标注的样本量:Llama-Guard TP 1127、FN 2838;Llama-Guard-2 TP 1896、FN 2069;Llama-Guard-3 TP 2367、FN 1598;WildGuard TP 3040、FN 925;ShieldGemma TP 856、FN 3109。
    • 阈值:下半部分是置信度 ≥ τ 时仍保持 TP 或 FN 的对抗有害样本比例。图上标注:τ=0.99 时 Llama-Guard 仍有 17% FN(另有 47% 标注),Llama-Guard-2 为 17% 与 33%,Llama-Guard-3 为 11% 与 26%,WildGuard 为 12% 与 18%,ShieldGemma 为 37% 与 62%。正文将 τ=0.99 的 FN 写为 Llama-Guard-3 11%、WildGuard 12%、ShieldGemma 37%。
    • 作者的解读:作者称,提高阈值会同时滤掉 TP 与 FN,不能单独去掉漏检;“不确定就弃权”无法拯回这些漏检。ShieldGemma 的 FN 置信度分布更宽,作者认为这反映其对抗准确率低,而不是可靠的不确定性。

    攻击敏感度与 guard–base 熵差

    • 判决偏移:Figure 3 在双方都对清洁提示词给出 ≥ 0.9 unsafe 概率的子集上,比较 KL(p_clean ∥ p_adv)。图上 ΔAS 为 Llama-Guard-2 +2.23、Llama-Guard-3 +1.71、WildGuard +1.79、ShieldGemma +4.91。作者称,同一有害内容只被对抗包装改写后,guard 的安全判决偏移远大于 base,因此认为 guard 对表层上下文更敏感。
    • 熵差:Figure 4 在 guard FN 上给出 Pr(ΔH>0):Llama-Guard-2 82%、Llama-Guard-3 80%、WildGuard 93%、ShieldGemma 51%。作者称,前三者在大多数漏检上 base 更不确定;ShieldGemma 接近一半,与第 4.2 节所说的更广校准失败一致。
    • 作者的解读:Guard 对攻击敏感,但失败时并不相应提高不确定性;在 guard 高置信地预测 safe 的输入上,base 通常更不确定。

    逐层分歧与表示几何

    • Logit 差:Figure 5 的样本量为 Llama-Guard-2 n=1323、Llama-Guard-3 n=1138、WildGuard n=632、ShieldGemma n=2840。作者称,清洁有害输入上 p_base − p_guard 接近零或略为负;对抗 FN 上该差在后层反转并增大,最终层约为 Llama-Guard-3 0.45、WildGuard 0.7、ShieldGemma 0.9。作者称分歧出现在最后约三分之一的层,而不只在输出层。
    • PCA:Figure 6 展示 Llama-Guard-3 与 WildGuard 及其 base 在第 3/32 层与第 30/32 层的前两主成分。作者称:base 在早层与晚层上 clean safe、clean harmful 与 adversarial harmful 大体混在一起;guard 在晚层把清洁 safe 与清洁 harmful 分开,但对抗有害输入更靠近 clean-safe 一侧。这是作者对图的解读;纯文本转换看不到点的位置。
    • Effective rank:Figure 7 中,作者称倒数第二层的 base 对 guard 有效秩比约为 Llama-Guard-2 1.4×、Llama-Guard-3 1.7×、WildGuard 3.4×、ShieldGemma 4.0×。作者称,压缩后的子空间能分开清洁输入,但表层像安全内容的对抗有害输入会落到 clean-safe 一侧,guard 在此不表达不确定性。

    其他消融与分析

    • 分攻击可靠性图:Figure 8 给出五个 guard × 六种攻击的 ECE。可读到的标注中,Llama-Guard-3 为 0.01、0.02、0.37、0.45、0.39、0.55;WildGuard 为 0.01、0.00、0.28、0.33、0.15、0.34;ShieldGemma 为 0.61、0.48、0.72、0.78、0.71、0.81。每格 n 为 400 或 713。纯文本未标出每个 ECE 对应哪种攻击,也未给出 Llama-Guard 与 Llama-Guard-2 的分攻击 ECE。
    • 响应审核:附录 D 在 WildGuardMix 响应上测五对。作者称五个 guard 的对抗 ECE 为 .346–.788,清洁 ECE 为 .081–.182;Llama-Guard-2、Llama-Guard-3、ShieldGemma 的对抗 ECE 高于其 base。对抗子集只含 unsafe 响应,作者将其视为有害响应审核的检查,而不是完整响应校准评估,并避免对 Llama-2 与 Mistral 下配对结论,因为二者清洁准确率低、对抗准确率近乎完美,表明有强烈 unsafe 偏置。Table 6 的逐格数字在所读文本中未展开。
    • 规模:作者称附录 C 检查 guard–base 模式是否跨规模保持。所读文本未给出附录 C 的具体数字。
    • 接口稳健性:附录 A 分析判决 token 有效性与替代 base 接口。所读文本未给出这些分析的数字。
  5. 有什么可以进一步探索的点?

    证据是相关性的;作者未把 base 不确定性做成校准方法。

    作者指出的局限与后续方向

    • 相关而非因果(Limitations):作者把分歧定位到后层,并描述了相伴的表示几何,但称证据是相关性的。Logit 差、更尖锐的 safe/unsafe 边界与更低秩子空间都与高置信失败一同出现,作者并未对这些量做干预。
    • 机制尚未建立(Limitations):作者称,还不能说明这种几何产生了误分类,而不只是与误分类共现。建立机制需要因果干预,例如对找到的方向做消融或 steering。
    • 只做诊断(Limitations):作者称,工作是诊断性的。Base 不确定性在 guard 置信度失败处仍有信息,但未把该信号变成校准方法,也未刻画这一差距在什么条件下可以被弥合。
    • 结论中的使用方向(Conclusion):作者认为 guard 不应只按检测准确率评估,还应看置信度在攻击下是否仍可信;base 不确定性是校准感知型 guardrail 可以使用的一种信号。

    实验覆盖范围

    • 主实验模型:五个 guard 与五个对应 base(Section 4.1、Table 1)。Figure 3–7 的配对分析排除 Llama-Guard 7B/Llama-2 7B(Section 4.2)。
    • 提示词分类数据:清洁 1,213 条(HarmBench、StrongREJECT、Alpaca);对抗 3,965 条,攻击为 GCG、AutoDAN、TAP、PAIR、AutoDAN-Turbo 与自定义 TextGrad(Section 4.1)。
    • 响应审核:附录 D 在 WildGuardMix 响应上比较五对的准确率与 ECE。作者称对抗子集只含 unsafe 响应,因此不作完整响应校准评估。
    • 分析粒度:逐层分析覆盖四对(Figure 5、7);PCA 只展示 Llama-Guard-3 与 WildGuard(Figure 6)。论文未报告 ECE 的 bin 数与实验重复次数。
    • 作者说明不适用的结论:附录 D 避免对 Llama-2 与 Mistral 下响应审核的配对结论,因为二者低清洁准确率与近乎完美的对抗准确率表明强烈 unsafe 预测偏置。
  6. 总结一下论文的主要内容

    对抗包装使 guard 高置信漏检,而对应 base 在同一输入上常更不确定。

    诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。

    • 问题:部署中常用置信度阈值决定放行或拦截。作者要区分的是,对抗输入本身含糊,还是对应 base LM 仍保留不确定性。
    • 做法:Guard 用原生安全指令,base 用 3 safe + 2 unsafe 的 5-shot 提示词,二者都对两个判决 token 做受限 softmax。比较准确率、ECE、攻击引起的判决 KL 偏移,以及 guard 假阴性上的熵差;再用逐层 unsafe 概率、PCA 与 effective rank 看后层表示。
    • 主数字:Table 1 中 Llama-Guard-3 的 ECE 从清洁 0.013 到对抗 0.308,WildGuard 从 0.004 到 0.196,ShieldGemma 从 0.325 到 0.684。Figure 2 中 τ=0.99 时,Llama-Guard-3、WildGuard、ShieldGemma 仍分别把 11%、12%、37% 的对抗有害样本留作高置信 FN。Figure 4 中,这些 FN 上 base 熵更高的比例为 Llama-Guard-2 82%、Llama-Guard-3 80%、WildGuard 93%,ShieldGemma 为 51%。
    • 内部定位:作者称差距在后层拉大,最终层约为 Llama-Guard-3 0.45、WildGuard 0.7、ShieldGemma 0.9(Figure 5);倒数第二层 base/guard 有效秩比约为 1.4× 到 4.0×(Figure 7)。对抗有害输入被作者描述为更靠近 clean-safe 一侧。
    • 作者的结论:失败不只是输入含糊,因为 base 在同一漏检上通常更不确定。Guard 应同时按准确率与攻击下的置信度可信度来评估。作者明确说这些几何证据是相关性的,并未把 base 不确定性做成校准方法。
阅读原文arxiv.org