论文发现安全监控器主要拦截模型本就会拒答的请求
Safety Monitors Mostly Catch What the Model Already Refuses
作者评估发现安全监视器多拦截模型已拒答的请求;在Gemma-4-31B-IT回答的L1间接请求上,四种守卫召回率仅.04–.55。
论文指出其研究的失效在没有攻击者(with no attacker at all)的自然重述(natural rewording)下即可发生。
- 安全监视器通常按有害基准的全量召回率评估,但对模型本就会拒答的请求进行拦截并无增益,只有在模型实际会回答的有害请求上漏检才产生风险。现有评测忽视了这一点,无法反映监视器对模型真正合规漏洞的实际防御能力。
- 作者将647个有害请求改写为意图相同但措辞明确度不同的三个层级(间接、直接、直白),以模型实际回答的子集评估文本守卫与内部激活探测器,分析表征机制并设计包含正负双侧明确度梯级与无害蒸馏的微调方案。
- 措辞软化使Gemma-4-31B-IT合规率增加28倍,而四种文本守卫在回答请求上的召回率降至.04–.55,漏过44%–93%的翻转请求;双侧梯级微调使Qwen3Guard在被回答L1请求上的召回率提升至.889。
- 表征读取、导向与微调仅在单一目标模型上完成,且导向仅测单一守卫;所有请求均为英文单轮;L3仅有12个回答样本;梯级数据依赖模型生成且区分L2与L3的人工一致性较低;微调方案在无害文本与外部迁移间存在权衡。
- 威胁模型
- 论文指出其研究的失效在没有攻击者(with no attacker at all)的自然重述(natural rewording)下即可发生。攻击者目标为使系统生成实质性有害回答(complied);输入为保持意图不变的表面明确度(L1间接/L2直接/L3直白)提示词;受害系统为前置安全监视器及后置目标大语言模型。
- 模型
- Gemma-4-31B-ITQwen3-32BLlama Guard 3 8BWildGuardQwen3Guard 8Bgpt-oss-safeguard-120B
- 基准
- Aegis 2.0HarmBenchStrongREJECTWildChatLMSYS-Chat-1MWildGuardMixXSTestOR-BenchSORRY-BenchWildJailbreakWildGuardTestToxicChat
- 指标
- RecallFlag rateAUROCFPRRefused-to-answered ratioLeak
Sripad Karne 的论文测量了安全监控器在目标模型实际会作答的请求上的召回率,发现四款文本护栏、两个激活探针和 Latent Guard 在 1% 假阳性率下,对模型会拒答请求的召回率是模型会作答请求的 1.1 到 6.4 倍,而 AUROC 多数仍在 0.85 以上,标准指标掩盖了这一差距。研究基于 647 条有害请求(来自 Aegis 2.0、HarmBench、StrongREJECT),每条改写成间接、直接、直白三个显式程度版本且意图经 LLM 与人工核验;Gemma-4-31B-IT 在直白版本只答 12 条,在间接版本答 340 条,相差 28 倍,其中 344 条翻转请求里各护栏漏放 153 到 321 条。作者把原因追溯到显式程度本身:模型与护栏内部的危害读数都随措辞变软而下降,沿显式方向对 Qwen3Guard 做激活引导可把标记率从 26% 推到 100%。
推荐理由论文把监控器召回率按目标模型是否真的作答来切分,并给出措辞阶梯训练护栏的配方,做护栏评测与部署的团队可据此重设指标。
深度解读
这篇论文试图解决什么问题?
现有安全监视器评测未区分模型是否答复,导致监视器大多只拦截模型已拒答请求,在模型答复的弱明确度请求上召回率大幅走低。
核心问题是现有的安全监视器(Safety Monitors)在评测时未与目标模型实际回答行为对齐,导致其在模型真正会回答的有害请求上防线失守。
- 部署场景与重要性:大语言模型已被广泛应用,作者称安全训练虽教导模型拒答(Bai et al., 2022a;b),但拒答并非完全稳定;部署系统通常在模型前置安全监视器(如文本分类器或激活探测器)来拦截有害请求。
- 现有评测方式的局限:现有研究通常在标注有害基准上使用 Recall、F1 或 AUROC 评估监视器(Bassani & Sanchez, 2024; McKenzie et al., 2025);作者指出,拦截模型原本就会拒答的请求没有增益,只有在模型实际会回答的请求上漏检才真正重要。
- 核心观察与机制假设:当固定恶意意图并将请求措辞软化(间接表达)时,目标模型的拒答倾向下降并给出有害回答;与此同时,监视器同样将直白度视作有害信号,在软化措辞下报警率同步下降,导致二者在同类请求上共同失效。
- 本文提出的方案:提出了基于模型实际回答子集评估监视器的方法,构建了固定意图的多级明确度梯级(Explicitness Ladders)基准,并设计了在标签两侧覆盖不同明确度的守卫微调方案。
- 威胁模型:
- 攻击者目标:促使受害系统对有害请求生成实质性回答(complied),获取可操作的有害协助内容。
- 攻击者知识与能力:攻击无需自适应攻击者(with no attacker at all),攻击者仅通过自然重述(natural rewording)控制输入提示词的表面明确度(L1间接、L2直接、L3直白),保持恶意意图与严重性固定。
- 受害系统:包括前置文本守卫(Text guards)、基于内部激活的探测器(Activation probes / Latent Guard)以及后置的目标语言模型(Gemma-4-31B-IT、Qwen3-32B)。
有哪些相关研究?
相关工作涵盖安全监视器评测、重述对拒答的影响、守卫鲁棒性与内部表征,作者强调此前工作仅单独研究模型而未联合评估监视器。
相关研究主要围绕以下几方面展开:
安全监视器及其评测
- 文本分类守卫:Han et al. (2024a) 提出 WildGuard,Zhao et al. (2025a) 提出 Qwen3Guard,OpenAI (2025) 提出基于书面政策推理的 gpt-oss-safeguard;作者指出常用基准评估分数在分布偏移下校准较差(Liu et al., 2025; David et al., 2026)。
- 激活探测器:McKenzie et al. (2025)、Kramár et al. (2026) 与 Cunningham et al. (2026) 在模型隐藏状态上训练探测器用于检测高风险交互,但 Wang et al. (2026) 和 David et al. (2026) 报告探测器同样依赖表面模式。
- 评测指标局限:Bassani & Sanchez (2024) 与 McKenzie et al. (2025) 使用 Recall、F1 和 AUROC 评估监视器;论文指出此前评估未询问被保护模型是否会答复该请求。
请求措辞与模型拒答
- 顺从性重述研究:Zeng et al. (2024b) 的说服性改写、Andriushchenko & Flammarion (2025) 的过去时重构,以及 SORRY-Bench(Xie et al., 2025)的五种说服变异均报告改变措辞会提高模型依从性。
- 本文区别:作者指出以往工作仅孤立研究目标模型,本文在保证意图不变的前提下,联合测量同一重述对模型和监视器的相反影响。
守卫鲁棒性、多层防御与内部表征
- 守卫关键词捷径与重叠失效:Tasawong et al. (2025) 报告守卫依赖关键词,Pinneri & Louizos (2025) 报告守卫对释义判定不稳定,Wen et al. (2023) 报告隐晦有害表达易逃逸;Alotaibi et al. (2026) 指出自适应攻击下多层防御会协同失效,而本文指出在无攻击者自然重述下各层就会重叠失效。
- 害处与拒答表征分离:Arditi et al. (2024)、Pan et al. (2025) 与 Wollschläger et al. (2025) 研究了激活空间中的拒答方向;Zhao et al. (2025b) 提出有害性与拒答独立编码并构建 Latent Guard。本文指出软化措辞会系统性降低有害表征读数。
数据增强与微调策略
- 梯级训练与捷径学习:反事实数据增强(Kaushik et al., 2020)与释义一致性训练(Pinneri & Louizos, 2025)用于稳定模型;OR-Bench(Cui et al., 2025)和 XSTest(Röttger et al., 2024)研究过度拒答与难负例。
- 本文区别:作者诊断了各类训练数据可能带来的具体捷径,并发现用于纠正误报的难负例(Hard negatives)自身会引入新的偏差。
基线方法与基准数据集
- 对比基线包括 4 种文本守卫(Llama Guard 3 8B、WildGuard、Qwen3Guard 8B、gpt-oss-safeguard-120B)、2 种激活探测器(线性探测器与注意力探测器)及 Latent Guard;测试基准包括 Aegis 2.0、HarmBench、StrongREJECT、WildChat、LMSYS-Chat-1M、OR-Bench 和 XSTest。
论文如何解决这个问题?
作者构建三级明确度梯级与回答条件化评估协议,测试表征导向,并提出包含双侧梯级与无害蒸馏的守卫微调方案。
整体思路是构建固定恶意意图的多级明确度梯级,提出以模型实际回答为条件的监视器评估方法,通过激活读出与导向干预阐明失效机制,并设计双侧梯级微调与无害蒸馏方案。
明确度梯级构建与质量控制
- 明确度定义:定义 explicitness(表面明确度)为提示词陈述有害目的的直接程度,分为 L1(间接/隐含)、L2(直接中性)、L3(直白不加掩饰)三级。
- 梯级生成流程:使用 Claude Opus 5(Opus 4.8 兜底)作为改写模型,保留原始请求在对应等级,生成其余两级;要求意图完全保持不变、相邻梯级在 1–10 分打分中差距至少 2 分。
- 双重检验与样本清洗:由 Claude Opus 5 和 Claude Sonnet 5 独立评分并检验意图;714 个候选样本中排除 67 个(改写拒绝、无法更明确、盲测排序失败、L2与L3仅为同义改写等),保留 647 个有效三元组;人工独立标注确认意图保持率在 97%–100%。
条件化评估协议与泄露度量
- 模型回答判定:对每个提示词从目标模型采样 8 次响应(温度 1.0,top-p 1.0,最大 512 token),由 Claude Opus 5 判定为 complied、refused 或 deflected(偏转),若至少 1 次响应为 complied 则认定该请求被模型回答(answered)。
- 指标与泄露定义:监视器在 10,000 条 WildChat 无害样本上校准阈值,固定误报率(FPR)为 1%;定义翻转请求(Flipped requests)为 L3 全拒答但在较软层级被回答的请求;定义漏检泄露(Leak)为监视器放行且模型答复的有害请求;计算拒答与回答请求上的召回率比值(refused-to-answered ratio)。
表征读出与激活导向分析
- 表征方向构建:沿用 Zhao et al. (2025b) 方法,在指令最后一个 token 提取有害性方向与拒答方向,以无害分布的标准差(SD)为度量单位。
- 导向干预设计:在 Qwen3Guard 表现最佳的层(13–19 与 22 层),提取一半样本上 L1 到 L3 的平均激活位移作为明确度方向 eℓ: eℓ ∝ 1/(|S|) ∑i ∈ S [hiℓ(L3) − hiℓ(L1)] 其中将位移强度记为 α(α=1 对应 L1 到 L3 的平均距离),在另一半样本的回答 L1 请求中注入 α sℓ eℓ,或将其沿有害方向正交投影后进行干预,观察守卫判定是否反转。
梯级微调与无害蒸馏方案
- 微调配置:采用 LoRA(秩 16,α=32,学习率 10−4,1 epoch)微调 Qwen3Guard-8B。
- 损失函数设计:为解决引入害词无害样本带来的误报,在微调中加入含害词无害梯级并对无害样本施加 KL 散度蒸馏惩罚: Li = −log pθ(yi ∣ xi) + w · 𝕀[harmlessi] ∑k sik (log sik − log tik) 其中 w=1,s 为学生模型在三分类输出上的 softmax 概率,t 为未微调教师模型的输出,使无害样本评分锚定在原始水平。
论文做了哪些实验?
实验覆盖四种文本守卫与三种内部探测器,在两款目标模型上均显示监视器在被回答请求上的召回率低于拒答请求。
实验设置
- 被测模型:主目标模型为 Gemma-4-31B-IT,复现目标模型为 Qwen3-32B;文本守卫测试 Llama Guard 3 8B、WildGuard、Qwen3Guard 8B(及严格变体)、gpt-oss-safeguard-120B(Llama Guard 政策与 WildGuard 政策变体);内部监视器测试线性探测器(层 31)、注意力探测器(层 28)及 Latent Guard,附录扩展了另外 4 种内部探测器变体。
- 数据集与规模:评估集包含 647 个有害请求(Aegis 2.0 占 193、HarmBench 占 168、StrongREJECT 占 286);校准集使用 10,000 条 WildChat 无害样本,泛化校准使用 LMSYS-Chat-1M;微调测试包括 2,000 条 held-out WildChat 无害样本、250 条 XSTest,以及 24 个外部有害基准(包含 SORRY-Bench 21 个变异类别共 9,155 条、WildJailbreak 1,687 条、WildGuardTest 298 条、ToxicChat 333 条等去重后数据)。
- 指标定义:AUROC(区分有害与良性池能力)、Flag rate(全部 647 个请求的拦截率)、Recall(refused / answered,模型拒答与回答子集上的召回率)、Refused-to-answered ratio(拒答召回与回答召回之比)、Leak(344 个翻转请求中未被拦截的个数)、FPR(无害数据误报率)。
- 评审方式:依从性评审主评委为 Claude Opus 5(拒判由 Claude Opus 4.8 重审,截断至 6,000 字符);危害分级采用 HarmBench 的 Llama-2-13B 分类器与 StrongREJECT 的 gpt-4o-mini/gpt-3.5-turbo 评估链;两个有害分级器只要有任一个判为有害即计为有害。
- 样本量与采样重复:目标模型每条请求采样 8 次(温度 1.0,bfloat16);微调评估采用 3 个随机种子取均值;置信区间采用按请求抽样的 95% Bootstrap 重采样(1,000 次)。
- 阈值设定:所有监视器阈值统一冻结在 10,000 条 WildChat 良性样本产生 1% FPR 的得分点。
主结果
据 Table 1 与 Table 2(在 Gemma-4-31B-IT,冻结 1% FPR 阈值下):
表格较宽,可左右滑动
监视器类型与名称 AUROC (L1/L2/L3) Flag rate (L1/L2/L3) Recall (answered) (L1/L2/L3) Refused-to-answered Ratio (L1) Leak (/344) Llama Guard 3 8B .70 / .94 / .99 .15 / .77 / .94 .04 / .35 / .50 6.4 321 Qwen3Guard 8B .85 / .99 / 1.00 .40 / .89 / .99 .26 / .69 / .75 2.1 245 WildGuard .96 / .99 / 1.00 .54 / .88 / .99 .47 / .73 / .75 1.4 177 gpt-oss-safeguard-120B .86 / .95 / .96 .59 / .74 / .76 .55 / .39 / .42 1.1 153 Linear probe (L31) .91 / .98 / 1.00 .43 / .79 / .94 .21 / .35 / .58 3.2 270 Attention probe (L28) .92 / .99 / 1.00 .45 / .94 / .99 .22 / .68 / .75 3.2 259 Latent Guard .83 / .95 / .98 .44 / .72 / .87 .24 / .28 / .17 2.8 261 - 回答子集召回率普遍低迷:在模型回答样本最多的 L1 级别(340 个回答),所有文本守卫与内部探测器的回答召回率均处于最低水平(.04 至 .55),且每个监视器在拒答请求上的召回率均高于回答请求,比值达 1.1 至 6.4 倍(Table 1, Table 2)。
- 翻转请求多数被放行:在 344 个 L3 拒答但被软化表达后诱导模型回答的翻转请求中,Llama Guard 3 漏过 321 个,漏检最少的 gpt-oss-safeguard 仍漏过 153 个(Table 1)。
- 基准综合指标掩盖局部缺陷:所有监视器在 L2 和 L3 的 AUROC 保持在 .94 至 1.00,L1 也大多在 .83 以上,作者称分类器在混合数据上的整体排序能力未崩塌,但受限于固定阈值无法有效识别被回答的间接恶意请求(Table 1, Table 2)。
内部表征与激活导向分析
- 测了什么:测量目标模型与 Qwen3Guard 内部有害性及拒答方向投影(以良性池 SD 为单位),并在 Qwen3Guard 的 13–19 与 22 层注入 L1 到 L3 的平均激活位移。
- 结果:Gemma-4-31B-IT 的回答请求有害读数在各层级仅 +1.2 至 +1.5 SD,而拒答请求处于 +3.1 至 +4.9 SD;向回答的 L1 请求注入 α=0.5 明确度方向后,Qwen3Guard 的拦截率从 .26 升至 .91,投影去除有害方向后仍达 .57(Table 3, Table 14)。
- 作者的解读:模型与监视器均将措辞明确度作为有害判断的线索;内部探测器依赖这一表征,因而同样继承了这一盲区,仅调整阈值无法消除差距。
监视器集成与多层防御测试
- 测了什么:测试全部 7 种主要监视器两两组合(OR 规则),在冻结 1% 阈值和匹配 1% 联合 FPR 预算下的表现,以及全部 7 个监视器堆叠效果。
- 结果:在匹配 1% FPR 预算下,无任一 OR 组合优于单模型最低泄露数(最好组合漏过 163 次,单模型最佳漏过 153 次);21 对组合中有 15 对的共同漏检频率高于独立随机假设预测;7 个监视器全部堆叠漏过 184 次(Table 13)。
- 作者的解读:作者称不同监视器漏掉的是同类请求,多层防御在此类自然重述下会产生重叠失效,增加成本与延迟但无法修补该盲区。
梯级微调策略与泛化对比
- 测了什么:在 450 条训练样本上微调 Qwen3Guard-8B,对比原始数据(Arm B)、有害梯级(Arm C)、双侧梯级(Arm D)、添加 OR-Bench 负例以及添加害词无害梯级加蒸馏(Arm H)。
- 结果:仅微调原始有害请求(Arm B)在测试集被回答 L1 请求上的召回率为 .422;双侧梯级(Arm D)达到 .889,外部 24 个基准召回率为 .553(较原始未微调提升 11 个百分点);添加 OR-Bench 难负例导致模型在说服外部基准召回率降至 .000,对抗类降至 .268(Table 4)。
- 作者的解读:单一标签的文风会成为捷径,双侧梯级促使守卫脱敏表面措辞;单纯引入间接难负例反而促使模型将间接语气一律学为安全,导致安全防御失效。
其他消融与分析
- 第二目标模型复现:Qwen3-32B 在 L1 回答 482 个请求(470 个翻转),四种守卫 L1 拒答/回答召回比为 1.0 至 3.4,漏过 195 至 422 个翻转请求(Table 5)。
- 害处类别细分:八大有害类别中被回答比例为 .37(性内容)至 .69(欺诈),四守卫汇总的拒答/回答比均大于 1,处于 1.13 至 1.88 之间(Table 7)。
- 良性校准池切换:切换至 LMSYS-Chat-1M 后,各监视器在 1% FPR 下对 L1 拒答/回答比扩大至 1.2 至 11.3(Table 10)。
- FPR 阈值扫描:将 FPR 放宽至 10%,守卫平均拒答/回答比从 3.5 降至 1.7,但仍漏过超过三分之一的翻转请求(Table 11)。
- 第二守卫微调复现:Llama Guard 3 在双侧梯级(Arm D)下回答 L1 召回率从未微调的 .048 升至 .905,但 XSTest FPR 升至 29.6%(Table 22)。
- 无害蒸馏作用:引入 KL 散度蒸馏(Arm H)使 Qwen3Guard 在 XSTest 上的误报率从 Arm D 的 9.4% 降至 4.8%(Table 4)。
有什么可以进一步探索的点?
作者指出了目标模型与守卫种类单一、依赖合成梯级等局限,实验也仅覆盖特定规模的英文单轮请求与固定微调超参。
作者指出的局限与后续方向
- 被测目标模型与守卫种类单一:表征读取、激活导向与微调仅在单一目标模型上完成,导向实验仅测试了单一守卫,表征读取与微调也仅涉及两个守卫,作者指出更全面的研究需要将多个目标模型与多个守卫进行交叉实验(Limitations 节)。
- 未对内部监视器进行导向或微调:作者明确指出论文未对任何内部监视器(如探测器或 Latent Guard)进行激活导向或微调实验(Limitations 节)。
- 梯级构建依赖语言模型且极值样本较小:梯级文本由语言模型生成并检查,虽然人工抽样验证了意图和 L1 梯级,但区分 L2 与 L3 的一致性较低;此外 L3 等级仅依赖 12 个被回答的样本(Limitations 节)。
- 激活导向仅测试均值差方向:导向结果仅基于一个守卫和一种基于均值差方向的干预手段,作者指出未尝试其他寻找表征方向的方法、方向组合或单层注入(Limitations 节)。
- 交互场景与语言覆盖范围单一:所有评估和改写的请求均为单轮交互且全部为英文(Limitations 节)。
- 害词误报与说服召回率之间的权衡:无害文本中包含有害词汇时的过度拒答问题虽然通过梯级与蒸馏有所缓解,但作者指出这牺牲了部分说服类样本的召回率,这一权衡需由具体部署场景自行决定(第 8 节)。
实验覆盖范围
- 被测模型范围:目标模型评估覆盖 Gemma-4-31B-IT 和 Qwen3-32B 共 2 个;测试的文本守卫为主流开源或商用的 4 种(Llama Guard 3 8B、WildGuard、Qwen3Guard 8B、gpt-oss-safeguard-120B),微调实验仅覆盖 Qwen3Guard 8B 与 Llama Guard 3 8B。
- 有害数据与语言形式:有害基准涵盖 Aegis 2.0、HarmBench 和 StrongREJECT 三个来源共 647 个独立提示词,且全部为英文单轮文本输入。
- 明确度梯级跨度:每个请求严格限制在 L1、L2、L3 三个由 LLM 生成的表面明确度层级,排除无法通过文字改写区分明确度的命题害处请求(共排除 67 个)。
- 微调训练参数与算力设置:微调均固定为 LoRA(秩 16,学习率 10−4,1 个 epoch,3 个随机种子),未探索全参数微调或其他对齐算法。
- 信息披露:论文未报告商业闭源目标模型(如 GPT-4o、Claude 3.5 Sonnet)作为受害模型时的表现,亦未测试非英语语料下的多语言防御效果。
总结一下论文的主要内容
论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。
- 研究定位:该论文针对大语言模型安全部署中的前置监视器,系统分析了监视器评测与实际回答脱节的问题,并提出了机制解释与训练改进方案。
- 核心问题:传统安全评测以有害基准上的全量召回率为核心,忽视了目标模型原本的拒答能力;监视器若仅拦截模型本就会拒绝的请求,在实际防线中并无增益,而模型实际会回答的漏洞请求才是监视器的关键防守点。
- 方法设计:研究将 647 个有害请求在保持恶意意图不变的前提下重写为间接(L1)、直接(L2)和直白(L3)三个明确度梯级,以目标模型实际答复的请求子集为基准检验监视器有效性,结合内部激活投影与表征导向分析成因,并提出正负双侧梯级结合无害蒸馏的微调策略。
- 核心实验结果:
- 措辞软化使 Gemma-4-31B-IT 的回答率从 L3 的 1.9%(12/647)升至 L1 的 52.6%(340/647),为 28 倍差距(第 4 节),其中 86% 的翻转请求经判定为有害回答。
- 在 1% FPR 阈值下,四种主流文本守卫在被回答的 L1 请求上召回率低至 .04 到 .55,在 344 个翻转有害请求中漏过 153 至 321 个(Table 1)。
- 内部激活探测器与 Latent Guard 表现出相同甚至更大的漏检差距,L1 拒答/回答比达 2.8 至 3.2,漏过 259 至 270 个翻转请求(Table 2)。
- 多层监视器集成未能修补盲区,在控制 1% 联合 FPR 下无任一组 OR 堆叠优于最低泄露数的单模型(Table 13)。
- 采用双侧梯级微调的 Qwen3Guard(Arm D)在测试集被回答 L1 请求上的召回率从未微调的 .238 提高至 .889,且 24 个外部有害基准平均召回率达到 .553(Table 4)。
- 作者结论与启示:模型与监视器均将表面措辞明确度作为判断危害的快捷信号,导致安全守卫在模型最易妥协的间接提问下共同失防;安全监视器评测应常规化报告以模型实际回答为条件的召回率,并通过平衡各类文风的双侧梯级数据训练守卫脱敏表面形式。