研究:LLM 安全评判模型难以按新上下文与安全定义调整判断
Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators
作者评测13个LLM-judge,NovelPrompts上context使F1均升0.06,新定义下少改判。
- 规模化安全评测依赖LLM-judge,但安全定义随语言、文化、领域和时间变。作者要看judge会不会用新context,以及会不会改按与训练先验不同的政策打分。
- 作者形式化context-sensitivity与steerability,用翻转率、accuracy和F1评测13个judge。对照包括无、正确、打乱的context,以及无定义、基础定义、两种变体、球类荒谬定义和1/2分类改写。
- 作者称NovelPrompts上正确context使F1平均升0.06;新定义下MultilingualPrompts平均只翻5%预测,应变超过15%。改成1/2分类后steerability高过两倍。球类政策上准确率多高于95%。
- 作者在Limitations称只考察了若干judge与设置,词频代理也未分开各模型先验。实验含Table 1的13个judge、四套数据和5个seed;论文未报告自建数据的标注者间一致性。
- 被测模型
- GPT-5-2GPT-5-mini-08-2025Claude-4-5-SonnetClaude-3-5-HaikuCommand-ACommand-RQWEN3-235b-a22b-instruct-2507-tputMeta-Llama-3-1-70b-instruct-turboGPT-OSS-20bTiny-AYA-globalLlama-3.1-Nemotron-Safety-Guard-8B-v3Llama-Guard-4-12BGPT-OSS-safeguard-20b
- 基准
- MultilingualPromptsNovelPromptsSorry-BENCHsports datasettiny-MMLUGlobalMMLUIFEvalinternal translated IFEvalinternal English safety benchmarkinternal multilingual safety benchmarkFineWebFineWeb-2
- 指标
- F1accuracybalanced accuracySensjSteerj
研究者评测了 13 个通用大语言模型和安全专用评判模型的安全评判能力,考察它们对上下文中新增信息以及不同安全定义的敏感度。结果显示,LLM 评判模型能够从新信息中学习,但当上下文或安全定义偏离其内部既有先验时,它们普遍不会更新自己的评判。作者认为,LLM-as-judge 是大规模安全评估的主要手段,但此前很少在简单静态基准之外被检验,其上下文敏感性和可引导性仍有待关注。
深度解读
这篇论文试图解决什么问题?
作者要测LLM-judge会不会用新context,以及会不会改按新安全政策打分。
LLM-judge 在安全没有单一标准答案时,会不会使用 prompt 中的新信息,并改按与训练先验不同的安全政策打分。
- 使用场景:作者称规模化安全评测主要依赖 LLM-judge。安全定义随语言、文化、领域和时间变化;酒精、布道、新闻中的暴力,在不同地区或产品里并不一样。
- 现有评测的缺口:作者称常见做法是把政策写进 judge prompt,但没有专门检验模型是在执行新政策,还是在套用后训练得到的安全边界。与人工标签的差距因此分不清来源。
- 作者的划分:评判被分成两步,先估计请求里的安全类别与严重度,再按政策映射为 SAFE 或 UNSAFE。作者假设:对请求的先验越分散,context 引起的更新越大;SAFE/UNSAFE 上的安全先验越尖,书面政策越难改写后验。
- 本文要测的量:作者提出并形式化 context-sensitivity 与 steerability。前者看加入不改变标签的说明后预测是否翻转,后者看更换政策后是否翻转。评测 13 个通用或安全专用 judge,语言覆盖英、法、日、阿、韩。作者称已发布 NovelPrompts 与评测框架。
有哪些相关研究?
相关工作主要测人工一致性、脆性、context和任务说明,作者认为还分不开先验。
与人工一致性
- Zheng et al. (2023) 以及随后的多领域评测,用 accuracy 或 Cohen’s kappa 看 judge 是否对齐人工标注。作者称在标准 LLM-as-judge 基准上,较强 LLM 的一致性常达到或超过标注者之间的一致性(Zheng et al., 2023; Zeng et al., 2024; Tan et al., 2025)。
- Son et al. (2025)、Xu et al. (2025)、Xie et al. (2025) 把这类评测扩到多语言、元评测或安全拒绝。论文在这一组只作描述,没有逐篇指出相对本文的不足。
一致性没有覆盖的失败
- Gu et al. (2025)、Chen and Goldfarb-Tarrant (2025)、Wei et al. (2025)、Weng et al. (2026) 记录 judge 的失败:模板或被评回复的小改动会让评判变化很大,judge 也容易受对抗攻击影响。
- Chen et al. (2026)、Schwinn et al. (2026)、Eiras et al. (2025) 被用来说明:某一基准上的高一致性,并不保证分布外仍如此;部分基准上 judge 表现差。作者用这些工作说明只测一致性不够。
Context 是否被使用
- Xu et al. (2025) 在带 context 的评测里称,表现最高的 judge GPT-o1 准确率也只勉强到 55%。In et al. (2025) 称 Llama-guard 等在给定用户画像时假阴性率很高,论文未在此处给具体比率。
- 非评判任务上,Min et al. (2022)、Kossen et al. (2024)、Long et al. (2024) 认为 in-context 示例主要提示标签空间和输出格式。Du et al. (2024)、Ming et al. (2025) 则发现,context 与参数知识冲突时,模型在自己有信心的主题上更可能忽略 context。
任务说明是否被遵守
- Kim et al. (2024)、Asai et al. (2026) 报告把评分标准写入 prompt 能提高准确率;Souly et al. (2024) 报告这可以超过任务专用微调。
- Weng et al. (2026) 发现部分 judge 能适应从严格到宽松的简单定义改动。作者指出该工作只覆盖四个 judge 和一种变换。Murugadoss et al. (2025) 称,不给任务说明或量表时,表现更高的 judge 反而更好;作者据此认为它们在用先验,而不是说明。
对照设置与数据
- 论文没有另设命名的攻击或防御基线。对照是无 context、正确 context、打乱后的无关 context,以及无定义、基础定义、变体 sa、变体 sb、球类荒谬定义和 1/2 分类改写。数据为 MultilingualPrompts、NovelPrompts、Sorry-BENCH,另有合成 sports 数据。
作者认为,既有评测常把演示或量表写进 prompt,却没有把 context 的作用和训练先验分开;本文用 sensitivity 与 steerability 专门测这两件事。
论文如何解决这个问题?
作者用编码再解码的形式化,以翻转率测量context-sensitivity和steerability。
作者把安全评判写成先理解请求、再套用政策,并用 context-sensitivity 与 steerability 分别测新信息和新政策是否改变预测。
问题设定与形式化
- 输入:每个样本是用户请求 xi。judge j 同时看到安全定义 s,输出 SAFE 或 UNSAFE。主分析评请求;作者称加上模型回复后的图景一致,见 §D.1.1–F。
- 两步:hj 从请求估计表示 zi,包括安全类别与严重度;政策再把 zi 映到标签。作者写成 fj(xi|s)=gj(hj(xi), s)。
- 基础政策:先映射类别和严重度,再决定该组合是否不安全。五类为 misinformation、self-harm、sexual content、child sexual exploitation and abuse、violence and hate。高严重度记为不安全;中性信息多为低严重度,因而安全。附录 C.1 给出完整定义。
- 作者的读法:context 被看成对“请求表示”的先验更新,政策被看成对“该表示是否安全”的先验更新。这是解释框架,论文没有另做干预来检验这个贝叶斯故事。
Context-sensitivity
- 操作:在请求后拼接短说明 ci。说明解释地区性用语,或 2024 年 7 月之后、接近所测 judge 训练截止的概念。作者强调说明不改变人工标签,政策保持不变。
- 指标:Sensj=(1/N)∑i 1{fj(xi⊕ ci|s)≠ fj(xi⊕∅|s)}。这是相对无说明的预测翻转率。accuracy 与 F1 用来看翻转方向是否朝向人工标签。
- 三组条件:无 context、正确 context、无关 context。无关条件把数据集里的说明打乱后再配给请求。
- 假设:作者假设请求里的词越不熟悉、先验越分散,sensitivity 越高。
Steerability
- 操作:输入固定,只改政策。Steerj 是新政策相对原政策的预测翻转率,形式与 Sensj 相同。
- 五类政策:无定义;应与训练先验较接近的基础定义;sa,五类里改两类,自我伤害一律安全、性内容一律不安全;sb,只要提到安全相关类别,连中性信息也算不安全;荒谬定义,只有球类运动不安全。附录 C.1、C.4 给出全文。
- 另一种标签空间:把输出改成类别 1 和 2,边界与原先相同,但提示词不出现 safety。作者预测此时没有对应的安全后训练联想,书面政策会成为主要证据。
- 设计意图:作者称这些条件离训练先验的距离不同,用来区分“与先验冲突”和“一般不能跟随指令”。
数据、judge 与判定
- 数据:MultilingualPrompts 为 779 条法、阿、韩、日请求及回复,按基础定义 310 条不安全、469 条安全,约一半需要地方知识。NovelPrompts 为英语 194 条,61 条不安全、133 条安全,概念晚于 2024 年 7 月;作者称不理解该概念就无法判断安全。Sorry-BENCH 随机取 1000 条不安全请求及回复,不安全指回复遵从了不安全请求。sports 为 240 条合成英文回复。
- judge:Table 1 的 13 个模型用同一任务提示。三个安全专用模型按推荐格式做小改,仍使用作者的安全定义。附录 C.4 给出完整提示词。
- 推断:temperature 为 0,max_tokens 为 512,5 个 seed,报告均值和标准差。格式不合格计为错误且不进分数;只保留错误率低于 2% 的评测。
- 读数:翻转率不要求翻转后一定正确;正确性另相对目标政策下的人工标签计算 accuracy 和 F1。
论文做了哪些实验?
作者称NovelPrompts上context使F1平均升0.06,新安全定义下却很少改判。
实验设置
- 被测 judge:GPT-5-2、GPT-5-mini-08-2025、Claude-4-5-Sonnet、Claude-3-5-Haiku、Command-A、Command-R、QWEN3-235b-a22b-instruct-2507-tput、Meta-Llama-3-1-70b-instruct-turbo、GPT-OSS-20b、Tiny-AYA-global,以及三个 safety-specific:Llama-3.1-Nemotron-Safety-Guard-8B-v3、Llama-Guard-4-12B、GPT-OSS-safeguard-20b。gpt-5-nano 与 llama-3-8b 因超过错误率阈值未纳入(§C.3)。
- 数据:MultilingualPrompts 779;NovelPrompts 194;Sorry-BENCH 从 7000 中随机 1000;sports 240,其中球类 100、非球类 40、无关教育话题 100。回复由 command-a、gpt-4o、command-r、DeepSeek-R1 生成;多语言小节写生成模型含 claude-4-5-sonnet,sports 小节写 claude-3-5-sonnet。
- 条件:context 为无、正确、打乱三类。政策为无定义、基础定义、sa、sb、球类定义,以及 1/2 分类改写。Sorry-BENCH 的变体按该基准自己的四类请求改写,与主政策不是同一条文(§C.4)。
- 指标与重复:Sensj、Steerj 为翻转率;相对人工标签有 accuracy、F1;Table 3 为 mean balanced accuracy。每组 5 个 seed,temperature 0。论文未写人工复核 judge 输出。
- 排除:只使用错误率低于 2% 的评测。Claude-4-5-Sonnet 在 Sorry-BENCH 上因安全过滤产生超过 10% 的 NaN,该设置下被排除出部分实验(§C.3)。
主结果
论文没有一张列出全部 13 个 judge、全部条件的数值表。Figure 1 的逐模型柱高在正文里大多没有标出。下表是 Table 3 的汇总,论文写 mean balanced accuracy ± std across seeds。论文未说明该均值是否再对全部 judge 平均。SB 的变体 A/B 条文与前两列数据不同。
表格较宽,可左右滑动
政策与框架 ML仅请求 ML请求+回复 NP仅请求 NP请求+回复 SB请求+回复 基础,安全评判 67.2±0.5 72.6±0.5 66.4±0.6 65.7±0.6 78.2±0.1 基础,1/2分类 68.1±0.4 70.8±0.8 67.5±0.7 63.8±0.6 78.1±0.2 变体A,安全评判 57.5±0.2 68.9±0.5 62.5±0.4 66.8±0.4 80.2±0.4 变体A,1/2分类 68.1±0.2 69.3±0.4 64.3±0.5 69.0±0.6 82.7±0.2 变体B,安全评判 54.1±9.1 68.4±0.9 63.4±0.7 62.1±0.5 73.2±0.5 变体B,1/2分类 55.9±0.5 49.4±1.5 62.9±0.4 69.4±0.2 76.9±0.4 - 作者称基础定义下,安全评判和 1/2 分类的表现很接近。表中 Base 两行接近,但不是每一格分类框架都更高。
- 作者称变体政策下分类框架带来更高 accuracy(§E.3)。表中有反例:MultilingualPrompts 变体 B 的请求+回复,分类框架低于安全评判。变体 B 的 ML 仅请求一行,安全评判的标准差也明显更大。
- 作者称有无基础定义时,相对基础标签的 accuracy 差在 ±0.02(§5、§E.1)。Table 3 没有“无定义”行。
Context 是否改变预测
- 测了什么:在 MultilingualPrompts 与 NovelPrompts 上比较无 context、正确 context 和打乱 context,请求与请求+回复都做了。
- 结果:作者称 NovelPrompts 上正确 context 使各 judge 的 F1 平均提高 0.06,并称为 10% increase;无 context 时 F1 仍可达 67%(Figure 1 及脚注)。GPT-OSS 提高 0.09,Qwen3 略降,论文未给降幅。MultilingualPrompts 上作者称无一致收益,§D.1.1 称无显著效应。无关 context 下作者称没有明显性能下降(Figure 1 右、Figure 9)。
- 作者解读:作者认为 judge 能学 NovelPrompts 里的新概念,并使 Command A、Llama 70b 达到与正文所称 GPT-5.2、Claude 4.5 Sonnet 相当的水平,论文未给这四者的具体 F1。作者认为多语言数据里的地区信息多数 judge 已经知道。翻转集中在少数样本:MultilingualPrompts 上超过 70% 的样本预测不变;作者称 NovelPrompts 的平均翻转是前者的两倍。作者把这与词频代理上的负相关放在一起,并给出 NovelPrompts 约 25% 的 OOV、MultilingualPrompts 约 3% 的 OOV(§4.2、§C.5)。作者称 Nemotron-safety-guard 在四组实验里 sensitivity 排名都最高(Figure 3)。
政策能否改写安全边界
- 测了什么:三套安全数据上比较无定义、基础定义、sa、sb,以及同一边界的 1/2 改写;另用 sports 数据测球类定义。
- 结果:作者称 Figure 5 中,MultilingualPrompts 在 sa、sb 下平均只改变 5% 的预测,适应新定义需要改变超过 15%;相对新标签的 accuracy 最多降 0.15(Figure 4、§E.1)。图注把 steerability 写成相对期望翻转数的平均翻转,正文则直接写 5% 与超过 15%。分类改写后,作者称 steerability 超过安全评判的两倍(Figure 5);NovelPrompts 与 Sorry-BENCH 上作者称有类似结果(§E.3),没有再给出“两倍”。球类定义下,作者称多数 judge 准确率高于 95%(§E.2)。给出标准安全模板去评 sports 数据时,作者称准确率为 58%,并称全部 judge 把样本判为不安全,该比例与安全样本比例一致。
- 例外与作者解释:作者称在真正不安全、但按体育政策应判安全的数据上,Tiny Aya 与 Claude 系列有 15% 到 45% 的样本判错;Llama-guard 与 Nemotron 也较差(§5)。§E.2 则把超过 15% 判错的模型写成 Claude 系列、Tiny-AYA 和 Nemotron。Figure 13、14 的柱值在文本转换后不能与模型名可靠对齐,故不逐模型引用。作者认为安全专用 judge 较差,可能是因为高严重度类别上的 UNSAFE 先验更尖,或它们被做得更不易受指令修改影响。
属性关系与能力迁移
- 测了什么:sensitivity、steerability、与人工标签的一致性是否相关;三套评测数据之间、四种语言之间,以及与 MMLU 类基准、IFEval 和内部安全基准是否相关。安全专用 judge 未进入能力对比,作者称它们不是为安全评测以外的任务设计的。
- 结果:sa 与 sb 的 steerability 正相关,三个数据集上 Pearson 系数为 0.55 到 0.65(§E.4)。Figure 16 的回复评测给出 0.55(p=0.0619)、0.65(p=0.0231)、0.60(p=0.051)。作者称 sensitivity、steerability 与 accuracy 的相关不显著且不一致(§F.1),正文未给这些系数。三套 judge 数据的 F1 相关为 r=0.50、0.46、0.44,p 为 0.096、0.131、0.148(Figure 18)。
- 作者解读:作者认为两种属性受不同先验影响,可能分别来自预训练和安全后训练,且都不与人工一致性对应。作者举例 Claude-3-5-Haiku 在多语言安全评测上靠后,但在 NovelPrompts 上 F1 最高;Claude-4-5-Sonnet 在韩语子集排名第 1、日语子集第 7(Figure 19,无分数)。作者称通用与多语言知识相对评判表现的平均 Pearson 相关,MultilingualPrompts 为 0.62、NovelPrompts 为 0.68(§F.4);指令跟随无显著相关。作者还称模型可以很安全但不善评判,或相反,例子是 NovelPrompts 上的 GPT-oss-20b 与 Sorry-BENCH 上的 Llama-70b,论文未给这两处分数。
其他消融与分析
- 提示词风格改写:作者称 MultilingualPrompts 回复评测上,多数 judge 的准确率跨四个模板基本不变(Figure 6);转换后的柱值不对齐,不摘数字。
- 词频代理:FineWeb 与 FineWeb-2 各语言 10B token,去掉最常见 200 个 token 后,用最稀有实词的 Zipf 频率;与翻转率负相关,正文无系数(Figure 2、附录 D.2)。
- 高频新义:作者称 NovelPrompts 的 common 词翻转率直方图有两簇,一簇为 0,一簇为四类中最高(Figure 11)。Table 2 有例句,此处不复述。
- 无定义:作者称与给出基础定义时的表现相当,差在 ±0.02(§5)。
- 分类改写:作者称更接近图中虚线所标的理想翻转,但仍达不到完全 steerability(§5)。
- 安全专用模板:Nemotron、Llama-guard、GPT-OSS-safeguard 使用推荐格式,政策仍是作者的定义(§C.4)。
有什么可以进一步探索的点?
作者在Limitations中称judge、设置和词频先验代理都还可以再扩展。
作者指出的局限与后续方向
- 评测规模:Limitations 称只考虑了若干 judge 和评测数据集,并希望他人用所发布的框架把评测做得更全。
- 设置数量:同一节称实验设置有限,例子是三个数据集,或三个安全定义变体中的一个。作者认为这未必展示 judge 行为的全部范围,并指出 LLM 容易受 prompt 中的虚假偏差影响。
- 先验代理:Limitations 称词频分析还可以细化。目前用的是一份标准预训练语料上的词频,没有分开各 judge 的先验差异。作者提出可先探询 judge 对主题知道多少,或用对样本的困惑度作代理。
- 新义:同一节指出,部分高频词可能在 judge 未知的情况下获得新含义,并指向 §D.2.1。
- 避开先验:Conclusion 称,让任务和数据不与先验冲突,是得到更可适配 judge 的一条途径,但也会增加对错误或无关信息的脆弱性。
实验覆盖范围
- 被评 judge 为 Table 1 的 13 个模型,其中 3 个是 safety-specific;§C.3 写明 gpt-5-nano 与 llama-3-8b 因错误率超阈值未进入结果。
- 安全相关数据为 MultilingualPrompts(779,法/阿/韩/日)、NovelPrompts(194,英语)、Sorry-BENCH 随机 1000,以及 240 条 sports 合成回复(§3.3、§C.2)。
- 推断设置为 temperature 0、max_tokens 512、5 个 seed;错误不计入,且只使用错误率低于 2% 的评测(§C.3)。
- Context 的三种条件做在 MultilingualPrompts 与 NovelPrompts 的请求及请求+回复上(§4、§D);政策变体做在三套安全数据和 sports 定义上(§5、§E)。
- 论文未报告 MultilingualPrompts 与 NovelPrompts 的标注者间一致性。附录还在 tiny-MMLU、GlobalMMLU、IFEval 及内部安全基准上比较了模型能力与评判表现(§C.2、§F.4)。
总结一下论文的主要内容
作者形式化两种judge属性,称新context只在先验弱时有用,新政策则很难改判。
作者度量的不是 judge 与某一套人工标签有多一致,而是它会不会吸收新 context、会不会改用另一套安全政策。
- 问题:安全评测没有单一可核对的奖励。作者认为只报 human agreement,会漏掉 context-sensitivity 和 steerability,而实际部署里的语言、文化和产品政策都在变。
- 做法:先估计类别与严重度,再映射成标签。Sensitivity 是加入不改变标签的说明后预测是否翻转;steerability 是更换政策后是否翻转。13 个 judge、5 个 seed;数据包括 779 条多语言样本、194 条 2024 年 7 月后的英语样本,以及 Sorry-BENCH 的 1000 条子样本。
- Context:作者称 NovelPrompts 上正确说明使 F1 平均升 0.06,并称为 10% increase;MultilingualPrompts 上无一致收益。无关说明下作者称性能没有明显下降。超过 70% 的 MultilingualPrompts 样本预测不变。作者认为先验弱时,judge 才更会使用 context。
- 政策:有无基础定义时 accuracy 差为 ±0.02。sa 与 sb 下,MultilingualPrompts 平均只改 5% 预测,作者称应变超过 15%,accuracy 最多降 0.15。改成 1/2 分类后,steerability 超过两倍。球类政策上多数准确率高于 95%;作者称这与训练中的安全类别正交,所以更容易跟随。
- 作者的结论:作者认为安全因场景而异,judge 却常按内部边界打分,实践中可能评到的是前沿实验室式的政策。应按部署需要选择更敏感或更可引导的 judge;只按一致性挑选时,写入的定义和 context 可能只带来虚假的安全感。作者同时认为,为避开先验而提高可适应性,也会提高对错误信息的脆弱性。