论文:安全路由评测在分布偏移下失效,基线选取偏差被低估
False Floors: LLM Safety Routing Evaluations Break Under Distribution Shift
在分布偏移下,事后最佳单模型基线产生 0.045 至 0.113 的选择代价,诚实评分下安全路由在多数池单元退化为固定模型选择。
包含四类不观测权重或激活的攻击者:A1(routing-steering (α))迫使部分请求进入级联廉价分支;A2(post-hoc template selector)事后选择最低标记模板;A3(generic adaptive attacker)在训练重跑中选单一模板跨模型泛化;A4(targeted adaptive attacker)知晓响应模型并针对性选择模板。
- 安全路由器根据请求将输入分流至不同模型以降低危害,评估通常将其与最佳单模型基线对比。现有评测常在测试集上后验挑选基线模型,忽略了真实部署中测试分布发生类别偏移时基线选择所带来的不确定性与偏倚。
- 论文在 7 个安全语料上引入严格留出协议,对比在训练折冻结的诚实基准与测试集后验基准;推导选择代价边界并分解尾部优势;随后在智能体环境与技能注入语料中,评估预执行路由上限、中间识别信号的自适应可操纵性及动作级防御。
- 分布偏移下后验基准产生 0.045 至 0.113 的选择代价,路由器在多数单元收缩为固定模型;AgentDojo 上预执行路由空间至多 0.0105;针对性攻击使 gpt-5.4 识别标记率下降 19.6 点,四种动作策略零成功但缺乏机械强制。
- 结果主要覆盖英语及单轮对话设置;偏移代价在各语料间不均且依赖分组划分;智能体数据自然饱和且覆盖稀疏;危害与标记主要依赖单一自动化评审模型,缺乏对评审召回率的测量;动作级策略未经验证机械隔离。
- 模型
- claude-3-5-sonnetclaude-3-opusclaude-sonnet-4-6gpt-4ogpt-5.4gpt-5.4-minipalmyra-x-004grok-3-mini-betaCommand-R-plusQwen3-Embedding-8BMiniLMdistilroberta-base
- 基准
- HELM Safety (harm_bench, xstest, simple_safety_tests)HarmBenchAgentDojoXSTestSORRY-BenchAIR-Bench 2024skill injection
- 指标
- harmselection costAUROCattack success rateflag ratetask utilityconditional tail edge (ε)
论文指出,一个主要的安全路由基准在评测数据上挑选作为对照的最佳单模型,这在基准自身设定下无碍,分布偏移下却不成立。在 HELM Safety 上,这一选择代价在随机划分下为 0.003–0.030 的 harm,按类别留出时升至 0.045–0.113,与归因于路由的全部劣势相当;在 AgentDojo 上按整套件留出时上升七到九倍。改用不看测试标签选出的基线、在偏移下评分,路由在这些基准上收益很小:多数情况下路由器直接选用基线的模型,在接近饱和的 AgentDojo 上,完美的预分发路由器最多只值 2 个点的 harm。论文还发现,知道面对哪个模型的攻击者挑选注入模板后,可在留出重跑中让 GPT-5.4 对后到注入的判定识别率降低 19.6 个百分点,独立的词表标签复现了这一下降。
推荐理由论文量化了安全路由评测中基线在测试集上选取带来的偏差,并给出分布偏移下的评测协议建议。
深度解读
这篇论文试图解决什么问题?
测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。
论文试图解决大语言模型安全路由评估因在测试集上后验挑选单模型基准,而在分布偏移下产生“虚假下限”(False Floors)并误判路由防御价值的问题。
- 问题场景与重要性:生产服务栈已采用安全路由器对混合模型池进行分流以拦截风险请求,其存在理由依赖于单请求预言机与最佳单模型之间的差距。作者称,安全路由器主要针对未见过的请求,因此必须在分布偏移下衡量其表现。
- 现有评估的不足:主流评测基准在评估数据上后验挑选最佳单模型(如 Best Single in hindsight),在测试集上与需要泛化的路由器进行对比。作者称,这种做法让路由器承担泛化不确定性,却免除了固定基准的不确定性,在分布偏移下偏向固定基准。
- 核心观察与假设:在平稳随机划分下,后验基准的选择代价接近于零;但在类别留出等分布偏移下,选择代价扩大至与路由劣势相当的量级。作者推导指出选择代价非负,并将其分解为诚实选择的遗憾项与后验基准的乐观偏差项。
- 提出的分析与方案:论文提出了在训练折冻结固定模型的诚实评测协议,在多个安全语料上量化了评估偏差、路由器的多维门槛表面、智能体预执行路由上限,以及识别信号在自适应攻击下的可操纵性。
- 威胁模型:
- 攻击者知识与能力:不观测模型权重或激活。A1(routing-steering (α))能迫使比例为 α 的请求进入廉价分支并观测路由策略;A2(post-hoc template selector)事后观测全部结果选择标记率最低的模板。
- 自适应攻击设定:A3(generic adaptive attacker)在训练重跑中选择单一模板并在留出重跑中攻击整个模型池;A4(targeted adaptive attacker)知晓响应模型身份(target observability)并针对特定模型选择模板。
- 攻击目标与受害系统:攻击目标为诱发有害输出或绕过注入标记;受害系统涵盖多模型路由池、基于标记门控的级联系统以及具备工具调用能力的智能体。
有哪些相关研究?
现有研究揭示了路由同样本评估偏倚与退化现象,本文系统量化安全分布偏移下的代价与防御脆弱性。
- 路由基线评估与优化者诅咒
- Shihab et al. (2026) [4]:指出路由评估中同样本选择最佳固定模型(same-sample selection)的缺陷并证明准确率上的偏倚方向;本文将其拓展至安全危害(harm)指标,在相同折上对比随机与类别留出划分并给出尾部优势符号与几何/信号分解。
- Li et al. (2026) [2] (LLMRouterBench):其 Best Single 基准在全数据集后验选择模型;作者测试其开源结果发现全量 20 模型池下该代价为 0,但在小池和留出数据集下存在偏移代价。
- Smith & Winkler (2006) [6]:提出决策分析中的优化者诅咒(optimizer's curse);本文结合有限类极大不等式给出选择代价在分布偏移下的理论界。
- 路由器退化与模型组合上限
- Lai & Ye (2026) [27]、Lu et al. (2026) [28]、Garg & Sagtani (2026) [29]:分别从选择失败、精度平台和强先验下似然比退化等角度记录了路由器收缩至单一模型的现象;本文在诚实基准与无信号原假设下度量了嵌套收缩规则驱动收缩因子趋向 0 的行为。
- Chen (2026) [32]、Chen (2026) [33]、Dekoninck et al. (2024) [34]:分析路由器与预言机差距及共失效上限(co-failure ceiling);本文与其互补,指出实测的路由劣势主要是基准选择方式膨胀的结果。
- 提示注入防御与动作级隔离
- Greshake et al. (2023) [31]:提出间接提示注入威胁;Zhan et al. (2025) [21]、Nasr et al. (2025) [22] 研究了针对独立检测器的自适应攻击;本文测试的是模型自身的表达性识别信号。
- Dong et al. (2026) [20]:揭示智能体隐藏状态能以较高 AUROC 编码注入暴露但存在知识-动作差距;本文表明输出端表达性识别易受模板选择操纵。
- Debenedetti et al. (2025) (CaMeL) [7]、Beurer-Kellner et al. (2025) [8]:提出在智能体上下文外部通过 harness 强制执行动作策略;本文测试了四种动作级配置并发现其表现与模型识别一致而非机械阻断。
- 基线方法与基准
- 基线包括诚实固定基准(pinhonest)、样本内基准(pinoracle)、全样本基准、随机选择(random)与打乱预测的无信号路由器(signal-free router)。
- 使用的数据集包括 HELM Safety、HarmBench、AgentDojo、XSTest、SORRY-Bench、AIR-Bench 2024 及技能注入语料。
- 与相关工作的区别定位:作者指出,本文通过严格的留出评测协议,揭示了后验基线在分布偏移下制造的虚假下限,证明安全路由在诚实评估下收益微弱,并阐明了防御应从输入意图分类转向外部动作强制。
- 路由基线评估与优化者诅咒
论文如何解决这个问题?
建立诚实留出评估协议,推导超额危害分解恒等式,并评估门槛表面与动作防御。
论文构建了参数化收缩路由族,形式化分解基线选择偏差,并建立跨多语料的严格留出评估协议,进而度量路由器性能表面、智能体预执行瓶颈与自适应对抗下的识别脆弱性。
问题设定与收缩路由族
设模型池为 M = {1, ..., M},对请求 x,路由器输出各模型预测分数 si(x) 并选择 arg min_i si(x);hi(x) ∈ {0, 1} 表示模型 i 是否产生危害输出。为了平衡请求级信号与全局边际,定义收缩公式: si(λ)(x) = λ pi(x) + (1 − λ)p̄i 其中 λ = 1 对应逐请求路由器,λ = 0 退化为预测边际固定选择。定义偏离固定基准的转移率 ρd 与条件尾部优势 ε,路由超额危害分解为: 𝔼[hrouter] − 𝔼[hpin] = ρd · (−ε) 该恒等式在各折及各池内均精确闭合。
基准定义与留出评估协议
- 两种基准区分:样本内基准 pinoracle 在评估折或全评估集上选择危害最低的模型;诚实基准 pinhonest 仅在训练折数据上选择并冻结。
- 交叉验证纪律:采用基于攻击家族、语义类别或用户任务的分组留出交叉验证(GroupKFold),杜绝跨模板随机划分;AUROC 在折内独立计算后求平均。
- 超参数嵌套调优:路由器超参数 λ 严格在训练折内部通过嵌套交叉验证选取,禁止使用测试折数据进行调优。
路由器门槛表面与多维分析
- 四维影响轴:路由器盈亏平衡所需的信号门槛 a* 不是标量,而是由策略类别(政策收缩)、操作点不对称性 κ、任务经验难度(基础危害率)和基准协议四维共同决定的表面。
- 特征与编码器配置:使用冻结文本特征(TF-IDF、MiniLM、Qwen3-Embedding 等)配合 Logistic 回归进行拟合,同时评估端到端微调与非语义长度基线。
智能体与信号门控防御评估
- 预执行与循环内分流:在 AgentDojo 上分析工具调用前预执行路由的理论上限;在循环内评估基于注入文本可见性的即时监控。
- 门控控制器与自适应攻击:在技能注入语料上,将模型表达性标记输入离线组合进静默升级(escalate-on-silence)控制器;设计 A3 与 A4 自适应模板攻击,评估识别信号在分布偏移与对抗选择下的有效性。
论文做了哪些实验?
分布偏移下后验基准产生大额偏差,诚实评估下路由收益微弱且识别信号易被操纵。
实验设置
- 被测模型:HELM 44 模型池(涵盖 claude-3-5-sonnet、claude-3-opus、gpt-4o、gpt-5.4、gpt-5.4-mini、claude-sonnet-4-6、palmyra-x-004、grok-3-mini-beta、deepseek、Command-R-plus 等)、HarmBench 19 模型、AgentDojo 28 种配置(完整评估涵盖 4 种基模型共 5 种配置)、技能注入语料 5 种模型。
- 数据集与规模:HELM harm_bench(393 个行为,7 个类别)、HarmBench(19 模型 × 16 种攻击共 2210 个样本对)、AgentDojo(完整网格 478 个场景;单家族 949 个场景)、XSTest(200 个不安全与 250 个安全提示词)、SORRY-Bench(44 项,4 个领域)、AIR-Bench 2024(87 模型 × 5694 个提示词,16 个二级类别)、技能注入语料(1342 个未防御回合,每项防御 130 回合)。
- 基线方法:样本内基准(pin (oracle))、诚实基准(pin (honest))、随机选择(random)、逐请求预言机(oracle)、无信号路由器(signal-free null)。
- 评价指标:危害率(harm)、选择代价(selection cost)、条件尾部优势(ε)、AUROC、攻击成功率(attack success)、标记率(flag rate)、任务效用(task utility)。
- 评审机制:HELM harm_bench 使用 safety_gpt_score 与 safety_llama_score 两个自动化评审模型的并集标签(任一判定有害即为有害);技能注入语料使用 claude-sonnet-4-6 单一自动化评审模型判定成功与标记;XSTest 采用人工标签。
- 采样与重复设置:小池规模(k ≤ 5)平均 200 个随机池 × 5 折;k = 44 为 1 个全池 × 5 折;自适应攻击在 130 个重跑索引上采用 200 次划分或 200 次重采样自举。
主结果
表格较宽,可左右滑动
模型池规模 k pin (oracle) pin (honest) 胜者诅咒 (选择代价) router − pin (oracle) router − pin (honest) 2 0.1873 0.2299 +0.0426 +0.0355 −0.0071 3 0.1278 0.1951 +0.0674 +0.0536 −0.0138 5 0.0654 0.1622 +0.0968 +0.0732 −0.0236 44 0.0000 0.1127 +0.1127 +0.0819 −0.0308 (据 Table II,HELM harm_bench 类别留出折均值,种子 24)
- 后验基准造成虚假劣势:作者指出,当面对样本内基准 pin (oracle) 时,路由器在所有池规模上平均处于劣势(危害差 +0.0355 至 +0.0819),且在任何池单元中均未获胜。
- 诚实基准下均值反转但中位数打平:一旦替换为训练折选出的诚实基准 pin (honest),路由器平均危害低于基准(−0.0071 至 −0.0308),但跨池单元的差异中位数在所有池规模下均为 0.0000。
- 路由器发生策略收敛:作者称,中位数为零并非路由生效,而是嵌套调优在分布偏移下倾向于选择极小收缩因子 λ = 0,使路由器完全塌缩为固定模型选择,在 82% 至 91% 的池单元中直接输出诚实基准的模型。
多语料选择代价审计与偏移效应
- 测试内容:在 7 个符合条件的安全语料上评估 k=2 时的选择代价,对比类别/家族留出划分与平稳随机划分(Table III)。
- 实验结果:在 HELM harm_bench 上,留出选择代价为 0.0454,随机划分为 0.0026,差异 95% 置信区间为 [0.0329, 0.0491];在 SORRY-Bench 上留出代价为 0.0076(随机 0.0036);在 AIR-Bench 2024 上留出代价为 0.0053(随机 0.0002);在 HarmBench 上留出代价为 0.0019(随机 0.0006)。
- 作者解读:作者指出,选择代价在有显著路由空间的语料上随分布偏移而上升,在 HELM 上达到完美单请求路由器潜在增益的 57%,在 SORRY-Bench 上达到 40%;在存在零危害模型的饱和语料上选择代价空间较小。
智能体环境中的预执行路由与识别脆弱性
- 测试内容:在 AgentDojo 上评估跨家族与单家族预执行路由上限,并在技能注入语料上测试自适应模板攻击对模型识别标记的影响。
- 实验结果:AgentDojo 完整子网格上预执行预言机危害差距至多 0.0105(E43);在技能注入语料中,针对性攻击者(A4)知晓目标模型后,使 gpt-5.4 的判定标记率从 0.226 降至 0.030,降幅达 19.6 点(E54b),并在独立词表标注下复现(κ = 0.818,p ≤ 10^-4,E55)。
- 作者解读:作者称预执行路由在任务饱和的智能体网格中收益极低(至多 2 点危害);而执行后的防御若依赖模型自发识别,该信号在知晓模型的自适应攻击下易被操纵,产生警惕幻觉(vigilance illusion)。
信号门控控制器与动作级防御评测
- 测试内容:将识别标记离线组合进静默升级控制器,并评估四种动作级策略设置(ask_user, no_network, script_audit, two_pass)的防御效果(Table XVI)。
- 实验结果:静默升级在 94% 至 98% 任务中触发升级;针对性攻击使系统危害降低 4.9 至 10.6 点,但若移除 claude-sonnet-4-6 这一后备模型,危害变化反转为增加 2.3 至 8.9 点(E56b);四种动作级策略均记录到 0/130 判定成功,严格对齐执行模式后剩余 10 个有效样本,残余成功率 95% Clopper–Pearson 上界为 0.308(E40)。
- 作者解读:作者指出,门控控制器的安全性取决于后备模型而非识别信号本身;动作级策略在发布数据中未包含强制隔离 harness(docker_sandbox 为 false),520 个防御回合无一出现机械阻断报错,其零成功表现与模型自主拒绝一致。
其他消融与分析
- 编码器缩放分析:从 MiniLM 扩展至 Qwen3-Embedding-8B,AUROC 从 0.6060 升至 0.6901,仅 8B 模型超过诚实门槛 0.6842(Table XI)。
- 操作点不对称性消融:在固定 AUROC 0.80 下,改变分数不对称性 κ 跨 16 倍,危害差从 −0.0095 转为 +0.0548(Table VIII)。
- 经验难度分布分析:按样本基础危害率分 4 组,条件尾部优势单调恶化,诚实基准下从 −0.0071 降至 −0.3325(Table IX)。
- 评审模型偏差分析:仅更换自动化评审模型,最佳单模型在 harm_bench 上发生改变,两评审模型在样本上重合率 82.8%,跨模型预测 AUROC 仅 0.746(Figure 5)。
- 级联成本前沿分析:在计划预算下 16 种真级联危害低于诚实前沿,但 12 种的节约完全来自廉价模型本身,且 6 种在实际成本上超支(E34)。
- 负面结果与例外:在 HarmBench 上,留出选择代价仅 0.0019,且其固定折分配的代价低于 200 次随机分配,未展现出大额留出代价,作者未给出具体机制解释。
有什么可以进一步探索的点?
作者指出了语料范围、评测器偏差与离线假设等局限,实际实验覆盖至 7 个公开语料。
作者指出的局限与后续方向
- 适用环境与语言范围局限:实验语料主要覆盖两个聊天、一个智能体和一个技能注入环境,且聊天数据基本为英语和单轮对话(Section IX)。
- 分布偏移类别与语料异质性:研究的偏移形式为请求类别留出,选择代价仅在 HELM harm_bench 上显著偏大,且事先注册的标准未能预测各语料代价大小(Section IX)。
- 分组划分依赖性:留出成本依赖于分组与折的分配方式,在 HELM 上 200 次随机分配均值为 0.037,论文固定分配处于第 89 百分位偏高位置(Section IX)。
- 智能体环境自然饱和性缺失:所测智能体数据缺乏自然非饱和且具备互补弱点的模型池,唯一具备显著空间的池依赖于事后人为剔除主导模型(Section IX)。
- 评审模型自评偏差与召回率未测:危害与标记依赖单一自动化评测器,在技能注入语料中评测模型自身也是被测目标之一,其自评成功率为 0.263(低于其余模型的 0.575),且评测器召回率未经验证(Section IX)。
- 攻击者与控制器假设:转向参数 α 强制进入廉价分支采用随机而非针对性子集;自适应攻击仅在 6 个预设模板中选择而非优化有效载荷;控制器评估为基于日志的离线反事实重抽样而非在线执行(Section IX)。
实验覆盖范围
- 数据集覆盖至 7 个公开安全语料(HELM 3 个子任务、HarmBench、AgentDojo、XSTest、SORRY-Bench、AIR-Bench 2024 及技能注入数据)。
- 完整模型池比较仅覆盖至具有全案例交叉测试记录的模型子集(HELM 为 44 个模型,HarmBench 为 19 个模型,AgentDojo 跨家族完整网格为 4 个基模型)。
- 编码器模型探索覆盖至从 22M MiniLM 到 8B Qwen3-Embedding 参数规模。
- 动作级防御评估仅覆盖 4 种策略设置在 3 个模型与 5 个单元上的 130 个回合,模式匹配后有效样本为 10 个。
- 论文未报告轨迹中途动态切换模型的在线交互评测,亦未构建外部物理隔离执行环境验证机械策略。
总结一下论文的主要内容
论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
- 论文定位:论文系统评估了多模型安全路由与基于信号的防御机制在分布偏移下的有效性,指出流行评测中后验选择基准所造成的评估误导。
- 要解决的问题:传统路由评估常在测试数据上事后挑选最佳单模型,在分布偏移下为固定基线注入了人为优势,构成了 deployer 无法实现的虚假下限。
- 关键方法:提出在训练折严格冻结基准模型与收缩因子的诚实留出协议;推导超额危害分解与多维门槛表面;在智能体与技能注入环境中测试预执行路由上限、自适应模板攻击与动作级策略。
- 核心实验发现:
- 在 HELM Safety 类别留出下,后验基准的选择代价为 0.045 至 0.113(Table II),与路由全额劣势相当;在平稳划分下仅为 0.003 至 0.030。
- 在诚实基准下,路由器在 82% 至 91% 的池单元中直接收缩为固定基准模型,危害差异中位数为 0.0000(Section IV)。
- AgentDojo 智能体网格中预执行路由预言机增益至多 0.0105(E43)。
- 针对性自适应攻击使 gpt-5.4 表达性标记率下降 19.6 点(E54b),使门控控制器的有效性取决于后备模型漏洞。
- 四项动作级防御测试取得 0/130 判定成功,但模式对齐后有效样本仅 10 个(Clopper–Pearson 上界 0.308,Table XVI),且未见机械强制阻断标记。
- 作者结论与启示:作者认为安全路由在应对未见类别时的防御收益微弱,安全评估必须使用未见测试标签的诚实基准并公布成对数据;防御重心应从脆弱的输入分类转向外部动作级强制隔离。