研究发现类型化决策模型主要按选项标签而非定义作答
Labels Override Definitions in Jev-Style Typed Decision Models
研究者在开源类型化决策模型上发现模型主要遵循选项标签而非定义规则,该偏差源于提示词渲染而非决策头结构。
- 在 Jev 风格类型化决策模型中,开发者通过选项定义指定规则,但模型概率究竟遵循定义还是短标签;此前研究归咎于受限决策头,论文探究该偏好(选项标签偏差)的真正根因与对安全决策的影响。
- 提出选项标签与定义双通道消融框架,设计仅在定义中包含决策规则的合成基准 PolicyBench;通过对代码中选项提示词渲染表达式的双向补丁修改,因果验证偏差来源;并给出双调用检测测试与 4 种缓解策略。
- 在 3 个 LAYA 模型与开源语言模型中,决策主要被标签主导,删除定义准确率不变,冲突时准确率暴跌;VON 因未将标签填入输入而完全不受影响。消除或添加标签前缀可在不改动权重下消除或复现该效应。此外模型无法正确理解否定句,且标签冲突时置信度排序反转。
- 作者指出未测试闭源商业模型 Jev 本身,机制结论基于开源实现代码;PolicyBench 为合成模板数据,牺牲了自然度;定义措辞由作者编写,不同措辞会改变绝对数值;LAYA-ML 与 Qwen2.5-1.5B 在该基准接近随机猜测。实验覆盖 4 个开源决策模型与 5 个开源语言模型,测试 11 个公开分类任务与合成基准 PolicyBench(n=3500)。
- 模型
- laya-typed-decisionslayalaya-multilingualvonQwen2.5-0.5BQwen2.5-1.5BQwen2.5-7BLlama-3.1-8B-InstructMistral-7B-Instruct-v0.3
- 基准
- PolicyBenchPolicyBench-XFSST-2RTECBSST-5BoolQWiCUNFAIR-ToS
- 指标
- accuracyAUROCflip ratestate-blindness
研究者对开放权重类型化决策模型及语言模型进行对照评测,发现部分模型会优先遵循选项标签的语义,而非定义中的规则。作者通过输入渲染的对照修改,将偏差与标签是否进入模型输入关联起来;所测 VON 在原设置下不受同样影响。研究未直接测试闭源商业 Jev 模型,合成评测结果不能直接代表所有部署场景。
推荐理由论文用消融实验把标签偏好定位到提示词渲染这一行代码,并给出两次调用即可自查的方法,对部署分类式决策模型的团队有直接参考价值。
深度解读
这篇论文试图解决什么问题?
探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。
论文试图解决的核心问题是:在 Jev 风格的类型化决策模型(typed decision models)及提示词分类器中,模型的输出概率究竟是遵循选项的定义规则,还是被选项的名称标签(label)所主导。
- 问题场景与现实价值:2026年出现的类型化决策模型(如商业模型 Jev 及其开源复现)专用于路由、内容审核与分流等安全与工程场景。这类模型不生成文本,仅通过单次前向传播在调用者指定的选项集上输出概率分布,调用成本比通用大模型低 1 到 2 个数量级。
- 现有假设与归因缺陷:此类接口要求开发者传入简短标签(如 billing)与规则定义(criteria 字段中的文本)。此前的研究(Sun et al., 2026)发现重命名选项会导致决策剧变,并将其归咎于此类模型用于替代自回归解码器的受限决策头(constrained decision head)。
- 论文的核心观察与论点:作者认为这一归因缺乏对照,实际上普通语言模型直接打分选项时同样存在该偏差。该失效机制并不在决策头结构中,而在于提示词的输入渲染方式(prompt rendering):模型倾向于根据标签的语义做判断,忽略甚至覆盖在定义中写明的具体决策规则,作者将该现象定义为选项标签偏差(option-label bias)。
- 论文提出的核心工作:论文解耦了请求中的标签通道与定义通道,引入了规则仅存在于定义中的合成路由评测基准 PolicyBench,在开源模型上进行了双向提示词补丁干预实验,提出了无需权重即可诊断该偏差的双调用测试(two-call test),并实测了 4 种缓解方案。
- 威胁模型:
- 攻击者目标:论文不预设对抗性恶意攻击者,重点研究决策机制在自然使用或语义冲突输入下的非对抗性失效风险。
- 系统能力与接口:调用者通过结构化请求传入被评估状态(state)、指令(instructions)以及包含选项标签与定义的规则字典(criteria)。
- 失效模式:当标签的表面语义与定义中约定的逻辑规则发生不一致、不匹配或误导时,模型决策脱离开发者指定的定义规则。
- 受害系统:依赖类型化决策模型进行策略路由、内容审核与风险拦截的自动化安全管线。
有哪些相关研究?
回顾类型化决策模型评估与上下文校准,反驳此前归咎于决策头的观点。
论文围绕类型化决策模型的评测、机制归因及先验偏差等相关工作展开了讨论:
- 类型化决策模型评测与脆弱性研究
- Deußer et al. (2026):评估了商业托管模型 Jev 在广泛的分类与阅读理解任务上的准确率与性能。
- Li et al. (2026a):发现此类模型在面对逻辑关联的问题时,输出的概率违背了基本的概率公理。
- Xu (2026)、Hu et al. (2026) 与 Wu & Lim (2026):分别研究了上下文干扰、追加未验证意见以及提示注入攻击(prompt injection)对决策模型输出的篡改。
- Tang & Zheng (2026):对首批 28 篇相关论文进行了评估审计,指出其中极少包含普通语言模型基线(26 篇中仅 5 篇),且几乎未测试选项命名的不变性(27 篇中仅 1 篇)。
- 选项名称影响与决策头归因
- Sun et al. (2026):在闭源商业模型 Jev 上首次报告了重命名选项会导致决策改变的现象,并将其归咎于替代文本解码器的受限决策头结构。论文明确反驳了这一归因,指出普通语言模型打分同样存在该问题,且通过输入渲染干预即可消除或诱发该偏差。
- 输入无关的标签先验(Input-independent label priors)
- Zhao et al. (2021):在少样本语言模型中建立了输入无关先验的存在,并提出了上下文校准(contextual calibration)方法,通过除以空输入的预测概率消除偏差。论文对比了该先验与选项标签偏差的区别,指出前者是不论输入为何都偏向某一选项,而后者是当标签语义与定义冲突时优先遵循标签。
- 基线方法与基准数据集
- 基线方法:包含普通语言模型基于长度归一化的标签对数概率打分(label log-probability readout)、受限首 token 打分(first-token readout)以及生成后解析(generative readout)。
- 评测基准:公开分类基准包括 SuperGLUE 中的 RTE 与 CB、情感分析 SST-2、自然语言推理等,布尔任务包括 BoolQ、WiC、UNFAIR-ToS 等,以及论文构建的合成基准 PolicyBench。
作者将本文定位为:对早期文献归因的纠偏与机制深化,首次通过开源模型权重与代码级双向干预,证明选项标签偏差根植于输入提示词拼接,而非受限决策头架构。
- 类型化决策模型评测与脆弱性研究
论文如何解决这个问题?
通过通道解耦、构建 PolicyBench、代码级渲染干预及双调用测试定位偏差。
论文通过解耦请求通道、设计受控基准、因果干预输入渲染以及提出诊断测试来解决该问题。
问题设定与形式化
类型化决策请求包含状态 s、问题 q 以及选项 o1, …, ok。每个选项包含两个通道:标签(label)与定义(definition)。
- 类型化决策头:在输入中为每个选项插入标记 token,由编码器在第 i 个标记位置读取标量 zi,通过温度参数 τ 归一化输出概率:
p(oi ∣ s, q) = (exp(zi/τ))/(∑j=1k exp(zj/τ)) (该公式表示单次前向传播直接计算所有选项的后验概率分布)。
- 语言模型对数概率读出:将状态和问题渲染为提示词 π(s, q),按选项文本长度 |oi| 归一化打分:
p(oi ∣ s, q) = (exp ℓi)/(∑j=1k exp ℓj), 其中 ℓi = 1/(|oi|) log PLM(oi ∣ π(s, q)) (该公式表示通用语言模型自回归打分作为分类器的后验概率)。
变体设计与通道解耦
为独立分离标签与定义的作用,论文设计了多种变体条件(Table 1):
- aligned(对齐):选项保留任务原本的类别名称,定义正确描述类别。
- arbitrary(任意):将标签重命名为无语义的 A、B 等,仅由定义承载分类规则。
- misleading(误导):将各个类别的名称互换,但绑定的定义依然真实准确。
- label only 与 neither:分别将定义剔除为占位符,或同时剔除两者的控制组。
- 状态变体:包括真实输入状态(real)、空状态(null,用于提取无证据先验)以及错误匹配状态(mismatch)。
PolicyBench 合成基准构建
为消除自然任务中标签本身即可提示类别的干扰,论文构建了 PolicyBench:
- 生成属性与受控模板:基于 6 个受控属性模板生成客服工单,规则是属性的布尔函数(涵盖单项、合取、析取与否定),且规则仅用自然语言写在选项定义中。
- 绝对真实标签:真值由生成属性直接布尔运算得出,通过拒绝采样使正负样本严格平衡(50:50),杜绝标注噪声与数据污染。
- 受控控制组 PolicyBench-XF:将否定分支的模糊定义(“以上皆不适用”)替换为对称明确的策略逻辑否定描述,确保两分支定义在长度与具体度上对称,消除位置偏好的人工假象。
输入渲染干预与两调用测试
- 输入渲染机制因果干预:对比发现,受影响的 LAYA 代码在输入中将每个选项拼接为
"{label}: {definition}";不受影响的 VON 则仅向编码器传入定义文本,标签仅作内部键值字典查找。作者仅修改这一行代码(双向打补丁),在不改变权重、决策头或校准参数的情况下验证因果性。 - 双调用黑盒测试(Two-call test):向模型发送同一问题两次,仅修改选项标签(如换为 A、B)而保持定义完全一致。若两次返回分布不同,则证明模型存在标签偏差。
论文做了哪些实验?
在多模型与基准上证实标签主导决策,干预代码消除该效应,发现否定失效与置信度倒挂。
实验设置
- 被测模型:开源类型化决策模型 4 个(基于 ModernBERT 架构):LAYA-TD(421M)、LAYA-EN(421M)、LAYA-ML(322M)、VON(395M)。开源语言模型读出基线 5 个:Qwen2.5(0.5B、1.5B、7B)、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3。
- 数据集与基准规模:固定标签选择任务 3 个(SST-2 500条、RTE 277条、CB 56条,合计 n=833);布尔任务 7 个(BoolQ 500条、SST-2 布尔版 500条、RTE 布尔版 277条、WiC 500条、UNFAIR-ToS 3类各 76条);有序任务 SST-5(500条);合成路由基准 PolicyBench-XF(n=3500,7项策略)。
- 指标定义:准确率(Accuracy);置信度 AUROC;翻转率 flip(公式4,定义为两次改写间最高概率类别改变的比例);状态盲目度 blind(公式5,定义为决策与空状态决策完全一致的比例)。
- 评审与置信区间:通过真实标签直接比对计算准确率,所有区间采用 4000 次重采样的百分位 Bootstrap 计算 95% 置信区间。
主结果
在合成路由基准 PolicyBench-XF 上,不同标签条件下的准确率如 Table 2 所示(随机猜测基准为 0.500):
表格较宽,可左右滑动
模型 aligned arbitrary A/B misleading label only neither LAYA-TD 0.742 [0.728, 0.756] 0.893 [0.883, 0.903] 0.836 [0.824, 0.849] 0.569 [0.553, 0.585] 0.528 [0.512, 0.545] LAYA-EN 0.791 [0.778, 0.804] 0.869 [0.857, 0.880] 0.530 [0.513, 0.546] 0.529 [0.513, 0.545] 0.502 [0.486, 0.519] LAYA-ML 0.635 [0.620, 0.652] 0.631 [0.615, 0.647] 0.673 [0.657, 0.688] 0.521 [0.505, 0.538] 0.477 [0.459, 0.493] VON 0.852 [0.840, 0.864] 0.852 [0.840, 0.864] 0.852 [0.840, 0.864] 0.500 [0.483, 0.517] 0.500 [0.483, 0.517] Qwen2.5-1.5B 0.500 [0.479, 0.521] 0.513 [0.492, 0.534] 0.511 [0.490, 0.532] 0.500 [0.479, 0.521] 0.508 [0.487, 0.529] Qwen2.5-7B 0.789 [0.770, 0.806] 0.909 [0.897, 0.921] 0.835 [0.820, 0.851] 0.500 [0.479, 0.522] 0.516 [0.495, 0.539] Llama-3.1-8B 0.638 [0.618, 0.659] 0.514 [0.493, 0.536] 0.500 [0.478, 0.521] 0.500 [0.479, 0.522] 0.503 [0.482, 0.525] Mistral-7B 0.723 [0.705, 0.743] 0.877 [0.862, 0.890] 0.867 [0.852, 0.881] 0.510 [0.490, 0.531] 0.492 [0.471, 0.514] - 作者对主结果的解读:除 VON 保持恒定外,具备充分能力的模型在将对齐标签替换为任意字母 A/B 后,准确率均出现提升(如 LAYA-TD 提升 +0.1511,Qwen2.5-7B 提升 +0.1203,Table 3)。
- 误导标签导致性能下降:在 LAYA-EN 上,标签误导使准确率降至 0.5297,接近 0.5 的随机水平;而控制组 label only 与 neither 均在 0.5 附近,表明规则完全蕴含在定义中。
- VON 的不变性:VON 在 aligned、arbitrary 与 misleading 下准确率完全相同(均为 0.852),在剥离定义后降至 0.500,作者指出其因果在于根本未将标签送入编码器。
输入渲染的双向打补丁干预
- 测了什么:在保持模型权重、结构与校准完全不变的前提下,修改单行代码:将 LAYA 的输入改为仅传定义,将 VON 的输入改为前缀拼接标签(Table 5)。
- 结果:删除标签前缀后,LAYA 3 个检查点在对齐、任意与误导条件下的准确率差异完全归零(对比差距为 +0.0000 [+0.0000, +0.0000]);而在分类任务上,LAYA-TD 在标签冲突下的暴跌被完全消除(从 0.136 恢复至 0.807)。反之,给 VON 拼接标签后,其在分类任务上遭遇相同崩溃,冲突条件下准确率从 0.851 骤降至 0.228。
- 作者的解读:作者认为这一双向实验排除了受限决策头的结构性归因,证实该偏差由提示词渲染逻辑直接引起。
否定问题敏感度实验
- 测了什么:在 7 个布尔任务上,测试将 yes/no 问题加上 "Is it false that" 否定前缀前后的准确率与翻转率(Figure 5, Table 10)。
- 结果:对于 LAYA-TD,否定前缀导致 0.983 的决策发生翻转(即概率几乎未变,但真值反转),准确率从 0.642 降至 0.358;即使是标签不变的 VON,翻转率也高达 0.971,准确率从 0.738 跌至 0.263。追加明确指令注意极性后准确率仍仅为 0.3546。
- 作者的解读:作者指出模型对问题极性存在普遍的不敏感性,对标签不变并不能保证模型正确读取了问题本身,这两类失效相互独立。
决策置信度的反向失效
- 测了什么:评估模型自带置信度在标签与定义冲突条件下的校准与排序能力(Table 6)。
- 结果:在对齐条件下,LAYA-TD 的置信度 AUROC 为 0.8123,能有效区分对错;但在误导标签下,其 AUROC 倒挂至 0.2433(LAYA-EN 倒挂至 0.1940)。
- 作者的解读:AUROC 低于 0.5 意味着排序完全反转,模型最自信的决策往往错得最多。常见的“高置信度采纳、低置信度上报大模型”路由门控在此场景下会发生彻底误判。
其他消融与分析
- 任意标签形式敏感度:LAYA-TD 使用无关单词、数字、字母标签的准确率分别为 0.8537、0.8740、0.8931,均高于对齐名称的 0.7420(Table 2)。
- 对数概率归一化与首 token:Qwen2.5-7B 长度归一化与受限首 token 打分在各条件下的数值完全在误差范围内重合(Table 11)。
- 生成式读出在受控与非受控基准下的表现:非受控套件下 7B 生成式读出在误导标签下达 0.8490,但在受控套件 XF 下生成读出为 0.7933,低于打分读出的 0.8352(Table 11)。
- 空状态先验校准增益:空状态先验校准使 LAYA-TD 对齐准确率提升 +0.0391,但使任意标签准确率下降 -0.0423,且使 VON 准确率暴跌至 0.5000(Table 7)。
- 添加忽略标签指令(M3):向指令中追加忽略标签文本仅为 LAYA-TD 带来 +0.0138 提升,远低于直接重命名为 A/B 的 +0.1511(第 6 节)。
- 双渲染不一致过滤(M4):过滤对齐与任意渲染不一致项后,LAYA-TD 保留项准确率从 0.7420 提升至 0.8921,覆盖率为 0.8100,精确率为 0.8977(Table 8)。
有什么可以进一步探索的点?
作者指出了未覆盖闭源模型及数据合成等局限,实验覆盖了9个模型与11项任务。
作者指出的局限与后续方向
- 未测试商业闭源模型(§7):论文指出未直接测试商业闭源模型 Jev,全部结论仅涵盖其接口的开源权重实现以及语言模型读出,机制层面的结论仅限于两套公开代码库,无法检查闭源模型内部实现。
- 合成评测集的真实感局限(§7):PolicyBench 采用合成模板生成,虽然确保了严格的真值逻辑、类别平衡与防污染,但牺牲了自然语料的真实性。
- 误导条件下的任务定义歧义(§7):误导设置中标签与定义发生冲突,读者可能认为此类请求本身存在定义不充分(under-specified)的问题。
- 人工编写定义的措辞依赖(§7):定义文本为作者自行编写,尽管控制组证明其可被模型理解,但不同的提示词表述可能会导致绝对指标发生波动。
- 部分小规模模型能力不足(§7):开源多语言检查点 laya-multilingual 在 PolicyBench 上表现接近随机猜测,作者未从其对比中得出机制结论。
实验覆盖范围
- 被测模型数量:实验覆盖 4 个开源类型化决策模型(LAYA-TD、LAYA-EN、LAYA-ML、VON)以及 5 个通用开源语言模型(Qwen2.5-0.5B/1.5B/7B、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3)。
- 任务与基准数量:实验测试了 11 个公开自然语言分类基准(涵盖选择、布尔与有序打分任务)以及 1 个包含 7 项规则的合成路由套件 PolicyBench。
- 样本量设置:合成基准 PolicyBench-XF 的样本量为 n=3500;固定标签分类任务集合的样本量为 n=833。
- 防御与缓解措施评测:测试了包括重命名任意标签(M1)、空状态先验校准(M2)、指令忽略标签(M3)以及双渲染一致性过滤(M4)共 4 种缓解手段。
- 论文未报告指标:论文未对模型的推理延迟与硬件运行成本进行实测对比,相关成本优势引用自早期文献;论文未包含人工评审一致性比例。
总结一下论文的主要内容
揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
- 一句话定位:论文系统分析了 Jev 风格类型化决策模型中普遍存在的选项标签偏差,揭示其物理根因为输入渲染而非决策头结构。
- 要解决的问题:在类型化决策接口中,开发者在 criteria 字段中为选项编写规则定义,期待模型以后验概率输出决策。然而,当标签自身带有语义时,模型输出究竟受定义驱动还是受标签驱动此前缺乏实证隔离与机理判定。
- 方法要点:设计双通道解耦实验与规则仅存在于定义中的 PolicyBench 合成基准;通过修改代码单行表达式,在保持模型权重完全不变的情况下,进行输入前缀拼接的双向因果干预;提出无需权重的双调用黑盒检测方法。
- 核心实验结果:
- 在 PolicyBench-XF 上,将语义标签替换为 A/B 任意标签使 LAYA-TD 准确率提升 +0.1511(达到 0.8931,Table 2, 3)。
- 在分类任务中,当标签与定义冲突时,LAYA-TD 准确率暴跌至 0.136,而代码中未拼接标签前缀的 VON 保持在 0.851 不受影响(Table 5)。
- 双向打补丁干预使 LAYA 的标签依赖完全消失(对比差归为 +0.0000),同时使 VON 出现标签敏感性与冲突崩溃(降至 0.228,Table 5)。
- 类型化模型在面对否定词前缀时决策翻转率高达 0.9656 至 0.9825(Table 10);且在标签冲突时置信度 AUROC 倒挂至 0.2433(Table 6)。
- 作者结论与启示:类型化决策模型的定义字段并未真正成为可靠的逻辑约束。若业务场景依赖自定义规则,应使用无语义标签(如 A、B)并将规则全量写入定义;不能单凭置信度阈值过滤错误,建议采用双渲染一致性校验。