研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
- 一句话定位:论文系统分析了 Jev 风格类型化决策模型中普遍存在的选项标签偏差,揭示其物理根因为输入渲染而非决策头结构。
- 要解决的问题:在类型化决策接口中,开发者在 criteria 字段中为选项编写规则定义,期待模型以后验概率输出决策。然而,当标签自身带有语义时,模型输出究竟受定义驱动还是受标签驱动此前缺乏实证隔离与机理判定。
- 方法要点:设计双通道解耦实验与规则仅存在于定义中的 PolicyBench 合成基准;通过修改代码单行表达式,在保持模型权重完全不变的情况下,进行输入前缀拼接的双向因果干预;提出无需权重的双调用黑盒检测方法。
- 核心实验结果:
- 在 PolicyBench-XF 上,将语义标签替换为 A/B 任意标签使 LAYA-TD 准确率提升 +0.1511(达到 0.8931,Table 2, 3)。
- 在分类任务中,当标签与定义冲突时,LAYA-TD 准确率暴跌至 0.136,而代码中未拼接标签前缀的 VON 保持在 0.851 不受影响(Table 5)。
- 双向打补丁干预使 LAYA 的标签依赖完全消失(对比差归为 +0.0000),同时使 VON 出现标签敏感性与冲突崩溃(降至 0.228,Table 5)。
- 类型化模型在面对否定词前缀时决策翻转率高达 0.9656 至 0.9825(Table 10);且在标签冲突时置信度 AUROC 倒挂至 0.2433(Table 6)。
- 作者结论与启示:类型化决策模型的定义字段并未真正成为可靠的逻辑约束。若业务场景依赖自定义规则,应使用无语义标签(如 A、B)并将规则全量写入定义;不能单凭置信度阈值过滤错误,建议采用双渲染一致性校验。