研究发现类型化决策模型主要按选项标签而非定义作答
研究者在开源类型化决策模型上发现模型主要遵循选项标签而非定义规则,该偏差源于提示词渲染而非决策头结构。
- +0.1511LAYA-TD 在 PolicyBench-XF 上任意标签相比对齐标签的准确率提升(Table 3)
- -0.0516LAYA-TD 在固定标签分类任务上标签与定义冲突相比对齐标签的准确率变化(Table 5)
- 0.136LAYA-TD 在固定标签分类任务误导标签下准确率暴跌至(Table 5)
探究类型化决策模型中概率输出被选项标签主导而非遵循规则定义的根因。
回顾类型化决策模型评估与上下文校准,反驳此前归咎于决策头的观点。
通过通道解耦、构建 PolicyBench、代码级渲染干预及双调用测试定位偏差。
在多模型与基准上证实标签主导决策,干预代码消除该效应,发现否定失效与置信度倒挂。
作者指出了未覆盖闭源模型及数据合成等局限,实验覆盖了9个模型与11项任务。
揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。