BeliefScope:区分证据与用户压力对模型信念影响的受控框架
AI 导读
研究者提出 BeliefScope,一个受控黑箱框架,用于在固定目标命题上区分真正相关证据与不带新事实的方向性用户压力对语言模型回答的影响。该框架将证据与压力两个因素交叉,并配合因素特定的局部控制,通过概率报告、分类判断和行动建议等渠道测量回答变化。在受控合成条件下,研究者用已知真值恢复和定向消融确定两类效应可分离的范围,并用半合成压力测试考察观测过程变噪、变异质时这种可恢复性如何变化。在 36 个 Qwen/Llama 模型家族的实验中,另对 12 个家族(含 Gemma3-12B)做定向检查,结果显示模型层面的差异在匹配控制、解码设置或回答接口变化时可能改变,而部分更窄的模型内模式保持稳定。指令干预还显示,目标对齐压力跟随的减少可能来自稳定抵抗,也可能来自朝相反方向移动。