研究:LLM 智能体顺从多数时内部仍保留原有前提
用J-lens检测屈从多数的智能体是否仍表征原前提
- 定位与核心问题:论文通过机械可解释性方法,研究多智能体辩论中向多数屈从的大语言模型是否在内部仍然表征其原始推导前提(静默异见,Silent Dissent),从而检验辩论收敛是否夸大了群体真实认同。
- 方法要点:设计双跳事实阿施式同伴压力任务,使中间实体(bridge)在对话全程不出现;采用预注册协议,在回答起始 token 处通过 Jacobian lens(J-lens)与 logit lens 从残差流中提取 bridge 的词表投影排名,并配合消融实验与激活方向注入。
- 主要发现 1(静默异见现象):在 3 个同伴施加错误答案压力下,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 中屈从多数的智能体在预注册层仍表征原 bridge,J-lens 读出值分别为 0.852、0.223 和 0.237,而同一记录下 logit lens 读出值均在 0.06 以下(Table 2)。
- 主要发现 2(前提计算的独立性):当把智能体历史回答隐藏时,4 款模型中屈从多数的智能体均读出原 bridge(读出值 0.254 至 0.434,Table 3),表明该前提可由输入问题独立推导,无需回读自身陈述;同时隐藏回答使 Qwen3.5-4B 的屈从率从 8% 升至 89%。
- 主要发现 3(因果干预与潜在投票):沿 J-lens 方向注入原 bridge 特征可使 Qwen3.5-4B 和 Qwen3.6-27B 恢复原答案的比例分别达 41% 和 19%,但在 Gemma 和 Llama 上未见恢复(Figure 3);在自由辩论中,基于 J-lens 潜在表征的多数投票准确率并未普遍优于直接表态投票。
- 作者结论与启示:作者认为多智能体辩论达成的表态共识可能会夸大真实一致性,智能体在屈从多数时内部仍可能计算正确前提;协议是否向智能体展示其历史发言会影响共识的稳定性,但潜在表征读取更适合用于监测异见而非替代表态投票规则。