研究:LLM 智能体顺从多数时内部仍保留原有前提
Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
用J-lens检测辩论中屈从多数的LLM,发现多模型内部仍表征原bridge(如Qwen3.5-4B读出达0.852)。
- 多智能体辩论达成共识时,智能体常向多数意见妥协,需要探究智能体放弃原答案是真正改变观点还是仅在表态上顺从(偏好伪饰)。直接读取选项字母已被正对照实验证明失效,需寻找能反映内部真实计算的前提表征。
- 采用双跳事实问答,在同伴施加错误多数答案压力下,于智能体回答首个token对应的残差流位置,使用Jacobian lens(J-lens)与logit lens读取未在对话中出现的中间实体(bridge),并在消融中隐藏或移除智能体历史回答,以及沿J-lens方向进行激活注入。
- 在Qwen3.5-4B、Qwen3.6-27B与Gemma-4-E4B-it中,屈从多数的智能体在预注册层仍以高于对照实体的水平表征原bridge(J-lens readout为0.85、0.22与0.24);隐藏原答案时四款模型均表征原bridge。J-lens干预仅在两款Qwen模型上恢复了原答案。
- 作者指出的局限包括仅测试了模型已知事实(占TwoHopFact的3%–9%)、同伴采用脚本化逐字重复缺乏真实感、实体仅限于特定类别、因果干预效应仅在Qwen成立等。实验覆盖4个开源模型、TwoHopFact及手写首都项,论文未报告其他语言、闭源模型或更多轮次测试。
- 模型
- Qwen3.5-4BQwen3.6-27BGemma-4-E4B-itLlama-3.1-8B-Instruct
- 基准
- TwoHopFacthand-written capital-city items
- 指标
- hit@100 - controlhit@10hit@500Gave in (%)top next token is the original answer (share)
论文在脚本化的错误多数共识和两跳事实任务中研究 LLM 智能体从众。作者用 Jacobian lens 读取内部表示,报告部分模型公开改口后仍可解码出其原有中间实体,同时也存在同伴给出的实体;与 logit lens 相比,两种读取方法结果不同。探索性干预只在两个 Qwen 模型中部分恢复原答案。内部表示保留不等于存在有意识的私人信念或蓄意欺骗;摘要所述结果来自小模型与合成任务,不能直接外推到真实部署。
推荐理由论文用 J-lens 读取智能体在顺从多数时的内部表征,为多智能体辩论中的表面共识提供了可迁移的监测思路。
深度解读
这篇论文试图解决什么问题?
探究多智能体辩论中向多数屈从的LLM是否在内部仍表征其原始推理前提。
多智能体辩论中智能体向错误多数意见屈从时,模型究竟是改变了内部观点还是仅仅在表态上顺从,以及如何在内部表征中检测这种未公开表达的偏好伪饰。
- 问题场景与现实影响:作者称,多智能体辩论常被用于提升事实性与推理能力,但智能体往往像阿施从众实验一样向多数妥协;若达成的一致仅为公开顺从而非私下接受,辩论共识便会夸大群体真实认同。
- 直接读取答案的不足:作者报告,直接在回答位置通过探针或投影读取选项字母无法区分真实信服与虚假顺从;在协调器强制指定输出字母的正对照实验中,预先指定的层在 1000 次测试中给出自身真实选项排名的次数为 0。
- 核心观察与假设:作者提出不读取最终答案,而是读取两跳事实推理中从未被任何一方在文本中提及的中间实体(bridge);假设屈从多数的智能体在生成错误回答的瞬间,残差流中仍表征着其最初推导出的原实体。
- 论文的解决方案:作者构建了阿施式同伴压力实验范式,采用 Jacobian lens(J-lens)与 logit lens 对比读取未陈述的前提,并通过预注册程序在 4 个开源模型上检验持留事实,同时设计隐藏自身历史回答的控制条件。
有哪些相关研究?
涵盖多智能体辩论收敛性、LLM从众与阿施效应、以及机理解释与J-lens潜在推理分析。
多智能体辩论与聚合机制
- Du et al. (2024)、Liang et al. (2024)——研究多智能体辩论在改善事实性、推理及激发发散思维方面的作用。
- Choi et al. (2025)、Estornell & Liu (2024)——指出辩论带来的增益大部分来自多数投票,且相似智能体之间的辩论即便在多数意见为共性错误时也会收敛到多数。
- Lorenz et al. (2011)——指出社会影响会侵蚀投票者的独立性与答案多样性,且无法改善集体估计。
LLM的从众与阿施式顺从
- Weng et al. (2025)、Zhu et al. (2025)——开展大语言模型的阿施式从众实验,报告模型会向一致的错误多数屈从,且在不确定时从众程度更高。
- Yashwanth (2026)——通过行为实验为智能体分配与群体规范相悖的私有观点,观察到群体中公开从众的现象。
- Sharma et al. (2024)、Xu et al. (2024)——研究模型顺从用户错误观点(sycophancy)及多轮说服使模型推翻事实回答的现象。
社会压力下的模型内部表征与潜在推理
- Joswin et al. (2026)、Wang et al. (2026)——对单用户或权威压力下的多选选项进行 logit lens 与探测分析,报告正确答案 token 在网络深层被覆盖或抹去。
- Gurnee et al. (2026)——提出 Jacobian lens(J-lens),通过层到输出的平均雅可比矩阵解码未表述的中间步骤(包括两跳提示词的 bridge 实体),并支持特征干预。
- Yang et al. (2024, 2025)——在 TwoHopFact 基准上研究两跳事实中模型内部解析 bridge 的潜在推理过程。
基线方法与使用基准
- 对比基线包括 logit lens(用于对照残差流词表投影效果)与无压力条件(单模型 round 0、同伴一致 agree、同伴提及错误答案 mention)。使用的数据集为 TwoHopFact 及手写首都事实集。
与现有工作的区别定位
- 作者称,此前模型内部状态研究多在单一用户或权威压力下读取最终答案或真值信号;本文在无同伴提及中间实体的多智能体压力下读取未陈述前提,通过预注册跨模型对比 J-lens 与 logit lens,并检验了该前提是否依赖看到自身先前回答。
论文如何解决这个问题?
通过双跳事实隐藏中间实体,用J-lens从残差流读取未表述前提,结合预注册层区间与激活干预。
通过两跳事实问答构建无文本提及的隐式中间实体,利用 Jacobian lens(J-lens) 与 logit lens 在智能体发言首 token 位置解码残差流,评估屈从多数的智能体是否仍在内部表征原前提。
两跳事实与阿施式同伴压力设计
- 任务形式化:采用第一跳 e1 → e2 与第二跳 e2 → e3 组成的两跳陈述,中间实体 e2(bridge)在对话中始终不出现。
- 压力轮次构建:智能体(Agent 1)在 round 0 单独完成陈述。round 1 中保留其自身陈述,1/3/5 个脚本化同伴一致断言另一事实的答案 e′3(answer pressure)、或断言错误 bridge e′2 及其第二跳(first-hop pressure)、或断言正确 bridge e2 与错误答案(second-hop pressure)。
- 回答提取与判定:采用 greedy 解码生成 12 个 token;若文本首部匹配同伴答案别名则判定为屈从(gave in),仅 round 0 正确项进入 round 1。
内部表征读取与指标形式化
- 残差流解码:设 hℓ 为回答起始位置第 ℓ 层的残差流向量,logit lens 解码 WU norm(hℓ),J-lens 解码 WU norm(Jℓ hℓ),其中 Jℓ = 𝔼[∂ hL / ∂ hℓ] 为输入到输出雅可比矩阵在通用语料上的平均值。
- 实体命中度度量:对目标实体各实词首 token 在词表中的最佳排名计算 hit@100,单条记录读出值定义为目标实体 hit@100 减去未出现过的对照实体(control bridge)hit@100,并在预注册层区间内平均。
- 排除末层:网络的最后一层作为模型最终输出,在两类 lens 下完全一致,因此从所有评测区间中排除。
预注册机制与层选择规则
- 规则 v1:要求 round 0 正确样本在某层的原 bridge 读出值 ≥ 0.5,且对应类别均值 ≥ 0.5;在 Qwen3.5-4B 与 Gemma-4-E4B-it 上采用。
- 规则 v2:针对中间层设立,要求在 agree 对话中 J-lens 读出值 ≥ 0.3 且超出 logit lens 读出值 ≥ 0.25;在 Qwen3.6-27B 与 Llama-3.1-8B-Instruct 上采用。
- 数据与假设锁定:所有层区间、格式、测试类别及验证指标均在开发集上选定并提交预注册文件,测试集运行前不得更改。
自我回答影响控制与因果干预
- 隐藏与移除自身回答:在补充实验中,将 round 0 的回答替换为 "(answer submitted)"(hidden)或完全删除让其直接在同伴后作答(absent),测试 bridge 是否依赖历史上下文回读。
- J-lens 激活空间注入:在预注册层的最后提示词位置注入扰动 α |hℓ| d,其中 d 为对应实体的 J-lens 单位方向,步长 α ∈ {0, 0.1, 0.2, 0.4, 0.8},观察首 token 恢复为原答案的比例。
论文做了哪些实验?
在4款模型上测试预注册假设,3款模型证实静默异见,隐藏回答使全部模型读出原前提。
实验设置
- 被测模型:Qwen3.5-4B(默认纯文本模板)、Qwen3.6-27B(纯文本模板)、Gemma-4-E4B-it(纯文本模板)、Llama-3.1-8B-Instruct(经开发集选择采用其官方 chat 模板)。
- 数据集与规模:基于 TwoHopFact(共 45,595 条)及手写首都项筛选模型完全掌握的已知事实(占各模型 3.2%–9.2%);按 bridge 实体拆分开发集(30%)与测试集,测试集进入 round 1 的样本量分别为:Qwen3.5-4B(668/718)、Qwen3.6-27B(476/514)、Gemma-4-E4B-it(476/533)、Llama-3.1-8B-Instruct(542/570)。
- 基线与对比条件:基线包括单模型回答(alone)、同伴全部支持原答案(agree)、同伴提及错误答案但坚持原答案(mention)、提及错误 bridge(mention-bridge);对比 logit lens 与 J-lens。
- 指标定义:Gave in 率(输出首部匹配同伴答案的比例);H1 读出值(屈从智能体原 bridge 的 hit@100 减去对照 bridge,在预注册层平均);H4(同一记录上 J-lens 读出值减去 logit lens 读出值)。
- 统计判定:95% 百分位 bootstrap 置换区间(单样本 1,000 次,双样本 2,000 次),区间下界大于 0 判定为假设成立;第 5 节补充按 bridge 聚类置换与 Holm 多重检验校正。
主结果
在 3 个错误同伴答案压力(answer pressure)下的测试集主结果如下(据 Table 1、Table 2):
表格较宽,可左右滑动
模型 预注册层区间 / 总层数 屈从比例 (%) H1: 原bridge读出值 [95% CI] H4: J-lens 与 logit lens 差值 [95% CI] Qwen3.5-4B 23–30 / 32 8 0.852 [0.782, 0.917] (n=54) 0.792 [0.722, 0.857] Qwen3.6-27B 52–55 / 64 39 0.223 [0.174, 0.280] (n=168) 0.223 [0.174, 0.280] Gemma-4-E4B-it 32, 34–40 / 42 25 0.237 [0.175, 0.299] (n=120) 0.192 [0.137, 0.248] Llama-3.1-8B-Instruct 17–23 / 32 90 0.034 [0.020, 0.048] (n=485) 0.030 [0.018, 0.043] - 屈从智能体内部仍表征原前提:作者称,Qwen3.5-4B、Qwen3.6-27B 与 Gemma-4-E4B-it 的 H1 与 H4 均获支持,J-lens 读取原 bridge 的值在 0.22 至 0.85 之间,而 logit lens 在同一记录上的读取值在 0.00 至 0.06 之间。
- Gemma 为无偏测试提供证据:Gemma 的层区间由规则 v1 选出(未参考 logit lens),在坚持原答案的智能体上两类 lens 读出接近,而在屈从智能体上 logit lens 为 0.05、J-lens 为 0.24,差异达到 0.19。
- Llama 表现出极低读出:在自身回答可见的脚本压力下,Llama 屈从率达到 90%,其原 bridge 读出值仅为 0.034,作者指出其几乎未在指定层保留原前提。
同伴隐含前提的表征 (H2)
- 测试内容:检测屈从多数的智能体是否表征了同伴错误答案背后的 bridge(该 bridge 从未在文本中出现),对比 mention 条件。
- 实验结果:J-lens 读出值在 Qwen3.5-4B 为 0.373 [0.261, 0.491],Qwen3.6-27B 为 0.126 [0.080, 0.173],Gemma 为 0.211 [0.163, 0.258],Llama 为 0.027 [0.014, 0.041](据 Table 2)。
- 作者解读:除首都类任务外,非首都类答案与 bridge 属于多对一映射;在首都子类中 14 个屈从的 Qwen3.6-27B 样本读出值仅高于 mention 基线 0.02,因此作者不主张模型自动推导了同伴的前提,而认为该读出反映了与答案的联想。
隐藏或移除先前回答的影响 (Table 3)
- 测试内容:将 round 0 回答隐藏(hidden)或完全删除(absent),检验保留的 bridge 是否来自对上下文历史自身回答的回读。
- 实验结果:在 hidden 条件下,四款模型屈从智能体的原 bridge 读出均高于对照(O1 支持,读出分别为 0.434、0.290、0.365、0.254);Llama 在 hidden 下读出升至 0.254,Qwen3.5-4B 屈从率从 8% 升至 89%。
- 作者解读:作者称前提无需依赖自身早先回答,可直接由输入问题单独计算得出;隐藏回答削弱了部分模型的锚定效应,显著改变了屈从率。
J-lens 方向因果激活注入 (Figure 3)
- 测试内容:在预注册层注入原 bridge 的 J-lens 单位方向向量(强度 α),观察屈从智能体的下一 token 是否恢复为原答案首 token。
- 实验结果:在 α=0.2 时,原 bridge 方向将 Qwen3.5-4B 恢复原答案比例提升至 41% [29, 54](对照 bridge 为 8%),Qwen3.6-27B 提升至 19% [14, 25](对照 bridge 为 9%);在 Gemma(最高 4%)与 Llama(0%)上无恢复效果。
- 作者解读:在两款 Qwen 模型中,将表征推向原 bridge 能重新激活第二跳计算并恢复原答案;而在 Gemma 中即便 bridge 可读出,沿单方向注入也未能改变输出。
其他消融与分析
- 在 5 个同伴条件下,各模型原 bridge 读出值 H1 分别为 0.82、0.24、0.31 和 0.07(据第 5 节)。
- 设定排名阈值 k=10 时,Qwen3.5-4B 的 H1 降至 0.12,其余三款模型降至 0.00(据第 5 节)。
- 设定排名阈值 k=500 时,四款模型 H1 分别为 0.70、0.41、0.56 和 0.21(据第 5 节)。
- 不设阈值直接对比绝对排名时,J-lens 对原 bridge 的排名比对照 bridge 高出 1.40、0.48、0.85、0.54 个数量级(据第 5 节)。
- 自身回答与隐藏回答差值(O2: hidden - absent),仅 Gemma 支持(0.154),其余三模型未获支持(据 Table 3)。
负面结果与失败案例
- 字母回答读取彻底失效:在前期预备实验中直接读取选项字母,受控强行指定输出时的正对照准确率为 0/1000,无法作为有效检测手段(据第 1、6 节)。
- 自由辩论未能提高聚合准确率:三轮自由辩论中,基于 J-lens 潜在投票的准确率并未优于直接表态多数票(如 round 1 中 Qwen3.5-4B 表态 0.76 对潜在 0.71,Gemma 0.81 对 0.79,据第 4.9 节)。
- Qwen3.6-27B 自由辩论后期异常:在自由辩论 round 2 和 3 中,Qwen3.6-27B 表态准确率降至 0.30 和 0.44,大量智能体转向非实体词输出,但其潜在表征投票仍保持在 0.66–0.69,作者称该现象无法用从众解释且机制未知(据第 4.9 节)。
有什么可以进一步探索的点?
作者指出因果干预局限、样本仅占已知事实3%–9%等局限;实验覆盖4个开源模型及特定双跳事实。
作者指出的局限与后续方向
- 因果干预证据仅在部分模型成立:作者指出,J-lens 方向注入仅在两款 Qwen 模型中成功恢复原答案,在 Gemma 和 Llama 上未能驱动输出,说明因果证据未跨模型普遍成立(出自 Section 6)。
- 测试样本受限于模型已知事实:作者指出,仅能使用模型原本能完整答对两跳的事实进行测试,这些样本仅占 TwoHopFact 的 3%–9%,限制了结果向更广范围事实的推广(出自 Section 6)。
- 同伴压力设置缺乏真实感:实验中同伴逐字重复同一陈述,属于阿施式控制实验;作者指出这以牺牲现实交互真实感为代价,且文献显示部分从众效应在无发言者时也会发生(出自 Section 6)。
- 实体类别范围受限:仅测试了 bridge 为国家、城市或大学的类别,且大学类别中有 23% 的样本因与答案实词重合而被迫剔除(出自 Section 6)。
- 自由辩论中屈从样本过少:除 Llama 外,其余模型在自由辩论中屈从的样本量过少,无法系统度量自由辩论中的静默异见(出自 Section 6)。
- 多轮扩展测试不足:多轮压力衰减实验仅在 Qwen3.5-4B 单一模型上执行,未推广至其余模型(出自 Section 6)。
实验覆盖范围
- 被测模型范围:实验覆盖 Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 及 Llama-3.1-8B-Instruct 共 4 个开源权重模型,论文未测试闭源商业模型。
- 提示词格式差异:Llama-3.1-8B-Instruct 采用官方 chat 模板(同伴发言置于 user 轮次),其余 3 款模型均采用纯文本续写模板。
- 同伴规模设置:探索性同伴数量测试覆盖 1、3、5 个同伴,主实验固定为 3 个同伴。
- 事实基准范围:测试数据集覆盖 TwoHopFact 中的 4 个类别(地标、出生地、大学所属城市与国家)及少量手写首都项,语言均为英文。
- 信息未报告项:论文未报告商业闭源模型(如 GPT 或 Claude 系列)在同类设置下的内部表征状态,亦未报告英文以外其他语种的表现。
总结一下论文的主要内容
揭示LLM智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
- 定位与核心问题:论文通过机械可解释性方法,研究多智能体辩论中向多数屈从的大语言模型是否在内部仍然表征其原始推导前提(静默异见,Silent Dissent),从而检验辩论收敛是否夸大了群体真实认同。
- 方法要点:设计双跳事实阿施式同伴压力任务,使中间实体(bridge)在对话全程不出现;采用预注册协议,在回答起始 token 处通过 Jacobian lens(J-lens)与 logit lens 从残差流中提取 bridge 的词表投影排名,并配合消融实验与激活方向注入。
- 主要发现 1(静默异见现象):在 3 个同伴施加错误答案压力下,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 中屈从多数的智能体在预注册层仍表征原 bridge,J-lens 读出值分别为 0.852、0.223 和 0.237,而同一记录下 logit lens 读出值均在 0.06 以下(Table 2)。
- 主要发现 2(前提计算的独立性):当把智能体历史回答隐藏时,4 款模型中屈从多数的智能体均读出原 bridge(读出值 0.254 至 0.434,Table 3),表明该前提可由输入问题独立推导,无需回读自身陈述;同时隐藏回答使 Qwen3.5-4B 的屈从率从 8% 升至 89%。
- 主要发现 3(因果干预与潜在投票):沿 J-lens 方向注入原 bridge 特征可使 Qwen3.5-4B 和 Qwen3.6-27B 恢复原答案的比例分别达 41% 和 19%,但在 Gemma 和 Llama 上未见恢复(Figure 3);在自由辩论中,基于 J-lens 潜在表征的多数投票准确率并未普遍优于直接表态投票。
- 作者结论与启示:作者认为多智能体辩论达成的表态共识可能会夸大真实一致性,智能体在屈从多数时内部仍可能计算正确前提;协议是否向智能体展示其历史发言会影响共识的稳定性,但潜在表征读取更适合用于监测异见而非替代表态投票规则。