研究:LLM 在多智能体系统中更易被同伴共识误导而非纠正
Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity
四模型聚合:全错同伴使有害修订从15.6%到62.9%,全对使有益修订从32.7%到51.5%(Table 1无权威)。
- 多智能体里,模型可能因同伴答案一致而放弃自己的答案。作者要在同一受控设置里比较:这种影响纠正初始错误,是否与误导初始正确一样强。
- 模型先独立答选择题,再看六个模拟同伴后重答。交叉共识结构与权威标签,以混合同伴为两种修订的共享基线,并另测 CoT 与 reflect-then-revise。
- 无权威、四模型聚合时,全错下有害修订为62.9%(混合15.6%),全对下有益修订为51.5%(混合32.7%,Table 1)。权威人数增加时更常改向被背书选项,不论对错。两种推理提示都不能只压有害修订。
- 作者指出仅用选择题、模拟同伴而非实时对话,自评信心也不是校准概率,并计划在实时多智能体和开放生成上继续做。实验为四个开源模型、2,500道选择题、三个种子,对错按金标判定。
- 被测模型
- Qwen2.5-7B-InstructMistral-7B-Instruct-v0.3Gemma-2-9B-InstructLlama-3.1-8B-Instruct
- 基准
- BBH geometric shapesBBH logical deduction (seven objects)BBH temporal sequencesBBH tracking shuffled objects (five objects)MMLU-ProARC-ChallengeTruthfulQA
- 指标
- revision rateharmful revision ratebeneficial revision rateauthority-aligned revisionconfidence change ΔC
论文对多智能体系统中 LLM 的从众行为做了受控研究:模型先回答一个问题,再看到模拟的同伴回答后给出最终答案,并操纵共识结构与同伴的权威标签两种社会线索。在四个开源权重模型和七个 QA 数据集上,同伴一致意见让原本正确的模型被误导的概率远高于纠正原本错误答案的概率;权威标签则让模型更倾向选择被背书的答案,无论其是否正确。作者还发现,思维链和反思等通用推理干预无法在保留有益修改的同时可靠减少有害修改,因此建议多智能体 LLM 系统应验证同伴答案而非简单聚合。
深度解读
这篇论文试图解决什么问题?
要比较同伴纠错与带偏是否一样强;作者称带偏更容易。
同伴影响纠正初始错误的模型,是否与误导初始正确的模型一样强?
- 出现场景:作者认为多智能体系统里,模型会看到并回应其他智能体的答案,从众是关键风险:模型可能只因多数同伴同意另一答案就放弃自己的答案。同伴交互既可能帮忙纠错,也可能把错误传开。
- 已有缺口:已有研究称模型会跟随多数、显得更自信的同伴,或被标成 expert 的同伴。作者称正确与错误同伴引导已被分开测量,但两个方向的相对强度尚未在同一受控设置里直接比较。
- 本文区分:错误改对称为有益修订(beneficial revision),正确改错称为有害修订(harmful revision)。作者要问同伴影响在这两个方向是否同样强。
- 比较设计:混合同伴是两种修订的共享基线,用来对照全错同伴抬高有害修订、全对同伴抬高有益修订。另操纵权威角色标签,并检验 chain-of-thought 与 reflect-then-revise 能否少做有害修订、同时保留有益修订。
有哪些相关研究?
相关工作分别测过多数与权威从众;作者用混合基线比较两个方向。
LLM 从众
- 多数与信心:Zhu et al. (2025)、Weng et al. (2025)、Cho et al. (2025) 报告,多数变大、模型自身信心较低、同伴显得更自信时,模型更可能改答案。引言还将 Choi et al. (2026) 列入会顺从被标成 expert 的同伴的工作。
- 开放辩论:Choi et al. (2025) 在开放式多智能体辩论中观察到,智能体可漂向更多参与者支持的立场。
- 与本文最接近的测量:Weng et al. (2025) 在错误与正确同伴引导下分别测从众。作者称其未在同一受控设置中直接比较两个方向的相对强度。
社会线索与系统设计
- 线索压过任务证据:Li et al. (2025) 在检索增强生成中观察到,用户提供的上下文可在与检索事实冲突时压过检索事实。Ye et al. (2025) 报告 LLM-as-a-Judge 有从众与权威偏差,多数票和来源标签会改变裁决。
- 系统设计:Mehdizadeh and Hilbert (2025) 称意见改变可呈 sigmoid 阈值,而非与分歧成线性关系。Han et al. (2026) 称去中心化拓扑可让自信的错误少数意见在智能体交互中级联。
- 社会镜头下的多智能体:Kran et al. (2025)、Hagendorff et al. (2023) 从社会角度看 LLM;Jin et al. (2024b)、Wang et al. (2026) 讨论同伴评审与社会协作式交互。论文此处是背景描述,未把它们写成数值对照。
社会心理学基础
- 共识:Asch (1955) 显示群体给出同一答案时人常从众,群体内分歧可降低从众。作者据此比较混合、全对与全错同伴。
- 信息性影响与权威:Deutsch and Gerard (1955) 区分把他人当证据与因社会压力附和。Milgram (1963) 与 French et al. (1959) 讨论对感知权威的服从,以及合法、专家、参照等权力形式。作者用角色标签操纵权威。
基线与数据集
- 基线方法:论文未把其他从众测量算法当作数值基线。共享基线是混合同伴(金标占 3 票相对多数),同时用于有害修订与有益修订。
- 基准/数据集:BBH 的 geometric shapes、logical deduction(七个对象)、temporal sequences、tracking shuffled objects(五个对象),以及 MMLU-Pro、ARC-Challenge、TruthfulQA。
作者将本文定位为:用因子设计交叉共识结构与权威标签,在两种线索同时出现时看交互,并用混合基线直接比较有害与有益修订的相对强度,而不是把两种线索分开研究。
论文如何解决这个问题?
先独立作答,再看六个模拟同伴,按共识与权威比较两种修订。
整体是受控的两轮修订,而不是训练新模型。三个研究问题共用同一流水线,只改同伴答案如何分配,以及 RQ3 是否加推理提示。
两轮协议
- 第一轮:模型独立答一道选择题,输出答案和 1–10 的自评信心。提示里有刻度锚点。作者把信心当作辅助自评,不是校准概率。
- 第二轮:对话历史保留原题和第一轮答案,再加入六个模拟同伴,要求可保持或修改答案。同伴名从 40 个常见名中无放回抽取;发言从固定释义模板抽取,只点选项、不给理由。
- 权威标签:部分同伴名后加组织角色,角色池为 team leader、research director、senior expert、department head、principal investigator。附录 A 给出完整提示词。
RQ1:共识结构 × 权威在场
- 混合:三人选金标,其余三人各选不同错误选项,金标为 3 票相对多数。
- 全对:六人都选金标。全错:六人同选一个非金标选项,从非金标中均匀随机抽取。
- 权威:缺席时全是普通同伴;在场时一名同伴带权威角色。每个原题六个变体。
- 计算范围:初始答对时,有害修订只在混合与全错中算;初始答错时,有益修订只在混合与全对中算。
RQ2:线索强度
每条提示仍是六名同伴。
- RQ2a:承诺人数 n_com 取 0、2、4、6,其余用不确定说法。至少两人承诺时,承诺者在正确与错误答案之间平衡,因此不是全对或全错。每题四个扰动。作者称动机来自 Latané (1981) 与 Moscovici et al. (1969)。
- RQ2b:权威标签人数 n_auth 从 1 到 5。带标签者可背书正确答案或错误答案,普通同伴始终选相反选项。五档交叉两种背书,每题十个变体。指标是权威对齐修订:改到权威所背书选项的比例,不区分有害或有益。
RQ3:推理干预
两种干预分别加到全部 RQ1 扰动。
- CoT:两轮都要求逐步思考,并与答案、信心一起给出短推理。第二轮还要求考虑同伴是否改变自己的答案。
- reflect-then-revise:标准两轮之后再加一轮,要求对照完整对话决定保持或修改。这一轮的答案当作最终答案。
度量与实现
有害修订率为 P(af ≠ t ∣ a0 = t),即初始答对、最终偏离金标的比例。有益修订率为 P(af = t ∣ a0 ≠ t),即初始答错、最终回到金标的比例。另有任意改答的修订率,以及信心变化 ΔC = c_f − c_0。
四个开源指令模型用 vLLM 贪心解码(temperature 0,top-p 1.0),每个实验三个独立随机种子,结果跨次聚合。七个数据集共 2,500 题。JSON 解析失败时最多重试五次,每次 temperature 加 0.1;仍失败则整条 instance–model 的全部扰动都剔除。推断用混合效应模型(附录 C):二分类结果用逻辑混合模型,ΔC 用线性混合模型;固定效应含模型与任务,随机截距为原题。
论文做了哪些实验?
聚合后有害修订在全错下为62.9%(混合15.6%),有益修订在全对下为51.5%(混合32.7%)。
实验设置
- 被测模型:Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、Gemma-2-9B-Instruct、Llama-3.1-8B-Instruct。没有单独的攻击模型或打分模型。
- 数据:BBH 四项各 250 题;MMLU-Pro、ARC-Challenge、TruthfulQA 各抽 500,并在各数据集内按科目平衡。共 2,500 题。
- 解码与重复:vLLM 贪心解码(temperature 0,top-p 1.0),三个随机种子。正文是跨模型、任务、运行的聚合;分模型、分任务见附录 B。
- 条件:RQ1 为三种共识 × 权威在场或然缺席。RQ2a 的承诺人数为 0/2/4/6。RQ2b 的权威人数为 1–5,并交叉背书对或错。RQ3 把 CoT 与 reflect-then-revise 分别加到全部 RQ1 扰动。
- 判定:对错相对数据集金标,不是 LLM 评审。指标为修订率、有害修订率、有益修订率、权威对齐修订率、ΔC。
- 检验:附录 C 的混合效应回归,报告优势比与 p 值。作者称分析在原始 instance 层面,量级约 10^5,统计显著性几乎必然出现。
主结果
下表为 Table 1 中权威缺席的修订质量。Table 1 的模型简称对应 §3.6 的 Instruct 全名。
表格较宽,可左右滑动
模型 有害·混合 有害·全错 有益·混合 有益·全对 Qwen2.5-7B 4.1% 95.5% 55.6% 98.2% Mistral-7B 51.7% 61.3% 24.4% 39.9% Gemma-2-9B 10.5% 18.4% 3.2% 5.0% Llama-3.1-8B 17.8% 79.6% 44.0% 59.0% 四模型聚合 15.6% 62.9% 32.7% 51.5% - 作者称全错同伴对有害修订的效应是全对同伴对有益修订的五倍,优势比分别为 28.5 与 5.2,两者 p < .001。表中 Mistral-7B 一行并不符合“各模型都是有害一侧升得更多”:全对相对混合的有益修订变化大于全错相对混合的有害修订变化。
- 权威在场的聚合数字不在上表:混合有害修订 20.6%、全错 65.0%;混合有益修订 30.4%、全对 54.0%(Table 1)。作者称同伴一致是主要驱动,权威角色的附加效应更小,且在全对、全错条件下更小;所测对比 p < .001。
- 作者给出两种可能解释:同伴消息只有选项标签、没有理由;有害与有益修订所基于的题目难度不同,初始答错的题可能更难。附录 B 称幅度差很大,例如 Mistral-7B 混合修订率为 59.6%(无权威)/ 62.9%(有权威)。
承诺人数与权威人数
- RQ2a:聚合修订率在 n_com = 0/2/4/6 时为 25.3%、31.2%、31.5%、34.9%(Table 2)。回归的线性项为正、二次项为负,作者报告两者 p < .001,并称这与 Social Impact Theory 的边际递减一致。Table 2 中 Llama-3.1-8B 为 44.0%、44.4%、37.3%、39.4%,不是随承诺人数上升。
- 无人承诺时聚合修订率 25.3%。作者称它低于 RQ1 的每一种共识条件,因此 RQ1 的效应来自同伴给出明确答案,而不是同伴消息或提示变长。
- RQ2b:作者称权威背书正确时,权威对齐修订从 n_auth = 1 到 5 约升 30 个百分点;背书错误时约升 28 个百分点。回归同样是单调但次线性,线性项为正、二次项为负,两者 p < .001。Figure 3 按背书对错分面,画出四个模型与聚合曲线;正文未给出各端点的精确百分比。
推理干预
- CoT:全错同伴下,有害修订从 63.9% 降到 36.5%(Figure 4a;共识与 CoT 的交互 p < .001)。作者称这一好处不能推广到有益修订:混合与全对下,CoT 都降低有益修订(p < .001)。Table 7 在全对、初始答错的结局中,落到金标的比例无 CoT 为 52.7%、有 CoT 为 32.5%;停在初始错误答案上为 27.4% 与 50.3%。论文未说明 Figure 4 与 Table 7 是否合并了权威在场与缺席;Figure 4 的 63.9% 也不等于 Table 1 无权威聚合的 62.9%。
- reflect-then-revise:全错下有害修订从 63.9% 降到 41.2%,全对下有益修订从 52.7% 降到 33.4%(Figure 4c–d;两者 p < .001)。作者称混合条件下反思也会同时降低两个方向,因而不是在区分误导与有用纠正,而是整体更少改答案。
- 作者认为两种失败方式不同(附录 F):CoT 可能让模型更依赖对话历史里自己的推理;反思更像部分重置,而不是核验哪一个答案正确。
错误汇聚
- 跨模型与数据集聚合后,初始答错的案例在全错同伴下有 56.8% 改到同伴一致的那个错误选项;混合为 20.7%,全对为 19.9%(§5.1)。论文未说明该比例是否区分权威标签。作者称全错同伴还会让已经答错的模型汇到同一个错误选项。
- Table 7:混合条件下,有害修订落到没有任何同伴选择的错误选项的比例,无 CoT 为 16.3%,有 CoT 为 23.3%。论文未说明是否区分权威条件。
- Table 8(权威缺席):反思把第二轮有害修订撤回到第一轮答案的比例,聚合为 47.9%,有益修订为 29.8%。差距最大在全对(62.2% 对 27.7%),最小在全错(41.1% 对 33.4%)。
其他消融与分析
- Table 3:作者称全错有害修订从 Geometric Shapes、权威在场的 50.0% 到 MMLU-Pro、权威在场的 70.4%;同表 Logical Deduction (7)、全错、权威缺席为 71.0%。作者称全对有益修订从 Logical Deduction 7 的 45.2% 到 Temporal Sequences 的 56.4%。
- Table 4 聚合 ΔC:有害案例在混合为 −0.39/−0.45(权威缺/在),全错为 −0.46/−0.46;有益案例在混合为 −0.22/−0.24,全对为 −0.45/−0.31。作者称全一致下修订后信心略低于混合。
- Table 5:n_com 从 0 到 6,聚合 ΔC 为 −2.93、−0.90、−0.54、−0.33。
- Table 6:权威背书错误且模型初始正确时,ΔC 从 n_auth = 1 的 −0.27 到 n = 5 的 −0.54;模型与权威都正确时,从 −0.59 到 −0.04。
有什么可以进一步探索的点?
作者指出选择题、模拟同伴和自评信心的限制,并计划在真实多智能体中验证。
作者指出的局限与后续方向
- 题型:只用选择题,以便无歧义定义有害与有益修订。作者称扩展到开放生成需要额外的答案等价判断,这可能引入偏差,尤其在领域特定或多语言设置(Limitations)。
- 同伴来源:用的是模拟同伴消息,不是实时多智能体对话。作者称因此没有迭代对话、同伴自己写的理由,或智能体之间的涌现依赖;在真实 MAS 中验证是下一步(Limitations)。
- 信心:分析依赖自评 1–10。作者称不应把它读成校准概率,只当作社会压力之后、实例内部的确定性变化信号(Limitations)。
- 结论中的后续:在实时多智能体交互中检验这些模式,发展基于证据的验证方法,并把这种区分修订质量的分析扩展到正确性更难观察的开放生成(Conclusion)。
- 提示稳健性:作者称通用推理提示不能解决从众问题,并称这促使以后研究提示词对社会影响的稳健性(§5.2)。
实验覆盖范围
- 被测模型为四个开源指令模型,vLLM 贪心解码,三个随机种子,结果跨运行聚合(§3.6、§4)。
- 数据为七个选择题任务共 2,500 题:BBH 四项各 250,MMLU-Pro、ARC-Challenge、TruthfulQA 各 500(§3.6)。
- 每条社会提示固定六个模拟同伴;RQ1 为六种共识×权威条件,RQ2a 为四种承诺人数,RQ2b 为十种权威变体(§3.2–3.3)。发言来自固定释义模板,不包含理由。
- 有害与有益由最终答案是否等于金标判定。论文未使用 LLM 评审,也未报告与人工判定的一致性。
- 推理干预为 CoT 与 reflect-then-revise。分模型、分任务描述统计在附录 B;作者称完整回归系数表随代码发布(附录 C)。
总结一下论文的主要内容
全错比全对更能改写答案;权威不分对错;通用推理提示不能只压有害修订。
这篇工作在四个开源指令模型上测量从众修订的方向:错改对是有益修订,对改错是有害修订。模型先独立答选择题,再看到六个模拟同伴后重答;同伴可以全体一致、意见分裂,也可以带权威角色标签。
- 无权威、四模型聚合时,全错同伴下有害修订为 62.9%,混合基线为 15.6%;全对同伴下有益修订为 51.5%,混合基线为 32.7%(Table 1)。作者称前者的优势比为 28.5,后者为 5.2。Table 1 的 Mistral-7B 一行与“每个模型都是有害一侧升得更多”不一致。
- 权威标签人数从 1 增到 5 时,作者称模型更常改向被背书的选项:背书正确约升 30 个百分点,背书错误约升 28 个百分点。承诺给出明确答案的同伴越多,修订率从 25.3% 升到 34.9%,作者称增幅递减(Table 2)。
- CoT 把全错条件下的有害修订从 63.9% 降到 36.5%,但作者称它同时压低有益修订。reflect-then-revise 把全错有害修订从 63.9% 降到 41.2%,把全对有益修订从 52.7% 降到 33.4%。论文未说明这组图中的百分比是否合并了权威条件。
- 初始已经答错时,全错同伴下有 56.8% 改到同伴一致的错误选项,混合与全对约为 20.7% 和 19.9%。
作者的结论是:多智能体系统不应把同伴同意当成投票,也不应把角色标签当成正确性的保证;chain-of-thought 和 reflect-then-revise 不能可靠地只减少有害修订并留下有益修订。作者认为修订前应对照任务核对每个同伴答案的证据。