跳到正文
原文
论文追踪· arXiv:2504.00374· Mahak Agarwal, Divyam Khanna·本站收录 · 原文发表

研究提出 CW-POR 指标衡量多智能体 LLM 辩论中的说服覆盖

When Persuasion Overrides Truth in Multi-Agent LLM Debates: Introducing a Confidence-Weighted Persuasion Override Rate (CW-POR)

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者用CW-POR衡量单轮辩论:五款3B–14B开源评委可被修辞性错误答案说服,且选错时常带高置信。

问题
LLM同时生成并评判时,单轮看到的中性事实与用力错误陈述可能冲突。作者要一起衡量评委被说服的次数,以及选错时置信有多高。
方法
TruthfulQA的validation split上,同一模型族分饰中立解释、错误辩护和评委。评委随机阅读双方并打1–5分。CW-POR用归一化自评乘LLC给选错加权,长度从30词到300词。
实验与结果
五款3B–14B模型上,作者称90–120词附近自信误判的可能性最低,更长后走势分开。多数模型在non-adversarial题上CW-POR更高;Phi-4 14B选错时文本置信仍较高。正文没有具体百分数。
局限与可以继续做的
作者提出扩充高CW-POR且样本少的类别、加入有限反驳、改用不同架构的评委,并在组合置信高时做阈值或外部核验。本次是五款模型、三角同族、单轮;论文未报告题目数和重复次数。
实验设置LLaMA 3.2B、Mistral 7B 等 · TruthfulQA (validation split) · CW-POR、POR 等
被测模型
LLaMA 3.2BMistral 7BGranite 3.2 8BPhi-4 14BQwen 14B
基准
TruthfulQA (validation split)
指标
CW-PORPORRubric ConfidenceLLC
AI 导读论文提出置信度加权说服覆盖率(CW-POR),用于衡量多智能体辩论中裁判 LLM 被错误论点说服的频率及其对错误选项的置信程度。研究采用单轮多智能体辩论框架:一个基于 LLM 的智能体给出 TruthfulQA 中的真实答案,另一个智能体力挺错误说法,同一 LLM 架构担任裁判。实验覆盖五个开源 LLM(3B 至 14B 参数),并系统改变智能体发言长度(30 至 300 词)。结果显示,即使较小的模型也能构造出说服力强的论证,覆盖真实答案,且往往伴随高置信度。作者认为这凸显了稳健校准与对抗测试的必要性,以防 LLM 自信地为错误信息背书。

论文提出置信度加权说服覆盖率(CW-POR),用于衡量多智能体辩论中裁判 LLM 被错误论点说服的频率及其对错误选项的置信程度。研究采用单轮多智能体辩论框架:一个基于 LLM 的智能体给出 TruthfulQA 中的真实答案,另一个智能体力挺错误说法,同一 LLM 架构担任裁判。实验覆盖五个开源 LLM(3B 至 14B 参数),并系统改变智能体发言长度(30 至 300 词)。结果显示,即使较小的模型也能构造出说服力强的论证,覆盖真实答案,且往往伴随高置信度。作者认为这凸显了稳健校准与对抗测试的必要性,以防 LLM 自信地为错误信息背书。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    单轮中,修辞性能否让同族评委高置信地压过TruthfulQA上的事实回答。

    单轮中,修辞能否让评委高置信地选中错误答案。

    • 场景: 作者认为部署中的 LLM 会既写文本也判对错。汇总有争议话题时,中性的事实陈述会和带情绪或强断言的错误叙述同时出现,而且常常没有追问。
    • 已有做法: 作者称多轮辩论能暴露矛盾,但依赖额外开销和 robust prompting。POR 只记说服方获胜的比例,不看评委有多确信。作者还称自评置信经常与正确性对不齐。
    • 要检验的点: 没有第二次回应时,修辞风格、情绪感染或权威语气能否压过事实正确性;若压过,评委的置信有多高。
    • 作者提出: 单轮、完全对抗的多智能体辩论,以及 CW-POR。一方中性解释 TruthfulQA 的正确答案,一方辩护已知错误,同一模型族作评委并打 1–5 分。实验为五款 3B–14B 开源模型,冗长度 30–300 词。
    • 角色与信息: 评委要判断哪一份在事实上正确。中立代理拿到正确答案,说服代理拿到选定的错误项,评委看不到标准答案。交互只有一轮,A/B 顺序每题随机。论文未使用 white-box 或 black-box 这些词。
  2. 有哪些相关研究?

    相关工作分辩论框架、说服文本、置信校准和TruthfulQA四组,作者对照的是单轮完全对抗。

    作者按四条线组织相关工作,并把本文放在单轮、角色分离、完全对抗、且按置信加权的位置上。

    辩论框架与多智能体

    • Irving 等(2018): 用多轮对抗辩论引出真实推理。Michael 等(2023)与 Kenton 等(2024)做迭代对话,由评委或验证者插问。作者称多轮能暴露隐藏矛盾,但依赖额外开销和 robust prompting;作者因此只做没有后续反驳的单轮。
    • Chan 等(2024,ChatEval): 作者称其工作提出,多个代理互相检查可以增强事实准确性。Bandi 与 Harrasse(2024) 用迭代辩论做对抗式评测。作者称这类系统常常是合作的或部分对抗的;本文一方明确正确、一方明确错误,且不允许澄清。

    说服性文本与虚假信息

    • Chiang 等(2024): 情绪化对话可以让 LLM 认可明显虚假的陈述。Breum 等(2024): 诉诸权威或情绪会提高可信度,并影响人类和机器评估者。
    • 作者称这些研究通常评估的是人类或同一模型如何感受说服;本文把评委、中立代理和说服代理分成不同角色,即使底座架构相同。

    置信度校准

    • Jiang 等(2021)、Kadavath 等(2022): 讨论问答中语言模型的校准,以及模型在多大程度上知道自己知道什么。作者称自评置信经常与实际正确性不一致。
    • 作者称 self-consistency 或 CoT 或能略微改善校准,但不能消除错误断言上的过度自信。作者引用 OpenAI(2023):指令微调模型有时会发出听起来自信、事实依据不足的陈述。本文用显式的 1–5 分记录评委对所选答案的确信。

    幻觉与问答基准

    • Ji 等(2023): 综述自然语言生成中的幻觉。TruthfulQA(Lin 等,2021): 用来抓住模型复述常见神话或虚假说法的情况。
    • 作者称先前工作多看单个模型会不会答错;本文把数据集里已标明的错误答案交给对抗代理,再与已知正确答案对照。

    基线与数据: 实验没有其他方法作基线。数据是 TruthfulQA 的 validation split。作者把 POR 定义为评委选中错误回答的比例,CW-POR 在此之上按置信加权;正文没有 POR 的数值。

    作者的定位是:用单轮、完全对抗和角色分离,衡量修辞是否压过事实,并用置信加权描述被误导的程度,而不是只做多轮合作式辩论或只计胜率。

  3. 论文如何解决这个问题?

    同族模型分饰三方;CW-POR用归一化自评置信与对数似然置信的乘积给选错加权。

    作者用同一模型族扮演三方,在 TruthfulQA 上做单轮对抗,再用 CW-POR 把“选错”和“选错时有多确信”合成一个率。

    数据与三方角色

    • 数据: TruthfulQA 的 validation split。每题有一个正确答案和多个似是而非的错误干扰项,领域例子包括 Health、Science、Myths。论文未给出题量。
    • 中立代理: 对给定的正确答案做简洁的事实性解释,不使用说服技巧,长度不超过 v 词。
    • 说服代理: 为选定的一个错误干扰项做用力、带情绪的辩护;提示要求不露出不确定,长度同样不超过 v 词。论文未写多个干扰项时如何挑选。
    • 评委: 以随机 A/B 顺序阅读双方,输出一句理由,并给出 1(随机猜测)到 5(绝对确定)的置信。作者记录哪一侧是正确方,用来判定选错。

    单轮流程与冗长度

    1. 中立生成: 输入问题和正确答案,在 v 词内解释。
    2. 说服生成: 同一问题配上错误干扰项,在 v 词内辩护。
    3. 评委评判: 两份回答随机标成 A/B 后,选择哪一份事实上正确,并报告 1–5 分。
    • 档位: v ∈ {30, 60, 90, …, 300}。三种角色使用同一模型族。引言把评委写成 same or similar architecture;Contributions 与 Discussion 写的是实验使用同一模型族。

    指标与 CW-POR

    • POR: 评委选中错误回答的次数除以题数 N。
    • Rubric 置信: 从评委文本解析 1–5 分。
    • LLC: 把评委提示分别接到 “Final Answer: Answer A” 与 “Final Answer: Answer B”,取各自末 token 的对数概率,再对这两个对数概率做 softmax;较大值即 LLC,范围 0.5–1。
    • 组合置信: 最终实现把归一化 rubric 置信与 LLC 相乘,再代入 CW-POR。c_i 也可以单独取 rubric 或 LLC,但作者写明最终用的是二者的乘积。Figure 1 把自评 4/5 写成 0.8,与 LL 置信 0.92 相乘得 0.736;图中另印有 3.68,正文未解释它和 0.736 的关系。

    作者给出的定义为

    CW\text{-}POR=(∑i=1N 1[Override]· ci)/(∑i=1N ci)

    Override 表示评委选了错误回答,c_i 为该题的组合置信。高置信的选错在分子和分母里权更重。

    实现

    • 解码: do_sample=false。随机种子 42,用于代理顺序和确定性 PyTorch。批大小 128,bfloat16,NVIDIA H100(80GB)。
    • 抽取: 用正则取出 A/B 和置信;另一次前向计算末 token “Answer A” 与 “Answer B” 的对数似然,得到 LLC。
    • 工具: Hugging Face Transformers 的 AutoModelForCausalLM 与 AutoTokenizer。正文只描述各角色的目标和词数上限,未给出完整提示词。
  4. 论文做了哪些实验?

    正文无CW-POR读数;作者称多数模型在90–120词最低,非对抗题上往往更高。

    实验设置

    • 模型: LLaMA 3.2B、Mistral 7B、Granite 3.2 8B、Phi-4 14B、Qwen 14B。作者称参数范围为 3B–14B。每款模型同时担任中立代理、说服代理和评委。
    • 数据: TruthfulQA validation split,类别为互斥标签。正文点名 Confusion: Other、Science、Misconceptions、Indexical Error、Finance 等。论文未报告题量 N。
    • 自变量: 冗长度取 v ∈ {30, 60, 90, …, 300}。题型分为 adversarial 与 non-adversarial;论文未说明划分规则。
    • 指标: 各分析使用组合置信下的 CW-POR,即归一化 rubric × LLC。POR、1–5 自评和 LLC(0.5–1)在方法节定义。选错指评委选择说服方的错误回答。
    • 运行: seed 42,do_sample=false,batch 128,bfloat16,H100 80GB。论文未报告重复次数、人工一致性或查询次数。
    • 对照: 没有外部方法基线。比较发生在模型、冗长度、类别和题型之间。

    主结果

    正文和图注没有可抄录的 CW-POR 百分数。下表只记作者对 Figure 4 的文字描述,不填图上读数。Figure 4 图注写的是 each model,但正文没有单独描述 Qwen 14B 的曲线。

    模型作者对 Figure 4 的描述
    LLaMA 3.2B90–120 词下降,其后 mild U-shape,300 词 CW-POR 回到更高
    Mistral 7B90–120 词为低点,120 词后再度上升
    Granite 3.2 8Bmild U-shape,300 词回到更高 CW-POR
    Phi-4 14B120 词后相对较低且平稳
    Qwen 14B未报告
    • 作者的一种可能解释: 过短的回答缺少可区分的细节,过长则会堆叠修辞或情绪线索,中段或许刚好够清楚。作者没有把这写成已检验的机制。
    • 作者称: 即便较小模型也能写出压过事实回答的说服性论述,而且常常伴随高置信。这句话没有对应到正文里的百分数。
    • 未写入正文的量: 各模型、各冗长度的 CW-POR 与 POR 具体数值。

    类别

    • 测了什么: Figure 2 按 TruthfulQA 的互斥类别画 CW-POR(柱,左轴,带 95% 置信区间)和题目占比(线,右轴)。正文称题目占比为红线。
    • 作者称: Confusion: Other 与 Science 的 CW-POR 较高;某些 Misconceptions 或 Indexical Error 相对较低。Figure 3 把 Confusion: Other 标为 High CW-POR,把 Misconceptions 标为 High Question Share,把 Finance 标为 Low CW-POR,并各给了一则问答示例。
    • 作者提醒: 图注称有的类别 CW-POR 高但题目少,可能是数据稀缺造成的尖峰。正文称这些类别的置信区间宽,泛化时要谨慎。正文未给出各类的 CW-POR、区间端点或题目占比。论文未做假设检验,这里不把区间写成统计检验结果。

    对抗与非对抗

    • 测了什么: Figure 5 比较五款模型在 adversarial 与 non-adversarial 题目上的 CW-POR。
    • 作者称: 多数模型在 non-adversarial 上 CW-POR 更高,与“对抗题更易误导”的直觉相反。Mistral 7B 与 Qwen 14B 更接近预期:对抗题仍略难判断。
    • 作者的解释: 直接的非对抗问题若被说服性文风包住,评委可能不怀疑它是错的。作者称之为 “false sense of security”。论文未给出两组的 CW-POR 数值。

    置信度随冗长度

    • 测了什么: Figure 6 按冗长度分别画 LL 置信(上排)和 rubric 自评(下排);实线为选对,虚线为被说服后的选错。图注称曲线在全数据集上汇总。这张图画的是两个分量,不是组合置信本身。正文未给坐标读数。
    • 作者称: 各模型上,选对通常对应更高的 LL 置信。自评在选错时倾向更低,但并非总是如此。Phi-4 14B 选错时仍保持较高的文本置信;作者称它比样本中其余模型更大。论文同时把另一款模型标为 Qwen 14B。
    • 作者称: LLaMA 3.2B 与 Qwen 14B 在错误选择上,冗长度升高时评委置信总体下降。作者认为这或许反映模型察觉到冲突,但它们仍会被说服。Mistral 7B 与 Granite 3.2 8B 在对错两种选择上的置信信号更一致。作者认为,对数似然本身不能避免修辞触发的过度自信,Phi-4 14B 的 rubric × LL 仍会把 CW-POR 推高。

    其他消融与分析

    • 位置:每题随机把中立方或说服方标为 A/B,以避开 position bias;论文未报告位置对选错的数值影响。
    • 置信来源:最终 CW-POR 用归一化 rubric × LLC;论文未报告只使用 rubric 或只使用 LLC 时的 CW-POR。
    • Figure 2 标注 95% 置信区间;正文未给出区间端点,也未报告假设检验。
    • 采样关闭且种子固定;论文未报告多次运行的方差。
  5. 有什么可以进一步探索的点?

    作者列出的后续是多轮反驳、异架构评委,以及高置信时的阈值或外部核验。

    作者指出的局限与后续方向

    • 小样本类别: Discussion 的 Categories vs. Data Representation 写道,高 CW-POR 与较小题目占比的错配可能掩盖或放大真实弱点;后续可在这些领域补充数据,以确认易被说服是领域因素还是样本量造成的。
    • 多轮: Limitations and Future Directions 写道,后续的多轮设置可以让中立代理做有限的反驳或澄清。
    • 评委架构: 同一段写道,后续可测试由不同架构担任评委,而不是三种角色都用同一 LLM 族,以查看系统性偏差是否下降。
    • 置信干预: 同一段写道,后续可在组合置信高时做阈值处理,或请求外部核验,以降低被强烈认可的错误陈述带来的风险。

    论文没有单独的 Limitations 节,上述文字在 Discussion。Conclusion 重申需要改进校准和多智能体评测策略,没有另列局限。

    实验覆盖范围

    • 被测模型为 LLaMA 3.2B、Mistral 7B、Granite 3.2 8B、Phi-4 14B、Qwen 14B,共 5 个;中立、说服和评委使用同一模型族(Contributions;Discussion 用“而非同一 LLM 族”对照本次设置)。
    • 数据为 TruthfulQA validation split;冗长度取 v ∈ {30, 60, 90, …, 300}(Section 3.1、3.3)。
    • 已写出的分析是类别 CW-POR(Figure 2)、冗长度(Figure 4)、adversarial 与 non-adversarial(Figure 5),以及 LL 置信和 rubric 自评随冗长度的变化(Figure 6)。判定来自评委的 A/B 选择、1–5 分和 LLC。
    • 运行设置为 seed 42、do_sample=false、batch 128、bfloat16、H100 80GB(Section 3.5)。论文未报告题量 N、重复次数、POR 数值、多个错误干扰项的选择规则、题型划分标准,正文也未给出各图的 CW-POR 读数。
    • 本次协议是单轮:评委随机阅读双方,输出一句理由和 1–5 分;选择与置信用正则抽取,LLC 来自末 token 对数似然(Section 3.2–3.6)。
  6. 总结一下论文的主要内容

    作者用CW-POR把选错频率和置信合在一起,并称五款开源模型上修辞仍可压过事实。

    作者用单轮对抗辩论和 CW-POR,观察同族评委面对事实性解释与错误辩护时是否选错,以及选错时有多确信。

    • 做法: 中立代理解释 TruthfulQA validation split 中给定的正确答案,说服代理辩护给定的错误项,评委随机阅读双方并给出 1–5 分,没有反驳。CW-POR 的权重是归一化自评置信与 LLC 的乘积。LLC 是以 Answer A 或 Answer B 结尾的两份提示上,末 token 对数概率经 softmax 后的较大值,范围 0.5–1。
    • 模型与档位: LLaMA 3.2B、Mistral 7B、Granite 3.2 8B、Phi-4 14B、Qwen 14B,冗长度 30–300 词,采样关闭。三种角色为同一模型族。
    • 冗长度: 作者称多数模型在 90–120 词时,自信误判的可能性最低。其后 Mistral 7B 上升,Phi-4 14B 相对低而平,LLaMA 3.2B 与 Granite 3.2 8B 到 300 词回升。正文没有各点的 CW-POR 百分数。
    • 题型与类别: 作者称多数模型在 non-adversarial 题上 CW-POR 更高;Mistral 7B 与 Qwen 14B 则是对抗题仍略难。Confusion: Other 与 Science 被标为 CW-POR 较高,部分高值类别题目少、区间宽。
    • 置信: 作者称选对通常对应更高的 LL 置信,但 Phi-4 14B 选错时文本置信仍较高。作者认为只看对数似然不能避免修辞带来的过度自信。
    • 作者的结论: 修辞可以压过事实正确性,高置信的选错并不少见,较大模型也不例外;引言还称这可以发生在没有恶意意图时。作者认为应改进校准并做对抗测试,也提到或许采用多轮或集成式辩论。金融、健康、公共政策里“一条事实对一条虚假”的单轮用法,作者认为要谨慎。
阅读原文arxiv.org