跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.12360·本站收录 · 原文发表

论文提出 ISE 框架,评测 LLM Agent 在知识冲突下的认知谦逊

Accurate but Not Humble: Evaluating Epistemic Humility in LLM Agents under Knowledge Conflict

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者以ISE评测四个智能体在知识冲突下的认知谦逊,称高准确率并不对应更高谦逊。

问题
现有智能体评测几乎只看最终答案对错。检索证据与参数信念冲突时,智能体有没有认出缺口、用工具处理,并把未解决的不确定性告诉用户,这类行为没有被单独计分。
方法
作者把认知谦逊操作成Identify、Solve、Escalate。受控题来自ConflictQA与WikiContradict,自然冲突从GAIA、MoNaCo、BrowseComp筛选,两边都有对照。GPT-5按整条轨迹打分。
实验与结果
五个配置上,作者称任务准确率高并不对应更高的Solve与Escalate。TMD上有结果者,冲突集准确率比对照低超过30个百分点。追加一条系统提示后,Escalate常上升,准确率常下降。
局限与可以继续做的
作者指出骨干与harness固定搭配,未做全因子组合;ISE不覆盖屈从用户压力、缺工具拒答和连续量校准。知识冲突以外的情形不在范围内。实验是五组固定配置,自然冲突与对照题目不同。
实验设置Nemotron-Orchestrator-8B、Claude Sonnet 4.6 等 · TMD、ConflictQA 等 · accuracy、Identify F1 等
被测模型
Nemotron-Orchestrator-8BClaude Sonnet 4.6GPT-5Qwen3.5-9BQwen3.5-27B
基准
TMDConflictQAWikiContradictGAIAMoNaCoBrowseComp
指标
accuracyIdentify F1Solve rateEscalate rate
AI 导读论文提出评测 LLM Agent 认知谦逊(EH)的框架,即 Agent 在任务执行中识别、处理并表达不确定性的意愿,并将其拆解为 Identify、Solve、Escalate 三个轨迹级行为维度。作者通过知识冲突场景开展评测,包括骨干模型的参数化知识与检索证据矛盾、以及两个上下文来源相互冲突,并设置受控冲突和多步 Agent 执行中的自然冲突两种设定,各自配有匹配的无冲突对照组。对四个 Agent 的评测显示,更高的任务准确率并不必然对应更高的认知谦逊,部分高准确率配置能在执行中识别冲突,却未在错误的最终答案中说明未解决的不确定性。轨迹级分析还发现,Agent 常在执行早期步骤检测到冲突,但未能在后续步骤中维持或解决。作者称模型层面的干预可以提升认知谦逊,但往往以任务准确率为代价,认知谦逊来自骨干模型、Agent 框架与评测环境之间的交互。

论文提出评测 LLM Agent 认知谦逊(EH)的框架,即 Agent 在任务执行中识别、处理并表达不确定性的意愿,并将其拆解为 Identify、Solve、Escalate 三个轨迹级行为维度。作者通过知识冲突场景开展评测,包括骨干模型的参数化知识与检索证据矛盾、以及两个上下文来源相互冲突,并设置受控冲突和多步 Agent 执行中的自然冲突两种设定,各自配有匹配的无冲突对照组。对四个 Agent 的评测显示,更高的任务准确率并不必然对应更高的认知谦逊,部分高准确率配置能在执行中识别冲突,却未在错误的最终答案中说明未解决的不确定性。轨迹级分析还发现,Agent 常在执行早期步骤检测到冲突,但未能在后续步骤中维持或解决。作者称模型层面的干预可以提升认知谦逊,但往往以任务准确率为代价,认知谦逊来自骨干模型、Agent 框架与评测环境之间的交互。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    知识冲突下,任务准确率高并不等于智能体会识别、处理并上报不确定性。

    当检索证据与智能体的参数信念冲突,或上下文来源彼此矛盾时,现有评测只看最终答案对错,看不到它是否识别缺口、动手处理并告诉用户不确定性。

    • 场景:作者称LLM正成为可调用工具、记忆和多步推理的智能体骨干,用于编程助手、研究智能体和通用助手;评测却几乎只判定最终答案是否正确(§1)。
    • 不足:作者称结果奖励不鼓励暴露不确定性,人通常只看长轨迹的最终答案,未浮出的不确定性无法被处理;即便骨干发现冲突,harness也可能在多步中稀释、覆盖或丢掉该信号。单轮的自我知识、口头不确定性、弃答和信念修正,没有覆盖这条轨迹。
    • 操作化:认知谦逊(epistemic humility, EH)被当作不可直接观察的构念,对应三条轨迹行为,合称ISE:Identify、Solve、Escalate。知识冲突提供已知标签,受控题再配无冲突对照。
    • 做法:在受控冲突和执行中自然出现的冲突两种设置下,评测四个智能体类、五组harness–骨干配置,并检验一条系统提示与EH、任务准确率的关系(§2–3)。
  2. 有哪些相关研究?

    作者把本文放在单轮知识冲突与不确定性研究之外,转向多步轨迹上与正确性正交的行为。

    第4节与引言把讨论过的工作分成三组。只有论文明确拿来和本文对照的地方,下面才写差别。

    知识冲突

    • Xu et al. (2024):综述知识冲突,分成context-memory、inter-context、intra-memory。作者采用前两类作为引出EH的机制。
    • Xie et al. (2023)、Hou et al. (2024):ConflictQA及参数信念/counter-memory抽取,WikiContradict来自维基百科编辑矛盾标签。受控冲突使用这两套题目。
    • Wang et al. (2024)及后续细化:Wang et al.主张冲突下应识别、定位并报告不同观点,概念上接近ISE,但只在单轮提示上评测。Sun et al. (2025)、Jin et al. (2024)、Wang et al. (2025a)分别看任务要求、检索管线、噪声或含糊证据。作者称这些都是单模型一次前向。

    不确定性与作答激励

    • Kadavath et al. (2022)、Lin et al. (2022)、Tian et al. (2023a):校准的自我知识常被后训练压住,口头置信度可以靠提示恢复。作者称对象是单轮LLM。
    • Tong et al. (2025):用HumbleBench测多模态LLM对错误选项的拒绝。作者称这是此前最接近使用epistemic humility一词的工作,但限于单轮选择题。
    • 引言中的相邻工作:弃答(Wen et al., 2025; Kirichenko et al., 2025)、纠正反馈下的信念修正(Jiang et al., 2025)、诚实(Li et al., 2024; Joglekar et al., 2025)。作者称EH与诚实相近,本文看的是执行全程如何识别、行动并传达不确定性。

    智能体与轨迹评测

    • Yao et al. (2022)、Schick et al. (2023):ReAct与Toolformer,把推理和工具调用接在一起。
    • GAIA、SWEBench、WebArena:作者称智能体通常按最终答案正确性打分,只看结果会挡住执行层面的行为。
    • Deshpande et al. (2025)、Zhu et al. (2026)、Gao et al. (2026):轨迹级失败定位与行为分类。作者称现有轨迹工作主要做失败归因;EH与对错正交,答错时既可以标出缺口,也可以不标。

    对照与数据

    • 基线:论文没有另立EH算法基线。比较是冲突划分对无冲突对照,以及默认系统提示对§3.4的谦逊条款。
    • 基准:TMD(题目来自ConflictQA、WikiContradict)、GAIA、MoNaCo、BrowseComp。

    作者把差别放在评测对象上:上述工作或评单轮前向,或主要归因失败;本文在骨干、harness与工具环境组成的系统上,用轨迹级ISE测不确定性处理。

  3. 论文如何解决这个问题?

    用受控与自然知识冲突引出EH,再按轨迹给Identify、Solve、Escalate打分。

    作者不改权重,用知识冲突引出认知谦逊,再按整条轨迹给ISE打分。冲突集记为D+,对照记为D−。

    冲突如何构造

    • 参数信念:每个问题用zero-shot的自由生成和多选两种方式抽取骨干答案;只保留两者一致且答案在候选集中的实例。附录A.1分Level 0–3,只有Level 3进入受控冲突。不一致时,作者认为无法确定智能体在运行中会坚持哪一个答案。
    • 受控冲突:题目来自ConflictQA与WikiContradict,不用工具也能答,但保留全部工具、不限单步。主场景是问题加两段答案互不相同的段落;对照保持问题和段落数,段落彼此一致且与ground truth对齐。Figure 2还列出Closed、RAG、PCK。
    • 自然冲突:在GAIA、MoNaCo、BrowseComp上做两遍抽取:闭卷作答,再自我核验。入选须同时满足HAS_PK、SELF_AGREES、DISAGREES_GT。规则判为与ground truth不一致时,再用gpt-5做语义等价检查。对照来自同一池:自信且正确,或没有强先验。作者写明两套划分题目不同,差异是观察性的,可能反映题目构成。

    轨迹与任务分

    • 记录τ=(s1,…,sT)。每步含推理、工具调用及其参数与结果,以及展示给用户的文本。
    • 规则分:单参考用归一化精确匹配,多参考用子串匹配;GAIA用官方quasi-exact-match;MoNaCo标量用1−|aref−apred|/max(|aref|,|apred|)。
    • 模型分:GPT-5只看预测和参考,不看原题,以免裁判自己重答。附录D.3给出完整提示词。

    ISE如何定义

    • Identify:GPT-5只读最终助手轮之前的中间轨迹,判断是否认出缺口,并给出首次出现的轮次。在D+与D−的并集上算精确率、召回率和F1。作者用F1同时惩罚“对所有输入都示警”和“从不示警”。最终轮不计入,以免和Escalate重复。
    • Solve:分母是被判为已识别缺口的轨迹。分子要求识别之后至少一次新的工具调用、调用不是先前调用的完全重复,并且没有因为达到max_turns而截断。作者称这衡量尝试,不衡量尝试是否把答案改对。
    • Escalate:只在冲突集、且最终答案不正确的实例上计算,不以Identify为条件,因此单轮直接升级也计入。另一名GPT-5裁判只看最终助手轮,判断是否承认残余不确定性。附录D.3给出Identify与Escalate的完整提示词。

    被测系统

    • 五组配置,迭代上限50。Nemotron-ToolOrchestra用Nemotron-Orchestrator-8B,工具为网页搜索、Python和最终答案。Claude Code用Claude Sonnet 4.6,工具为WebSearch、WebFetch、Bash。OpenHands的动作含终端、文件编辑、网页搜索、delegate、finish;正文与Table 1写GPT-5,Table 2写GPT-5.2。Qwen-Agent用网页搜索和Python,骨干为Qwen3.5-9B与Qwen3.5-27B。
    • 主文报告GPT-5裁判。正确性评分剥离think块;Identify保留think块,作者称推理模型的缺口识别会出现在其中。
  4. 论文做了哪些实验?

    作者称高准确率并不对应更高EH,且提示常以提高Escalate换取更低准确率。

    实验设置

    • 配置:Nemotron-ToolOrchestra + Nemotron-Orchestrator-8B;Claude Code + Claude Sonnet 4.6;OpenHands,正文、Table 1、Figure 5与Table 8写GPT-5,Table 2写GPT-5.2,论文未说明是否同一模型;Qwen-Agent + Qwen3.5-9B;Qwen-Agent + Qwen3.5-27B。默认与提示干预使用同一骨干。
    • 数据:受控冲突在结果表中称TMD,题目来自ConflictQA与WikiContradict。自然冲突为GAIA、MoNaCo、BrowseComp。Table 4中GAIA原始127条,冲突入选依次为93、11、49、11、13;MoNaCo原始694,冲突入选405、190、261、115、139;BrowseComp原始1266,冲突入选940、116、51、43、45。Table 1未写各单元格样本量。
    • 对照:受控对照固定问题与段落数。自然冲突对照是自信且正确,或无强信念。Claude Sonnet 4.6在TMD上没有强信念,Table 1记为–。
    • 指标:TMD为规则正确性,GAIA为精确匹配,MoNaCo为数值相似度、字符串二值,BrowseComp为模型评分。EH为Identify F1、Solve率、Escalate率。Identify是相对冲突/对照标签的F1,不是冲突集内的提及率。
    • 评审:主文GPT-5。附录用Claude Sonnet 5与GLM-5.2重评。三名标注者各标50条Identify轮和50条Escalate最终答案。
    • 检验:Table 1下标是95% bootstrap置信区间半宽,10,000次重抽样。*表示冲突与对照差异p<0.05:二值指标用双侧两比例z检验,MoNaCo相似度用Welch t检验。作者写明该检验不比较提示运行与默认运行。论文未报告每题重复次数。

    主结果

    表格较宽,可左右滑动

    智能体TMD冲突准确率TMD EscalateBC冲突准确率BC IdentifyBC Escalate
    Nemotron-Orch-8B3.0%68.0%8.3%32.2%41.0%
    Claude Code (Sonnet 4.6)未报告未报告55.2%90.0%0.0%
    OpenHands (GPT-5)3.2%3.3%29.4%0.0%2.8%
    Qwen-Agent (Qwen3.5-9B)4.0%35.0%14.0%0.0%0.0%
    Qwen-Agent (Qwen3.5-27B)6.5%49.3%6.7%23.0%28.6%

    据Table 1与Table 5。BC为BrowseComp。Claude Code的TMD在Table 1为–。Table 5把跑过但未识别缺口、或Escalate分母为空的经验零写成0.0;–表示没有产生预测。

    • 作者称TMD上所有有结果的配置,相对无冲突对照准确率下降超过30个百分点;对照为39.0%、58.4%、65.0%、60.0%,且冲突格均标*(Table 1,§3.1)。
    • 自然冲突并不一律更差。冲突高于对照且标的包括Qwen3.5-9B的GAIA(63.6%对31.9%,冲突集11条,±27.3)和Qwen3.5-27B的BrowseComp(6.7%对1.1%)。Claude Code的GAIA为81.8%±22.7对56.0%±8.6,未标,冲突集11条。作者称BrowseComp和部分GAIA上,智能体在持有错误知识的实例上更好,同时写明题目不同、难度可能不同。
    • 作者称Figure 3中Solve、Escalate与冲突集准确率负相关,Identify没有清晰单调关系;图注中的拟合曲线在低准确率处Solve近45%、Escalate近38%,高准确率处均低于10%。OpenHands在GAIA冲突集准确率为51.0%,作者称它在答错实例上倾向于忽略冲突。Table 5中OpenHands的Identify在TMD与GAIA为0.0,MoNaCo为0.8;MoNaCo上Qwen3.5-27B的Solve为85.0%,Qwen3.5-9B为71.4%。

    冲突相关提及出现的位置

    • 测的是轨迹中第一次提及冲突实体的归一化位置,跨(agent, dataset)汇总(Figure 4)。
    • 图注称:错误轨迹中对ground truth的提及、正确轨迹中对参数答案的提及,都在前10%步达到峰值,其后下降并有长尾。
    • 作者认为,与§3.2合看,早期接触冲突相关信息并不稳定伴随后续跟进或升级,并称该模式与simplicity bias相容。这是作者对分布的解读,不是干预结果。

    系统提示干预

    • 只在自然冲突设置上重跑冲突与对照。系统提示末尾追加一条短条款;不改工具、规划循环和权重。正文称该条款要求考虑其他解读、点名未解决冲突并报告ISE分数(§3.4)。附录E.1的条款要求承认冲突或不确定性,并仍给出最终答案;附录给出全文。
    • 作者称多数配置用更高Escalate换更低准确率。Figure 5图注称多数点落在humble-but-inaccurate象限。MoNaCo上,GPT-5的Escalate从1.6到60.7,准确率从30.1到23.2;Claude Code的Escalate从13.9到60.8;Qwen-Agent(Qwen3.5-9B)从16.7到44.9(Table 5、8、9)。作者把Table 8的GPT-5与Table 1的OpenHands (GPT-5)对照。
    • BrowseComp上,作者称GPT-5的Escalate增加28个百分点、准确率下降6个百分点。Table 9该行Escalate为30.8%,Table 8冲突准确率为23.5%。作者认为骨干被要求时可以表达不确定性,但该干预不能稳定地同时提高EH和准确率。

    裁判一致性

    • 三名裁判在全部实例上,正确性的Gwet's AC1为0.93到0.97,Identify与Escalate为0.82到0.92(§2.3)。Table 6按裁判对和冲突设置分列。作者称受控冲突上的一致性高于自然冲突。
    • GPT-5更不严格:未判识别1,334条,Sonnet 5为915,GLM-5.2为862;未判升级1,369条,对照835与540。作者称因此主文偏低的Solve、Escalate换裁判只会更低。
    • 人工彼此一致:Identify 76.0%(Fleiss κF=0.49),Escalate 85.3%(κF=0.63)。GPT-5与多数票为70.0%和72.0%(Table 7,各50条)。作者称这些判断对人也不容易;样本对正例过采样、负例偏难,是全量一致性的下界,不能直接与Table 6比。

    其他消融与分析

    • 受控冲突只保留Level 3;Claude Sonnet 4.6的L3为0,TMD场景行数均为0(Table 3)。
    • 自然冲突三条件为HAS_PK、SELF_AGREES、DISAGREES_GT(App. A.2)。
    • 迭代上限50;Identify保留think块,正确性评分剥离think块(§2.3,App. A.3)。
    • Qwen3.5-27B的TMD Identify为–,同格Escalate为49.3%(Table 5)。
    • 提示条款不改工具、循环和权重;显著性检验不覆盖提示对默认(§3.4)。
    • 冲突承认、自相矛盾、答案来源和工具调用次数四项次要诊断在正文定义,但未给出数值。
  5. 有什么可以进一步探索的点?

    作者称骨干与harness耦合、ISE只覆盖知识冲突这一通道,因子实验留待后续。

    作者指出的局限与后续方向

    • 骨干与harness耦合:五组配置各用固定骨干,因预算未跑完全部骨干×harness组合。提示干预不能分离模型、harness与评测环境的因果贡献,因子比较留待后续(Limitations)。
    • 计算开销:作者写实验花费超过3000美元、超过1000 GPU小时,因而必须选择跑哪些配置,覆盖不到全部组合(Limitations)。
    • ISE只是一片:不覆盖抗拒用户压力而同意、因缺少合适工具而拒题,以及对连续量给出校准置信。作者称结果应读作关于本研究所涉处理的证据,不是对智能体诚实全部方面的裁决;收窄范围是有意的(Limitations)。
    • 知识冲突只是一条通道:从现有工具无法得知的问题、含糊指令、超出能力的任务不在范围内。作者称更完整的图景需要合并这些通道,并认为知识冲突是其中最可控的(Limitations)。
    • 干预范围:§3.4只测一条系统提示,未做一等弃答动作,也未做面向诚实弃答的过程监督微调。作者称轨迹发布是为支持这些方向;Figure 5的混合结果说明的是这一干预的限度,而不是排除骨干层面的解释(Limitations)。
    • 冲突在何处被丢掉:作者把“轨迹哪一步丢掉冲突、何种harness与评分会保留并奖励不确定性承认”留作后续(§3.4)。

    实验覆盖范围

    • 被测为四类harness、五组固定骨干:Nemotron-Orchestrator-8B、Claude Sonnet 4.6、正文中的GPT-5(Table 2写作GPT-5.2)、Qwen3.5-9B、Qwen3.5-27B(§2.3,Table 2)。
    • 数据为TMD(ConflictQA、WikiContradict)以及GAIA、MoNaCo、BrowseComp;受控与自然冲突都有对照。自然冲突对照与冲突集题目不同(§2.1–2.2,Table 1、4)。
    • 主文裁判为GPT-5;附录用Claude Sonnet 5与GLM-5.2重评正确性、Identify、Escalate,并有50+50人工标注(§2.3,App. D)。
    • 提示干预只在自然冲突设置上重跑;作者写明显著性检验比较冲突与对照,不比较提示与默认(§3.4)。
    • 迭代上限写明为50。论文未报告每题重复运行次数,正文也未给出四项次要轨迹诊断的数值。
  6. 总结一下论文的主要内容

    ISE轨迹评测显示,四个智能体的高任务准确率并不对应更高的认知谦逊。

    作者要测的不是智能体最终答得对不对,而是知识冲突出现时,它有没有在轨迹里认出缺口、做有界的工具跟进,并把没解决的不确定性写给用户。

    • 问题:智能体评测几乎只看最终答案。作者认为缺的是认知谦逊,并把它收成Identify、Solve、Escalate三条可观察行为。
    • 做法:受控冲突把矛盾证据放进题面,题目来自ConflictQA与WikiContradict;自然冲突从GAIA、MoNaCo、BrowseComp的多步执行中筛选。两边都有对照。五个harness–骨干配置,迭代上限50,主裁判是GPT-5。Identify按冲突/对照标签算F1,Escalate只在冲突集的错误最终答案上计算。
    • 准确率:作者称TMD上有结果的配置,冲突集准确率比对照低超过30个百分点(Table 1)。自然冲突上并不一律下降;部分GAIA与BrowseComp单元格里,持有错误参数知识的实例准确率更高,作者同时注明题目构成可能不同。
    • 谦逊:作者称高准确率并不对应更高EH。BrowseComp冲突集上,Claude Code的Identify F1为90.0%,Escalate为0.0%(Table 5)。图注称冲突相关答案的提及集中在轨迹前10%(Figure 4)。
    • 提示:追加一条系统提示后,Escalate常常上升、准确率常常下降。MoNaCo上,作者报告GPT-5的Escalate从1.6到60.7,准确率从30.1到23.2。
    • 结论:作者认为EH来自骨干、harness与评测环境的交互,实验没有分开三者的贡献;并认为智能体不应只按基准准确率衡量,还要看不确定性是否被保留并传达。作者称已放出全部轨迹和逐轮ISE判定。
阅读原文huggingface.co