跳到正文
原文
研究者论文追踪· arXiv:2607.20891· Pengyu Zhu, Lijun Li, Longju Yang, Sen Su, Jing Shao·本站收录 · 原文发表 精选关注度32

MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

评估发现注入单篇虚假文档使六种开源深度研究配置的平均虚假结论采纳率从对照的 0% 升至 54.7%,合成前暴露达 85.5%。

问题
探究长程深度研究(Deep Research)智能体在处理包含表面可信但实际虚假的外部知识时,是否会在最终报告中采纳该虚假结论作为自身观点,以及这种采纳受何种因素影响。
方法
提出 MisKnow-Agent 框架,为 100 个任务构建经人工审核的虚假结论蓝图,生成覆盖 3 个权威层级与 4 种风格的误导文档,经 5 个搜索模型交叉验证与人工筛选建立评测集,并设计前置提示与后置精炼防御。
实验与结果
注入 1 篇误导文档使平均采纳率从无注入对照的 0% 升至 54.7%;学术论文风格与合成前暴露显著推高采纳率;DeerFlow 平均采纳率(67.0%)高于 WebThinker(55.0%);防御能降低采纳率但无法完全杜绝。
局限与可以继续做的
论文未专门设立章节讨论局限与后续方向;其实验覆盖了两个开源框架与一个闭源系统,防御评测仅在 DeerFlow 上开展,且未报告具体的网络查询次数与生成耗时。
实验设置DeerFlow、WebThinker 等 · DeepResearch Bench · FCAR、MER 等
模型
DeerFlowWebThinkerGemini Deep ResearchDeepSeek-V4 ProQwen3.5-397BIntern-S1-Pro
基准
DeepResearch Bench
指标
FCARMERECAR
AI 导读和推荐理由全文 408 字

北京邮电大学、上海人工智能实验室等机构的研究者提出 MisKnow-Agent,用受控的误导文档检验 Deep Research 智能体能否抵抗看似可信但事实错误的信息。框架基于 DeepResearch Bench 的 100 个任务,生成并筛选出 5,933 篇误导文档,控制三档机构权威度和论文、新闻、博客、帖子四种文体。在 DeerFlow、WebThinker 各配三个模型的六种开源配置上,注入一篇误导文档就使报告级错误结论采纳率(FCAR)均值从 0% 升至 54.7%,Gemini Deep Research 也会采纳。误导信息在最终综合报告前一刻进入时采纳率均值升到 85.5%,论文式文体的影响比权威度更强,检索排名和第一篇之外的文档数量影响有限;这些文档在交叉模型验证中都被判为误导,仍会被采纳。在 DeerFlow 上,研究前的验证提示和研究后的检索核查都能降低 FCAR,但不能消除采纳。

推荐理由论文给出单一误导文档即可让 Deep Research 报告采纳错误结论的量化结果,并比较了权威度、文体与生命周期阶段的影响。

深度解读

6 个问题,约 7,400 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    论文评估在长程深度研究工作流中,智能体是否会在最终报告中采纳具有表面可信度但实际虚假的误导性知识。

    在长程研究(Deep Research)工作流中,智能体是否会在最终报告中采纳具有表面可信度但事实错误的误导性知识作为自身结论。

    • 长程研究场景与重要性:Deep Research 智能体通过多步规划、多次检索、积累中间分析并最终生成结构化报告,正被用于整合论文、技术报告和领域资源的科学及知识密集型任务中;其价值不仅取决于能否检索到相关信息,还在于能否在整个工作流中保持健全的证据判断能力。
    • 现有评估的不足:现有评估主要关注长程研究的能力、引用正确性、检索忠实度与声明级真实性,或者局限于短程问答、检索增强生成(RAG)以及显式对抗攻击(如语料投毒或检索操纵);作者指出,现有评估未能联合刻画来源呈现形式、暴露时机、框架设计与骨干模型如何影响误导性知识被智能体采纳为最终结论。
    • 核心观察与假设:作者关注开放网络研究中的环境可靠性风险(ambient reliability risk),即误导性知识在未受主动恶意攻击时已存在于信息环境中;作者假设智能体在缺乏显式验证的情况下,可能会在中间状态压缩、保留并在最终合成阶段采纳这些虚假结论。
    • 威胁模型(Threat Model):
      • 目标与风险场景:模拟开放信息环境中出现误导性知识的场景,评估智能体在处理包含误导性证据的信息时能否保持正确判断(内容层可靠性)。
      • 攻击者能力:不假设提示注入(prompt injection)或指令劫持(instruction hijacking)等指令层攻击;不改变智能体模型参数、系统提示词、工具实现及基础证据环境;仅向智能体可访问的检索池中插入支持目标虚假结论的误导性文档。
      • 受害系统:基于大语言模型的长程深度研究系统,通过规划、检索、阅读、分析与合成多步生成报告。
      • 成功判定:以报告级虚假结论采纳率(FCAR)判定,仅当最终报告将目标虚假结论作为自身结论背书时计为采纳,单纯提及、引用或反驳不计入。
  2. 有哪些相关研究?

    论文梳理了深度研究智能体及其评估、外部知识下的模型可靠性与知识冲突、开放网络虚假信息等相关工作。
    • 深度研究智能体及其评估:
      • 智能体系统与范式(Xi 等 2025;Yao 等 2023;Schick 等 2023;OpenAI 2025;Li 等 2025):将大语言模型与规划、工具调用、记忆和外部环境交互相结合,通过多步搜索与证据整合生成长篇研究报告。
      • 智能体能力与事实性评估(Du 等 2026;Coelho 等 2025;Huang 等 2026):评估深度研究智能体的报告质量、引用正确性、检索忠实度与声明级事实性;作者指出这些工作评估了研究能力与输出正确性,但未系统隔离误导性知识在长程工作流内的传播过程。
    • 外部知识下的 LLM 可靠性与知识冲突:
      • 短程问答与事实核查中的外部知识冲突(Hong 等 2024;Wu 等 2024;Lewis 等 2020;Xu 等 2024):研究不正确、反事实或误导性上下文如何覆盖模型先验知识;作者指出这些研究主要关注短文本交互下的知识冲突。
      • 语料投毒与对抗性检索(Zou 等 2025;Dong 等 2026;Zhang 等 2026):PoisonedRAG 等研究攻击者投毒语料库诱导选定答案,SafeSearch 等评估检索智能体在操纵用户生成内容下的风险;作者指出这些工作多设定了攻击者主动投毒或操纵检索的对抗场景。
    • 网络虚假信息与过时信息风险:
      • 开放网络虚假与过时信息(Lazer 等 2018;Vosoughi 等 2018;Zhou & Zafarani 2020;Ouyang 等 2025):探讨网络环境中错误、过时或虚假信息的传播特征与对检索系统的影响。
    • 基线方法与基准:
      • 评估框架与基准:使用来自 DeepResearch Bench(Du 等 2026)的 100 个任务作为测试任务集。
      • 对比基准系统:开源框架评估了 DeerFlow(ByteDance 2025)和 WebThinker(Li 等 2025),闭源系统评估了 Gemini Deep Research(Citron 2024);骨干模型采用 DeepSeek-V4 Pro、Qwen3.5-397B 与 Intern-S1-Pro。
    • 本文定位:作者将本文定位为评估开放网络环境中由于误导性内容自然存在而带来的环境可靠性风险(ambient reliability risk),而非主动恶意攻击;重点研究受控的来源属性与暴露条件下,误导性知识如何在长程工作流的中间状态流转并在最终合成阶段被采纳。
  3. 论文如何解决这个问题?

    论文提出了 MisKnow-Agent 受控评估框架,构建经核实的误导知识蓝图与多维可控文档,并设计了前后两阶段防御策略。

    作者提出了受控评估框架 MisKnow-Agent,通过构建误导知识蓝图、生成可控权威度与风格的文档,并借助搜索引导的多模型交叉验证与人工筛选建立评测数据集,同时设计了前置提示与后置精炼两项防御策略。

    智能体在包含误导性文档的增强环境 ℰ̃q = ℰq ∪ ℳq 下运行,其中 ℳq 为支持规范虚假结论 cf(q) 的误导文档集。在多步研究过程中,智能体执行动作并根据 st = U𝒜(st−1, at, ot) 更新包含研究计划、累积证据与中间产物的研究状态,最终生成报告 r = G𝒜(sT)。

    蓝图构建(Blueprint Construction)

    • 蓝图元组定义:为每个任务 qi 构建蓝图 bi = (cfi, ℋi, ψi),包含规范虚假结论 cfi、权威层级机构池 ℋi 以及判定指令 ψi。
    • 虚假结论核实:所有规范虚假结论均经作者对照权威真实世界证据人工核查,确认其被权威记录直接反驳,或断言了权威记录中不存在的实体、方法、事件或实验结果。
    • 机构分层池:机构池分为高(High)、中(Medium)、低(Low)三个层级,每个层级包含 5 个具备机构名称、出版渠道类型及国家/地区元数据的虚构机构资料。
    • 采纳判定规则:ψi 规定仅当最终报告将 cfi 作为自身答案背书时判定为采纳,单纯提及、引用、归因或反驳均不计入。

    受控实例生成(Controlled Instance Generation)

    • 受控生成函数:在给定任务 qi、规范虚假结论 cfi、机构资料 hi,ℓ,k 与风格 s 下,文档生成器产出误导文档 mi,ℓ,s,k = Gdoc(qi, cfi, hi,ℓ,k, s)。
    • 风格与权威正交控制:风格空间涵盖学术论文(Paper)、技术博客(Blog)、新闻报道(News)与社交论坛帖子(Post);提示词要求不同权威层级的文档保持同等写作质量与术语密度,仅改变机构名称、发布渠道与 URL 模式。
    • 生成模型选型:经附录 A 人工盲评对比 Kimi 2.6、Qwen3.5-397B、GLM-5 和 DeepSeek-V4 Pro,作者选定 DeepSeek-V4 Pro 作为生成模型,作者称其在语言一致性、机构本地化与层级风格遵从度上表现更佳。

    检索引导的精炼与质量过滤(Search-Guided Refinement and Filtering)

    • 多模型交叉决策:引入 5 个具备网络搜索能力的独立验证模型(GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro);仅当全部 5 个模型一致判定候选文档为 Mis(无法通过真实证据佐证或与权威记录冲突)时予以保留。
    • 迭代精炼循环:若任一验证模型判定为 Real,则由生成器结合反馈进行迭代修改,直到全部验证模型判定为 Mis 或耗尽精炼预算。
    • 人工筛选构建语料:经人工质量筛查剔除低质量实例后,最终为 DeepResearch Bench 的 100 个任务生成了 5,933 篇受控误导性文档。

    防御策略设计(Defense Strategies)

    • 前置防御(Pre-research Defense):在用户查询后拼接通用验证提示词(附录 D),要求智能体将检索信息视为未经验证,对关键结论要求一手来源或独立可靠来源佐证,对薄弱或冲突证据予以弱化或剔除。
    • 后置防御(Post-research Defense):在生成初始报告后,引入同款骨干模型驱动的带搜索能力的精炼智能体(附录 E 算法 1),在同一增强检索环境下逐条识别核心声明、检索证据并修改或剔除未获支持的主张。
  4. 论文做了哪些实验?

    论文在两个开源框架和 Gemini Deep Research 上评估了误导知识对虚假结论采纳率的影响及防御效果。

    实验设置

    • 被测系统与模型:开源框架评估了 DeerFlow 和 WebThinker,各搭配 DeepSeek-V4 Pro、Qwen3.5-397B-A17B(简称 Qwen3.5-397B)、Intern-S1-Pro(Artificial Analysis Intelligence Index 分别为 44、34、22);闭源系统评估了 Gemini Deep Research。
    • 数据集与规模:基于 DeepResearch Bench 的 100 个任务,生成并筛选出 5,933 篇误导性文档。
    • 评测指标:核心指标为报告级虚假结论采纳率(FCAR),即最终报告采纳规范虚假结论的有效完成运行比例;过程指标包括误导证据检索触达率(MER)与暴露条件下的采纳率(ECAR),满足 FCAR = MER × ECAR。
    • 评审机制:统一采用 DeepSeek-V4 Pro 作为裁判模型,附录 B 报告其在 300 份随机抽样报告上与人工裁决达到 99.7% 的原始一致率(Cohen's κ 为 0.993)。
    • 默认参数与设置:温度统一设为 0;搜索后端使用 Serper 且默认返回 top-10 结果;默认设置为 High 权威度、Paper 风格、注入预算 b = 3;遇工具或 API 故障的运行予以重跑。

    主结果

    下表展示六种开源框架–LLM 配置在匹配的高权威、学术论文风格默认设置(b = 3)下的表现(据 Table 3 和 Figure 6):

    表格较宽,可左右滑动

    骨干模型 (LLM)Intelligence IndexWebThinker FCAR (%)WebThinker MER (%)WebThinker ECAR (%)DeerFlow FCAR (%)DeerFlow MER (%)DeerFlow ECAR (%)
    Intern-S1-Pro2255.072.076.476.094.080.9
    Qwen3.5-397B3450.098.051.060.097.061.9
    DeepSeek-V4 Pro4460.092.065.265.096.067.7
    • 无注入对照为零而注入诱发采纳:在无注入对照(b = 0)下六种配置的 FCAR 均为 0%;而引入单篇误导文档(b = 1)后跨配置均值升至 54.7%(Figure 5)。
    • 框架差距随智力指数缩小但采纳率非单调:DeerFlow 平均 FCAR(67.0%)高于 WebThinker(55.0%),两框架差距随模型智力指数提高从 21.0 百分点收窄至 5.0 百分点;但绝对 FCAR 与智力指数不呈单调关系,Intern-S1-Pro 在 DeerFlow 上最高(76.0%),DeepSeek-V4 Pro 在 WebThinker 上最高(60.0%)。
    • 框架差距来源因模型而异:差异分解表明,Intern-S1-Pro 的框架差距主要来自 MER(贡献 17.3 百分点,配对 McNemar 检验 p < 0.001);Qwen3.5-397B 的差距主要来自 ECAR(贡献 10.6 百分点);DeepSeek-V4 Pro 的差距由两者各贡献约一半(据 Table 3)。

    搜索结果排名与生命周期阶段影响

    • 测了什么:在单次搜索结果的前部(Front)、分散(Spread)、后部(Back)放置误导文档,以及在研究开始前(Cold start)、研究中期(Mid-research)、最终合成前(Pre-synthesis)引入误导文档对 FCAR 的影响(Figure 3)。
    • 实验结果:搜索排名影响较小,Front、Spread、Back 的跨配置平均 FCAR 分别为 66.2%、65.5% 和 64.5%,最大跨配置差异仅 1.7 个百分点;生命周期阶段影响较大,Cold start 平均 FCAR 为 40.5%,Mid-research 为 44.2%,而在合成前(Pre-synthesis)升至 85.5%(跨配置范围 77% 至 94%)。
    • 作者解读:作者认为排名影响小表明智能体基于内容相关性而非列表位置纳入证据;合成前采纳率增加表明智能体在最终合成阶段难以识别误导证据,WebThinker 前期的较低采纳率反映的是后续搜索推翻误导证据的机会,而非在合成时的可靠拒绝。

    来源权威度与呈现风格影响

    • 测了什么:评估机构权威层级(High、Medium、Low)与来源风格(Paper、Blog、News、Post)对 FCAR 的影响(Figure 4)。
    • 实验结果:权威层级上,跨配置平均 FCAR 从高权威的 61.0% 降至中权威的 57.7% 和低权威的 46.2%(高低相差 14.8 个百分点),但在 WebThinker 的两个配置中中权威略高于高权威;风格上,Paper 产生最高平均 FCAR(61.0%),后续依次为 Blog(53.0%)、News(44.0%)和 Post(37.5%),Paper 与 Post 相差 23.5 个百分点。
    • 作者解读:作者指出学术论文风格是比权威层级更强、更一致的说服线索;学术论文风格在全部 6 种配置中 FCAR 均最高,而 Post 在全部配置中均最低。

    闭源系统泛化与防御有效性

    • 测了什么:在 Gemini Deep Research 上评估权威度、风格与注入数量(Figure 7(a)-(c));在 DeerFlow 上对三种骨干模型评估前置提示防御、后置精炼防御及组合防御(Figure 7(d)-(f))。
    • 实验结果:Gemini Deep Research 的 FCAR 从高权威的 54% 降至中权威的 46% 和低权威的 8%;Paper 风格为 54%,Blog 为 41%,News 为 34%,Post 为 28%;注入文档数从 1 篇的 27% 增至 3 篇的 54%,4 至 5 篇在 50%–56% 之间。防御方面,无防御基线为 60%–76%,前置防御降至 37%–57%,后置防御降至 20%–58%,组合防御降至 15%–62%;但在 Intern-S1-Pro 上组合防御(62%)高于单独前置(57%)或单独后置(58%)。
    • 作者解读:作者指出误导知识采纳同样存在于带原生在线搜索的闭源系统中;现有防御虽能降低采纳率但无法消除采纳,且组合防御并未在所有模型上带来相加收益,作者认为可能因后置精炼在相同混合检索环境中再次检索并接受了误导信息。

    其他消融与分析

    • 误导文档预算(Figure 5):跨配置平均 FCAR 在 1 篇时为 54.7%,2 篇为 59.5%,3 篇达到峰值 61.0%,4 篇为 60.3%,5 篇为 58.3%,没有配置呈现单调剂量反应。
    • 审判模型人工一致性验证(附录 B):以 300 份最终报告抽样为基准,DeepSeek-V4 Pro 与人工裁决的原始一致率为 99.7%,Cohen's κ 为 0.993。
    • 生成模型定性对比(附录 A / Table 1):Kimi 2.6 出现跨语言不一致(中文任务夹杂英文),Qwen3.5-397B 出现机构本地化不匹配(中文任务使用全英文机构名),GLM-5 引入未请求的个人署名(如 Elena Rostova)。
  5. 有什么可以进一步探索的点?

    论文未专门设立章节讨论局限与后续方向,其实验覆盖了两个开源框架、一个闭源系统及多维受控条件。

    作者指出的局限与后续方向

    • 论文未专门讨论局限:论文正文、附录、结论(Section 6)以及相关章节均未专门设立独立小节讨论该工作自身的局限性或未来研究方向(Limitations / Future Work)。

    实验覆盖范围

    • 任务与基准覆盖:实验评估了来自 DeepResearch Bench 的 100 个任务(Section 4.1),为每个任务人工审核了其规范虚假结论(附录 C),共构建并筛选出 5,933 篇误导性文档。
    • 系统与模型覆盖:开源系统测试了 DeerFlow 和 WebThinker 两个框架,各搭配 DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro 共 6 种组合(Section 4.1);闭源系统测试了 Gemini Deep Research(Section 5.1)。
    • 受控自变量覆盖:测试了 3 个机构权威层级(High、Medium、Low)、4 种呈现风格(Paper、News、Blog、Post)、3 种搜索结果排名位置(Front、Spread、Back)、3 个生命周期阶段(Cold start、Mid-research、Pre-synthesis)以及 0 至 5 篇文档预算(Section 3.3、4.2–4.4)。
    • 防御评估范围:防御实验仅在 DeerFlow 框架下对三种骨干模型评估了前置提示、后置精炼及组合防御(Section 5.2);论文未在 WebThinker 或 Gemini Deep Research 上评估防御效果。
    • 运行参数与未报告信息:所有实验温度固定为 0,搜索后端使用 Serper 并默认检索 top-10 结果(Section 4.1);论文未报告各系统在研究过程中的具体网络查询次数与生成耗时。
  6. 总结一下论文的主要内容

    论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
    • 定位与核心问题:本文评估大语言模型长程研究(Deep Research)智能体在开放信息环境下的内容可靠性,重点探究智能体是否会在最终报告中采纳具有表面可信度但事实错误的误导性知识作为自身结论。
    • 方法设计要点:提出 MisKnow-Agent 受控评估框架,针对 DeepResearch Bench 的 100 个任务构建人工审核的虚假结论蓝图,生成跨 3 个权威层级与 4 种风格的误导文档,并经 5 个搜索验证模型交叉检验与人工质量筛选保留 5,933 篇文档;同时设计了前置验证提示与后置精炼智能体两阶段防御。
    • 暴露与来源影响:实验表明无注入对照下平均虚假结论采纳率(FCAR)为 0%,注入 1 篇误导文档即升至 54.7%(Figure 5);搜索结果排名位置对采纳率影响较小(Front 与 Back 仅差 1.7 个百分点),而在最终合成前引入误导文档使平均采纳率升至 85.5%(Figure 3);学术论文风格产生的采纳率最高(61.0%),较社交帖子高出 23.5 个百分点(Figure 4)。
    • 系统与框架差异:在默认高权威学术论文风格下,DeerFlow 平均 FCAR(67.0%)高于 WebThinker(55.0%),差距随模型智力指数提升而缩小,但采纳率与智力指数不呈单调关系(Table 3);Gemini Deep Research 同样表现出类似趋势,FCAR 在 1 篇时为 27%,在 3 篇时达到 54%(Figure 7)。
    • 防御表现与启示:前置提示、后置精炼及组合防御可将 DeerFlow 上的 FCAR 从基线的 60%–76% 降至 15%–62%,但无法完全消除采纳,且在 Intern-S1-Pro 上组合防御(62%)高于单项防御(Figure 7);作者认为仅靠隔离识别误导文档并不充分,必须将验证与修正机制贯穿于证据获取、中间研究状态和最终合成的全流程。
阅读原文arxiv.org