研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
Stale-Document Poisoning: When Outdated Retrieval Overrides Correct Model Answers
研究者评测发现,陈旧证据检索会推翻模型正确回答,4个开源模型在医学的中毒率为66%–91%(Table 5)。
- RAG常用于通过外部证据补充时效知识,但当检索到的文档本身已过时时,即使模型原本掌握正确答案,过时证据也会推翻正确结果,作者将这种时序对齐失效称为陈旧文档中毒。
- 作者构建了涵盖医学、法律、软件和策略的317项知识逆转基准;设计控制实验,保持证据内容一致仅改变评估日期或显式给出失效边界,并通过因果激活修补定位内部表征机制。
- 单篇陈旧文档在4个开源模型上造成17%–91%的中毒率(Table 5);仅改变日期难以促成适应,显式失效边界能使大模型实现94%–100%的适用性转换(Table 7);因果修补显示其调用了通用比较机制。
- 新旧逆转对比仅限于医学且题目不同,未完全排除题目难度差异;因果分析基于选取的20个题目和答案对数任务,未覆盖开放式生成或实际部署系统;头部特异性分析仅在10个保留确认项上评估。
- 模型
- GPT-4oGPT-4.1Claude-Opus-4.5Claude-Sonnet-4.6DeepSeek-V3DeepSeek-R1Qwen2.5-7BQwen2.5-72BLlama-3.1-8BLlama-3.1-70BMedGemma-4BMedGemma-27BGPT-5.5
- 基准
- 317-item knowledge reversal benchmark50-item temporal-applicability subset
- 指标
- Poisoning rate (Pm)Applicability gap (Gm)AccuracyError recoveryLogit shift
南丹麦大学研究者提出并量化了 stale-document poisoning(过期文档投毒):当检索到的证据本身已过时,模型会放弃不检索时本已答对的答案。他们构建了覆盖医学、法律、软件与平台政策的 317 条知识反转基准,每条都配有官方来源。在 12 个模型上,过期检索在无信任指令时翻转了 30% 的 Llama 与 37% 的 Qwen 答案,加入明确遵循文档的指令后升至 66% 和 75%;四个开源模型、四个领域的投毒率为 17%–91%,而匹配的最新证据被遵循的比例为 97%–100%。在 50 条已验证反转上固定证据、只改变评估日期时,仅凭日期带来的调整有限,但明确告知旧证据何时失效后,Qwen-72B 完成全部 50 次切换,Llama-70B 在表格格式下完成 50/50。因果干预显示评估日期处的内部状态可直接改变答案,注意力层是早期主要贡献者,且同一组件也参与一般比较任务。
推荐理由论文给出过期文档翻转正确答案的跨模型数据,并区分日期与有效性边界两种条件,为 RAG 部署方提供可复现的失效模式。
深度解读
这篇论文试图解决什么问题?
论文研究陈旧检索文档推翻模型原本正确回答的陈旧文档中毒问题。
这篇论文试图解决检索增强生成(RAG)中,检索到的过时证据推翻模型原本正确回答的“陈旧文档中毒”(Stale-Document Poisoning)问题。
- 问题场景与现实影响:医学指南、法律先例与软件接口常发生知识逆转,模型权重可能落后于变化,因此实践中常引入 RAG 检索外部证据;但当检索系统返回的是曾经真实有效但已被推翻的历史文档时,模型可能放弃自身正确的记忆而给出错误回答。
- 现有认知的不足:以往知识冲突研究多关注模型权重陈旧、伪造事实或对抗性提示注入,作者认为尚未充分探讨当真实官方证据随时间自然失效时,具备正确知识的模型是否具备选择性信任能力。
- 核心观察与假设:作者提出该问题本质是选择性认知信任(selective epistemic trust)的失效;时间适用性不仅取决于文档的撰写时间,还取决于其主张在提问时刻是否仍然有效,仅凭单纯的日期元数据不足以促成模型的主动判别。
- 非对抗性特征:作者强调该问题不需要恶意作者或伪造文档,证据本身真实且曾经有效,仅因适用条件改变而导致失效。
- 提出的研究体系:作者构建了包含医学、法律、软件/API、平台策略 4 个领域共 317 项知识逆转的基准,通过控制评估日期与显式边界隔离时序适用性,并结合因果干预分析模型内部决策机制与检索端重排序防御。
有哪些相关研究?
论文梳理了时序演变、知识冲突、可解释性与顺从性四类相关工作。
论文将研究定位在时序知识、RAG 知识冲突、模型内部控制与顺从性四个领域的交叉点。
时序知识与知识演变
- 时序问答与截止期研究:Dhingra et al. (2022)、Chen, Wang, and Wang (2021)、Liška et al. (2022) 与 Kasai et al. (2023) 构建了时序敏感问答基准;Lazaridou et al. (2021)、Vu et al. (2024) 与 Cheng et al. (2024) 探讨模型在知识截止期后的过时问题。
- 垂直领域知识逆转:Park et al. (2025) 和 Zhu et al. (2025) 评测模型对演变知识的感知;Vladika, Dhaini, and Matthes (2025) 与 Guan et al. (2026) 探讨医学指南变化;Zhang, Savelka, and Ashley (2025) 测试法律先例被推翻时的模型理解。
知识冲突与 RAG 中毒
- 非对抗性知识冲突:Longpre et al. (2021) 使用实体替换生成冲突,Xie et al. (2024) 引入反事实证据,Wu, Wu, and Zou (2024)、Marjanović et al. (2024) 与 Kortukov et al. (2024) 使用基准或真实文档测试参数记忆与检索上下文的冲突;Li et al. (2026)、Chen et al. (2026)、Zhang et al. (2025)、Ye et al. (2026) 和 Wang et al. (2026) 提出了来源平衡、顺从性分析与证据适配等缓解方法。
- 对抗性攻击:Zou et al. (2025) 提出针对 RAG 的知识损坏攻击 PoisonedRAG,Greshake et al. (2023) 提出间接提示注入;作者指出本文的过时文档并非由攻击者恶意伪造,而是曾经真实成立的官方材料。
内部表征与因果干预
- 事实召回与冲突表征:Geva et al. (2023)、Yu, Merullo, and Pavlick (2023) 与 Ortu et al. (2024) 提取记忆冲突的内部信号;Hase et al. (2023) 指出因果定位与编辑干预之间存在差异。
- 因果追踪与注意力头干预:Meng et al. (2022) 提出激活修补定位事实关联;Jin et al. (2024)、Minder et al. (2025) 与 Arditi et al. (2024) 通过注意力头干预和激活控制缓解知识冲突或调整上下文敏感度。
顺从性与可靠性
- 模型顺从行为:Perez et al. (2023) 与 Sharma et al. (2024) 指出后训练会增加模型对用户陈述的顺从性;Samsami et al. (2024) 报告模型在特定条件下也能抵御欺骗性上下文。
基线与评测基准
- 基线方法与基准:实验对比了无检索直接回答、单文档检索、带指令提示检索以及基于稠密检索(sentence-transformers/all-MiniLM-L6-v2)和混合重排序的检索防御;评测基准使用作者构建的 317 项知识逆转数据集和 50 项时间适用性子集。
作者定位的区别 作者指出,以往工作关注模型权重过时或对抗伪造冲突,而本文在模型已掌握正确知识的前提下,保持检索证据文本字面一致且真实,仅改变评估日期和有效性边界,直接检验模型的信任是否随文档的真实有效性边界发生改变。
论文如何解决这个问题?
论文构建多领域知识逆转基准,通过控制实验、因果修补与重排序进行分析与缓解。
作者通过构建多领域真实知识逆转基准,提出条件性中毒评估框架,并结合时间适用性控制实验、双向激活修补因果分析以及混合重排序检索防御来探究与缓解该问题。
基准构建与知识逆转问题形式化
每个基准项包含问题 q_i、支持已被推翻旧答案 y_i^old 的真实历史证据 d_i,以及当前正确的及时答案 y_i^。数据来自医学、法律、软件/API 和平台策略 4 个领域的官方权威来源。为了衡量模型受陈旧检索推翻的影响,作者定义仅在模型无检索已能答对(即集合 E_m)的前提下统计中毒率: Pm = 1/(|Em|) ∑i ∈ Em 𝕀[ŷm(qi, di, tstale) ≠ yi∗] 该公式计算模型 m 在无检索答对的样本集 E_m 中,加入过时证据 d_i 后预测结果偏离及时答案 y_i^ 的比例。对于时间适用性子集,I_i 表示证据 d_i 保持有效的时段,指示函数 g_i(t) 标记时间 t 是否属于 I_i。模型在有效与失效状态下的旧答案输出率之差定义为适用性差距 G_m = R_m(1) - R_m(0)。
时间适用性控制实验设计
为了彻底剥离文档内容差异对判断的干扰,作者设计了严格的时序控制实验:
- 内容保持完全一致:选取 50 项具有明确官方废止边界的逆转事件,在两个不同的评估日期呈现完全相同的历史证据、问题、选项和指令。
- 三种表述格式对比:对比仅提供评估日期(date only)、在正文中显式说明旧证据何时终止适用(prose boundary),以及在小型表格中显式标明适用区间(table boundary)。
- 指令强度设置:设置中立提示(仅展示文档)与显式遵循指令(要求在与已有知识冲突时遵循带有日期的文档),检验提示压力对信任决策的调节作用。
评估日期因果干预与注意力头定位
作者在 Qwen2.5-72B 和 Llama-3.1-70B 上执行内部表征因果分析,探究评估日期信息如何传导至最终决策:
- 双向激活修补(Activation Patching):在保持其他输入一致的前提下,在输入层的评估日期位置将有效日期状态与过期日期状态相互替换;以自身修补作为伪干预对照(sham control),并以历史源日期位置的修补作为特异性对照。
- 逐层追踪与组件分解:在决策 token(即提示词最后一个 token)的残差流上,逐层追踪修补效应的恢复比例,并分解注意力层输出与 MLP 层输出的相对贡献。
- 发现–确认双样本定位:在 10 个发现样本上筛选贡献最大的正向注意力头并冻结,随后在 10 个独立的确认样本上通过 Holm 矫正的精确符号检验进行验证,并进一步在普通日期比较与非时序数值阈值任务上测试其机制特异性。
检索端时序感知混合重排序
为在检索阶段过滤已过时证据,作者提出了一种结合语义、时序与废止信号的固定规则重排序器: s(d, q) = 0.5 cos(d, q) + 0.5 r(d) + 0.1 Isup(d) 该公式对候选文档 d 进行评分,其中 cos(d, q) 为稠密检索的语义相似度,r(d) 为文档年份在索引内的极差归一化值,I_sup(d) 为显式废止表述的指示标记;同时系统会标出存在语义近似但年份冲突的候选文档。
论文做了哪些实验?
论文在12个模型上完成基准评测,并开展了适用性控制、因果修补与防御实验。
实验设置
- 被测模型:主实验覆盖 12 个模型,包括 6 个商业 API 模型(GPT-4o、GPT-4.1、Claude-Opus-4.5、Claude-Sonnet-4.6、DeepSeek-V3、DeepSeek-R1)与 6 个开源模型(Qwen2.5-7B/72B、Llama-3.1-8B/70B、MedGemma-4B/27B);前沿压力测试包含 GPT-5.5;补充分析包含 Qwen-14B 与 Qwen-32B。
- 评测数据集:317 项知识逆转基准(医学 87 项、法律 100 项、软件/API 60 项、平台策略 70 项);33 项建立多年的医学逆转作为新近性对照;50 项独立验证的时序转换子集。
- 评测指标:中毒率 P_m(无检索答对样本中被过时证据推翻的比例)、适用性差距 G_m(有效与失效状态下的旧答案率之差)、准确率 Accuracy、错误恢复率 Error recovery、对数变化量 Logit shift。
- 评审方式:自动评审使用 GPT-4o 将自由文本回答映射为 timely、superseded 或 unclear;经独立人类评审验证,200 个样本(每领域 50 个)上首轮标注一致率为 76.0%(kappa = 0.621),裁决后一致准确率为 92.5%(95% CI [88.9, 95.9%]),macro-F1 为 0.894;第二评测模型在 840 个医学回答上的一致性 kappa = 0.93。
- 生成参数与测试重复:商业模型 temperature 为 0,开源模型使用贪心解码;统计检验采用 10,000 次聚类 bootstrap 重采样、Fisher 精确检验、McNemar 检验与 Benjamini-Hochberg 矫正。
主结果
下表给出 4 个开源模型与 GPT-5.5 在 4 个领域指令检索提示下的中毒率(据 Table 5 与 Appendix O):
表格较宽,可左右滑动
模型 医学 (Medicine) 法律 (Law) 软件/API (Software) 平台策略 (Policy) Qwen2.5-7B 0.765 (39/51) 0.618 (34/55) 0.354 (17/48) 0.541 (20/37) Qwen2.5-72B 0.855 (47/55) 0.611 (33/54) 0.250 (12/48) 0.410 (16/39) Llama-3.1-8B 0.661 (37/56) 0.200 (12/60) 0.289 (11/38) 0.417 (20/48) Llama-3.1-70B 0.906 (58/64) 0.347 (26/75) 0.167 (7/42) 0.412 (21/51) GPT-5.5 0.89 (74/83) 0.26 (12/46) 0.11 (2/18) 0.13 (2/15) 注:括号内为被推翻题数/无检索答对题数(公式 2 的分母);GPT-5.5 结果来自 Appendix O。
- 领域间脆弱性分布:作者指出在指令提示下,医学领域中毒率最高(Llama-70B 达 0.906,Qwen-72B 达 0.855),法律和政策领域中毒显著,软件领域相对具备抵抗力(中毒率为 0.167–0.354)。
- 参数规模与中毒关系:作者分析指出,参数规模增大并未消除中毒现象,大模型在多个领域的中毒率与小模型相当甚至更高(如 Llama-70B 在医学中毒率高于 Llama-8B)。
- 无检索准确率不具保护性:作者报告 GPT-5.5 无检索正确率达 0.92–1.00,但单篇过时医学文档仍推翻了 74/83 道先前答对的题目,中毒率达 0.89,说明陈旧文档中毒不仅出现在基础知识匮乏的场景。
时间适用性与显式边界控制实验
- 实验设计:在 50 项已验证时序逆转上,保持证据内容完全一致,仅改变评估日期(有效 vs 失效),并对比仅日期、散文边界和表格边界三种形式(Table 7, Figure 3)。
- 实验结果:仅改变日期时模型适用性差距较小,Qwen-72B 为 0.12 [0.04, 0.22],Llama-70B 为 0.14 [0.06, 0.24];而在表格边界下,Qwen-72B 和 Llama-70B 的差距均升至 1.00 [1.00, 1.00],分别完成 50/50 次转换;散文边界下 Qwen-72B 达 1.00,Llama-70B 达 0.94(47/50 次转换);小模型改善幅度较小(Qwen-7B 表格边界为 0.42,Llama-8B 为 0.28)。
- 作者解读:作者认为模型具备利用时序信息的能力,但难以仅从普通日期元数据中自发推断适用性规则;当明确告知旧证据何时终止适用时,大模型能够准确执行转换。
评估日期因果激活修补与机制定位
- 实验设计:在 Qwen-72B 和 Llama-70B(各 20 项符合标准的样本)上将评估日期跨度的残差流在有效与过期提示间对调,追踪决策 token 的层级传递,并定位关键注意力头及其任务特异性(Section 3.3, Table 8, Table 9)。
- 实验结果:第 0 层交换评估日期状态可转移大部分偏好(Qwen-72B 转移 23.08 logits,Llama-70B 转移 7.82 logits),而历史源日期对照仅引起 0.04 和 0.03 的变化;效应在较后层级集中(Llama-70B 第 39 层恢复 75%,Qwen-72B 第 63 层恢复 80%);在起始显著层,注意力层贡献显著为主(Llama-70B 第 31 层注意力贡献 0.91 对比 MLP 的 -0.17;Qwen-72B 第 55 层注意力贡献 2.34 对比 MLP 的 -0.04);在 10 个保留确认项上,Qwen 冻结的 10 个头中有 8 个、Llama 冻结的 15 个头中有 7 个在 Holm 矫正后保持显著;但这些头在普通日期比较和非时序数值阈值任务中同样产生显著转移(Table 9)。
- 作者解读:作者指出注意力层在早期引导了适用性信息的整合,但机制分析拒绝了“专用时间门控模块”的假设,作者认为模型调用的是更为通用的比较与决策机制。
提示指令压力与检索端混合重排序防御
- 实验设计:通过 2x2 提示因子实验(中立头 vs "最当前"头,无指令 vs 显式遵循指令)测试提示压力对中毒的影响(Table 12),并在包含 1 篇最新和 2 篇过时文档的检索池中评测固定混合重排序器在不同日期质量下的防御效果(Table 14)。
- 实验结果:中立标题下,显式遵循指令使 Qwen-7B 中毒率从 0.373 升至 0.745(OR 4.92),Llama-8B 从 0.302 升至 0.660(OR 4.50)(Table 12);而在检索防御中,日期准确时重排序使 Qwen-7B 和 GPT-4o 在法律与医学的中毒率降低 4.6 至 10.0 个百分点(Table 14,3 组检验 p < 0.05);当日期缺失时收益微弱(改善 1.0 至 4.0 个百分点,无统计显著性),在法律 Qwen-7B 上恶化 1.1 个百分点;在日期错误时,选出最新文档的比例降至 0。
- 作者解读:作者指出陈旧文档在中立检索下已能造成显著中毒,指令压力会进一步放大危害;检索端重排序依赖元数据真实性,单纯按时间排序无法替代对证据有效性的仲裁。
其他消融与分析
- 匹配最新证据恢复效果:在 87 项医学题目上提供最新文档,4 个模型达到 87/87 正确,Qwen-7B 与 Llama-8B 为 86/87,未答对题目的错误恢复率为 97%–100%(Table 6)。
- 已解决与近期逆转对比:12 个模型在已解决逆转上准确率为 0.88–1.00,在近期逆转上下降至 0.61–0.90,准确率差距为 +0.10 至 +0.36,10 个模型经 BH 矫正后显著(Table 4)。
- 提示词标题影响消融:在已有遵循指令时,“Most current”标题相较中立标题未产生可检测到的额外中毒增加(Qwen-7B 为 0.765 对比 0.745,Llama-8B 均为 0.660,Table 12)。
- 证据状态判别与回答脱节:Qwen-7B 将 76/87 篇过时文档标记为 uncertain,Llama-8B 将全部 87 篇过时文档标为 superseded 但对 39 篇最新文档也误标为 superseded,且在其后仍遵循过时文档(Table 13)。
- 决策 token 线性探测性能:在 ⌊0.6L⌋ 层残差探测无检索预测标签,Qwen-7B 在医学(AUROC 0.631 对比表面基线 0.411)、软件(0.714 对比 0.571)和策略(0.850 对比 0.400)超越基线,但在法律低于基线(0.316 对比 0.461,附录 I)。
- 表征几何分解与向量干预:中毒残差向未检索正确性轴的正交与径向比在末层为 6.63,良性文档为 7.14;残差导向在医学最高挽救率为 2/14,在法律为 1/14,未超过随机方向第 95 百分位数(附录 L、M)。
有什么可以进一步探索的点?
作者指出了逆转难度分离、因果评估场景与头部特异性等局限与后续方向。
作者指出的局限与后续方向
- 已解决与近期逆转难以完全排除题目难度差异:作者指出已解决逆转与近期逆转的对比仅限于医学领域,且两组使用了不同的问题,因此时序新近性效应无法与题目本身的固有难度完全剥离(Section 5)。
- 因果分析基于受控对数任务而非开放式部署:作者指出因果机制分析使用的是每大模型 20 个符合行为标准的问题,且基于带有显式选项的答案 logits 任务;这确立了受控场景下的因果影响,但未表明相同组件支配了无约束自由文本生成或实际部署的 RAG 系统(Section 5)。
- 注意力头定位属于定位证据而非完整回路:作者指出注意力头的特异性是在每个模型仅 10 个保留确认样本上进行评估的,因此应被理解为定位性证据,而非完整的回路描述(Section 5)。
- 运行环境元数据存在缺失记录:作者指出部分实验运行在 Apple Silicon MPS 或 CPU 上,未保留所有运行的确切 CPU 型号、操作系统镜像、挂钟总耗时和历史软件包状态;MedGemma 的运行时 SHA 未能记录而使用检查时的仓库 HEAD 替代(Table 1 标注、Appendix P)。
- 从发布日期走向显式有效区间与推理训练:作者提出未来的重要方向是超越单纯的出版日期,转向显式有效区间、废止关系建模,并训练模型专门针对这些时序关系进行推理(Section 6)。
实验覆盖范围
- 被测模型范围:实验覆盖 12 个主要模型,包括 6 个商业 API 模型(GPT-4o、GPT-4.1、Claude-Opus-4.5、Claude-Sonnet-4.6、DeepSeek-V3、DeepSeek-R1)与 6 个开源模型(Qwen2.5-7B/72B、Llama-3.1-8B/70B、MedGemma-4B/27B),并对 GPT-5.5 进行了压力测试(Section 2、Table 1、Appendix O)。
- 领域基准规模:基准包含医学(87项)、法律(100项)、软件/API(60项)和平台策略(70项)共 317 项知识逆转;跨领域中毒实验覆盖 4 个开源模型与 GPT-5.5,12 模型新旧对比仅在医学子集完成(Section 2、Table 4、Table 5)。
- 时间适用性子集规模:时间适用性控制实验覆盖 50 个经过独立源验证的转换项,评估了 Qwen2.5-7B/72B 和 Llama-3.1-8B/70B 在 3 种格式与 2 种指令下的表现(Section 2、Table 7)。
- 因果干预样本与组件:因果激活修补在 Qwen2.5-72B 与 Llama-3.1-70B 上各选取 20 个双向符合行为条件的样本,注意力头分析基于 10 个发现项与 10 个确认项(Section 3.3、Appendix G、Appendix H)。
- 检索防御评测设置:检索端重排序评估使用 sentence-transformers/all-MiniLM-L6-v2 构建的包含 1 篇最新与 2 篇过时文档的索引,下游生成在法律与医学领域由 Qwen-7B 和 GPT-4o 评估;论文未报告更多领域或其他稠密检索器下的下游生成防御表现(Section 3.5、Table 14、Appendix N)。
总结一下论文的主要内容
论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
- 要解决的核心问题:当外部检索返回曾经正确但现已过时的真实文档时,原本已掌握最新正确知识的模型是否会产生选择性认知信任失效,被过时证据误导而推翻正确回答。
- 核心方法设计:构建涵盖医学、法律、软件与平台策略的 317 项真实知识逆转基准;在 50 项严格验证的时序子集上固定证据文本仅变动评估日期与有效性边界;结合双向激活修补追踪因果机制;并评估包含时间衰减与废止因子的混合重排序器。
- 主要实验发现一(中毒普遍存在):单篇陈旧文档在中立检索下即会诱发中毒,在指令提示下 4 个开源模型在医学子集的中毒率为 0.661–0.906,GPT-5.5 在医学子集的中毒率达 0.89(74/83)(Table 5、Appendix O)。
- 主要实验发现二(时间元数据不足以纠偏):在内容完全相同的 50 项时序测试中,仅改变评估日期时大模型适用性差距仅为 0.12–0.14;而显式给出表格边界时,Qwen-72B 和 Llama-70B 均实现 50/50 的正确转换,适用性差距达 1.00(Table 7)。
- 主要实验发现三(通用比较机制主导因果传递):因果修补显示评估日期状态在网络深层转移答案偏好(Qwen-72B 转移 23.08 logits),且由注意力层在起始层率先主导;但定位到的注意力头同样参与普通日期和数值比较,表明模型调用的是通用比较机制而非专用时间回路(Section 3.3、Table 8、Table 9)。
- 主要实验发现四(检索端重排序依赖元数据):混合重排序在日期准确时降低中毒率 4.6–10.0 个百分点,但在日期缺失时收益微弱,日期错误时最新文档检出率降至 0(Table 14、Appendix N)。
- 作者结论与启示:作者指出 RAG 系统不仅需要检索相关信息,更需要决定证据是否仍具备认知权威;出版日期不等同于有效性,未来的 RAG 体系需要显式表示有效区间与废止关系,并提升模型对适用性规则的推理能力。