跳到正文
原文
论文追踪· arXiv:2609.37468·本站收录 · 原文发表 精选关注度55

论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法

Backdoor in the Loop: Compromising Agentic Search via Malicious Retrievers

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

攻击者通过恶意检索器操纵智能体搜索,在HotpotQA使E5问答F1从53.99%降至25.62%(Table 1),并能利用覆盖遗忘隐蔽后门。

威胁模型攻击者向受害者提供恶意微调的检索器权重(模型供应链威胁),受害者在干净语料库上本地构建索引并运行;受害者智能体、提示词、语料库均未修改且攻击者不可见;攻击者无语料写入权限,仅通过触发词操纵检索器输出以影响智能体后续多轮搜索与停机决策。

问题
智能体RAG将推理与多轮检索交替进行,检索器可影响后续查询和停机决策。现有攻击多依赖语料注入或单轮设置;论文研究在语料库和智能体未修改时,仅凭恶意检索器操纵多轮搜索循环并隐蔽后门。
方法
构建三类攻击:无目标抑制关键证据、目标攻击持续召回指定文档、轮数控制延长搜索以耗尽预算。提出诱饵覆盖遗忘机制DOU,通过受限注入并遗忘弱辅助后门重塑表征,削弱检测器信号,同时保留原恶意关联。
实验与结果
在两项QA基准上,无目标攻击使F1下降18.8–30.9个百分点(Table 1);目标攻击实现99.8%–100%每轮命中(Table 2);高强度轮数控制使检索轮数增加78–88%(Table 3);DOU使MuSiQue上SS检测的∆从46.53降至29.26(Table 6)。
局限与可以继续做的
作者指出针对单文档的目标后门更难仅凭DOU隐蔽,需稳定性均衡扩展;防御基线BPO无法消除检索后门。实验覆盖了E5与Contriever检索器、Qwen2.5-7B-Instruct智能体及两项QA基准,检测评估仅在5万条候选池中进行而非全索引运行。
实验设置E5、Contriever-MSMARCO 等 · HotpotQA、TriviaQA 等 · EM、F1 等
模型
E5Contriever-MSMARCOQwen2.5-7B-Instruct
基准
HotpotQATriviaQAMuSiQuewiki18_100w
指标
EMF1Target HitEvery-Round HitTarget@1/RoundMean RoundsAUROC∆
AI 导读和推荐理由研究者提出针对 Agentic RAG 的检索器后门威胁模型:攻击者只提供被污染的检索器检查点,不改动搜索 Agent 和部署语料,即可在触发问题下操纵检索结果。三类攻击分别抑制支撑证据使答案错误、让指定已有文档在多轮检索中持续排前,以及诱导 Agent 延长搜索,在高强度下平均搜索轮数增加 78% 至 88%、最终上下文 token 增加 81% 至 87%、完成延迟增加 80% 至 126%,同时 F1 下降 24 至 29 分。研究还提出 Decoy Overwrite-Unlearn(DOU),先注入较弱的诱饵后门再将其遗忘,从而削弱 Spectral Signatures、Neural Cleanse、PICCOLO 等检测器的可见信号,同时保留原有恶意检索行为;在 MuSiQue 上 SS 的 Δ 从 46.53 降至 29.26,NC 从 38.23 降至 19.40。

研究者提出针对 Agentic RAG 的检索器后门威胁模型:攻击者只提供被污染的检索器检查点,不改动搜索 Agent 和部署语料,即可在触发问题下操纵检索结果。三类攻击分别抑制支撑证据使答案错误、让指定已有文档在多轮检索中持续排前,以及诱导 Agent 延长搜索,在高强度下平均搜索轮数增加 78% 至 88%、最终上下文 token 增加 81% 至 87%、完成延迟增加 80% 至 126%,同时 F1 下降 24 至 29 分。研究还提出 Decoy Overwrite-Unlearn(DOU),先注入较弱的诱饵后门再将其遗忘,从而削弱 Spectral Signatures、Neural Cleanse、PICCOLO 等检测器的可见信号,同时保留原有恶意检索行为;在 MuSiQue 上 SS 的 Δ 从 46.53 降至 29.26,NC 从 38.23 降至 19.40。

推荐理由论文提出仅替换检索器检查点即可操纵 Agent 搜索轨迹的三类后门,并给出用净化流程反向隐藏后门的方法。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    探索在智能体搜索循环中仅通过恶意检索器权重发起多目标后门攻击并利用净化机制隐蔽攻击。

    这篇论文试图解决的问题是:在智能体检索增强生成(Agentic RAG)的多轮搜索循环中,攻击者能否仅通过提供被篡改的检索器检查点操纵智能体决策,并利用后门净化机制隐蔽攻击。

    • 场景与重要性:智能体RAG将中间推理与重复检索交替进行,检索器不仅影响最终答案,还直接塑造智能体的后续查询与停机决策。作者认为,检索能力的扩展放大了检索器的系统级影响力,但这一闭环也带来了全新的安全脆弱性。
    • 现有方法的不足:以往针对RAG的攻击主要依赖向语料库注入恶意文本,作者指出在现实中攻击者往往无法修改受害者私有或官方审计的受信任语料库;而针对检索器的现有攻击大多面向单轮查询,未考虑智能体多轮动态生成查询的反馈轨迹。
    • 核心观察与假设:攻击者在初始问题中植入触发词后,即使智能体每轮改变检索查询,原始问题仍会被拼接在检索输入中;此外,有限的辅助后门注入与遗忘能够改变检测器检查的表征特征,却不消除原有的恶意关联,可被用于隐蔽后门。
    • 威胁模型:
      • 受害系统:受害者部署包含良性Search Agent(基于Qwen2.5-7B-Instruct)、密集检索器与干净语料库的智能体搜索系统,从公开源获取检索器检查点并在本地构建索引与运行,智能体及推理流程保持未篡改。
      • 攻击者目标:在保持干净问题检索与问答质量的同时,实现三种恶意目标:无目标抑制支持证据以破坏答案、有目标持续在多轮中检索指定的已有文档、以及控制搜索轮数以成倍消耗计算与上下文预算。
      • 攻击者知识与能力:攻击者拥有对检索器的白盒控制权,可任意微调参数;可利用训练时搜索轨迹或查询参考智能体,但无法查看或修改受害者部署的智能体参数与推理过程;攻击者无语料库写入权限,有目标攻击仅指向语料库中已有的单一文档。
    • 论文的应对方案:作者提出了针对证据完整性、持续定向检索与执行轮数控制的三种检索器后门攻击,并提出了诱饵覆盖遗忘(Decoy Overwrite–Unlearn, DOU)机制,通过注入并消除辅助后门来愚弄多种后门检测器。
  2. 有哪些相关研究?

    梳理了智能体搜索系统、RAG语料与检索器攻击、以及后门净化防御等研究,定位了检索器供应链在多轮反馈中的脆弱性。

    相关研究主要围绕智能体搜索机制、RAG攻击方法以及后门净化与检测技术展开。

    智能体搜索系统

    • 交互式搜索策略:WebGPT(Nakano et al., 2021)与ReAct(Yao et al., 2023)结合了浏览器环境交互与中间推理;IRCoT(Trivedi et al., 2023)交织检索与思维链推理;Search-o1(Li et al., 2025)、Search-R1(Jin et al., 2025)与R1-Searcher(Song et al., 2025)通过强化学习探索长文本多轮搜索策略;Agentic-R(Liu et al., 2026a)使检索器适应智能体生成的查询及其答案效用。
    • 语义分发与检索架构:SDN(Hua & Xiao, 2026)探索了面向大语言模型智能体的网络检索基础设施;AgentIR(Chen et al., 2026)研究了用于深度研究智能体的推理感知检索。

    RAG攻击方法

    • 语料库投毒攻击:对抗段落注入(Zhong et al., 2023)与PoisonedRAG(Zou et al., 2025)通过构造高排名恶意文本注入语料库来操控模型回答。作者指出,此类攻击需要修改受害者部署的语料库,在索引公开或经过官方审计的文档时难以实施。
    • 检索器后门与编辑攻击:BaD-DPR(Long et al., 2025)利用语法错误触发被注入的段落;Backdoored Retrievers(Clop & Teglia, 2024)将特定主题映射至提示注入文档;TrojanRAG(Cheng et al., 2024)建立触发词与恶意上下文关联;DisarmRAG(Dai et al., 2026)与CAREAttack(Liu et al., 2026b)针对特定查询注入规避指令或冲突知识。作者指出,这些工作聚焦于单轮检索场景,未探讨智能体多轮搜索反馈循环。

    后门净化与检测防御

    • 基于注入的后门净化:PDB(Wei et al., 2024)在推理阶段激活防御性后门以覆盖恶意行为;Dummy Backdoor(Iwahana et al., 2026)、Locphylax(Lin et al., 2026)以及BPO(Huang et al., 2026)引入已知辅助后门并通过微调或解学习消除未知后门。作者指出,BPO原面向监督图像任务,且防御性去除辅助关联与去除原后门是不同结果。
    • 基线方法与评测基准:论文评测的防御基线包括CleanFT、Prune30+FT以及BPO(A2A和A2O变体);评估的后门检测方法包括Activation Clustering(Chen et al., 2018)、Spectral Signatures(Tran et al., 2018)、Neural Cleanse(Wang et al., 2019)、PICCOLO(Liu et al., 2022)、TopK Instability、RAP(Yang et al., 2021)和STRIP(Gao et al., 2019);评测采用HotpotQA、TriviaQA与MuSiQue基准。

    与现有工作的区别定位:作者将本文工作定位于通过模型供应链提供恶意检索器权重,无需语料写入权限即可在智能体多轮动态推理反馈中维持攻击,并将防御端的弱净化反向用作攻击者的后门隐蔽手段。

  3. 论文如何解决这个问题?

    设计了无目标、有目标和轮数控制三类轨迹级攻击,并提出诱饵覆盖遗忘机制,通过弱辅助后门重塑表征以逃避检测。

    整体思路上,论文针对智能体检索增强系统设计了三类轨迹级后门攻击,并通过诱饵覆盖遗忘(Decoy Overwrite–Unlearn, DOU)后处理重塑模型表征以逃避后门检测。联合优化目标采用 L(θb) = Lclean(θb) + λa La(θb),该联合优化目标通过干净检索损失约束正常效用,并由恶意损失加权控制后门攻击强度。

    问题设定与输入构建

    • 多轮检索工作流:在智能体搜索中,第 t 轮时搜索智能体结合历史信息生成推理步与查询 (r_t, q_t) = π(Q, h_{t-1})。检索器接收输入 x_t = Q [SEP] q_t 并返回文档集合 D_t。
    • 触发词持续传递:由于检索器输入始终保留原始问题 Q,攻击者在用户问题中注入的触发词会在每一轮检索调用中持续传递,即使智能体生成的后续查询 q_t 发生动态改变。

    三类轨迹级后门攻击

    • 无目标证据抑制攻击:目标是剥夺智能体回答所需的关键证据并引导错误后续查询。从候选池中选出原检索器打分最低的 r 个段落集合并排除真实支持文档,抽取负面段落并在多轮交叉熵损失中提升其排名。
    • 有目标持续检索攻击:目标是在查询动态变化时让语料库中指定的已有文档 d* 持续保持在 Top-K。在每个检索轮次中,通过交叉熵损失将该文档对其他候选段落的相对得分进行提升,无需编辑或插入语料库文档。
    • 控制流轮数控制攻击:目标是操纵证据以诱导智能体延长搜索轮数,消耗计算与上下文预算。训练离线判定器 J(x_t, d) 给段落与停机行为的关联度打分,完成轨迹的终轮检索作为正例,未完成轨迹作为负例;攻击训练时选择打分偏低的段落作为检索目标以推迟停机。

    诱饵覆盖遗忘隐蔽机制(DOU)

    • 覆盖与遗忘两阶段优化:引入与攻击触发词不同的辅助触发词 δ_o(实验中设置为 bpooverwrite)。首先在预热后门模型上进行全对全覆盖训练,将带有辅助触发词的输入映射至置换后的正例;随后进行遗忘训练,恢复辅助输入的真实文档并施加参数稀疏惩罚。覆盖阶段目标为 Low(θ) = 𝔼i [ℓret(xi, d+i; θ) + β ℓret(xδoi, d+σ(i); θ)],该覆盖损失通过全对全置换将带有辅助触发词的输入映射到错位的正例文档以重塑编码器表征。
    • 步数限制与机制隔离:DOU 由攻击者在受限优化步数下执行。作者指出,消除辅助关联与消除原有后门是不同结果,有限步数更新能调整共享编码器中被检测器捕捉的全局表征特征,同时保留原后门的检索操纵能力。
    • 目标后门稳定性均衡扩展:针对单一目标文档的残余特征,附录进一步提出了可选的稳定性均衡阶段,最小化干净样本与触发样本在轻量词汇扰动下的表示不稳定性差距,仅微调编码器最后两层。
  4. 论文做了哪些实验?

    在两项QA基准上评测了三类后门攻击的有效性、防御基线的抵抗力,并在MuSiQue上验证了DOU对抗7种检测器的隐蔽效果。

    实验设置

    • 被测模型:Dense Retriever采用E5与Contriever-MSMARCO;Search Agent基于Qwen2.5-7B-Instruct。
    • 评测基准与语料:评测采用HotpotQA(多跳推理)与TriviaQA(开放域问答)各1,000条测试问题;检测验证集使用MuSiQue-1000(30条自然触发正例);检索语料采用wiki18_100w维基百科语料。
    • 后门训练配置:无目标攻击采用author、how和##三种触发词,使用27,500条干净样本和2,752条投毒样本(投毒率9.1%)训练2个epoch;目标攻击使用2,750条投毒样本并指向Pavia Cathedral文档。
    • 评估指标:问答质量采用精确匹配(EM)和F1;目标攻击采用Target Hit、Every-Round Hit与Target@1/Round;轮数控制采用Mean Rounds与No Valid计数;隐蔽性采用检测器AUROC及其偏离50的绝对差值均值∆。
    • 防御基线与检测器:防御基线包括CleanFT、Prune30+FT以及BPO(A2A和A2O);检测器包括Activation Clustering(AC)、Spectral Signatures(SS)、Neural Cleanse(NC)、PICCOLO、TopK Instability、RAP与STRIP。
    • 协议与样本量:净化与问答评估各使用1,000个样本;检测评估在1,000个未修改问题上进行,通过200次随机种子抽样运行,每次使用128个无标签问题拟合、872个问题计算AUROC。

    主结果

    | 数据集 | 检索器 | 评估设置 | EM (%) | F1 (%) | 数据出处 | | HotpotQA | E5 | 原始检索器 | 43.40 | 55.51 | Table 1 | | HotpotQA | E5 | 后门-干净输入 | 42.50 | 53.99 | Table 1 | | HotpotQA | E5 | 后门-触发输入 | 18.30 | 25.62 | Table 1 | | TriviaQA | E5 | 原始检索器 | 65.00 | 72.21 | Table 1 | | TriviaQA | E5 | 后门-干净输入 | 64.70 | 72.35 | Table 1 | | TriviaQA | E5 | 后门-触发输入 | 41.30 | 46.71 | Table 1 |

    • 干净效用保持:作者指出,在无目标攻击下,后门训练对干净输入的F1影响在1.92个百分点以内,使得被篡改的检索器在干净评估中难以被察觉。
    • 回答质量下降:作者指出,触发词激活后导致F1下降18.8–30.9个百分点,且HotpotQA上的绝对下降幅度高于TriviaQA,作者认为这与其需要跨文档组合证据的特性一致。
    • 自然触发有效性:作者报告,在包含自然出现author单词的90个真实未修改问题上,触发后F1相比原始检索器下降13.9–34.7个百分点(Table 1下栏)。

    持续定向检索与轮数控制攻击

    • 持续目标命中:在目标攻击评测中,针对Pavia Cathedral文档,激活状态下99.8%–100%的问题在每一个执行轮次中均命中该目标(Every-Round Hit),且超过99.7%的轮次中该目标排名第一(Table 2);作者称攻击在首轮命中后仍能在动态多轮中持续暴露目标。
    • 搜索轮数额外增加:作者指出,尽管目标攻击仅优化文档排名,但平均搜索长度仍增加了约1轮(HotpotQA上E5从2.22轮增至3.00轮,Table 2),作者称增加搜索并不能弥补被操纵证据带来的负面影响。
    • 资源开销成倍消耗:高强度轮数控制攻击在HotpotQA上使检索轮数增加78.5%、Token消耗增加81.1%、耗时增加80.0%,在TriviaQA上耗时增加125.9%(Table 3);作者指出这使攻击者仅凭检索证据即可耗尽智能体资源预算。

    后门防御基线评测

    • 微调与剪枝无法消除差距:CleanFT(5–30轮)与30%权重剪枝后微调(Prune30+FT)在HotpotQA上仍保留28.64–30.05个百分点的干净-触发F1差距,在TriviaQA上保留23.12–24.10个百分点(Table 4);作者称延长训练未能持续恢复触发性能。
    • BPO净化机制失效:无论采用全对全(A2A)还是全对一(A2O)覆盖,BPO微调后原后门触发F1变化均为负值(Figure 4,HotpotQA上相对源后门变化为-0.53至-3.70);作者称诊断测试表明辅助后门被消除而原后门依然存活。

    DOU隐蔽效果与检测器评估

    • 无目标攻击检测指标大幅下降:在Held-out的MuSiQue数据集上,80/80步DOU使Spectral Signatures的∆从46.53降至29.26,Neural Cleanse从38.23降至19.40,PICCOLO从39.99降至21.64,TopK从44.63降至14.66(Table 6);作者称此预算下触发输入F1变化在0.9个百分点以内(Table 5)。
    • 目标后门隐蔽的局限与均衡扩展:在目标攻击下,Activation Clustering在各预算下∆均保持在30以上(Table 10);引入稳定性均衡扩展后,240/160步下AC的∆降至28.71,SS降至23.21(Table 11),但作者指出这以回答质量劣化减弱为代价(Table 12中HotpotQA触发F1升至36.36)。

    其他消融与分析

    • DOU步数对TriviaQA检测影响:OW/UW从0/0增至80/80步,NC的∆从41.54降至27.09,SS从44.29降至16.10,AC在240/160步达到最低值10.00(Table 5、Table 8)。
    • DOU步数对MuSiQue无目标检测影响:Deep预算(240/160步)下AC与RAP分别降至最低值18.19与5.23,但NC与PICCOLO反弹至34.74与42.26(Table 9)。
    • 稳定性均衡对目标后门检测影响:在0/0步无DOU时单独应用均衡,AC的∆从35.29降至32.17,SS从40.39降至34.30(Table 10、Table 11)。
    • 目标后门DOU步数对QA影响:HotpotQA上DOU步数从0/0增至80/80再至240/240,触发F1由26.27非单调变为33.79和32.54,每轮命中率维持在98.1%以上(Table 12)。
    • 轮数控制的上下文溢出率:在16384 Token上下文上限下,高强度攻击在HotpotQA上仅有6例/1000例发生溢出,TriviaQA仅1例/1000例(Table 13)。
    • 自然触发检测样本占比:TriviaQA-1000检测集中自然包含author的正例占0.8%(8条),MuSiQue-1000检测集中占3.0%(30条)(附录B.2)。
  5. 有什么可以进一步探索的点?

    论文指出了针对单文档目标后门隐蔽困难、BPO缺乏有效检索适配等局限,未来需要联合评估检测与移除。

    作者指出的局限与后续方向

    • 单文档目标后门的隐蔽难度更高:作者指出,由于目标后门在所有触发输入上持续强化相同的单一文档,比无目标后门更难仅凭DOU完全去除检测特征,AC检测指标在各测试预算下均高于30(Section 4.5)。
    • 稳定性均衡存在效用代价:作者指出,为进一步降低目标后门的检测分离度而设计的稳定性均衡扩展,以较弱的答案质量破坏为代价换取了隐蔽性提升(Section 4.5、附录A.3)。
    • 缺乏针对检索器的有效净化防御:作者指出,BPO原是针对监督图像任务设计的防御方法,而在密集检索场景下未能成功移除原后门,将有效的后门净化方法适配至检索器留待未来研究(Section 4.3)。
    • 轨迹分析未确立内部因果路径:作者在附录中指出,尽管目标攻击下智能体生成的错误答案均包含在持续命中的目标文档中,但仅凭轨迹数据本身无法建立智能体内部的因果推断路径(附录C)。
    • 需要联合验证检测与清除:作者在结论中提出,未来的安全性评估应当针对系统实际产生的多轮轨迹与综合资源开销进行更全面的评估,而非仅依赖孤立快照,并呼吁联合验证后门的检测与移除能力(Section 5)。

    实验覆盖范围

    • 被测模型架构范围:实验测试了E5与Contriever-MSMARCO两个密集检索器,Search Agent固定采用Qwen2.5-7B-Instruct,未覆盖其他参数规模或架构的智能体模型。
    • 测试数据集与语料范围:问答任务在HotpotQA和TriviaQA各1,000个测试问题上展开,外部未见检测评估在MuSiQue的1,000个样本上进行,底层检索索引均基于wiki18_100w维基百科语料库构建。
    • 目标文档设置范围:目标攻击实验中将攻击目标固定为语料库中ID为4的Pavia Cathedral单篇文档,未对不同领域、长度或主题的多样化目标文档开展全面测试。
    • 检测评估候选池范围:后门检测评估基于从前50,000行语料构建的局部候选池诊断环境进行Top-3检索评分,而非直接在全索引端到端智能体生成运行中进行在线检测。
    • 资源与计算开销报告范围:论文未报告攻击微调与DOU阶段的具体GPU显存开销、训练时长以及相比干净检索器的推理吞吐量变化。
  6. 总结一下论文的主要内容

    论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
    • 研究定位:论文从模型供应链视角研究智能体检索增强生成(Agentic RAG)系���的检索器后门安全风险。
    • 核心问题:在语料库与智能体均保持干净未篡改的现实设定下,攻击者仅通过提供恶意检索器权重,利用智能体推理与多轮检索的交互反馈操纵搜索轨迹,并试图逃避后门检测。
    • 方法设计:提出了抑制关键证据的无目标攻击、多轮锁定单文档的目标攻击与增加无效检索的轮数控制攻击,并提出诱饵覆盖遗忘(DOU)机制,通过注入并消除辅助后门扰动表征以逃避检测。
    • 关键攻击表现:在HotpotQA和TriviaQA上,无目标触发使问答F1下降18.8–30.9个百分点(Table 1);目标攻击在99.8%–100%的样本上实现多轮全命中(Table 2);高强度轮数控制使检索轮数增加78.5%–87.9%、耗时增加最高达125.9%(Table 3)。
    • 防御与隐蔽表现:微调与剪枝后净-触F1仍相差23–30个百分点,BPO防御未能清除后门(Table 4);而反向使用DOU后,在MuSiQue上将Spectral Signatures检测的∆从46.53降至29.26(Table 6)。
    • 作者结论:作者认为检索器后门不仅破坏答案正确性,更显著增加系统计算与延迟开销;弱净化机制容易沦为攻击者的隐蔽工具,评估检索安全性必须结合完整轨迹与资源消耗,并联合验证检测与清除。
阅读原文arxiv.org