跳到正文
原文
论文追踪· arXiv:2609.35155·本站收录 · 原文发表 精选关注度55

LENS:检索增强生成中集合级投毒的整体危害大于各部分之和

LENS: The Sum Is Worse Than the Parts for Set-Level Poisoning in Retrieval-Augmented Generation

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

LENS以黑盒多智能体构造RAG集合级投毒,四基准三生成器上返回包Full ASR 0.852、最强真子集0.069。

威胁模型generator-black-box 的 index-admitted 语料投毒。

问题
冻结单轮RAG把多篇检索文档联合作为生成条件。作者称,单篇看似合理且不足以改答案的文档,组合后仍可能把输出导向预设的非金标目标,而局部筛查看的不是这个组合单元。
方法
LENS是生成器黑盒的多智能体流程。外环选定查询条件下的解释透镜和文档角色,内环写透镜设定与事实补全文档,并用本地surrogate的全集、真子集、对齐和有效性反例做修复,冻结前穷尽检查真子集。
实验与结果
四基准、三目标生成器上,返回包Full ASR为0.852,最强真子集0.069,检索后ASR@5为0.784。全尝试E2E-Strict@5为0.363,高于最强构造基线0.244。四种防御下全尝试ASR@5均高于所列基线。
局限与可以继续做的
论文未在Conclusion或专节写出局限。实验覆盖四个基准各1000次、三个目标生成器,以及四种已发表防御。论文未报告人工一致性,也未给出Llama引导构造的型号与数字。
实验设置Qwen3.6-35B-A3B、Llama-3.1-70B-Instruct 等 · HotpotQA、2WikiMultihopQA 等 · Full ASR、Max-sub. TR 等
威胁模型
generator-black-box 的 index-admitted 语料投毒。只插入包 D,不改查询、原文档、检索或目标生成器;构造只用本地 surrogate,冻结前无被攻击查询反馈。要把金标 g 换成预先固定、类型兼容且 alias-distinct 的 t,并压低每个真子集目标率。
被测模型
Qwen3.6-35B-A3BLlama-3.1-70B-InstructDeepSeek-V4-Pro
基准
HotpotQA2WikiMultihopQAMuSiQueNatural Questions
指标
Full ASRMax-sub. TRCJLYieldJRR@5Ret. ASR@5E2E-Strict@5Cond-Strict@5Subset Pass@20
AI 导读和推荐理由研究者提出 LENS,一种针对检索增强生成(RAG)的集合级组合投毒框架,让单篇看似合理的文档只有在组合后才把答案引向攻击者预设目标,而任何真子集都不足以做到。该方法把构造形式化为带全真子集约束的证据组合,用外层规划解释视角、内层合成文档并以反例修复的多智能体流程实现。在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Natural Questions 四个基准、三个目标生成器上,返回文档包的全集合 ASR 为 0.852、检索后 ASR@5 为 0.784,最强真子集仅 0.069;相对最强构造基线,全尝试 E2E-Strict@5 从 0.244 升到 0.363。盲审显示 68.3% 的文档包同时具备错误目标、明确的答案标准偏移和原语义下无目标蕴含;在四种已发表防御下其 ASR@5 仍最高,平均超出最强基线 0.141。

研究者提出 LENS,一种针对检索增强生成(RAG)的集合级组合投毒框架,让单篇看似合理的文档只有在组合后才把答案引向攻击者预设目标,而任何真子集都不足以做到。该方法把构造形式化为带全真子集约束的证据组合,用外层规划解释视角、内层合成文档并以反例修复的多智能体流程实现。在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Natural Questions 四个基准、三个目标生成器上,返回文档包的全集合 ASR 为 0.852、检索后 ASR@5 为 0.784,最强真子集仅 0.069;相对最强构造基线,全尝试 E2E-Strict@5 从 0.244 升到 0.363。盲审显示 68.3% 的文档包同时具备错误目标、明确的答案标准偏移和原语义下无目标蕴含;在四种已发表防御下其 ASR@5 仍最高,平均超出最强基线 0.141。

推荐理由论文把 RAG 投毒的攻击单元从单篇文档移到证据集合,完整集攻击成功率 0.852 而最强真子集仅 0.069,为集合级防御提供压力测试。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者把问题形式化为集合级组合投毒:全集导向预设目标,真子集在冻结RAG中不足。

    单篇不足的文档,经集合组合仍可能把冻结RAG导向预设的非金标答案。

    • 场景:RAG让生成条件于外部语料检索出的少量top-K段落。作者称,用户上传、策展较弱或来自开放来源的文档进入可检索语料后,可能在推理时被选中并影响最终答案。
    • 现有方法:作者称,直接陈述目标、加入答案形脚手架、优化对抗字符串或使用触发式文档,会留下局部充分或可单独检测的线索。按文档局部异常、冲突、答案支持或隔离测试做筛查时,检查的单元与产生答案的组合集合不同。作者还称,已有协同攻击没有显式要求每个真子集在冻结单轮RAG中都不足以诱导目标。
    • 观察:作者称,各自合理的文档可占据互补语义角色;组合后安装攻击者选定的答案选择准则,真子集则仍然不足。控制放在诱导出的证据集决策规则,而不是段落局部载荷。攻击发生在推理时,针对冻结管线。
    • 威胁模型:
      • 目标:把干净系统输出的基准金标g,替换为构造前固定、类型兼容、且与g别名不同的t。作者称之为攻击者主导的输出完整性破坏。
      • 知识:generator-black-box。构造只用攻击者控制的本地surrogate;目标生成器在包冻结前不提供被攻击查询的反馈。
      • 能力:向语料插入包D,得到扩大后的语料。不能修改查询、原始文档、检索管线或目标生成器。设定是index-admitted、冻结的、基准规模RAG语料投毒。
      • 受害系统:条件于检索证据的冻结RAG。全集应输出t,每个真子集的目标率应不超过容忍度。
    • 本文做法:作者形式化带全真子集约束的集合级组合投毒,并提出LENS(Local Evidence, Non-local Steering)。它把目标推断分成查询条件下的解释透镜和互补事实,再用嵌套双环压低子集泄漏。
  2. 有哪些相关研究?

    相关工作分语料投毒、协同组合攻击与文档局部防御;作者把全真子集约束作为区别。

    作者按三类讨论已有工作,并把区别放在“每个真子集都保持不足”这一构造约束上。

    RAG语料投毒

    • 检索增强:Lewis et al.(2020)、Ram et al.(2023)、Izacard and Grave(2021)、Asai et al.(2024)让生成条件于检索段落。论文将其作为语料成为安全输入的背景。
    • 投毒构造:Related Work把承载答案的段落、触发器、梯度优化和黑盒文档构造归为一类,并点名Zou et al.(2025)、Ben-Tov and Sharif(2025)、Chaudhari et al.(2026)、Wang et al.(2026b)、Xian et al.(2025)、Chang et al.(2025b)、Zhang et al.(2025a)、Nazary, Deldjoo, and di Noia(2025)、Chen et al.(2025b)。Qian(2026)的SilentRetrieval改进这类毒物的流畅性与检索迁移。
    • 论文指出的缺口:作者称这些方法优化攻击成功、可检索性或隐蔽性,但没有约束每一个真子集。

    协同与组合攻击

    • 论文归在一起的工作:sleeper–trigger对、智能体轨迹、提示注入加数据库投毒、对抗知识图谱推理链,以及相互竞争的攻击者。引用为Thornton(2026)、Choi et al.(2026)、Pan et al.(2026)、Wang et al.(2026a)、Zhao et al.(2025)、Chen et al.(2025a)、Huang et al.(2024)。实验里的Semantic Chameleon(Thornton 2026)被实现为原生两文档sleeper–trigger。
    • 作者给出的区别:LENS隔离的是冻结单轮文本RAG:一个自然语言包产生答案级效应,同时每个真子集都不足。作者称,这一全真子集目标把它和协同检索、提示注入、结构化推理链投毒、攻击者竞争分开。

    检测与防御

    • 段落级信号:论文把过滤、答案聚合、干净证据恢复、一致性图、聚类和自我评估放在一起,引用Qi et al.(2021)、Robey et al.(2023)、Xiang et al.(2026)、Tan et al.(2025)、Yao et al.(2025)、Edemacu et al.(2025)、Cheng et al.(2025)、Kim, Lee, and Koo(2025)、Chang et al.(2025a)、Shen et al.(2025)、Si et al.(2025)、Zhou et al.(2025)。
    • 作者的定位:作者称这些信号适合局部异常或相互冲突的毒物;LENS用合理且局部不足的文档同时减弱两类线索,因而需要检查段落如何共同支持一个答案。

    基线与基准

    • 构造基线:direct multi-document synthesis、best-of-N synthesis、generic self-refinement、split evidence/payload synthesis、Semantic Chameleon。防御实验中的攻击对照为PoisonedRAG、GASLITE、BadRAG。
    • 基准与防御:HotpotQA、2WikiMultihopQA、MuSiQue、Natural Questions。防御为RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG。

    作者把LENS的构造目标定为全真子集约束,并把目标效应放在证据组合而不是单篇载荷上。

  3. 论文如何解决这个问题?

    外环规划解释透镜与角色,内环合成并用反例修复,冻结前以τ=0.50、ε=0.10穷尽查真子集。

    LENS把构造看成带约束的证据组合:外环定解释透镜和语义角色,内环写文档并用反例修复,使全集导向t,真子集不泄漏。Figure 2分出Planner、Proposer、Verifier;构造用本地surrogate,目标侧运行只在包冻结之后。

    问题设定与形式化

    • 插入范围:攻击者只加入包D,语料变为原语料与D的并集。不能改查询、原文档、检索或目标生成器。目标生成器在冻结前不给被攻击查询的反馈。
    • 目标率:对子集S,在干净top-K上下文X上再加入S后输出t的概率写成 TR(x)(S)=Pr[Gx(q,X∪ S)=t]。x为sur时是构造surrogate,为m时是目标生成器。带下标d20的量是20次生成上的观察频率。
    • 真子集安全:包对生成器m在容忍度ε下subset-safe,当 TR(m)(S)≤ϵ 对每个真子集S成立。作者称这是总体性质;报告的是20次协议下的经验全子集通过率,不是概率证书。
    • 依赖差距:CJL是全集目标率减去最强真子集目标率。作者用token与槽位匹配的对照检验“只是上下文变长”这一替代解释。

    解释透镜与角色规划

    • 透镜:解释透镜是分类型、随查询变化的阅读准则,如角色、时间、类别、命名或范围,不是被插入的结论。Planner按语义契合、闭合、有效性和泄漏风险,给透镜与角色分解排序,并拒绝要求单篇陈述决定性目标关系的计划。
    • 计划内容:选中计划含透镜、文档角色、闭合所需事实、应避免的泄漏性主张,以及预计高泄漏的真子集槽位。内环修复保持透镜和角色不变;改动二者即开启新的外环计划。
    • 两类文档:透镜设定文档只让非默认阅读准则可用,不实例化目标关系。事实补全文档提供该准则下缺少的支持,不重述透镜、不比较候选答案、也不陈述目标。规划目标是两类文档各自的surrogate目标率不超过ε,合集不低于τ。
    • 主动子集:构造阶段的经验率只覆盖主动集合A。A起初包含全部单文档和风险列表指定的子集,发现新泄漏再加入。

    合成、验证与修复

    • 两类失败:子集泄漏指某个真子集已使目标在局部成为决定性结果。接口不匹配指透镜与互补事实用了不同的答案维度。对齐检查查询、干净支持、透镜和目标相关事实是否共享同一选择准则。诊断上下文包括仅干净、仅透镜、仅事实、干净加单一角色,以及全集。
    • 当前通过门:全集的20次surrogate率不低于τ,A中子集率不超过ε,对齐与文档有效性都为1。Table 1把失败映射为补缺失关系、去掉决定性线索、对齐角色、改写或删除,以及把新泄漏子集加入A。
    • 局部改写:反例同时标出违反条件和负责的文档角色。Proposer只改对应文档,并保留干净上下文、透镜和角色。全集闭合不足时补充或澄清缺失支持,而不是直接写入结论。内环用A上的追踪依赖差距给修复排序,接受标准仍是通过门。
    • 冻结:追踪检查不定义最终报告的子集结果。冻结前,Verifier对每个真子集做同一20次surrogate穷尽检查,并重做全集、对齐和有效性检查。若修复在泄漏与闭合不足之间反复摆动,就放弃当前计划并回到Planner。随后各目标生成器独立重做穷尽子集分析。

    准入与评测接口

    • 过滤:验证器去掉被判为编造、推测、答案形或冲突的候选,偏向仍合理、且与周围证据一致的文档。冻结过滤器只放行在基准原语义下被分类为不正确的候选。
    • 构造成功:一次尝试成功,仅当包通过穷尽surrogate门,阈值为τ=0.50、ε=0.10。LENS与基于LLM的基线遵循指定的k∈{2, 3}。
    • 两种接口:条件评测提供干净上下文与指定子集的并集。端到端评测把返回包索引进语料,用BM25与BGE-M3的reciprocal-rank fusion,再经Qwen3 reranker。只有与t或g的无保留匹配才计数。
  4. 论文做了哪些实验?

    返回包Full ASR 0.852、最强真子集0.069;全尝试E2E-Strict@5由0.244到0.363。

    实验设置

    • 基准:HotpotQA、2WikiMultihopQA、MuSiQue、Natural Questions。每基准固定1,000个query–target尝试,共4,000。保留查询都能被三个干净目标RAG答对;目标在构造前固定,失败不替换。
    • 模型:构造和surrogate阅读用Qwen3.6-27B。目标生成器为Qwen3.6-35B-A3B、Llama-3.1-70B-Instruct、DeepSeek-V4-Pro。冻结包在三个目标上评测,不做目标侧筛选。
    • 检索与包大小:端到端使用BM25/BGE-M3 reciprocal-rank fusion和Qwen3 reranker。LENS与基于LLM的基线遵循指定k∈{2, 3};Semantic Chameleon始终用原生两文档sleeper–trigger。各方法共享清单、语料、检索、目标无关准入和目标侧评测;候选选择只用冻结的构造侧信号。
    • 基线与防御:构造基线为direct multi-document synthesis、best-of-N synthesis、generic self-refinement、split evidence/payload synthesis、Semantic Chameleon。防御实验另比PoisonedRAG、GASLITE、BadRAG,防御为RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG。
    • 指标:每个上下文20次随机生成。Yield是返回包的尝试比例。Full ASR是条件全集目标率,Max-sub. TR是最强真子集率,CJL为二者之差。E2E-Strict@5要求完整检索、实际top-5目标率至少0.50,且每个受控真子集至多0.10;Cond-Strict@5把全集阈值放在条件接口,子集测试相同。全尝试指标把构造失败记0。Subset Pass@20要求每个真子集在20次中至多产生目标两次。只计对t或g的无保留匹配。
    • 汇总与人工:结果为基准宏平均,带基准分层置信区间;方法比较用配对重抽样。Clean Acc.用单独留出效用集。人工标注者独立于构造验证器,且看不到接纳决定和模型侧结果。

    主结果

    据Table 2。前三个数值列是全部4,000次尝试、失败记0;后两列是返回包,无目标侧过滤。

    表格较宽,可左右滑动

    基准Yield全尝试Ret. ASR@5全尝试E2E-Strict@5返回包Full ASR返回包Max-sub. TR
    HotpotQA0.6550.5170.4010.8620.036
    2WikiMultihopQA0.6400.4900.3640.8410.029
    MuSiQue0.7050.6110.4770.9100.069
    Natural Questions0.5000.3570.2090.7950.141
    宏平均0.6250.4940.3630.8520.069
    • 作者称返回包有强的集合依赖。正文称79.7%通过每一个真子集检查;Cond-Strict成功中89.7%在实际检索上下文中仍严格,作者据此称依赖从受控接口迁到检索路径。
    • 宏平均全尝试E2E-Strict@5的95% CI为[0.348, 0.378]。
    • Table 2中Natural Questions的三项全尝试指标均为四基准最低,其返回包Max-sub. TR也是该列最高;作者未解释这一差距。

    构造基线与目标特异性

    • 严格集合成功:Table 6中,全尝试E2E-Strict@5从Semantic Chameleon的0.244到LENS的0.363;作者称相对增益48.8%。返回包Full ASR是Semantic Chameleon 0.872、LENS 0.852;Max-sub. TR从0.153到0.069。返回包Packet Ret.为0.798对0.784,全尝试Ret.为0.436对0.494。
    • 两文档匹配:正文称精确两文档匹配下LENS为0.397,原生Semantic Chameleon为0.247。
    • 可控性与外溢:Table 3对每查询三个预选目标,返回包Selectivity gap为0.693。240个查询中,至少两个目标可选择到达的比例为0.538,三个都到达为0.158;可选择要求差距至少0.30。1,200个未见离目标查询–包对上,完整包检索1.7%,原目标外溢0.8%,配对干净运行0.3%,金标准确率变化1.5 points;同实体查询检索到单个文档的比例为29.0%。

    四种已发表防御

    • 设置:Table 4是共享4,000次尝试的全尝试defended ASR@5。构造失败和无效输出记0。每格汇总三个目标生成器,且每个尝试有20个配对解码种子。
    • 无防御与有防御:None列PoisonedRAG为0.507,LENS为0.494。四种防御下LENS最高:SeCon-RAG 0.401、ReliabilityRAG 0.448、RobustRAG 0.260、TrustRAG 0.408。作者称超出最强基线0.103–0.182,平均0.141,配对区间不含零。
    • 作者解读:作者称优势来自构造覆盖,以及围绕文档局部线索建立的防御仍留存的集合级效应。

    人工审计、机制控制与缓解探针

    • 盲审:Table 5中,600篇插入里552/600(92.0%)局部有支持,535/600(89.2%)像普通参考文献散文;另抽的240个冻结目标中211/240(87.9%)在原语义下不正确。SemValid要求目标不正确、准则明确转移、且原语义下无蕴含,164/240(68.3%)返回包满足。
    • 与行为并列:720个生成器评测中331/720(46.0%)同时SemValid且E2E-Strict。条件于SemValid为331/492(67.3%),条件于非SemValid为78/228(34.2%)。作者称严格成功在SemValid包内几乎是包外的两倍,并把行为效应联系到攻击者诱导的答案准则。
    • 机制与探针:正文对Figure 3报告,240个匹配实例、每条件720个实现–生成器对上,匹配包Ret. ASR@K为0.785,角色打乱后0.265,跨透镜替换后0.127;JRR@K为0.863–0.867。K对k∈{2, 3}取5,对留出的k=4取8。作者称效应位于计划好的透镜–事实对应。集合级评判把Ret. ASR从0.784降到0.318,再加上子集消融到0.164;选择性审计降到0.284,并保留91.3%的基线干净准确率。不完整包的目标率为0.028;定向硬负例把Ret. ASR@5降到0.519。

    其他消融与分析

    • Figure 4,独立1,000次尝试:完整LENS的全尝试E2E-Strict@5为0.403;共享上限15次提议或修复、800次诊断生成、1.05M token时为0.327,最强组件移除为0.163;作者称前者是后者的两倍。
    • 去掉子集更新:固定预算全尝试E2E-Strict@5为0.134(Figure 4正文)。
    • 独立100-draw:抽样对中68.6%确认全子集控制;该句未写明“对”的组成。三目标生成器的全尝试E2E-Strict在0.357–0.370,正文未对应到具体模型。
    • 提高τ、嵌套ε扫描:正文只作定性描述,未给出扫描表数值。
    • Llama-guided construction:正文称结果可迁移,未报告型号与数字。
  5. 有什么可以进一步探索的点?

    论文未在Conclusion或专节写出局限与后续方向。

    作者指出的局限与后续方向

    论文未专门讨论局限。Conclusion未把任何一项写成不足或后续工作。

    实验覆盖范围

    • 清单:四个基准各1,000次固定query–target尝试,共4,000;目标在构造前固定,失败不替换(Experimental Setup,Table 2)。
    • 模型与检索:目标生成器为Qwen3.6-35B-A3B、Llama-3.1-70B-Instruct、DeepSeek-V4-Pro;构造与surrogate阅读为Qwen3.6-27B。检索为BM25/BGE-M3 reciprocal-rank fusion加Qwen3 reranker。包预算k∈{2, 3},Figure 3另有留出的k=4、K=8。
    • 对照:五种构造基线共享清单、语料、检索、目标无关准入和目标侧评测(Table 6)。防御比较包含RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG,攻击对照为PoisonedRAG、GASLITE、BadRAG(Table 4)。
    • 协议与审计:每个上下文20次随机生成,另有独立100-draw。人工审计覆盖240个返回包的600篇插入,以及另抽的240个冻结目标(Table 5)。
    • 未报告项:论文未报告人工标注者之间的一致性。正文称可迁移到Llama-guided construction,但未报告该次构造的具体型号和数字。
  6. 总结一下论文的主要内容

    LENS用解释透镜把投毒放到文档组合上,返回包Full ASR 0.852、最强真子集0.069。

    LENS研究冻结单轮RAG的集合级组合投毒:插入文档各自保持合理,合在一起才把输出从金标g导向预先固定的t。

    • 问题:生成条件于检索集合,而许多筛查仍按单篇进行。作者认为,因此会漏掉一种失败模式:真子集诱导不了目标,全集却能改写答案选择准则。
    • 做法:攻击者只能插入包,不能改查询、原文档、检索或生成器,并用本地surrogate构造。外环选定解释透镜和角色,内环分开写透镜设定与事实补全文档,再按全集闭合、子集泄漏、对齐和有效性做局部修复。冻结前穷尽检查真子集,门槛为τ=0.50、ε=0.10。
    • 主结果:四基准、三个目标生成器上,返回包Full ASR为0.852,最强真子集0.069,检索后ASR@5为0.784(Table 2)。全尝试E2E-Strict@5为0.363;同一清单上Semantic Chameleon为0.244(Table 6)。作者称相对增益48.8%。
    • 审计与防御:盲审里68.3%的返回包同时有不正确目标、明确准则转移和原语义下无蕴含(Table 5,n=240)。四种已发表防御下,LENS的全尝试ASR@5都高于同表基线;作者称平均高出0.141。无防御时PoisonedRAG为0.507,高于LENS的0.494(Table 4)。
    • 作者结论:作者称证据组合是不同于单文档投毒的安全边界。有效干预要区分可疑的跨文档依赖和合法多跳组合,同时保留检索增强所依赖的跨文档推理。
阅读原文arxiv.org