LENS:检索增强生成中集合级投毒的整体危害大于各部分之和
LENS: The Sum Is Worse Than the Parts for Set-Level Poisoning in Retrieval-Augmented Generation
LENS以黑盒多智能体构造RAG集合级投毒,四基准三生成器上返回包Full ASR 0.852、最强真子集0.069。
generator-black-box 的 index-admitted 语料投毒。
- 冻结单轮RAG把多篇检索文档联合作为生成条件。作者称,单篇看似合理且不足以改答案的文档,组合后仍可能把输出导向预设的非金标目标,而局部筛查看的不是这个组合单元。
- LENS是生成器黑盒的多智能体流程。外环选定查询条件下的解释透镜和文档角色,内环写透镜设定与事实补全文档,并用本地surrogate的全集、真子集、对齐和有效性反例做修复,冻结前穷尽检查真子集。
- 四基准、三目标生成器上,返回包Full ASR为0.852,最强真子集0.069,检索后ASR@5为0.784。全尝试E2E-Strict@5为0.363,高于最强构造基线0.244。四种防御下全尝试ASR@5均高于所列基线。
- 论文未在Conclusion或专节写出局限。实验覆盖四个基准各1000次、三个目标生成器,以及四种已发表防御。论文未报告人工一致性,也未给出Llama引导构造的型号与数字。
- 威胁模型
- generator-black-box 的 index-admitted 语料投毒。只插入包 D,不改查询、原文档、检索或目标生成器;构造只用本地 surrogate,冻结前无被攻击查询反馈。要把金标 g 换成预先固定、类型兼容且 alias-distinct 的 t,并压低每个真子集目标率。
- 被测模型
- Qwen3.6-35B-A3BLlama-3.1-70B-InstructDeepSeek-V4-Pro
- 基准
- HotpotQA2WikiMultihopQAMuSiQueNatural Questions
- 指标
- Full ASRMax-sub. TRCJLYieldJRR@5Ret. ASR@5E2E-Strict@5Cond-Strict@5Subset Pass@20
研究者提出 LENS,一种针对检索增强生成(RAG)的集合级组合投毒框架,让单篇看似合理的文档只有在组合后才把答案引向攻击者预设目标,而任何真子集都不足以做到。该方法把构造形式化为带全真子集约束的证据组合,用外层规划解释视角、内层合成文档并以反例修复的多智能体流程实现。在 HotpotQA、2WikiMultihopQA、MuSiQue 和 Natural Questions 四个基准、三个目标生成器上,返回文档包的全集合 ASR 为 0.852、检索后 ASR@5 为 0.784,最强真子集仅 0.069;相对最强构造基线,全尝试 E2E-Strict@5 从 0.244 升到 0.363。盲审显示 68.3% 的文档包同时具备错误目标、明确的答案标准偏移和原语义下无目标蕴含;在四种已发表防御下其 ASR@5 仍最高,平均超出最强基线 0.141。
推荐理由论文把 RAG 投毒的攻击单元从单篇文档移到证据集合,完整集攻击成功率 0.852 而最强真子集仅 0.069,为集合级防御提供压力测试。
深度解读
这篇论文试图解决什么问题?
作者把问题形式化为集合级组合投毒:全集导向预设目标,真子集在冻结RAG中不足。
单篇不足的文档,经集合组合仍可能把冻结RAG导向预设的非金标答案。
- 场景:RAG让生成条件于外部语料检索出的少量top-K段落。作者称,用户上传、策展较弱或来自开放来源的文档进入可检索语料后,可能在推理时被选中并影响最终答案。
- 现有方法:作者称,直接陈述目标、加入答案形脚手架、优化对抗字符串或使用触发式文档,会留下局部充分或可单独检测的线索。按文档局部异常、冲突、答案支持或隔离测试做筛查时,检查的单元与产生答案的组合集合不同。作者还称,已有协同攻击没有显式要求每个真子集在冻结单轮RAG中都不足以诱导目标。
- 观察:作者称,各自合理的文档可占据互补语义角色;组合后安装攻击者选定的答案选择准则,真子集则仍然不足。控制放在诱导出的证据集决策规则,而不是段落局部载荷。攻击发生在推理时,针对冻结管线。
- 威胁模型:
- 目标:把干净系统输出的基准金标g,替换为构造前固定、类型兼容、且与g别名不同的t。作者称之为攻击者主导的输出完整性破坏。
- 知识:generator-black-box。构造只用攻击者控制的本地surrogate;目标生成器在包冻结前不提供被攻击查询的反馈。
- 能力:向语料插入包D,得到扩大后的语料。不能修改查询、原始文档、检索管线或目标生成器。设定是index-admitted、冻结的、基准规模RAG语料投毒。
- 受害系统:条件于检索证据的冻结RAG。全集应输出t,每个真子集的目标率应不超过容忍度。
- 本文做法:作者形式化带全真子集约束的集合级组合投毒,并提出LENS(Local Evidence, Non-local Steering)。它把目标推断分成查询条件下的解释透镜和互补事实,再用嵌套双环压低子集泄漏。
有哪些相关研究?
相关工作分语料投毒、协同组合攻击与文档局部防御;作者把全真子集约束作为区别。
作者按三类讨论已有工作,并把区别放在“每个真子集都保持不足”这一构造约束上。
RAG语料投毒
- 检索增强:Lewis et al.(2020)、Ram et al.(2023)、Izacard and Grave(2021)、Asai et al.(2024)让生成条件于检索段落。论文将其作为语料成为安全输入的背景。
- 投毒构造:Related Work把承载答案的段落、触发器、梯度优化和黑盒文档构造归为一类,并点名Zou et al.(2025)、Ben-Tov and Sharif(2025)、Chaudhari et al.(2026)、Wang et al.(2026b)、Xian et al.(2025)、Chang et al.(2025b)、Zhang et al.(2025a)、Nazary, Deldjoo, and di Noia(2025)、Chen et al.(2025b)。Qian(2026)的SilentRetrieval改进这类毒物的流畅性与检索迁移。
- 论文指出的缺口:作者称这些方法优化攻击成功、可检索性或隐蔽性,但没有约束每一个真子集。
协同与组合攻击
- 论文归在一起的工作:sleeper–trigger对、智能体轨迹、提示注入加数据库投毒、对抗知识图谱推理链,以及相互竞争的攻击者。引用为Thornton(2026)、Choi et al.(2026)、Pan et al.(2026)、Wang et al.(2026a)、Zhao et al.(2025)、Chen et al.(2025a)、Huang et al.(2024)。实验里的Semantic Chameleon(Thornton 2026)被实现为原生两文档sleeper–trigger。
- 作者给出的区别:LENS隔离的是冻结单轮文本RAG:一个自然语言包产生答案级效应,同时每个真子集都不足。作者称,这一全真子集目标把它和协同检索、提示注入、结构化推理链投毒、攻击者竞争分开。
检测与防御
- 段落级信号:论文把过滤、答案聚合、干净证据恢复、一致性图、聚类和自我评估放在一起,引用Qi et al.(2021)、Robey et al.(2023)、Xiang et al.(2026)、Tan et al.(2025)、Yao et al.(2025)、Edemacu et al.(2025)、Cheng et al.(2025)、Kim, Lee, and Koo(2025)、Chang et al.(2025a)、Shen et al.(2025)、Si et al.(2025)、Zhou et al.(2025)。
- 作者的定位:作者称这些信号适合局部异常或相互冲突的毒物;LENS用合理且局部不足的文档同时减弱两类线索,因而需要检查段落如何共同支持一个答案。
基线与基准
- 构造基线:direct multi-document synthesis、best-of-N synthesis、generic self-refinement、split evidence/payload synthesis、Semantic Chameleon。防御实验中的攻击对照为PoisonedRAG、GASLITE、BadRAG。
- 基准与防御:HotpotQA、2WikiMultihopQA、MuSiQue、Natural Questions。防御为RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG。
作者把LENS的构造目标定为全真子集约束,并把目标效应放在证据组合而不是单篇载荷上。
论文如何解决这个问题?
外环规划解释透镜与角色,内环合成并用反例修复,冻结前以τ=0.50、ε=0.10穷尽查真子集。
LENS把构造看成带约束的证据组合:外环定解释透镜和语义角色,内环写文档并用反例修复,使全集导向t,真子集不泄漏。Figure 2分出Planner、Proposer、Verifier;构造用本地surrogate,目标侧运行只在包冻结之后。
问题设定与形式化
- 插入范围:攻击者只加入包D,语料变为原语料与D的并集。不能改查询、原文档、检索或目标生成器。目标生成器在冻结前不给被攻击查询的反馈。
- 目标率:对子集S,在干净top-K上下文X上再加入S后输出t的概率写成 TR(x)(S)=Pr[Gx(q,X∪ S)=t]。x为sur时是构造surrogate,为m时是目标生成器。带下标d20的量是20次生成上的观察频率。
- 真子集安全:包对生成器m在容忍度ε下subset-safe,当 TR(m)(S)≤ϵ 对每个真子集S成立。作者称这是总体性质;报告的是20次协议下的经验全子集通过率,不是概率证书。
- 依赖差距:CJL是全集目标率减去最强真子集目标率。作者用token与槽位匹配的对照检验“只是上下文变长”这一替代解释。
解释透镜与角色规划
- 透镜:解释透镜是分类型、随查询变化的阅读准则,如角色、时间、类别、命名或范围,不是被插入的结论。Planner按语义契合、闭合、有效性和泄漏风险,给透镜与角色分解排序,并拒绝要求单篇陈述决定性目标关系的计划。
- 计划内容:选中计划含透镜、文档角色、闭合所需事实、应避免的泄漏性主张,以及预计高泄漏的真子集槽位。内环修复保持透镜和角色不变;改动二者即开启新的外环计划。
- 两类文档:透镜设定文档只让非默认阅读准则可用,不实例化目标关系。事实补全文档提供该准则下缺少的支持,不重述透镜、不比较候选答案、也不陈述目标。规划目标是两类文档各自的surrogate目标率不超过ε,合集不低于τ。
- 主动子集:构造阶段的经验率只覆盖主动集合A。A起初包含全部单文档和风险列表指定的子集,发现新泄漏再加入。
合成、验证与修复
- 两类失败:子集泄漏指某个真子集已使目标在局部成为决定性结果。接口不匹配指透镜与互补事实用了不同的答案维度。对齐检查查询、干净支持、透镜和目标相关事实是否共享同一选择准则。诊断上下文包括仅干净、仅透镜、仅事实、干净加单一角色,以及全集。
- 当前通过门:全集的20次surrogate率不低于τ,A中子集率不超过ε,对齐与文档有效性都为1。Table 1把失败映射为补缺失关系、去掉决定性线索、对齐角色、改写或删除,以及把新泄漏子集加入A。
- 局部改写:反例同时标出违反条件和负责的文档角色。Proposer只改对应文档,并保留干净上下文、透镜和角色。全集闭合不足时补充或澄清缺失支持,而不是直接写入结论。内环用A上的追踪依赖差距给修复排序,接受标准仍是通过门。
- 冻结:追踪检查不定义最终报告的子集结果。冻结前,Verifier对每个真子集做同一20次surrogate穷尽检查,并重做全集、对齐和有效性检查。若修复在泄漏与闭合不足之间反复摆动,就放弃当前计划并回到Planner。随后各目标生成器独立重做穷尽子集分析。
准入与评测接口
- 过滤:验证器去掉被判为编造、推测、答案形或冲突的候选,偏向仍合理、且与周围证据一致的文档。冻结过滤器只放行在基准原语义下被分类为不正确的候选。
- 构造成功:一次尝试成功,仅当包通过穷尽surrogate门,阈值为τ=0.50、ε=0.10。LENS与基于LLM的基线遵循指定的k∈{2, 3}。
- 两种接口:条件评测提供干净上下文与指定子集的并集。端到端评测把返回包索引进语料,用BM25与BGE-M3的reciprocal-rank fusion,再经Qwen3 reranker。只有与t或g的无保留匹配才计数。
论文做了哪些实验?
返回包Full ASR 0.852、最强真子集0.069;全尝试E2E-Strict@5由0.244到0.363。
实验设置
- 基准:HotpotQA、2WikiMultihopQA、MuSiQue、Natural Questions。每基准固定1,000个query–target尝试,共4,000。保留查询都能被三个干净目标RAG答对;目标在构造前固定,失败不替换。
- 模型:构造和surrogate阅读用Qwen3.6-27B。目标生成器为Qwen3.6-35B-A3B、Llama-3.1-70B-Instruct、DeepSeek-V4-Pro。冻结包在三个目标上评测,不做目标侧筛选。
- 检索与包大小:端到端使用BM25/BGE-M3 reciprocal-rank fusion和Qwen3 reranker。LENS与基于LLM的基线遵循指定k∈{2, 3};Semantic Chameleon始终用原生两文档sleeper–trigger。各方法共享清单、语料、检索、目标无关准入和目标侧评测;候选选择只用冻结的构造侧信号。
- 基线与防御:构造基线为direct multi-document synthesis、best-of-N synthesis、generic self-refinement、split evidence/payload synthesis、Semantic Chameleon。防御实验另比PoisonedRAG、GASLITE、BadRAG,防御为RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG。
- 指标:每个上下文20次随机生成。Yield是返回包的尝试比例。Full ASR是条件全集目标率,Max-sub. TR是最强真子集率,CJL为二者之差。E2E-Strict@5要求完整检索、实际top-5目标率至少0.50,且每个受控真子集至多0.10;Cond-Strict@5把全集阈值放在条件接口,子集测试相同。全尝试指标把构造失败记0。Subset Pass@20要求每个真子集在20次中至多产生目标两次。只计对t或g的无保留匹配。
- 汇总与人工:结果为基准宏平均,带基准分层置信区间;方法比较用配对重抽样。Clean Acc.用单独留出效用集。人工标注者独立于构造验证器,且看不到接纳决定和模型侧结果。
主结果
据Table 2。前三个数值列是全部4,000次尝试、失败记0;后两列是返回包,无目标侧过滤。
表格较宽,可左右滑动
基准 Yield 全尝试Ret. ASR@5 全尝试E2E-Strict@5 返回包Full ASR 返回包Max-sub. TR HotpotQA 0.655 0.517 0.401 0.862 0.036 2WikiMultihopQA 0.640 0.490 0.364 0.841 0.029 MuSiQue 0.705 0.611 0.477 0.910 0.069 Natural Questions 0.500 0.357 0.209 0.795 0.141 宏平均 0.625 0.494 0.363 0.852 0.069 - 作者称返回包有强的集合依赖。正文称79.7%通过每一个真子集检查;Cond-Strict成功中89.7%在实际检索上下文中仍严格,作者据此称依赖从受控接口迁到检索路径。
- 宏平均全尝试E2E-Strict@5的95% CI为[0.348, 0.378]。
- Table 2中Natural Questions的三项全尝试指标均为四基准最低,其返回包Max-sub. TR也是该列最高;作者未解释这一差距。
构造基线与目标特异性
- 严格集合成功:Table 6中,全尝试E2E-Strict@5从Semantic Chameleon的0.244到LENS的0.363;作者称相对增益48.8%。返回包Full ASR是Semantic Chameleon 0.872、LENS 0.852;Max-sub. TR从0.153到0.069。返回包Packet Ret.为0.798对0.784,全尝试Ret.为0.436对0.494。
- 两文档匹配:正文称精确两文档匹配下LENS为0.397,原生Semantic Chameleon为0.247。
- 可控性与外溢:Table 3对每查询三个预选目标,返回包Selectivity gap为0.693。240个查询中,至少两个目标可选择到达的比例为0.538,三个都到达为0.158;可选择要求差距至少0.30。1,200个未见离目标查询–包对上,完整包检索1.7%,原目标外溢0.8%,配对干净运行0.3%,金标准确率变化1.5 points;同实体查询检索到单个文档的比例为29.0%。
四种已发表防御
- 设置:Table 4是共享4,000次尝试的全尝试defended ASR@5。构造失败和无效输出记0。每格汇总三个目标生成器,且每个尝试有20个配对解码种子。
- 无防御与有防御:None列PoisonedRAG为0.507,LENS为0.494。四种防御下LENS最高:SeCon-RAG 0.401、ReliabilityRAG 0.448、RobustRAG 0.260、TrustRAG 0.408。作者称超出最强基线0.103–0.182,平均0.141,配对区间不含零。
- 作者解读:作者称优势来自构造覆盖,以及围绕文档局部线索建立的防御仍留存的集合级效应。
人工审计、机制控制与缓解探针
- 盲审:Table 5中,600篇插入里552/600(92.0%)局部有支持,535/600(89.2%)像普通参考文献散文;另抽的240个冻结目标中211/240(87.9%)在原语义下不正确。SemValid要求目标不正确、准则明确转移、且原语义下无蕴含,164/240(68.3%)返回包满足。
- 与行为并列:720个生成器评测中331/720(46.0%)同时SemValid且E2E-Strict。条件于SemValid为331/492(67.3%),条件于非SemValid为78/228(34.2%)。作者称严格成功在SemValid包内几乎是包外的两倍,并把行为效应联系到攻击者诱导的答案准则。
- 机制与探针:正文对Figure 3报告,240个匹配实例、每条件720个实现–生成器对上,匹配包Ret. ASR@K为0.785,角色打乱后0.265,跨透镜替换后0.127;JRR@K为0.863–0.867。K对k∈{2, 3}取5,对留出的k=4取8。作者称效应位于计划好的透镜–事实对应。集合级评判把Ret. ASR从0.784降到0.318,再加上子集消融到0.164;选择性审计降到0.284,并保留91.3%的基线干净准确率。不完整包的目标率为0.028;定向硬负例把Ret. ASR@5降到0.519。
其他消融与分析
- Figure 4,独立1,000次尝试:完整LENS的全尝试E2E-Strict@5为0.403;共享上限15次提议或修复、800次诊断生成、1.05M token时为0.327,最强组件移除为0.163;作者称前者是后者的两倍。
- 去掉子集更新:固定预算全尝试E2E-Strict@5为0.134(Figure 4正文)。
- 独立100-draw:抽样对中68.6%确认全子集控制;该句未写明“对”的组成。三目标生成器的全尝试E2E-Strict在0.357–0.370,正文未对应到具体模型。
- 提高τ、嵌套ε扫描:正文只作定性描述,未给出扫描表数值。
- Llama-guided construction:正文称结果可迁移,未报告型号与数字。
有什么可以进一步探索的点?
论文未在Conclusion或专节写出局限与后续方向。
作者指出的局限与后续方向
论文未专门讨论局限。Conclusion未把任何一项写成不足或后续工作。
实验覆盖范围
- 清单:四个基准各1,000次固定query–target尝试,共4,000;目标在构造前固定,失败不替换(Experimental Setup,Table 2)。
- 模型与检索:目标生成器为Qwen3.6-35B-A3B、Llama-3.1-70B-Instruct、DeepSeek-V4-Pro;构造与surrogate阅读为Qwen3.6-27B。检索为BM25/BGE-M3 reciprocal-rank fusion加Qwen3 reranker。包预算k∈{2, 3},Figure 3另有留出的k=4、K=8。
- 对照:五种构造基线共享清单、语料、检索、目标无关准入和目标侧评测(Table 6)。防御比较包含RobustRAG、ReliabilityRAG、SeCon-RAG、TrustRAG,攻击对照为PoisonedRAG、GASLITE、BadRAG(Table 4)。
- 协议与审计:每个上下文20次随机生成,另有独立100-draw。人工审计覆盖240个返回包的600篇插入,以及另抽的240个冻结目标(Table 5)。
- 未报告项:论文未报告人工标注者之间的一致性。正文称可迁移到Llama-guided construction,但未报告该次构造的具体型号和数字。
总结一下论文的主要内容
LENS用解释透镜把投毒放到文档组合上,返回包Full ASR 0.852、最强真子集0.069。
LENS研究冻结单轮RAG的集合级组合投毒:插入文档各自保持合理,合在一起才把输出从金标g导向预先固定的t。
- 问题:生成条件于检索集合,而许多筛查仍按单篇进行。作者认为,因此会漏掉一种失败模式:真子集诱导不了目标,全集却能改写答案选择准则。
- 做法:攻击者只能插入包,不能改查询、原文档、检索或生成器,并用本地surrogate构造。外环选定解释透镜和角色,内环分开写透镜设定与事实补全文档,再按全集闭合、子集泄漏、对齐和有效性做局部修复。冻结前穷尽检查真子集,门槛为τ=0.50、ε=0.10。
- 主结果:四基准、三个目标生成器上,返回包Full ASR为0.852,最强真子集0.069,检索后ASR@5为0.784(Table 2)。全尝试E2E-Strict@5为0.363;同一清单上Semantic Chameleon为0.244(Table 6)。作者称相对增益48.8%。
- 审计与防御:盲审里68.3%的返回包同时有不正确目标、明确准则转移和原语义下无蕴含(Table 5,n=240)。四种已发表防御下,LENS的全尝试ASR@5都高于同表基线;作者称平均高出0.141。无防御时PoisonedRAG为0.507,高于LENS的0.494(Table 4)。
- 作者结论:作者称证据组合是不同于单文档投毒的安全边界。有效干预要区分可疑的跨文档依赖和合法多跳组合,同时保留检索增强所依赖的跨文档推理。