MEntA 用 5 次查询实现 RAG 成员推断攻击
Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment
MEntA用5次非模板查询、无影子模型,在SCIDOCS上对Phi4-14B的AUC为0.991。
黑盒 RAG:判断文档 D 是否在检索库中,只提交非模板查询并只看最终文本。
- RAG把回答锚定在外部或专有语料上,输出可能暴露某文档是否在检索库中。作者称现有成员推断常依赖易被检测的模板,或需要大量非模板查询和影子模型。
- MEntA离线生成覆盖文档各部分的信息寻求式问题,并前置摘要再查询黑盒RAG。回答被拆成原子句,用NLI判断是否被候选文档蕴含,减去拒答后取平均得到成员分数。
- 三个BEIR集、四生成器、5次查询时,作者称12组中11组AUC最高,SCIDOCS上Phi4-14B为0.991。NFCorpus上GPT-4对MEntA召回为0.061;SCIDOCS上Mirabel对良性查询的FPR为0.881。
- 附录B称短或泛化文档难以支撑多样问题,非成员与库内文档高相似会带来假阳性,过长文档或原子句会降低效用。结论认为需要在仅5–10次查询时仍有效的文档级暴露控制。评测含四个生成器、三个BEIR集,以及文中的输入修改、DP和两种检测器。
- 威胁模型
- 黑盒 RAG:判断文档 D 是否在检索库中,只提交非模板查询并只看最终文本。看不到检索上下文、相似度、嵌入、logits、元数据和参数。知道系统使用检索,但不绑定具体实现或防御。只持有 D,不知库内其他内容。查询预算有限,并考虑输入/输出修改会削弱成员信号。
- 被测模型
- Phi4-14BLlama3.1-8BCommandR-7BGemma2-2BGPT-4.1-nano
- 基准
- BEIRNFCorpusSCIDOCSTREC-COVIDSciFact
- 指标
- AUCAccuracyTPR@FPRRecallFPR
研究者提出 MEntA(Membership Entailment Attack),一种针对 RAG 系统的成员推断攻击,通过提出低成本的宽泛信息类问题,并测量模型回答与候选文档之间的自然语言蕴含关系,判断某文档是否在检索语料中。该方法无需影子模型,也不需要大量查询,在 NFCorpus、SCIDOCS 和 TREC-COVID 上仅用 5 次查询即达到最高 0.991 AUC,在同等条件下比此前方法高出最多 0.42 AUC。MEntA 在现有 SOTA RAG 防御下仍然有效,而当前检测器要么漏检,要么对正常查询产生高误报;在相同攻击设置下,其总攻击成本比 SOTA 攻击低最多 65 倍。该工作已被 USENIX Security 2026 接收。
深度解读
这篇论文试图解决什么问题?
黑盒RAG上,少查询、无影子模型、非模板的成员推断是否可行。
黑盒 RAG 上,攻击者能否只用少量非模板查询、且不借助影子模型,判断某文档是否在检索库中。
- 场景: 作者称机构用 RAG 把回答锚定在医疗、电信、金融等专有语料上,用户只通过自然语言接口交互,知识源不公开。确认某份病历、合同或内部合规文档在库中,就可能泄露受监管信息。
- 现有方法: 作者称许多 MIA 依赖固定模板,易被 prompt injection 检测器发现,或被其他防御削弱;gray-box 设定不实用。IA 使用自然对话,但常需每文档 30 次或更多查询,并要影子 LLM 校准;其二值回答在输出扰动下表现不好(Table 1、§4)。
- 作者的问题: 能否发动 limited-budget、surrogate-free、stealthy、defense-agnostic,且使用非模板查询的成员推断。
- 本文提出: MEntA。用范围较宽的信息寻求式问题,测量回答与候选文档之间的蕴含,从而去掉影子 LLM 和大查询预算。
- 威胁模型:
- 目标: 推断文档 D 是否在检索库中,得到 member(D) ∈ {0, 1}。途径是非模板查询。
- 知识: black-box。只提交 q、只观察最终文本 a(q)。检索上下文、相似度、嵌入、logits、后端元数据和参数都不可见。知道系统依赖检索,但对 dense 或 sparse、分块和是否有防御保持 agnostic。
- 能力: 持有候选文档 D,没有库中其他内容。查询预算有限,以避免费用告警和速率限制;查询必须是非模板的。
- 受害系统: 自然语言接口后的 RAG。防御方可以部署输入修改、DP 和输入检测。攻击还要考虑输入/输出修改会削弱成员信号。
有哪些相关研究?
论文将本文放在黑盒、无影子模型、非模板且少查询的RAG成员推断中。
RAG 与攻击面
- 检索式生成: Lewis 等(2020)把检索到的 top-k 证据送入生成器,以降低幻觉。论文称检索器、数据库与生成器的接口扩大了攻击面:注入可操纵检索或生成,成员推断则只判断文档是否存在。
黑盒与 gray-box 成员推断
- 模板化探测: S2-MIA、RAGLeak 比较输出与候选文本或裁剪后的 ground-truth;MBA 用被遮蔽片段的恢复情况作成员分数。DCMI、RAG-MIA、Prompt-Injected 和 The Good and The Bad 直接要求确认文档存在或复述上下文。论文在 §4 称后一类是模板,容易被防御标记。
- 自然问答: IA 用只有文档在库中才答得出的自然语言问题。论文称它更隐蔽,但查询次数多,且依赖影子 LLM;二值回答在输出扰动下不好用。
- gray-box: RAG-leaks 用目标分布上的参考 RAG 校准;SMA 开关检索以分离检索驱动的 token;BudgetLeak-Z 操纵最大输出 token。论文因需要 gray-box 而未把这三项放入主比较。
防御
- 输入修改: 包括查询改写、重排序和指令提示。论文称改写可破坏模板与脆弱的词面重叠,重排序减少同一证据反复出现,指令能约束逐字泄露但依赖指令遵循。
- 输入检测: 论文称 LLM 分类器易部署,但可被像人写的非模板攻击绕过。Mirabel 标记与单篇索引文档异常高的相似度,同时要控制非模板查询上的误报。
- DP: 通过扰动输出削弱成员证据,并要在隐私增益和回答质量之间调节。
用 NLI 看上下文依据
- 相关技术: FENICE 把输出拆成原子陈述,检查是否被检索上下文严格蕴含。CoPE 衡量输出对给定证据相对内部先验的依赖。AlignScore 评估回答与依据来源的语义对齐。论文未把这三项当作攻击基线。
基线与基准
- 主实验: 基线为 S2-MIA、MBA、DCMI 黑盒版和 IA;数据为 BEIR 的 NFCorpus、SCIDOCS、TREC-COVID。Table 1 注称,1 次查询的模板基线与 MEntA 的 5 次非模板查询不宜直接对比。
作者把本文放在 black-box、无影子模型、非模板、每文档 5 次查询这一格,并在 Table 1 中标为 stealthy 与 defense-agnostic。与 IA 的差别是问题改为信息寻求式,打分改为原子陈述的蕴含,而不是与影子模型答案是否一致。
论文如何解决这个问题?
MEntA用信息寻求式问题加NLI蕴含命中,在无影子模型下聚合成员分数。
MEntA 把文档是否在库中,转成回答里的原子陈述能否被候选文档蕴含。Figure 1 分四步:离线生成问题、查询黑盒 RAG、用 NLI 得到每查询信号、聚合并选阈值。它借用 IA 的摘要前置和拒答惩罚,但不用短的二值问题,也不与影子模型的答案比对。
信号选择
- 蕴含而非相似度: 作者认为,若 D 是成员,检索到它之后,生成结果里的原子陈述更常被 D 逻辑推出;若不是,则更常幻觉或拒答。NLI 标签为蕴含、中立、矛盾。
- 相似度的分解: 作者不把余弦相似度当成员信号,并把它写成真实证据项加上领域重叠带来的虚假相关。非成员时领域重叠仍可能很高;成员若以改写或概括作答,词面重叠又可能很低。
- 对照例子: Figure 2:NFCorpus 成员文档、Phi4-14B,余弦相似度 0.72,高于文中阈值 0.7,蕴含概率 0.24。Figure 3 图注称,SUPPORT 与 CONTRADICT 在相似度上重叠大,蕴含概率分得更开。该检查用 SciFact;相似度模型为 all-mpnet-base-v2,蕴含模型为 tasksource/deberta-base-long-nli。
查询生成
- 离线出题: 问题在目标系统之外生成,攻击循环本身只做黑盒查询。对 D 生成 n 个不同问题,要求覆盖开头、中部和结尾,以核对整篇而不是单条事实。生成提示见附录 A,不在此列出句式约束。
- 摘要前置: 另生成短摘要,实际提交的是摘要与问题的拼接。作者称这一步来自 IA,摘要用作更密的检索键。
- 为何可以少问: 作者用序贯概率比检验说明,固定错误率下所需样本数约与每次观察的 KL 散度成反比,并把查询具体性当作信息量代理,写成 n ∝ 1/DKL ∼ 1/L(q)。因此认为提高具体性可以减少查询次数。评测默认 n=5(§6.1)。
查询与打分
- 交互: 系统先检索上下文,再生成回答。攻击利用回答对检索上下文的依赖:D 若被检索到,回答更可能含 D 中的具体事实。
- 弃答指令: 用户侧提示要求上下文不够时只做弃答。附录 A 的 Figure 12 给出 RAG 提示模板,不在此复述弃答原句。
- 原子句与 NLI: 打分用 tasksource/deberta-base-long-nli。作者称需要长上下文、文档级判断,而不是短句对分类。每条回答先拆成原子句。
- 分数: 某查询记为蕴含命中,当且仅当至少一句的蕴含概率大于中立与矛盾概率中的较大者。若某原子句蕴含附录 A 的拒答假设,则记拒答。成员分数是二者之差在查询上的平均:MIA(D)=1/(|QD|)∑q∈ QD(Ient(q)−Iidk(q))。分数越高,作者认为越像成员。拒答项的结构对应 IA 的式 (5)。
阈值
- 工作点: τ 在留出校准集上按目标指标选取(AUC 工作点或 balanced accuracy),再用于评测集。高于 τ 判为成员。论文未报告校准集规模。
- 最优性: 定理 1 把每次查询的蕴含命中看成伯努利变量,假设在给定成员或非成员时相互独立,且成员时命中概率更高。作者称,由 Neyman–Pearson 引理,固定假阳性率下最强检验等价于对命中总数设阈值。
论文做了哪些实验?
Table 3中5次查询下,作者称MEntA在12组里11组AUC最高,最高0.991。
实验设置
- 生成器与检索: Phi4-14B、Llama3.1-8B、CommandR-7B、Gemma2-2B。默认检索器为 sentence-transformers/all-mpnet-base-v2,另测 thenlper/gte-large。除非另有说明,Top-K=3。
- 数据: BEIR 的 NFCorpus、SCIDOCS、TREC-COVID,各 1,000 个成员与 1,000 个非成员。
- 基线: S2-MIA 用文档前半作查询,分数为与原文的 BLEU。MBA 用与生成器相同的模型作 proxy LM,以恢复的 mask 词数为分数。DCMI 黑盒版做 yes/no,扰动幅度 0.06,原查询加扰动查询共 2 次。IA 用 GPT-4o 生成查询、GPT-4o-mini 作影子 LLM。RAG-leaks、SMA、BudgetLeak-Z 因 gray-box 未纳入。
- MEntA 辅助模型: GPT-4.1-nano 生成查询与摘要;tasksource/deberta-base-long-nli 做蕴含。Table 3 里 IA 与 MEntA 的预算都是每文档 5 次;Table 1 把 IA 的查询数写成 30。
- 指标: AUC;accuracy 取 ROC-AUC 上的最佳成员阈值;TPR@FPR,Table 3 报告 0.01 与 0.05。作者称更看重低 FPR 的 TPR。DCMI 的这两列在 Table 3 为“–”。论文未报告 Table 3 的重复次数。
- 检测集: 每个数据集、每种攻击 1,000 条良性查询和 1,000 条攻击查询(附录 C.1)。§6.7 与 Table 7 写 GPT-4 检测器;附录 C.2 写该检测器为 GPT-4.1-nano。Mirabel 的 ρ=0.05。
主结果
据 Table 3,预算 5、Top-K=3、检索器 all-mpnet-base-v2,下表为 MEntA 的 AUC。
表格较宽,可左右滑动
生成器 NFCorpus SCIDOCS TREC-COVID Phi4-14B 0.989 0.991 0.893 Llama3.1-8B 0.935 0.936 0.801 CommandR-7B 0.973 0.984 0.860 Gemma2-2B 0.836 0.799 0.757 - 作者的概括: 作者称 12 个模型–数据集配置中 11 个 AUC 最高。例外是 TREC-COVID、Llama3.1-8B:IA 的 AUC 为 0.847,MEntA 为 0.801。Gemma2-2B 上 MEntA 的三格 AUC 低于另外三个生成器。
- 低 FPR: 同表中 IA 在 FPR=0.01 的 TPR 有 12 格里 11 格为 0.000,SCIDOCS、Gemma2-2B 为 0.104。MEntA 在 SCIDOCS、Phi4-14B 上为 0.906。DCMI 的 TPR 未报告。
- 摘要中的总括: 作者称最多比先前方法高 0.42 AUC,并称高于 IA 的 0.915。0.915 与 0.991 同为 SCIDOCS、Phi4-14B、5 次查询。0.42 未对应到表中单一格子。部分基线低于 0.5,例如 NFCorpus、CommandR-7B 上 S2-MIA 的 AUC 为 0.489。
输入与输出修改防御
Table 6 为 Phi4-14B、每文档 5 次查询时 MEntA 的 AUC。
表格较宽,可左右滑动
数据集 None DP Rerank Prompt Inst. Paraphrase NFCorpus 0.989 0.913 0.975 0.984 0.977 SCIDOCS 0.991 0.916 0.986 0.992 0.953 TREC-COVID 0.893 0.836 0.904 0.908 0.846 - DP 与 IA: 作者称 DP 会降低 MEntA,但仍保持较高 AUC;IA 最多下降 0.372 AUC。Table 6 中 IA 的 DP 列为 NFCorpus 0.518、SCIDOCS 0.543、TREC-COVID 0.487,对应 None 为 0.756、0.915、0.816。
- 与正文不完全一致的两处: 作者称 NFCorpus 上 Prompt Instruction 甚至使 MEntA 提升;该格为 0.984,None 为 0.989。SCIDOCS 的 Prompt Inst. 为 0.992,TREC-COVID 为 0.908。引言称 Phi4-14B 在所有数据集和防御下 AUC 大约在 0.90;Table 6 中 TREC-COVID 的 DP 为 0.836、Paraphrase 为 0.846。
- DCMI: 作者称其在多数防御下仍低于 MEntA。反例是 SCIDOCS 的 DP:DCMI 0.943、MEntA 0.916;TREC-COVID 的 DP:DCMI 0.889、MEntA 0.836。TREC-COVID 的 Paraphrase 两者均为 0.846。
输入检测
MEntA 查询的召回据 Table 7,良性查询的 FPR 据 Table 8。表中检测器名称为 GPT-4。
表格较宽,可左右滑动
数据集 GPT-4 召回 Mirabel 召回 GPT-4 良性 FPR Mirabel 良性 FPR NFCorpus 0.061 0.738 0.033 0.596 SCIDOCS 0.263 0.991 0.151 0.881 TREC-COVID 0.058 0.454 0.076 0.518 - 两种检测器: 作者称 GPT-4 很少把 MEntA 判为攻击,而 MBA 在 NFCorpus 的召回为 0.910。摘要写 MEntA 上召回为 6̃%;Table 7 的 SCIDOCS 为 0.263。作者称 Mirabel 能检出包括 MEntA 在内的各攻击,但工作点激进。
- 误报例子: 作者举例,每天 100 万次查询、FPR 0.881 会标记超过 880,000 条合法请求。作者认为同一主题上的追问也会产生相似度尖峰,并称 Mirabel 在 NQ 与 TriviaQA 上的 FPR 更低,那些数据没有按文档聚集的问题。Table 1 仍把 MEntA 标为 Stealthy。
查询预算与成本
- 预算曲线: Figure 8 的正文未给出曲线端点 AUC。作者称 MEntA 在 NFCorpus 上约 5–10 次查询内饱和,IA 要更大预算才到峰值;1 次查询的 MBA、S2-MIA 和 2 次查询的 DCMI 持续低于 MEntA。
- 美元成本: Table 4 按各自最优预算计:IA 30 次,MEntA 5 次。IA 含每次影子调用加黑盒调用(输出按 10 token);MEntA 为黑盒调用(输出按 100 token)加 DeBERTa-NLI。Gemma2-2B 价格按 Gemma-3-4B 的一半近似。
表格较宽,可左右滑动
生成器 IA 每次攻击 MEntA 每次攻击 IA/MEntA Phi4-14B 3.37e-3 2.21e-4 15.24 CommandR-7B 3.04e-3 1.70e-4 17.87 Llama3.1-8B 2.74e-3 6.62e-5 41.37 Gemma2-2B 2.57e-3 3.95e-5 65.06 - 65× 的两种写法: 贡献列表写 token cost 最多降 65×;摘要写相同攻击设置下总成本最多低 65×。Table 4 的 65.06 是最优预算下的美元总成本比,不是同一查询次数。
其他消融与分析
- 蕴含对相似度(Figure 4,NFCorpus,四生成器,Top-k=3,5 个查询变体,相似度阈值 0.7): 正文未给 AUC;作者称蕴含更高。
- 最少蕴含句数(Figure 6,Phi4-14B): 正文未给各阈值的 AUC;作者称大体稳定,默认至少 1 句。
- 查询策略(Figure 7,Llama3.1-8B,Top-k=3): 文档特定问题比泛化主题问题高 0.109–0.214 AUC。去掉检索后 AUC 为 NFCorpus 0.493、SCIDOCS 0.524、TREC-COVID 0.483。
- 检索器(Table 5,Llama3.1-8B,5 个查询变体平均): all-mpnet-base-v2 对 gte-large 的 AUC 为 NFCorpus 0.935 对 0.931、SCIDOCS 0.936 对 0.939、TREC-COVID 0.801 对 0.796。
- Top-k(Figure 9,Llama3.1-8B,5 次查询,k 为 3、5、10、20): 作者称各数据集都稳定,SCIDOCS 大约在 0.94。正文未给其他 k 的具体 AUC。
- 分数分布(Figure 5,Phi4-14B,Top-k=3,5 个查询变体): 图注称成员分数多为正、非成员多为负,阈值附近重叠小。作者称剩余重叠主要在尾部。正文未给密度数值。
有什么可以进一步探索的点?
附录B写了短文档、高相似非成员和过长输入等失败模式,结论指向文档级控制。
作者指出的局限与后续方向
- 短或泛化文档: 附录 B 称,文档太短或太泛时,无法支撑多样的、针对该文档的问题。作者把这视为 IA 与 MEntA 共同的失败模式,并归于自然查询下的检索与生成,而不是打分函数本身。
- 高相似非成员: 附录 B 称,非成员文档与已索引文档相似度高时会出现假阳性。
- 过长输入: 附录 B 称,候选文档或抽出的原子句过长时效用下降。同节写 Split-and-rephrase 可把长文档拆成较短段落、把长陈述改成更短单位。
- 文档级控制: 结论写,需要限制累积暴露的文档级、隐私感知控制,以及在攻击只用 5–10 次查询时仍然有效的防御。
- 会话级监测: 附录 D 建议把文档级暴露控制与会话内语义相关的迭代查询监测结合起来;同一文档在短窗口内被反复检索时,可加强认证或暂时拒答,并改用更短、更抽象的回答。把 Mirabel 扩到会话内语义重叠时,作者称这不是完整方案。
实验覆盖范围
- 生成器为 Phi4-14B、Llama3.1-8B、CommandR-7B、Gemma2-2B;检索器为 sentence-transformers/all-mpnet-base-v2 与 thenlper/gte-large(§6.1、Table 5)。
- 主数据为 BEIR 的 NFCorpus、SCIDOCS、TREC-COVID,各 1,000 个成员和 1,000 个非成员。SciFact 只用于 §5.2 的相似度与蕴含对照。
- 防御设置包括 DP(ε=0.1)、随机打乱重排序、指令防御、查询改写,以及文中的 GPT-4 检测器和 Mirabel(ρ=0.05)(§6.7、附录 C.2)。
- 主结果的查询预算为每文档 5 次。Figure 8 改变查询次数;Table 4 用 IA 的 30 次查询对比 MEntA 的 5 次。Top-k 在 Llama3.1-8B 上取 3、5、10、20(Figure 9)。
- 论文写明不纳入 gray-box 的 RAG-leaks、SMA、BudgetLeak-Z。论文未报告 Table 3 的重复次数和校准集规模。检测查询集为每个数据集、每种攻击 1,000 条良性查询和 1,000 条攻击查询(附录 C.1)。
总结一下论文的主要内容
MEntA以5次非模板查询和蕴含打分,在黑盒RAG上做无影子模型的成员推断。
MEntA 是对 black-box RAG 的成员推断:只根据最终文本回答,判断持有的候选文档是否在检索库中,不使用影子模型。
要处理的困难是,模板查询容易被输入检测发现,而自然问答式的 IA 需要大量查询和影子 LLM,二值回答又容易被输出扰动打断。
做法是离线生成覆盖文档各部分的信息寻求式问题,前置摘要后提交;把回答拆成原子句,用 NLI 记录是否被候选文档蕴含,并扣除拒答,再对查询取平均。阈值在留出校准集上选择。
- Table 3(5 次查询,Top-K=3,all-mpnet-base-v2):四个生成器、三个数据集共 12 组中,作者称 11 组 AUC 最高。SCIDOCS、Phi4-14B 的 AUC 为 0.991,TPR@FPR=0.01 为 0.906。例外是 TREC-COVID、Llama3.1-8B,IA 为 0.847,MEntA 为 0.801。
- Table 6:Phi4-14B、NFCorpus 上,DP 后 MEntA 的 AUC 为 0.913。作者称 IA 在 DP 下最多下降 0.372 AUC。
- Table 4:IA 用 30 次查询、MEntA 用 5 次时,总成本比在 Gemma2-2B 上为 65.06。摘要另称相同攻击设置下最多低 65×。
- Table 7–8:GPT-4 对 MEntA 的召回在 NFCorpus 为 0.061、在 SCIDOCS 为 0.263;Mirabel 在 SCIDOCS 良性查询上的 FPR 为 0.881。
作者的结论是,小查询预算下的黑盒成员推断可以做成;查询改写和指令约束会减少但去不掉文档特定证据,检测又难以在不高误报的情况下部署。因此需要限制累积暴露的文档级控制,以及在攻击只用 5–10 次查询时仍然有效的防御。