HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
HDI: GraphRAG auxiliary schema poisoning
论文针对 GraphRAG 辅助模式级实体提出跳衰减影响攻击,篡改 0.016% 结构使 HippoRAG2 达到 94.44% ASR。
灰盒设定,攻击者拥有代表性目标查询集并通过图数据库接口查询知识图谱;拥有索引后修改辅助结构权限(内部人员或受损接口),但无法访问原始语料库、无法重跑索引流程、无法控制检索器或生成器参数;目标是在扰动预算内破坏辅助结构使检索失效。
- GraphRAG 离线索引构建的语义摘要与评分等辅助结构决定在线检索路径,但现有图投毒攻击仅局限于节点和边等实例级组件,忽视了辅助模式级实体的安全脆弱性。
- 论文提出 3S 框架与跳衰减影响(HDI)攻击,在索引后通过代表性查询集沿图传播衰减影响以选取高价值节点,进而实施语义注入、虚假边添加或预计算分值篡改。
- 在 HotpotQA 与 2WikiMultiHopQA 上,HDI 在修改 0.016%–4.82% 结构下取得 88.17%–94.44% ASR,实现单点影响多查询的杠杆放大,并以超 99% 的规避率绕过困惑度与改写防御。
- 作者指出后索引写权限假设并非普适,防御评估未覆盖针对分值与结构的检测,跨骨干 LLM 的泛化性未经验证;实验仅覆盖 2 个问答基准与 2 种 GraphRAG 架构。
- 模型
- Microsoft GraphRAGHippoRAG2text-embedding-3-smallGPT-4o-mini
- 基准
- HotpotQA2WikiMultiHopQA
- 指标
- ASRSLRF1EMPerplexity EvasionParaphrase EvasionDetection Rate
论文研究GraphRAG索引生成的语义摘要、层级关系和预计算分数等辅助结构被篡改后的风险,提出3S框架和HDI影响分析方法。攻击者须先取得索引完成后的辅助结构写入权限,这不是无需访问条件的远程攻击。作者在两类GraphRAG架构和两个问答基准上报告少量篡改可影响多个查询,并绕过所测困惑度与改写防御;结果限于这些实验条件,尚未独立复现。
推荐理由论文把 GraphRAG 离线索引生成的摘要、层级边和预计算分数列为新攻击面,并给出可复现的攻击与防御盲区分析。
深度解读
这篇论文试图解决什么问题?
论文指出现有图投毒局限于实例级,提出了针对 GraphRAG 辅助模式级实体的攻击方法。
论文聚焦于端到端 GraphRAG 系统中辅助模式级实体(Auxiliary Schema-Level Entity)的安全脆弱性,旨在解决现有图投毒攻击仅作用于实例级组件而忽视控制平面辅助结构的问题。
- 应用场景与重要性:作者指出,GraphRAG 将检索增强生成扩展至知识图谱,通过离线索引构建语义摘要、层次边与预计算分值等辅助结构,用于支持多跳推理并优化在线检索路径。
- 现有方法的不足:作者称,现有的直接图攻击与语料级攻击均局限于实例级事实(节点、边、三元组),将图本身视为全部检索载体,未能触及控制检索路径与优先级的模式级结构。
- 核心观察与假设:作者提出,辅助结构作为系统生成的派生构件享有隐式信任且缺乏运行时校验;操纵层次聚合点能产生 1:N 的不对称影响杠杆,且由于缺乏唯一定义的真实标注而难以检验篡改。
- 论文提出的方案:论文提出了 3S 框架(语义、结构、打分)与跳衰减影响(Hop-Decayed Influence, HDI)攻击方法,在索引完成后、检索开始前识别并篡改高影响力的辅助结构。
- 威胁模型:
- 攻击目标:在有限扰动预算内,通过破坏用于检索优化的辅助结构使目标查询集产生错误回答,同时规避现有防御。
- 攻击者能力:具备索引后修改知识图谱辅助结构的权限(如内部人员数据库写权限或受损接口);无法访问原始语料,无法重新触发索引,无法控制检索器或生成器参数。
- 攻击者知识:设定为灰盒(gray-box),攻击者拥有一组代表性目标查询集,并能通过标准图数据库接口查询知识图谱。
- 受害系统:采用辅助结构优化在线检索的端到端 GraphRAG 系统(如 Microsoft GraphRAG 与 HippoRAG2)。
有哪些相关研究?
论文梳理了 GraphRAG 架构、实例级图投毒及语言防御研究,指出现有工作忽视模式层。
论文在相关工作与引言中讨论了以下研究方向:
- 知识图谱与 GraphRAG 架构
- 微软 GraphRAG:Edge 等人(2025)提出基于层次化社区检测的 GraphRAG 框架,通过高层社区摘要聚合下属实体,以支持聚焦全局的查询回答。
- HippoRAG 与 HippoRAG2:Gutiérrez 等人(2025)受神经生物学启发提出图检索增强模型,通过个性化 PageRank(PPR)与预计算分值确定检索优先级。
- 图检索增强综述与框架:Han 等人(2025)与 Peng 等人(2024)系统梳理了图检索增强生成范式;He 等人(2024)提出了结合图结构理解与问答的 G-Retriever。
- 知识图谱与 RAG 系统的投毒攻击
- 直接图攻击(GRAGPOISON):Liang 等人(2026)提出 GRAGPOISON,通过识别跨查询共享关系并注入带有时间序的竞争关系以实施破坏。作者指出该方法仅针对实例级关系。
- 语料到图投毒攻击:Wen 等人(2025)提出通过源文本投毒的 TKPA 与 UKPA,分别重写脆弱文本块控制特定输出,或扰动共指信号打碎全局图结构;Zhao 等人(2025)亦探讨了知识投毒风险。
- 检索文本投毒(PoisonedRAG):Zou 等人(2025)提出 PoisonedRAG,注入针对检索相似度优化的恶意文本以诱导错误答案,属于文本层面的知识破坏。
- 对抗性攻击防御基线
- 困惑度过滤与改写防御:Jain 等人(2023)与 Panebianco 等人(2025)评测了困惑度过滤与改写检测基线。作者指出,既有防御假设对抗内容表现为统计异常,无法识别系统生成的流畅辅助结构。
- 基线方法与评测基准
- 对比基线:实验选取了直接图投毒方法 GRAGPOISON(Liang 等人,2026)以及检索投毒方法 PoisonedRAG(Zou 等人,2025)。
- 评测基准:选用维基百科来源的多跳问答基准 HotpotQA(Yang 等人,2018)与 2WikiMultiHopQA(Ho 等人,2020)。
- 本文与既有工作的定位区别:作者指出,既有攻击与防御均局限于传统知识图谱的数据平面(节点、边、三元组),而本文聚焦于离线索引构建的辅助模式级结构,揭示了控制平面上的脆弱性。
- 知识图谱与 GraphRAG 架构
论文如何解决这个问题?
论文通过跳衰减影响算法筛选核心节点,并以 3S 框架实施语义、结构与打分机制篡改。
作者提出了跳衰减影响(Hop-Decayed Influence, HDI)攻击与 3S 框架,在离线索引完成后通过查询感知的影响力传播筛选高价值目标,并针对语义、结构与打分辅助结构实施定向篡改。
问题形式化
在端到端 GraphRAG 系统中,索引阶段除构建图结构外,还会生成语义摘要、层次边与预计算分值等辅助结构集合 A。给定目标查询集 Q,攻击者的目标是在扰动预算 epsilon 约束下,寻找最小辅助结构修改量 Delta A,使得检索到的上下文与原上下文交集为空的查询数量最大化:
maxΔ A ∑q ∈ Q 𝕀[R(q, A + Δ A) ∩ R(q, A) = ∅]
该公式表示攻击者通过对辅助结构集合施加扰动,最大化完全破坏原始检索上下文的目标查询总数。
目标选择:跳衰减影响算法
为在有限预算下最大化跨查询影响,HDI 提出了一种查询感知的影响力传播机制。对每个查询 q,算法首先抽取种子实体并映射至图节点;随后影响力以指数衰减因子 lambda 沿最短路径向外传播:
Influence(v) = ∑q ∈ Q ∑s ∈ Seeds(q) λd(s, v)
该公式表示节点 v 的累积影响力等于各查询种子实体沿最短距离 d(s, v) 指数衰减贡献的总和。超过最大跳数 h_max 的节点影响力计为 0。算法最终选取累积影响力最高的 top-k 个节点作为攻击目标。
攻击实施:3S 攻击框架
根据辅助结构的不同类型,作者设计了三种针对性篡改方式:
- 语义攻击(Semantic Attack):针对目标节点的文本摘要注入对抗性文本 delta,引入虚假实体关联,同时保持低困惑度以逃避基于语言模型的异常检测。
- 结构攻击(Structure Attack):在目标节点与语义不相关的遥远节点之间建立虚假边。对目标节点 v*,算法添加与相似度低于阈值 tau 的节点 u 相连的边,构建虚假的图遍历路径。
- 打分攻击(Score Attack):篡改预计算分值以颠覆检索排序。将最高影响力的目标节点集合 V* 的分值降级为基线值 mu,同时将中位数排名的不相关节点集合 V_med 的分值提升至最大值 sigma_max,诱导检索器优先检出无关节点。
整体执行流程
攻击流程分为两阶段:第一阶段,HDI 算法基于查询集计算各节点的影响力得分并筛选 top-k 目标节点;第二阶段,依据目标系统的检索机制匹配实施 3S 攻击。作者指出,语义攻击适用于基于向量嵌入的检索系统,而结构攻击主要针对依赖图遍历的检索系统。
论文做了哪些实验?
实验在两套基准和架构上展现了超 88% 的攻击成功率与高达 6.00 的模式杠杆率。
实验设置
- 被测系统与模型:测试了 Microsoft GraphRAG 与 HippoRAG2 两套系统架构;文本嵌入模型采用 OpenAI text-embedding-3-small,生成模型采用 GPT-4o-mini。
- 评测数据集与采样量:使用多跳问答基准 HotpotQA 与 2WikiMultiHopQA,受计算预算限制各抽取 1,000 条样本构建测试集。
- 对比基准:对比了实例级图投毒攻击 GRAGPOISON 以及检索投毒方法 PoisonedRAG。
- 评估指标定义:采用攻击成功率 ASR(受攻击前回答正确而受攻击后回答错误的查询比例)、模式杠杆率 SLR(受影响查询数除以修改结构数)、F1 分数、精确匹配 EM,以及基于现有标准的困惑度与改写防御规避率。
- 防御测试设置:评估了困惑度过滤(Perplexity Filter)与文本改写检测(Paraphrase Defense)两种防御基线。
- 超参数与硬件条件:HDI 算法衰减因子 lambda 设为 0.5,最大跳数 h_max 设为 4,随机种子设为 42,扰动比例测试了 0.001%、0.01%、0.1%;实验在 32GB 以上内存环境下运行。
主结果
表格较宽,可左右滑动
目标系统 数据集 最佳配置 本文 ASR (%) PoisonedRAG (%) Gragpoison (%) MSGraphRAG HotpotQA HDI-T 91.69 80.69 85.64 MSGraphRAG 2WikiMultiHopQA HDI-T 88.17 80.42 88.68 HippoRAG2 HotpotQA HDI-T 88.24 81.49 86.28 HippoRAG2 2WikiMultiHopQA HDI-C 94.44 85.89 87.24 (据 Table 1)
- 攻击成功率表现:作者指出,HDI 在四组配置中的三组取得了最高 ASR,其中在 HippoRAG2 搭配 2WikiMultiHopQA 上达到 94.44%(Table 1)。
- 例外情况与反例:在 MSGraphRAG 搭配 2WikiMultiHopQA 任务中,基线方法 Gragpoison 的 ASR 为 88.68%,高于 HDI-T 的 88.17%(Table 1)。
- 系统架构差异:作者分析称,MSGraphRAG 的层次化社区结构放大了单点摘要被篡改的影响;而 HippoRAG2 的个性化 PageRank 将检索分散在多条路径上,具有一定分散性,但在打分攻击下仍表现出脆弱性(Table 1)。
攻击效率与模式杠杆率分析
- 篡改规模对比:据 Table 2,在 HippoRAG2-2WikiMultiHopQA 上,HDI-C 仅篡改了 311,419 个结构中的 49 个(0.016%),即达到 94.44% ASR;在 HotpotQA 上篡改 330 个结构(0.075%),达到 88.24% ASR。MSGraphRAG 的总结构数较少(HotpotQA 为 6,328,2WikiMultiHopQA 为 9,328),篡改比例分别为 4.74%(300 个)与 4.82%(450 个)。
- 模式杠杆率(SLR)对比:据 Table 2,HDI 的 SLR 达到 3.41–6.00,而 PoisonedRAG 的 SLR 仅为 0.32–1.36;最大差距出现在 HippoRAG2-2WikiMultiHopQA 上(HDI 为 6.00,PoisonedRAG 为 0.32)。
- 作者的解读:作者认为,SLR 大于 1 表明对单个模式级实体的修改能够同时影响多条检索路径,产生实例级攻击无法实现的 1:N 放大效应(Table 2)。
防御规避表现分析
- 规避率测试:据 Table 3,在针对困惑度过滤与改写防御的测试中,HDI 在各配置下的困惑度规避率为 99.50%–99.87%,改写防御规避率为 99.13%–99.72%,总体检测率均保持在 0.1% 以下(0.05%–0.09%)。
- 防御失效机理:作者称,现有防御针对实体名称异常或三元组不合理等实例级特征,而篡改后的摘要仍由语言模型生成并保持语言流畅性,虚假边连接的实体在语义上具有合理性,数值分值更完全绕过了基于文本的检测(Table 3)。
- 隐式信任盲区:作者认为,辅助结构作为系统生成的构件被默认信任且缺乏运行时校验,造成了 GraphRAG 防御的结构性盲点(Table 3)。
扰动强度的缩放效应分析
- 篡改强度扩展趋势:据 Figure 3,在 MSGraphRAG 上,随篡改比例从 0.01% 增至 0.1%,结构攻击 ASR 呈现接近线性的增长(HotpotQA 从 24.3% 增至 91.7%,2WikiMultiHopQA 从 19.8% 增至 88.8%)。
- 早期饱和现象:据 Figure 3,HippoRAG2 在 2WikiMultiHopQA 上仅需修改 0.01% 的结构即可达到 71.2%–73.5% ASR,表现出早期饱和特征,在 0.1% 扰动下结构攻击与语义攻击均达到 88.9%(正文称收敛至 88.89%)。
- 攻击类型差异:据 Figure 3 与正文,结构攻击(T)在 MSGraphRAG 上的表现整体优于语义攻击(S),例如在 HotpotQA(0.1% 比例)下结构攻击达 91.69% ASR,而语义攻击为 48.52%。
其他消融与分析
- MSGraphRAG 语义攻击强度缩放:HotpotQA 上扰动比例 0.01%、0.05%、0.1% 对应 ASR 分别为 15.5%、33.3%、48.5%(据 Figure 3)。
- MSGraphRAG-2WikiMHQA 语义攻击强度缩放:扰动比例 0.01%、0.05%、0.1% 对应 ASR 分别为 13.7%、41.7%、64.2%(据 Figure 3)。
- HippoRAG2-HotpotQA 结构与语义攻击对比:0.1% 扰动下结构攻击 ASR 为 88.2%,语义攻击 ASR 为 72.8%(据 Figure 3)。
- HippoRAG2 最优攻击类型偏好:HotpotQA 最优配置为结构攻击 HDI-T,2WikiMultiHopQA 最优配置为打分攻击 HDI-C(据 Table 1、Table 2、Table 3)。
有什么可以进一步探索的点?
作者指出了写权限假设、防御评估单一与模型泛化未测等局限,并列出后续防御方向。
作者指出的局限与后续方向
- 后索引写权限假设的普适性(出自 Section 8):作者指出,攻击所依赖的索引后数据库写访问权限假设在部分实际部署环境中可能并不成立。
- 防御评估维度的局限性(出自 Section 8):作者指出,现有的防御评估仅涵盖文本级检测方法,与分值篡改和结构篡改存在机制上的不匹配。
- 骨干语言模型的泛化性未测(出自 Section 8):作者指出,攻击在不同骨干语言模型(Backbone LLMs)之间的泛化表现仍未经测试验证。
- 扩展至其他 GraphRAG 任务与分布外查询(出自 Section 8):作者指出,未来的评估应进一步扩展到摘要生成、决策支持等其他 GraphRAG 应用以及分布外(OOD)查询。
- 新型检索管道扩展与标准化基准(出自 Section 8):作者计划将 HDI 扩展至具备时间感知和多模态检索能力的新型 GraphRAG 管道,并建立标准化的模式级攻击防御评测基准套件。
- 防御机制的研究方向(出自 Section 6 与 Section 8):作者提出了三种防御设想,包括维持模式实体与源实例血统的溯源感知防御(Provenance-aware Defense)、抗离群值的鲁棒聚合函数,以及在查询时检测语义漂移的运行时校验。
实验覆盖范围
- 被测管道与架构:评测覆盖 Microsoft GraphRAG 与 HippoRAG2 两种架构,共 2 个端到端 GraphRAG 系统。
- 数据集与样本量:评测在多跳问答数据集 HotpotQA 与 2WikiMultiHopQA 上展开,两项任务各抽取了 1,000 条样本。
- 模型配置:嵌入模型采用了 text-embedding-3-small,生成模型采用了 GPT-4o-mini,论文未测试其他模型。
- 防御评估基线:防御实验测试了困惑度过滤与改写检测两种基于文本的方法,论文未报告图结构异常检测或自适应防御。
- 重复次数与统计检验:实验设定固定随机种子 42,扰动比例测试了 0.001%、0.01%、0.1%,论文未报告多次重复实验的方差或统计显著性检验。
总结一下论文的主要内容
论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
- 论文定位:本文针对端到端 GraphRAG 系统,形式化了辅助模式级实体这一攻击面,并提出了基于跳衰减影响的投毒攻击方法。
- 解决的问题:现有知识图谱投毒主要聚焦于节点与边等实例级组件,忽视了离线索引阶段生成的语义摘要、层次边与预计算分值等辅助结构在控制平面上的脆弱性。
- 方法核心:作者提出跳衰减影响(HDI)算法,利用代表性查询集沿图谱传播衰减影响以筛选高价值节点,并通过 3S 框架(语义注入、虚假边添加、预计算分值篡改)实施针对性攻击。
- 主要实验结果:
- 在 HotpotQA 与 2WikiMultiHopQA 问答基准上,HDI 在各配置下达到 88.17%–94.44% 的 ASR,其中在 HippoRAG2 搭配 2WikiMultiHopQA 上取得最高 94.44% ASR(Table 1)。
- 攻击展现出 1:N 的放大杠杆,模式杠杆率(SLR)达到 3.41–6.00,在 HippoRAG2 上仅修改 0.016% 的结构(49 个)即达到 94.44% ASR(Table 2)。
- 篡改结构在困惑度过滤与改写检测下的规避率超过 99%,系统检测率保持在 0.1% 以下(Table 3)。
- 作者结论与启示:作者指出,辅助模式级实体因系统派生属性而享有隐式信任并缺乏运行时校验,构成了现有 GraphRAG 防御的结构性盲区;未来亟需发展结合溯源追踪与鲁棒聚合的协同防御机制。