PA-LLM-RAG 框架的知识库投毒攻击与防御
Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework
单条规则(1.6%)污染17/20条提示词上下文;CLD-KB在1.6%至25%投毒率下CIR为100%。
white-box对手对知识库K有写权限,知道嵌入模型nomic-embed-text与WF/ROE/CAP结构,不能修改已有规则、拦截操作员提示词或访问LLM权重,也不需要运行时提示词。
- PA-LLM-RAG用语义检索把边缘LLM的IoBT决策锚定到WF、ROE、CAP策略库,但默认库内容未被篡改。能写库的对手可不依赖运行时提示词,把伪造规则送进决策上下文。
- 投毒规则同时写入三类操作词汇,使嵌入靠近查询分布质心并对三类成员等距,从而跨查询类型进入检索前列。CLD-KB以OC-SVM与Member-Based Category Spread做或组合拦截,从top-10回填3条干净规则。
- 无防御时,1条规则(1.6%)使20条提示词中17条的LLM上下文出现投毒规则;约7.7%时平均每上下文2.65条后饱和。CLD-KB在60条合法加24条投毒规则上F1为1.000,1.6%至25%的CIR为100%,每任务大约7ms。
- 作者指出依赖三类分类、60条规模和启动时一次训练,并将定向、单类、释义与自适应攻击及仿真外实验列为后续。论文未与TrustRAG等在该规则库上直接比较,也未报告黑名单实测。
- 威胁模型
- white-box对手对知识库K有写权限,知道嵌入模型nomic-embed-text与WF/ROE/CAP结构,不能修改已有规则、拦截操作员提示词或访问LLM权重,也不需要运行时提示词。目标是污染LLM任务决策,使系统失灵并违反操作策略约束。受害系统为边缘PA-LLM-RAG。
- 被测模型
- Llama 3.2
- 基准
- IoBT policy knowledge base(60条合法规则)24条生成的对抗规则Appendix A的20条IoBT任务提示词Gazebo Harmonic v8.11
- 指标
- Context Integrity Rate (CIR)RecallPrecisionF1-scoreLLM context corruptionpoisoned rules per LLM context
研究针对战场物联网任务控制中 Policy-Aware LLM-RAG(PA-LLM-RAG)框架提出查询无关语义检索投毒攻击,单条注入规则(1.6% 投毒率)即可造成 85% 的 LLM 上下文污染,7.7% 投毒率时达到饱和。为应对该威胁,作者提出 CLD-KB 双检测器异常检测框架,结合 One-Class SVM 边界检测与基于成员的类别扩散分析,在投毒检测和知识保留上均优于 DBSCAN、LOF、K-Means、Isolation Forest 和 One-Class SVM 五种基线方法,每次任务计算开销仅 7ms,可边缘部署。
深度解读
这篇论文试图解决什么问题?
PA-LLM-RAG假设策略库可信,查询无关投毒可不依赖运行时提示词而污染检索上下文。
PA-LLM-RAG 把 IoBT 任务决策锚定到可写入的策略知识库,但对抗条件下检索是否仍只返回合法规则未被检验。
- 场景:作者称 IoBT 要让无人机、无人车和传感器在交战规则下协同,检索到的策略会塑造自主行动。伪造规则进入上下文后,可能改变交战条件并造成错误协同。
- 现有不足:先前的 PA-LLM-RAG 默认库内只有未改动的合法规则。已有 RAG 投毒在构造时需要目标查询,且对象是开放域文档,不是 60 条结构化任务规则。
- 观察:作者把攻击面放在检索层。若写入规则对整个查询分布都相似,就可以不靠某条运行时提示词进入 top-k;跨类用词还会使嵌入与三类成员近似等距。
- 做法:提出 Query-Agnostic Semantic Retrieval Poisoning,以及检索层双检测器 CLD-KB,在规则到达决策 LLM 前拦截并删除。
- 威胁模型:
- 知识:white-box。知道 nomic-embed-text 与 WF/ROE/CAP,不需要运行时提示词。
- 能力:可写知识库 K。作者称写权限可来自被攻破的上游同步、不可信操作员或供应链攻击。不能改已有规则、拦截提示词或访问 LLM 权重。
- 目标:污染 LLM 任务决策,使系统失灵并违反操作策略约束。
- 受害系统:边缘 PA-LLM-RAG,决策模型为本地 Llama 3.2;无防御时返回 top-3 规则。
有哪些相关研究?
作者把本文与需目标查询的RAG投毒,以及会额外调用LLM的通用防御区分开。
相关工作按任务编排、RAG 投毒和防御分组。差别只写在作者点名的方法上。
IoBT 与 LLM 编排
- IoBT(Kott 等,2016):异构无人平台在交战规则、能力约束和任务流程下协同。作者称静态规则难以适应实时行动,因而有工作用 LLM 做高层编排(Xiao 等,2024;Kalita 等,2025)。
- PA-LLM-RAG(Solanki 等,2026):作者先前的边缘框架,用向量检索锚定结构化策略,并用独立 Judge LLM 做执行前核验。作者称对抗安全性被留作开放问题。
RAG 投毒
- 检索增强(Lewis 等,2020):用外部库接地生成。作者称这减少文档任务中的幻觉,同时使可写知识库成为攻击面。
- PoisonedRAG(Zou 等,2025):论文称这是针对 RAG 的首次知识腐蚀攻击,每道目标题注入五条恶意文本,攻击成功率 90%。
- HijackRAG(Zhang 等,2024)与 PR-Attack(Jiao 等,2025):论文称前者用单条投毒文档劫持特定查询的回答,后者用双层优化同时污染知识库和提示词。作者指出 PoisonedRAG、HijackRAG 和 PR-Attack 都要在构造时知道目标查询。
RAG 防御
- TrustRAG(Zhou 等,2025):用 K-Means 标出可疑文档,再以 LLM 自评处理检索知识与内部知识的冲突。
- RobustRAG(Xiang 等,2024):隔离每条检索文档再聚合。作者称其良性段落多于恶意段落的假设在较高投毒率下不成立。
- RAGForensics(Jiang 等,2025):攻击被发现后迭代追溯投毒文本。作者称上述防御面向开放域非结构化语料,不能利用任务规则的分类;TrustRAG 与 RobustRAG 需要额外 LLM 调用;三者未提供与结构化规则库兼容的实现,故未在本文数据上直接比较。
基线与评测数据
- 对照检测器:DBSCAN、LOF、K-Means、Isolation Forest、One-Class SVM。数据为 60 条合法规则、生成的 24 条对抗规则,以及 Appendix A 的 20 条 IoBT 提示词。
作者把成功标准定为上下文完整性,即投毒规则是否进入 LLM 策略上下文,而不是开放域答案是否被改写。CLD-KB 用 WF/ROE/CAP 作检测信号,且不额外调用 LLM。作者称就其所知,这是首次刻画针对 LLM IoBT 任务控制的查询无关检索投毒,也是首次提出面向领域任务规则库的分类感知异常检测防御。
论文如何解决这个问题?
CLD-KB用OC-SVM与类别离散度拦截跨类等距的投毒规则,再从候选池回填干净规则。
攻击把伪造规则写入知识库,使其对查询分布而不是某一条运行时提示词排名靠前。CLD-KB 在检索结果进入决策 LLM 之前打分并拦截,再从候选池回填干净规则。
系统与攻击目标
- 库与检索:60 条规则,Workflow、Rules of Engagement、Capability 各 20,编号至 WF/ROE/CAP-20,另存智能体遥测。nomic-embed-text 产生 768 维归一化嵌入,相似度用点积。无防御时取 top-3,连同遥测交给经 Ollama 部署的 Llama 3.2,输出 JSON 动作分配。
- 形式化:注入集合 P,使任意 q∼Q 的 top-k 至少含一条投毒规则,即 maxpj∈ Psim(q,pj)≥minri∈ C(q)sim(q,ri)。嵌入模型与类别结构已知,已有规则不能改。
查询无关构造
- 与已有攻击的差别:PoisonedRAG、HijackRAG、PR-Attack 在构造时需要目标查询。本文把形式化目标写成 IoBT 查询分布的嵌入质心,不读取运行时提示词。
- 规则写法:论文称分析跨任务高频操作词后,让每条投毒规则同时覆盖资产类型和周界词,并指定资产集中到 NorthGate、EastGate、WestGate、SouthGate 之一。跨类用词使嵌入与三个类别质心等距。论文未写明是否对质心做了数值优化。
- 注入规模:ρ=M/(N+M)。M 取 1、2、3、5、7、9、11、15、20,对应 1.6% 至 25%。评估用的 20 条提示词列在 Appendix A。
两个检测器
- OC-SVM:只在合法规则上训练。嵌入标准化后,ν=0.2,RBF 核 γ=0.1。阈值是训练决策分数的第 3 百分位。论文称训练时至多 3% 合法规则会被误判,并称在 60 条库上假阳性为零。分数低于阈值则标记。
- 类别离散度:到某一类的距离是与该类任一成员的最小余弦距离。离散度为三类距离的最大减最小,spread(r)=maxc dmin(r,c)−minc dmin(r,c)。论文称合法规则大于 0.20,投毒规则小于 0.15,阈值取间隔中点 0.17,低于则标记。
- 互补:二者取或。作者称 OC-SVM 处理偏离整体边界的规则,离散度处理靠质心、因而留在边界内的规则。作者还称只写单类词汇的规则仍会被 OC-SVM 标出;该情形被列为后续工作,实验未测。
回填与判定
- Filter-and-refill:防御开启时检索 top-10,按排名收集未标记规则,凑满 3 条再送入决策 LLM。论文称该深度足以应付直至 25% 的评测投毒率。
- 黑名单:首次被标记的规则从库中永久删除。论文给出有效投毒率随任务单调下降的关系,实验节未报告该曲线。
- 成功定义:架构中的 Judge LLM 把上下文规则与干净库对照,库中不存在的规则视为对抗构造。只有干净规则为 Success,出现任一条则为 Failure。论文未给出该 Judge 的模型名。实验中的 CIR 采用同一判定。
论文做了哪些实验?
1.6%投毒时17/20条提示词上下文被污染;CLD-KB规则级F1为1.000,各投毒率CIR为100%。
实验设置
- 模型与运行:决策 LLM 为 Llama 3.2,嵌入为 nomic-embed-text,均经 Ollama 本地提供。CLD-KB 只用合法库内容,在启动时训练一次。
- 库与投毒档:60 条合法规则;另生成 24 条对抗规则,论文未说明生成模型。投毒率 1.6%–25.0%,按子集递增注入。规则级指标在全部 60+24 条上计算,不按投毒档拆分。
- 环境:Gazebo Harmonic v8.11、WSL2;6 个智能体(无人机 T01–T03、UGV T01–T02、机器人 T01),5 个门位。
- 提示词与重复:Appendix A 的 20 条提示词,覆盖周界、驻守、单智能体、威胁响应和多智能体协同。每个投毒档对全部提示词评估,并重复 3 次。论文未报告各次方差。
- 基线与指标:DBSCAN、LOF、K-Means、Isolation Forest、One-Class SVM。规则级 Recall、Precision、F1;任务级 CIR,仅当最终策略上下文不含投毒规则时记成功。防御开启时先取 top-10 再滤到 3 条。
- 评审:CIR 是上下文对照。架构把该检查交给 Judge LLM,论文未给出评审模型名称、打分阈值或与人工的一致性。
主结果
规则级检测见 Figure 4 与 Section VI。K-Means 与 Isolation Forest 的 Recall 为论文合写,未分别给出 Precision。
表格较宽,可左右滑动
方法 Recall Precision F1 假阳性 DBSCAN 未报告 未报告 0.000 未报告 LOF 未报告 未报告 0.000 未报告 K-Means 0.542(合写) 未报告 0.684 未报告 Isolation Forest 0.542(合写) 未报告 0.703 未报告 One-Class SVM 1.000 未报告 0.980 1 CLD-KB 1.000 1.000 1.000 0 - 密度基线:论文称 DBSCAN 与 LOF 把投毒规则当内点,因为它们靠近查询分布质心,不在稀疏离群区。K-Means 与 Isolation Forest 只识别 24 条中的 13 条。
- 分离间隙:作者称全部合法规则的 Member-Based Category Spread 高于 0.20,全部投毒规则低于 0.15,两分布无重叠。该结果不是按投毒率拆开的。
- 假阳性:单独 OC-SVM 有 1 次假阳性。论文称只有 CLD-KB 同时做到 100% CIR 与零假阳性。Section V 称其 OC-SVM 在 60 条库上假阳性为零;论文未说明该设置与基线 OC-SVM 是否同一套超参。
攻击阈值
- 测了什么:无防御时,进入 LLM 上下文的投毒规则条数如何随注入量变化(Figure 3),提示词为 Appendix A 的 20 条。
- 结果:Section IV.E 写 1 条规则(1.6%)使 20 条提示词中的 17 条上下文被污染(85%);Figure 3 正文写大约 85%。平均条数在约 7.7% 饱和;摘要写 2.65 条/上下文,正文写大约 2.65。摘要另称效果在直至 25% 的各投毒率下保持不变,并称饱和后追加注入收益有限。
- 检索示例:Table I 为 1.6%、无防御。作者称 “Secure all the gates” 中 POI-01 以 0.8436 高于 WF-03 的 0.8315,差 0.0121;“Unknown vehicle approaching west gate” 中 POI-01 仍以 0.8310 进入 top-3。
上下文完整性与开销
- CIR:Figure 5 与正文称 CLD-KB 在 1.6% 至 25.0% 九档均为 100%,没有任何评测场景让投毒规则进入最终上下文。
- 其他方法:K-Means 与 Isolation Forest 的 CIR 从低投毒率的大约 45% 降到高投毒率的 10%–20%。One-Class SVM 大约维持 100%,代价是 1 次假阳性、删掉一条合法规则。正文未给出 DBSCAN 与 LOF 的 CIR。Figure 5 逐档柱值在文本抽取后列对齐不可靠,除正文写明的范围外不逐格填写。
- 开销:Section VI 写每任务大约 7ms,含嵌入检索、OC-SVM 打分和类别离散度,并称不到任务执行时间的 0.04%。摘要与结论写 7ms。作者称因此可用于资源受限的边缘编排。
其他消融与分析
- 论文未报告 OC-SVM 与 Member Spread 的单独消融,也未报告 ν、γ、τ_sp 或 top-10 的参数扫描。
- 自适应黑名单只有定义式(Section V.E),论文未报告黑名单规模随任务次数的实测,也未把它与单次过滤回填分开测。
- 合法 spread>0.20、投毒 spread<0.15、阈值 0.17,同时出现在 Section V 的设计描述和 Section VI 的 60+24 条结果中。
- 论文未报告 Judge LLM 对策略符合度或任务结果的单独分数;成功标准是上下文是否含投毒规则。
有什么可以进一步探索的点?
作者指出依赖三类体系、60条规模与一次训练,仿真和单场景外推仍待做。
作者指出的局限与后续方向
- 分类结构:防御依赖三类 IoBT 策略体系;扁平或界定不清的知识库可能需要自适应阈值校准(Section VII)。
- 规模:评测使用 60 条合法规则,更大规模时 OC-SVM 边界的泛化可能不同(Section VII)。
- 更强攻击:掌握提示词的定向对手可能超过当前 85% 的上下文污染;后续应研究单类、释义和自适应攻击(Section VII)。
- 训练方式:防御在启动时训练一次,动态环境中可能需要增量再训练(Section VII)。
- 场景:当前评测覆盖单一任务场景;后续应评估不同 IoBT 任务类型和知识库配置(Section VII)。
- 部署形态:Gazebo 仿真限制外推,硬件在环和真实环境实验仍是后续工作;把传感器与图像纳入多模态知识库被写成一个方向(Section VII)。
实验覆盖范围
- 决策 LLM 为 Llama 3.2,嵌入为 nomic-embed-text,均由 Ollama 本地提供;仿真为 Gazebo Harmonic v8.11、6 个智能体、5 个门位(Section VI)。
- 合法规则 60 条,三类各 20;另生成 24 条对抗规则,论文未说明生成模型。投毒率 1.6%–25.0%,M 为 1、2、3、5、7、9、11、15、20(Section IV、VI)。
- 规则级 Recall、Precision、F1 在 60+24 条上计算;CIR 使用 Appendix A 的 20 条提示词,每档重复 3 次(Section VI)。论文未报告各次方差,也未报告显著性检验。
- 对照为 DBSCAN、LOF、K-Means、Isolation Forest、One-Class SVM。作者称与 TrustRAG、RobustRAG、RAGForensics 在该结构化规则库上直接比较不可行(Section II.C)。
- 论文未报告 Judge LLM 的模型名、策略符合度的单独分数、黑名单随任务次数的实测,以及 spread 阈值是否在检测评测集之外标定;CIR 只看最终上下文是否含投毒规则(Section III、V、VI)。
总结一下论文的主要内容
查询无关投毒以1条规则污染17/20条上下文;CLD-KB在1.6%–25%维持CIR 100%。
作者对边缘 PA-LLM-RAG 做对抗评估:在不知运行时提示词的情况下污染 IoBT 策略检索,并用分类结构把投毒规则挡在决策 LLM 之外。
- 问题:框架默认 60 条 WF/ROE/CAP 规则未被改写。white-box 写权限对手知道 nomic-embed-text 和类别结构,不能改旧规则,也不看运行时提示词。
- 攻击:形式化目标是查询分布质心。规则同时写入三类操作词汇,并按四个门分组,使检索排名不依赖某一条提示词。注入 1 条(1.6%)时,20 条提示词中 17 条的 Llama 3.2 上下文被污染;约 7.7% 时平均每上下文 2.65 条后饱和。
- 防御:OC-SVM(ν=0.2,RBF γ=0.1,第 3 百分位)与 Member-Based Category Spread(阈值 0.17)取或。从 top-10 回填 3 条未标记规则,并在首次命中后永久删除。
- 结果:在 60 条合法加 24 条投毒规则上,CLD-KB 的 Recall、Precision、F1 为 1.000,假阳性为 0;1.6%–25% 的 CIR 为 100%。DBSCAN 与 LOF 的 F1 为 0.000,K-Means 为 0.684,Isolation Forest 为 0.703,单独 OC-SVM 为 0.980 且有 1 次假阳性。每任务开销摘要写 7ms,正文写大约 7ms。
- 作者结论:作者称很小比例的库被改写就足以影响任务决策,分类感知检测可以在不额外调用 LLM 的情况下维持评测范围内的上下文完整性。作者同时把三类体系、60 条规模、启动时一次训练,以及 Gazebo 单场景写成仍待外推的部分。