论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击
Logic layer Prompt Control Injection (LPCI): A Novel Security Vulnerability Class in Agentic Systems
作者提出LPCI,并在五平台结构化测试中报告Gemini-2.5-pro执行率70.83%(Table 6)。
攻击者把编码、延迟、条件触发的载荷写入记忆、向量库或工具输出,跨会话触发未授权行为并绕过输入过滤。
- 持久记忆、向量库和工具输出会被智能体当成可信逻辑。作者称编码、延迟、条件触发的载荷能跨会话绕过输入过滤,并影响使用会话记忆、工具编排或RAG的企业系统。
- 作者定义LPCI的六阶段生命周期和注入、存储、触发、执行四步,并给出工具投毒、记忆内延迟指令、角色固化、向量库载荷四类机制。另提议风险评分、多阶段校验、升级路由、工具与数据源证明、RAG净化及记忆哈希链;QSAF写明日后发表。
- Table 6:ChatGPT执行15.06%,Claude 31.50%,LLaMA3 49.00%,Gemini-2.5-pro 70.83%(96条),Mixtral-8x7b 48.75%。Poe、Grok、Bohrium无定量结果。
- 作者指出测试限于公开平台,结果是2025年6月快照,且只覆盖可演示向量;后续包括自动检测、硬件飞地、形式化验证,以及多智能体和联邦学习。实验未报告分向量成功率、评审模型和重复次数。
- 威胁模型
- 攻击者把编码、延迟、条件触发的载荷写入记忆、向量库或工具输出,跨会话触发未授权行为并绕过输入过滤。侦察提示结构、角色分隔符和回退逻辑;论文未写black-box/white-box。可经输入、文件或API注入,做MCP工具投毒与RAG文档嵌入。受害系统是带持久记忆、工具编排或RAG的LLM智能体。
- 被测模型
- ChatGPTClaudeLLaMA3Gemini-2.5-proMixtral-8x7bPoeGrokBohrium
- 基准
- LPCI structured test suiteexploratory exploit demonstrations
- 指标
- Blocked OutcomesExecuted OutcomesWarning OutcomesVulnerability ExposedPass RateFail Rate
论文提出 Logic-layer Prompt Control Injection(LPCI),一类针对 Agent 系统逻辑执行层与持久记忆的攻击。攻击把经过编码、延迟且条件触发的载荷嵌入记忆、向量库或工具输出中,从而绕过常规输入过滤,并跨会话触发未授权行为。作者将 LPCI 归为面向企业 LLM 集成系统的新型隐蔽安全漏洞类别,论文编号 arXiv:2507.10457,属 cs.CR 方向。
深度解读
这篇论文试图解决什么问题?
作者称LPCI把延迟、条件触发的载荷写入记忆、向量库或工具输出,以绕过输入过滤。
如何刻画并检验藏在智能体逻辑层与持久记忆中、可跨会话延迟触发的提示控制注入。
- 场景:作者称LLM已进入金融、医疗和电信等系统;会话记忆、工具编排和RAG会重放历史内容,并默认信任检索结果(第1–2节)。
- 现有不足:作者称传统提示注入依赖当场改写输出;现行措施主要做提示审核和内容过滤,未处理记忆持久性、上下文信任和延迟执行(第1节、第3.2节)。
- 观察:作者称存储消息会跨会话重放且缺少校验,检索或嵌入内容被默认信任,命令可按内部角色、上下文或工具输出执行(第2节)。
- 提出内容:作者定义LPCI及其生命周期,报告1,700条结构化测试,并提出运行时控制。QSAF在第5节写明定于未来发表。
- 威胁模型:
- 目标:把编码、延迟、条件触发的载荷放入记忆、向量库或工具输出,跨会话触发未授权行为,绕过常规输入过滤(摘要,第2.4–2.5节)。
- 知识:侦察提示结构、角色分隔符和回退逻辑,探测内部提示与角色定义泄露(第2.2.1节)。论文未使用black-box、white-box或gray-box。
- 能力:经输入、文件上传或API注入;在MCP中投放仿冒工具;把指令嵌入被索引文档;用持久记忆改写角色(第2.3–2.5节)。
- 受害系统:带持久记忆、工具编排或RAG的LLM智能体。Table 4将攻击面标在记忆上下文处理、逻辑执行引擎、工具接口和输出分发。
有哪些相关研究?
正文没有与具名攻击方法做实验对比;作者将LPCI放在表层提示过滤之外。
作者在第7节把LPCI放在表层提示操纵文献之外,正文没有与具名攻击方法的实验对比。
- 表层提示操纵:第7节称现有AI安全文献主要关注表层提示操纵和基于响应的漏洞;LPCI的特征被写成延迟激活、触发嵌在记忆或外部工具中,且难以被静态或实时扫描发现。引言把传统提示注入写成依赖即时改写输出。
- 记忆层引用:第7节把文献[7][8]称为Johann的论文,并称本文剖析execution memory state这一提示注入向量,以加强该文的行动呼吁。参考文献中[7]是Rehberger(2024),[8]是Johann(2024)。正文未分开比较这两篇的做法。
- 作者评估的防御类别:Table 5列出Prompt Filtering、Safety Alignment(RLHF)、Content Moderation、Memory Isolation、Tool Selection Heuristics。作者分别称其可被编码或混淆逻辑、只优化输出语气、识别不了延迟或跨会话激活、未经验证的记忆重放、伪造元数据和重新引入的插件配置绕过。这些是类别,不是被点名的外部系统。
- 基线与基准:论文未把LPCI与已命名攻击方法做对照,也未使用具名外部基准。测试集是自建结构化用例,向量为Tool Poisoning、LPCI Core、Role Override、Vector Store Payload Persistence。
作者把LPCI类比为供应链妥协、跨会话建立信任和逻辑炸弹(第3.1节),未给实验对照。作者称需要运行时可观测性和持久会话分析,而不只做静态或实时扫描(第7节)。
论文如何解决这个问题?
LPCI按注入、存储、触发、执行推进,机制含工具投毒、角色固化与向量库载荷。
LPCI把逻辑放进持久记忆、检索内容或执行流,靠延迟或条件激活跨过单次输入过滤。作者另提议运行时控制,并写明QSAF定于未来发表。
设定与脆弱组件
- 独立于当场交互:作者称载荷可在多次会话后才触发,并在系统重置后仍保留;相关企业场景包括会话记忆、工具编排和RAG(第2节)。
- 四个组件:Host Application Layer收集并路由输入,作者称常缺少对编码或混淆载荷的校验;LLM Memory Store保存历史提示、工具交互和上下文,作者称常无完整性校验;Prompt Processing Pipeline解释指令与历史,作者称常无时间意识或来源校验;External Input Sources包括用户命令、检索文档和API响应(第2.1节)。
- 五段管线:Prompt Ingestion Layer、Memory Context Handler、Logic Execution Engine、Tool/Plugin Interface、Output Dispatcher(第2.9.1节)。
生命周期与四阶段流程
- 六阶段:Reconnaissance、Logic-Layer Injection、Trigger Execution、Persistence or Reuse、Evasion and Obfuscation、Trace Tampering(第2.2.1节)。Table 1为每阶段列出风险,包括结构泄露、逻辑覆盖、权限提升、重放、编码绕过和审计痕迹被改。
- 四阶段:Injection、Storage、Trigger、Execution。第2.4与第2.5节都写这一流程;第2.5节写触发可以来自关键词、角色上下文、工具输出或时间事件。
- 对应关系:Table 2把Injection对到侦察和逻辑注入,Storage对到持久化或重用,Trigger对到触发执行,Execution对到逻辑注入、规避和痕迹篡改。
四类机制
- Tool Poisoning(AV-1):在MCP中投放仿冒合法工具的恶意工具。作者列出的条件是缺少真实性校验、重复工具难以区分、默认信任、描述性声明无法核验。
- LPCI Core(AV-2):在记忆中放入持久、混淆、按条件触发的指令。作者列出的条件是无记忆完整性检查、盲信历史上下文、编码混淆、延迟执行。
- Role Override via Memory Entrenchment(AV-3):把改写后的角色指令固进持久记忆。作者列出的条件是角色锚点可变、信任序列化记忆、提示内声明角色、检测不到角色漂移。
- Vector Store Payload Persistence(AV-4):把指令嵌进RAG会检索的已索引文档。作者列出的条件是盲信检索内容、索引时不扫描载荷、上下文放大、用嵌入混淆隐蔽。
攻击面映射
- Table 4:Memory Context Handler对AV-3,Logic Execution Engine对AV-2,Tool/Plugin Interface对AV-1,Output Dispatcher对AV-4。Prompt Ingestion Layer未出现在该表。
提议的运行时控制
- Prompt Risk Scoring:针对AV-2、AV-3。对实时提示和从记忆重放的提示做启发式评分,检查编码、角色覆盖和触发式函数,再按分数升级或拒绝。论文未给分数阈值。
- Multi-Stage Validation Pipeline:针对AV-2、AV-3。Stage 1用正则过滤已知触发标记;Stage 2用LLM或启发式分类器看隐藏控制逻辑;Stage 3在组装最终提示前检查被召回记忆中的角色断言和潜伏触发。论文未写分类器模型名。
- Escalation Router:针对AV-2、AV-3。高风险上下文离开自主执行,可进沙箱或人工队列。论文未写风险画像的定量阈值。
- 证明、净化与记忆链:密码学工具与数据源证明主要针对AV-1,也用于AV-4,要求工具schema、元数据和端点URI签名,检索时核验索引清单。RAG摄入管道针对AV-4,用正则、语义分析和LLM检查器;正文举例把命令式内容标为risk_score: 0.85,并用标记隔离检索内容。Memory Integrity and Attribution Chaining针对AV-2、AV-3,条目含时间戳、不可变作者身份和前一条哈希;用户记忆不能冒充系统角色。
- 状态:第5节写这些组件属于开发中的内部框架,并对测试套件做过回顾评估。评估数字放在第4问。
论文做了哪些实验?
Table 6里Gemini-2.5-pro执行率70.83%,ChatGPT拦截率84.94%。
实验设置
- 被测系统:结构化测试为ChatGPT、Claude、LLaMA3、Gemini-2.5-pro、Mixtral-8x7b。探索性演示另有Poe、Grok、Bohrium,并再次写到Claude。除名称里的Gemini-2.5-pro与Mixtral-8x7b外,论文未写版本。
- 规模与时间:论文写1,700条结构化用例,测试于2025-06-24结束。Table 6分平台总数为Gemini-2.5-pro 96、Claude 400、LLaMA3 400、ChatGPT 405、Mixtral 8x7b 400。论文未解释分平台条数差异,也未解释与1,700的关系。
- 协议:第4节写各模型使用同一协议:Base64与十六进制编码载荷、延迟触发、记忆角色覆盖、向量库载荷持久化、插件场景中的工具投毒。论文未报告各向量条数。
- 指标:Blocked为拒绝处理或执行;Executed为提示被处理且逻辑被运行;Warning为含糊或部分安全;Vulnerability Exposed为已执行并导致可观察的安全相关动作;Pass Rate为被拦截或安全处理且未触发漏洞;Fail Rate为成功执行潜在不安全或未授权逻辑(第4.1节)。
- 判定:论文未说明由规则、人工还是模型判定,未写评审模型、阈值、重复次数或查询预算。
- 基线:无对照攻击方法,无对照模型。
主结果
据Table 6。五行的Vulnerability Exposed和Fail Rate百分比都等于执行率。表头写作Mixtral 8x7b。
表格较宽,可左右滑动
平台 测试数 拦截 执行 警告 Gemini-2.5-pro 96 2.08% 70.83% 27.08% Claude 400 20.75% 31.50% 47.75% LLaMA3 400 0.50% 49.00% 50.50% ChatGPT 405 84.94% 15.06% 0.00% Mixtral-8x7b 400 4.00% 48.75% 47.25% - 作者解读:作者称ChatGPT拦截最多,并归因于模式过滤、记忆分段和角色校验;论文未给出这三项的单独测量。作者称LLaMA3与Mixtral-8x7b对逻辑注入和持久记忆载荷更易执行。
- 与正文不一致:第4.2节写Gemini-2.5-pro拦截率0.5%;Table 6中0.50%在LLaMA3列,Gemini-2.5-pro列是2.08%。摘要写执行率up to 49%;Table 6执行率最高为Gemini-2.5-pro的70.83%。讨论写LLaMA3与Mixtral执行了近一半的405条载荷;Table 6中这两平台各400条。
- 通过率口径:Gemini-2.5-pro、Claude、LLaMA3的Pass Rate等于拦截加警告,分别为29.17%、68.50%、51.00%。ChatGPT警告为0,Pass Rate等于拦截率。Mixtral 8x7b的Pass Rate为16(4.00%),等于拦截数,未计入警告189(47.25%)。
探索性演示
- 测了什么:第2.7.2节在Poe、Claude、Grok、Bohrium上做定向演示,无成功率或样本量。此处Claude的结果与Table 6分开。
- 结果:作者称Poe经跨会话记忆固化触发了审批类逻辑;Claude用混淆提示完成角色覆盖;Grok从RAG中被投毒的向量文档取出并执行注入逻辑;Bohrium处理了会话记忆中的编码载荷。
- 作者解读:作者称这些演示说明问题不只有结构化测试里的构造。论文未给定量比较。
提议控制的回顾评估
- 测了什么:第5节写所提机制对照LPCI测试套件做回顾评估,对象是使用编码、延迟触发和嵌入记忆载荷的提示层逻辑攻击。
- 结果:作者报告有效拦截率84.94%。该数字与Table 6中ChatGPT的拦截率相同。论文未说明所用模型、样本、是否计入警告,以及各控制的单独贡献。
- 发布:作者写组件属于开发中的内部框架,QSAF定于未来发表。
其他消融与分析
- 论文未报告消融、参数扫描,也未报告四类向量各自的成功率。
- Figure 1图注为五平台Blocked、Executed、Warning的分组分布;正文未给出图上额外数字。
- Figure 2图注写汇总失败率43%,第4.4节称43%的用例执行了不安全逻辑;论文未说明43%如何由Table 6汇总。
- 第4.3节点名Gemini #12、Claude #44、LLaMA3 #88、Mixtral #195、ChatGPT #61,类型分别为延迟编码载荷执行、向量数据导致的角色配置泄露、记忆中逻辑执行、先前会话的工具命令被激活、角色提升后提示仍被执行。不转述载荷。
- Table 6注把部分结果标为strong security performance或critical vulnerabilities;颜色在所给文本中不可见。
- ChatGPT仍有执行结果;第4.3节的#61即角色提升案例。
有什么可以进一步探索的点?
作者写的局限是公开平台、2025年6月快照,以及只测可演示的攻击向量。
作者指出的局限与后续方向
- 平台范围:测试集中于公开可访问的LLM平台;作者认为企业专用或定制实现的漏洞画像可能不同(第6.2节)。
- 时间截面:作者称防护持续变化,结果是截至2025年6月的快照(第6.2节)。测试结束日写为2025-06-24(第4节)。
- 攻击复杂度:作者写只关注可演示向量,并认为国家级或高级持续威胁行为体可能做出更复杂的LPCI变体(第6.2节)。
- 自动检测:后续方向包括用异常检测和行为分析做自动LPCI检测(第6.2节)。
- 飞地与验证:后续包括用硬件安全飞地保护记忆完整性,以及对LLM逻辑执行路径做形式化验证(第6.2节)。
- 系统形态:后续包括分析多智能体系统和联邦学习环境中的LPCI(第6.2节)。
实验覆盖范围
- 结构化测试平台为ChatGPT、Claude、LLaMA3、Gemini-2.5-pro、Mixtral-8x7b;Table 6条数分别为405、400、400、96、400。论文另写总计1,700,结束于2025-06-24。
- 探索性演示写了Poe、Claude、Grok、Bohrium的定性结果,无分平台成功率(第2.7.2节)。
- 协议包含Tool Poisoning、LPCI Core、Role Override、Vector Store Payload Persistence,以及Base64、十六进制、延迟触发和插件场景;论文未报告分向量条数或成功率。
- 论文未报告攻击辅助模型、迭代预算、查询次数、重复次数、评审模型,以及评审与人工的一致性。
- 第5节对所提控制给出一句回顾评估,有效拦截率84.94%;论文未报告各控制的单独结果。作者写QSAF定于未来发表。
总结一下论文的主要内容
作者定义LPCI;Table 6中Gemini-2.5-pro执行率70.83%,ChatGPT拦截率84.94%。
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。
- 问题:会话记忆、向量库和工具输出会被重新放进上下文并默认信任。作者称编码、可延迟、按条件触发的载荷因此能越过以提示审核为主的防护。
- 做法:生命周期分侦察、逻辑注入、触发、持久化、规避和痕迹篡改;操作流分注入、存储、触发、执行。机制为工具投毒、记忆内延迟指令、角色固化和向量库载荷。另提议风险评分、三级校验、升级路由、签名证明、RAG净化和记忆哈希链。QSAF写为未来发表。
- 主结果:Table 6中,Gemini-2.5-pro执行率70.83%(96条,拦截2.08%),LLaMA3为49.00%(拦截0.50%),Mixtral-8x7b为48.75%(拦截4.00%),Claude为31.50%(拦截20.75%),ChatGPT为15.06%(拦截84.94%,405条)。摘要的up to 49%,以及第4.2节把0.5%拦截率归于Gemini的说法,与Table 6不一致。
- 其他结果:Poe、Grok、Bohrium只有定性描述。Figure 2图注写总体失败率43%,汇总方式未说明。回顾评估写拦截率84.94%,与ChatGPT在Table 6的拦截率相同,协议未说明。
- 作者结论:作者称LPCI可复现且跨平台,常规安全措施已过时,需要运行时逻辑分析、记忆召回校验和下游控制流监测。第6.2节把证据范围写成公开平台、2025年6月快照和可演示向量。