跳到正文
原文
论文追踪· arXiv:2507.10457· Hammad Atta, Ken Huang, Manish Bhatt, Kamal Ahmed, Muhammad Aziz Ul Haq, Yasir Mehmood·本站收录 · 原文发表

论文提出 LPCI:针对 Agent 逻辑层与持久记忆的提示控制注入攻击

Logic layer Prompt Control Injection (LPCI): A Novel Security Vulnerability Class in Agentic Systems

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者提出LPCI,并在五平台结构化测试中报告Gemini-2.5-pro执行率70.83%(Table 6)。

威胁模型攻击者把编码、延迟、条件触发的载荷写入记忆、向量库或工具输出,跨会话触发未授权行为并绕过输入过滤。

问题
持久记忆、向量库和工具输出会被智能体当成可信逻辑。作者称编码、延迟、条件触发的载荷能跨会话绕过输入过滤,并影响使用会话记忆、工具编排或RAG的企业系统。
方法
作者定义LPCI的六阶段生命周期和注入、存储、触发、执行四步,并给出工具投毒、记忆内延迟指令、角色固化、向量库载荷四类机制。另提议风险评分、多阶段校验、升级路由、工具与数据源证明、RAG净化及记忆哈希链;QSAF写明日后发表。
实验与结果
Table 6:ChatGPT执行15.06%,Claude 31.50%,LLaMA3 49.00%,Gemini-2.5-pro 70.83%(96条),Mixtral-8x7b 48.75%。Poe、Grok、Bohrium无定量结果。
局限与可以继续做的
作者指出测试限于公开平台,结果是2025年6月快照,且只覆盖可演示向量;后续包括自动检测、硬件飞地、形式化验证,以及多智能体和联邦学习。实验未报告分向量成功率、评审模型和重复次数。
实验设置ChatGPT、Claude 等 · LPCI structured test suite、exploratory exploit demonstrations · Blocked Outcomes、Executed Outcomes 等
威胁模型
攻击者把编码、延迟、条件触发的载荷写入记忆、向量库或工具输出,跨会话触发未授权行为并绕过输入过滤。侦察提示结构、角色分隔符和回退逻辑;论文未写black-box/white-box。可经输入、文件或API注入,做MCP工具投毒与RAG文档嵌入。受害系统是带持久记忆、工具编排或RAG的LLM智能体。
被测模型
ChatGPTClaudeLLaMA3Gemini-2.5-proMixtral-8x7bPoeGrokBohrium
基准
LPCI structured test suiteexploratory exploit demonstrations
指标
Blocked OutcomesExecuted OutcomesWarning OutcomesVulnerability ExposedPass RateFail Rate
AI 导读论文提出 Logic-layer Prompt Control Injection(LPCI),一类针对 Agent 系统逻辑执行层与持久记忆的攻击。攻击把经过编码、延迟且条件触发的载荷嵌入记忆、向量库或工具输出中,从而绕过常规输入过滤,并跨会话触发未授权行为。作者将 LPCI 归为面向企业 LLM 集成系统的新型隐蔽安全漏洞类别,论文编号 arXiv:2507.10457,属 cs.CR 方向。

论文提出 Logic-layer Prompt Control Injection(LPCI),一类针对 Agent 系统逻辑执行层与持久记忆的攻击。攻击把经过编码、延迟且条件触发的载荷嵌入记忆、向量库或工具输出中,从而绕过常规输入过滤,并跨会话触发未授权行为。作者将 LPCI 归为面向企业 LLM 集成系统的新型隐蔽安全漏洞类别,论文编号 arXiv:2507.10457,属 cs.CR 方向。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者称LPCI把延迟、条件触发的载荷写入记忆、向量库或工具输出,以绕过输入过滤。

    如何刻画并检验藏在智能体逻辑层与持久记忆中、可跨会话延迟触发的提示控制注入。

    • 场景:作者称LLM已进入金融、医疗和电信等系统;会话记忆、工具编排和RAG会重放历史内容,并默认信任检索结果(第1–2节)。
    • 现有不足:作者称传统提示注入依赖当场改写输出;现行措施主要做提示审核和内容过滤,未处理记忆持久性、上下文信任和延迟执行(第1节、第3.2节)。
    • 观察:作者称存储消息会跨会话重放且缺少校验,检索或嵌入内容被默认信任,命令可按内部角色、上下文或工具输出执行(第2节)。
    • 提出内容:作者定义LPCI及其生命周期,报告1,700条结构化测试,并提出运行时控制。QSAF在第5节写明定于未来发表。
    • 威胁模型:
      • 目标:把编码、延迟、条件触发的载荷放入记忆、向量库或工具输出,跨会话触发未授权行为,绕过常规输入过滤(摘要,第2.4–2.5节)。
      • 知识:侦察提示结构、角色分隔符和回退逻辑,探测内部提示与角色定义泄露(第2.2.1节)。论文未使用black-box、white-box或gray-box。
      • 能力:经输入、文件上传或API注入;在MCP中投放仿冒工具;把指令嵌入被索引文档;用持久记忆改写角色(第2.3–2.5节)。
      • 受害系统:带持久记忆、工具编排或RAG的LLM智能体。Table 4将攻击面标在记忆上下文处理、逻辑执行引擎、工具接口和输出分发。
  2. 有哪些相关研究?

    正文没有与具名攻击方法做实验对比;作者将LPCI放在表层提示过滤之外。

    作者在第7节把LPCI放在表层提示操纵文献之外,正文没有与具名攻击方法的实验对比。

    • 表层提示操纵:第7节称现有AI安全文献主要关注表层提示操纵和基于响应的漏洞;LPCI的特征被写成延迟激活、触发嵌在记忆或外部工具中,且难以被静态或实时扫描发现。引言把传统提示注入写成依赖即时改写输出。
    • 记忆层引用:第7节把文献[7][8]称为Johann的论文,并称本文剖析execution memory state这一提示注入向量,以加强该文的行动呼吁。参考文献中[7]是Rehberger(2024),[8]是Johann(2024)。正文未分开比较这两篇的做法。
    • 作者评估的防御类别:Table 5列出Prompt Filtering、Safety Alignment(RLHF)、Content Moderation、Memory Isolation、Tool Selection Heuristics。作者分别称其可被编码或混淆逻辑、只优化输出语气、识别不了延迟或跨会话激活、未经验证的记忆重放、伪造元数据和重新引入的插件配置绕过。这些是类别,不是被点名的外部系统。
    • 基线与基准:论文未把LPCI与已命名攻击方法做对照,也未使用具名外部基准。测试集是自建结构化用例,向量为Tool Poisoning、LPCI Core、Role Override、Vector Store Payload Persistence。

    作者把LPCI类比为供应链妥协、跨会话建立信任和逻辑炸弹(第3.1节),未给实验对照。作者称需要运行时可观测性和持久会话分析,而不只做静态或实时扫描(第7节)。

  3. 论文如何解决这个问题?

    LPCI按注入、存储、触发、执行推进,机制含工具投毒、角色固化与向量库载荷。

    LPCI把逻辑放进持久记忆、检索内容或执行流,靠延迟或条件激活跨过单次输入过滤。作者另提议运行时控制,并写明QSAF定于未来发表。

    设定与脆弱组件

    • 独立于当场交互:作者称载荷可在多次会话后才触发,并在系统重置后仍保留;相关企业场景包括会话记忆、工具编排和RAG(第2节)。
    • 四个组件:Host Application Layer收集并路由输入,作者称常缺少对编码或混淆载荷的校验;LLM Memory Store保存历史提示、工具交互和上下文,作者称常无完整性校验;Prompt Processing Pipeline解释指令与历史,作者称常无时间意识或来源校验;External Input Sources包括用户命令、检索文档和API响应(第2.1节)。
    • 五段管线:Prompt Ingestion Layer、Memory Context Handler、Logic Execution Engine、Tool/Plugin Interface、Output Dispatcher(第2.9.1节)。

    生命周期与四阶段流程

    • 六阶段:Reconnaissance、Logic-Layer Injection、Trigger Execution、Persistence or Reuse、Evasion and Obfuscation、Trace Tampering(第2.2.1节)。Table 1为每阶段列出风险,包括结构泄露、逻辑覆盖、权限提升、重放、编码绕过和审计痕迹被改。
    • 四阶段:Injection、Storage、Trigger、Execution。第2.4与第2.5节都写这一流程;第2.5节写触发可以来自关键词、角色上下文、工具输出或时间事件。
    • 对应关系:Table 2把Injection对到侦察和逻辑注入,Storage对到持久化或重用,Trigger对到触发执行,Execution对到逻辑注入、规避和痕迹篡改。

    四类机制

    • Tool Poisoning(AV-1):在MCP中投放仿冒合法工具的恶意工具。作者列出的条件是缺少真实性校验、重复工具难以区分、默认信任、描述性声明无法核验。
    • LPCI Core(AV-2):在记忆中放入持久、混淆、按条件触发的指令。作者列出的条件是无记忆完整性检查、盲信历史上下文、编码混淆、延迟执行。
    • Role Override via Memory Entrenchment(AV-3):把改写后的角色指令固进持久记忆。作者列出的条件是角色锚点可变、信任序列化记忆、提示内声明角色、检测不到角色漂移。
    • Vector Store Payload Persistence(AV-4):把指令嵌进RAG会检索的已索引文档。作者列出的条件是盲信检索内容、索引时不扫描载荷、上下文放大、用嵌入混淆隐蔽。

    攻击面映射

    • Table 4:Memory Context Handler对AV-3,Logic Execution Engine对AV-2,Tool/Plugin Interface对AV-1,Output Dispatcher对AV-4。Prompt Ingestion Layer未出现在该表。

    提议的运行时控制

    • Prompt Risk Scoring:针对AV-2、AV-3。对实时提示和从记忆重放的提示做启发式评分,检查编码、角色覆盖和触发式函数,再按分数升级或拒绝。论文未给分数阈值。
    • Multi-Stage Validation Pipeline:针对AV-2、AV-3。Stage 1用正则过滤已知触发标记;Stage 2用LLM或启发式分类器看隐藏控制逻辑;Stage 3在组装最终提示前检查被召回记忆中的角色断言和潜伏触发。论文未写分类器模型名。
    • Escalation Router:针对AV-2、AV-3。高风险上下文离开自主执行,可进沙箱或人工队列。论文未写风险画像的定量阈值。
    • 证明、净化与记忆链:密码学工具与数据源证明主要针对AV-1,也用于AV-4,要求工具schema、元数据和端点URI签名,检索时核验索引清单。RAG摄入管道针对AV-4,用正则、语义分析和LLM检查器;正文举例把命令式内容标为risk_score: 0.85,并用标记隔离检索内容。Memory Integrity and Attribution Chaining针对AV-2、AV-3,条目含时间戳、不可变作者身份和前一条哈希;用户记忆不能冒充系统角色。
    • 状态:第5节写这些组件属于开发中的内部框架,并对测试套件做过回顾评估。评估数字放在第4问。
  4. 论文做了哪些实验?

    Table 6里Gemini-2.5-pro执行率70.83%,ChatGPT拦截率84.94%。

    实验设置

    • 被测系统:结构化测试为ChatGPT、Claude、LLaMA3、Gemini-2.5-pro、Mixtral-8x7b。探索性演示另有Poe、Grok、Bohrium,并再次写到Claude。除名称里的Gemini-2.5-pro与Mixtral-8x7b外,论文未写版本。
    • 规模与时间:论文写1,700条结构化用例,测试于2025-06-24结束。Table 6分平台总数为Gemini-2.5-pro 96、Claude 400、LLaMA3 400、ChatGPT 405、Mixtral 8x7b 400。论文未解释分平台条数差异,也未解释与1,700的关系。
    • 协议:第4节写各模型使用同一协议:Base64与十六进制编码载荷、延迟触发、记忆角色覆盖、向量库载荷持久化、插件场景中的工具投毒。论文未报告各向量条数。
    • 指标:Blocked为拒绝处理或执行;Executed为提示被处理且逻辑被运行;Warning为含糊或部分安全;Vulnerability Exposed为已执行并导致可观察的安全相关动作;Pass Rate为被拦截或安全处理且未触发漏洞;Fail Rate为成功执行潜在不安全或未授权逻辑(第4.1节)。
    • 判定:论文未说明由规则、人工还是模型判定,未写评审模型、阈值、重复次数或查询预算。
    • 基线:无对照攻击方法,无对照模型。

    主结果

    据Table 6。五行的Vulnerability Exposed和Fail Rate百分比都等于执行率。表头写作Mixtral 8x7b。

    表格较宽,可左右滑动

    平台测试数拦截执行警告
    Gemini-2.5-pro962.08%70.83%27.08%
    Claude40020.75%31.50%47.75%
    LLaMA34000.50%49.00%50.50%
    ChatGPT40584.94%15.06%0.00%
    Mixtral-8x7b4004.00%48.75%47.25%
    • 作者解读:作者称ChatGPT拦截最多,并归因于模式过滤、记忆分段和角色校验;论文未给出这三项的单独测量。作者称LLaMA3与Mixtral-8x7b对逻辑注入和持久记忆载荷更易执行。
    • 与正文不一致:第4.2节写Gemini-2.5-pro拦截率0.5%;Table 6中0.50%在LLaMA3列,Gemini-2.5-pro列是2.08%。摘要写执行率up to 49%;Table 6执行率最高为Gemini-2.5-pro的70.83%。讨论写LLaMA3与Mixtral执行了近一半的405条载荷;Table 6中这两平台各400条。
    • 通过率口径:Gemini-2.5-pro、Claude、LLaMA3的Pass Rate等于拦截加警告,分别为29.17%、68.50%、51.00%。ChatGPT警告为0,Pass Rate等于拦截率。Mixtral 8x7b的Pass Rate为16(4.00%),等于拦截数,未计入警告189(47.25%)。

    探索性演示

    • 测了什么:第2.7.2节在Poe、Claude、Grok、Bohrium上做定向演示,无成功率或样本量。此处Claude的结果与Table 6分开。
    • 结果:作者称Poe经跨会话记忆固化触发了审批类逻辑;Claude用混淆提示完成角色覆盖;Grok从RAG中被投毒的向量文档取出并执行注入逻辑;Bohrium处理了会话记忆中的编码载荷。
    • 作者解读:作者称这些演示说明问题不只有结构化测试里的构造。论文未给定量比较。

    提议控制的回顾评估

    • 测了什么:第5节写所提机制对照LPCI测试套件做回顾评估,对象是使用编码、延迟触发和嵌入记忆载荷的提示层逻辑攻击。
    • 结果:作者报告有效拦截率84.94%。该数字与Table 6中ChatGPT的拦截率相同。论文未说明所用模型、样本、是否计入警告,以及各控制的单独贡献。
    • 发布:作者写组件属于开发中的内部框架,QSAF定于未来发表。

    其他消融与分析

    • 论文未报告消融、参数扫描,也未报告四类向量各自的成功率。
    • Figure 1图注为五平台Blocked、Executed、Warning的分组分布;正文未给出图上额外数字。
    • Figure 2图注写汇总失败率43%,第4.4节称43%的用例执行了不安全逻辑;论文未说明43%如何由Table 6汇总。
    • 第4.3节点名Gemini #12、Claude #44、LLaMA3 #88、Mixtral #195、ChatGPT #61,类型分别为延迟编码载荷执行、向量数据导致的角色配置泄露、记忆中逻辑执行、先前会话的工具命令被激活、角色提升后提示仍被执行。不转述载荷。
    • Table 6注把部分结果标为strong security performance或critical vulnerabilities;颜色在所给文本中不可见。
    • ChatGPT仍有执行结果;第4.3节的#61即角色提升案例。
  5. 有什么可以进一步探索的点?

    作者写的局限是公开平台、2025年6月快照,以及只测可演示的攻击向量。

    作者指出的局限与后续方向

    • 平台范围:测试集中于公开可访问的LLM平台;作者认为企业专用或定制实现的漏洞画像可能不同(第6.2节)。
    • 时间截面:作者称防护持续变化,结果是截至2025年6月的快照(第6.2节)。测试结束日写为2025-06-24(第4节)。
    • 攻击复杂度:作者写只关注可演示向量,并认为国家级或高级持续威胁行为体可能做出更复杂的LPCI变体(第6.2节)。
    • 自动检测:后续方向包括用异常检测和行为分析做自动LPCI检测(第6.2节)。
    • 飞地与验证:后续包括用硬件安全飞地保护记忆完整性,以及对LLM逻辑执行路径做形式化验证(第6.2节)。
    • 系统形态:后续包括分析多智能体系统和联邦学习环境中的LPCI(第6.2节)。

    实验覆盖范围

    • 结构化测试平台为ChatGPT、Claude、LLaMA3、Gemini-2.5-pro、Mixtral-8x7b;Table 6条数分别为405、400、400、96、400。论文另写总计1,700,结束于2025-06-24。
    • 探索性演示写了Poe、Claude、Grok、Bohrium的定性结果,无分平台成功率(第2.7.2节)。
    • 协议包含Tool Poisoning、LPCI Core、Role Override、Vector Store Payload Persistence,以及Base64、十六进制、延迟触发和插件场景;论文未报告分向量条数或成功率。
    • 论文未报告攻击辅助模型、迭代预算、查询次数、重复次数、评审模型,以及评审与人工的一致性。
    • 第5节对所提控制给出一句回顾评估,有效拦截率84.94%;论文未报告各控制的单独结果。作者写QSAF定于未来发表。
  6. 总结一下论文的主要内容

    作者定义LPCI;Table 6中Gemini-2.5-pro执行率70.83%,ChatGPT拦截率84.94%。

    作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。

    • 问题:会话记忆、向量库和工具输出会被重新放进上下文并默认信任。作者称编码、可延迟、按条件触发的载荷因此能越过以提示审核为主的防护。
    • 做法:生命周期分侦察、逻辑注入、触发、持久化、规避和痕迹篡改;操作流分注入、存储、触发、执行。机制为工具投毒、记忆内延迟指令、角色固化和向量库载荷。另提议风险评分、三级校验、升级路由、签名证明、RAG净化和记忆哈希链。QSAF写为未来发表。
    • 主结果:Table 6中,Gemini-2.5-pro执行率70.83%(96条,拦截2.08%),LLaMA3为49.00%(拦截0.50%),Mixtral-8x7b为48.75%(拦截4.00%),Claude为31.50%(拦截20.75%),ChatGPT为15.06%(拦截84.94%,405条)。摘要的up to 49%,以及第4.2节把0.5%拦截率归于Gemini的说法,与Table 6不一致。
    • 其他结果:Poe、Grok、Bohrium只有定性描述。Figure 2图注写总体失败率43%,汇总方式未说明。回顾评估写拦截率84.94%,与ChatGPT在Table 6的拦截率相同,协议未说明。
    • 作者结论:作者称LPCI可复现且跨平台,常规安全措施已过时,需要运行时逻辑分析、记忆召回校验和下游控制流监测。第6.2节把证据范围写成公开平台、2025年6月快照和可演示向量。
阅读原文arxiv.org