跳到正文
原文
论文追踪· arXiv:2606.04329· Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang·本站收录 · 原文发表 精选关注度53

研究者系统研究 LLM 智能体记忆投毒攻击并提出 MPBench 基准

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

作者评测发现,GPT-OSS-120B在HERMES上平均ASR达66.67%、RSR达64.70%(Table 2)。

威胁模型黑盒威胁模型(black-box threat model):外部攻击者无特权访问权限,不能读取或直接修改智能体记忆,不能修改系统提示词或策略,不能冒充用户或注入用户通道,不能观察内部推理与状态;仅通过网页、文档、邮件、工具输出等外部输入注入内容,无底层模型与记忆库先验知识。

问题
智能体持久化长效记忆容易受到记忆投毒攻击,攻击者通过不可信外部输入诱导智能体写入恶意记忆,即可在未来会话中持续影响智能体行为。但现有研究缺乏系统性脆弱性分析,且传统提示注入防御难以应对该威胁。
方法
作者在黑盒威胁模型下提炼出4条记忆写入渠道与3个层面的9个结构性脆弱点,划分出6类记忆投毒攻击;并构建包含3,240个测试用例的双阶段评测基准MPBench,分别测量记忆写入阶段与跨会话检索阶段。
实验与结果
GPT-OSS-120B在HERMES上的平均ASR达66.67%、RSR达64.70%,高于OpenClaw的34.25%与17.40%(Table 2)。现有提示注入防御在弱信号攻击上的检测率出现下滑(Table 4)。
局限与可以继续做的
实验仅评估了GPT-OSS-120B单个模型;部分域通过标注上下文块模拟输入,未建模真实部署的工具调用流程;评测覆盖OpenClaw和HERMES两款智能体及四种提示注入防御。
实验设置Meta-Llama-3.1-70B-Instruct、Deberta-v3-base 等 · MPBench · ASR、RSR 等
被测模型
Meta-Llama-3.1-70B-InstructDeberta-v3-baseLlama-3.1-8B-InstructXLM-RoBERTa-baseLlama-3.1-70B-Instruct
基准
MPBench
指标
ASRRSRTPRFPR
AI 导读和推荐理由研究者系统研究了基于 LLM 的智能体中的记忆投毒攻击,提出四类记忆写入通道、九项结构性漏洞与六类攻击分类,并发布 MPBench 基准。在 OpenClaw 与 HERMES 两个智能体系统上,攻击平均 ASR 为 50.46%、RSR 为 41.05%,其中 HERMES 平均 ASR 66.67% 明显高于 OpenClaw 的 34.25%。研究表明读写记忆越激进的智能体越容易被投毒,且 PIGuard、DataFilter、CommandSans、PromptArmor 四种提示注入防御对记忆投毒覆盖不足,弱信号攻击的检测率尤其低。

研究者系统研究了基于 LLM 的智能体中的记忆投毒攻击,提出四类记忆写入通道、九项结构性漏洞与六类攻击分类,并发布 MPBench 基准。在 OpenClaw 与 HERMES 两个智能体系统上,攻击平均 ASR 为 50.46%、RSR 为 41.05%,其中 HERMES 平均 ASR 66.67% 明显高于 OpenClaw 的 34.25%。研究表明读写记忆越激进的智能体越容易被投毒,且 PIGuard、DataFilter、CommandSans、PromptArmor 四种提示注入防御对记忆投毒覆盖不足,弱信号攻击的检测率尤其低。

推荐理由论文系统梳理了智能体长期记忆的四条写入通道与九类结构性漏洞,并给出六类投毒攻击的基准测试结果,可据此评估自有智能体的记忆写入策略。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    研究持久化记忆智能体面临的记忆投毒脆弱性机理、攻击分类与跨会话评测基准缺失问题。

    这篇论文试图解决大语言模型智能体在持久化记忆机制下面临的记忆投毒攻击机理不明、攻击面缺乏系统分类以及评测基准缺失的问题。

    • 场景与重要性:现代智能体通过持久化长效记忆积累用户偏好与任务经验以支持长周期任务,但记忆内容来自网页、文档等不可信外部输入,且缺乏来源追踪机制,单次写入即可产生跨会话持续影响。
    • 现有方法的不足:作者称现有研究假设过强(如需要直接内存访问权限)或仅孤立评估狭窄攻击场景,缺乏统一的脆弱性分析,且默认提示注入防御能够覆盖记忆投毒的假设并不成立。
    • 核心观察与假设:提示注入与记忆投毒存在结构性差异,提示注入需要载荷在当前上下文中生效,而记忆投毒仅需一次成功写入即可在后续会话中被视为可信知识进行检索。
    • 论文的主要工作:作者识别出4条记忆写入渠道与9个结构性脆弱点,提出包含6类攻击的分类法,并构建首个区分写入与检索双阶段的评测基准MPBench。
    • 威胁模型:
      • 目标:使智能体在正常任务中触发记忆写入、控制所写入的对抗性内容,并在未来会话中触发该恶意条目的检索以操纵行为。
      • 知识:黑盒威胁模型(black-box threat model),攻击者无底层模型知识,无法获知记忆库内容,仅依赖黑盒交互与公开文档。
      • 能力:无特权访问权限,不能读取或直接修改记忆,不能修改系统提示词或策略,不能伪造用户或注入用户通道消息,仅能向智能体正常处理的外部环境数据(网页、文档、邮件、工具输出等)中注入载荷。
      • 受害系统:具备持久化记忆功能的大语言模型智能体(实验中为OpenClaw与HERMES)。
  2. 有哪些相关研究?

    梳理了智能体记忆、记忆投毒攻击及提示注入防御等研究,指出已有工作缺乏系统脆弱性分析与跨会话评测。

    相关研究主要涵盖智能体记忆架构、记忆投毒与真实安全事件、以及提示注入评测与防御技术。

    智能体记忆机制与评测

    • 长效记忆系统构建:Chhikara et al. (2025) 与 Kang et al. (2025) 研究了智能体记忆操作系统与可扩展长效记忆架构,Hu et al. (2025) 梳理了智能体的事实记忆、经验记忆和程序记忆分类。
    • 良性记忆性能基准:Maharana et al. (2024)(LoCoMo)、Wu et al. (2024)(LongMemEval)以及 Tan et al. (2025)(MemBench)评估了智能体在良性条件下的长效交互记忆保真度;作者指出这些基准缺乏对抗性组件。

    记忆投毒攻击与真实安全事件

    • 记忆投毒攻击研究:Dong et al. (2025)、Srivastava & He (2025)、Anonymous (2025)、Zou et al. (2026) 与 Xu et al. (2026) 在不同设定下展示了智能体记忆投毒;Chen et al. (2024) 提出了AgentPoison红队方法,但作者指出该工作做出了需要直接内存访问的强假设,限制了在真实部署中的适用性。
    • 实际系统中的安全事件:Rehberger (2025) 报告了Gemini系统的提示注入与延迟工具调用风险,Microsoft Defender Security Research Team (2026) 报告了Azure的推荐投毒,Palo Alto Networks Unit 42 (2025) 报告了Bedrock中利用间接提示注入投毒长效记忆的问题。

    提示注入基准与防御方法

    • 单会话安全基准:Debenedetti et al. (2024)(AgentDojo)与 Zhan et al. (2024)(InjecAgent)构建了动态工具与间接提示注入评测环境;作者指出其局限于单会话范式,未考量跨会话持久化影响。
    • 提示注入防御方案:Li et al. (2025) 提出了轻量防护工具 PIGuard,Wang et al. (2025) 提出了基于数据过滤的 DataFilter,Das et al. (2025) 提出了精准提示净化的 CommandSans,Shi et al. (2025) 提出了基于大模型的 PromptArmor。

    基线方法与对比设置

    • 防御对比基线:论文选取了 PIGuard、DataFilter、CommandSans 和 PromptArmor 四种代表不同缓解策略的提示注入防御作为对比基线,评估其在开箱即用与针对记忆投毒微调/适配后的表现。

    作者认为,现有威胁模型要么假设过强要么局限于孤立攻击,缺乏对导致这些攻击的智能体记忆脆弱性的统一分析,本文旨在从写入渠道与系统脆弱性出发建立系统化基石。

  3. 论文如何解决这个问题?

    形式化记忆系统并梳理4类渠道与9项脆弱点,提出6类攻击分类法并构建双阶段基准MPBench。

    作者通过系统化形式化智能体记忆架构,提炼4条写入渠道与9个跨层次脆弱点,建立包含强/弱信号维度的6类攻击分类法,并构建了双阶段评测基准 MPBench。

    记忆系统形式化与写入渠道

    智能体记忆系统形式化为元组 M = (S, W, R),其中 S 表示持久化记忆存储,W 表示将上下文映射为记忆更新的写入函数,R 表示将查询映射为存储条目子集的检索函数。记忆写入分为直接写入与推理写入两类路径,具体通过4条渠道实现:

    • C1 显式指令执行写入:外部输入直接下达写入命令,智能体将其视为权威并无须额外推理直接执行,触发条件与写入权限均来自指令本身。
    • C2 系统提示词驱动写入:系统提示词包含常驻记忆策略,智能体在任务执行中评估输入内容是否符合策略后执行推理写入。
    • C3 压缩驱动写入:在上下文窗口达到上限或会话终止等系统事件触发时,智能体根据压缩提示词整合历史信息并总结写入。
    • C4 经验向程序转换写入:智能体在识别出新工作流、错误恢复、用户纠错或任务完成等结构信号后,将完整任务执行轨迹合成为可复用技能存入程序记忆。

    跨层次结构性脆弱点

    作者从模型能力、提示词设计和系统架构三个层面识别出9项漏洞:

    • 模型能力层面:包括无法从结构上区分指令与数据的指令-数据边界模糊(V-M1),以及多源上下文中无法可靠推断内容来源的来源归因失效(V-M2)。
    • 提示词设计层面:包括系统提示词仅给出宽泛保存标准的写入策略欠规范(V-P1),以及总结压缩时无来源区分的未过滤压缩(V-P2)。
    • 系统架构层面:包括写入前缺乏校验的无写入路径验证(V-S1)、多源数据混合处理的共享多源上下文(V-S2)、攻击者可通过控制长度触发的压缩触发器可操纵(V-S3)、程序记忆写入无审查的技能创建无验证(V-S4),以及自进化闭环中错误步骤被持续固化的自我改进放大效应(V-S5)。

    攻击形式化与六分类体系

    单次记忆投毒攻击被形式化为元组 P = (xadv, Ci, t),其中 x_adv 为通过渠道 C_i 注入的对抗载荷,t 为攻击者期望写入的目标指令。攻击划分为两大信号强度与六个具体类别:

    • 强信号攻击(Strong-signal):包含显式指令插入(利用祈使动词或用户偏好句式)、条件命令插入(预埋用户给出肯定答复后触发的条件指令)以及突显性驱动压缩投毒(Salience-Driven Compaction,通过词汇或语义重复使内容被压缩算法视作重点)。
    • 弱信号攻击(Weak-signal):包含策略合规事实注入(伪装成符合宽泛策略的世界事实或用户属性)、虚假先例插入(伪造包含任务描述、步骤和成功结果的历史经验日志)以及技能-程序插入(诱导智能体将对抗步骤泛化为可复用程序并进入自进化循环)。

    MPBench 基准构建与评测协议

    • 数据生成与验证:使用 Meta-Llama-3.1-70B-Instruct 依据固定模板生成,涵盖文件操作、网页浏览、邮件、日历管理、Slack、脚本代码执行与技能调用共7个领域,以及凭据窃取、数据外传、推荐投毒、绕过认证、未授权操作与信任劫持6类对抗目标;包含 3,240 个攻击用例与 2,997 个良性用例,均通过模式合规验证与人工抽检。
    • 双阶段测量协议:分为记忆写入与记忆检索两个独立阶段。写入阶段结束后由独立大模型裁判检查持久化存储是否写入目标指令;检索阶段在后续独立会话中由关联查询触发,并由大模型裁判评判智能体动作或输出是否反映了对抗指令。
  4. 论文做了哪些实验?

    评测表明更激进的记忆机制易受攻击性更高,且现有提示注入防御在弱信号攻击上出现检测率下滑。

    实验设置

    • 被测模型与智能体:被测智能体为 OpenClaw 与 HERMES,底层模型均为 GPT-OSS-120B,采用默认系统提示词与默认记忆配置;提示注入防御模型包括 Deberta-v3-base(86M)、Llama-3.1-8B-Instruct(8B)、XLM-RoBERTa-base(279M)和 Llama-3.1-70B-Instruct(70B)(Table 6)。
    • 数据集规模:评测基准为 MPBench,共 3,240 个攻击测试用例(显式指令插入、条件命令插入、突显性压缩投毒、策略合规事实注入、虚假先例插入各 600 例,技能-程序插入 240 例),良性用例 2,997 例(Table 7)。
    • 载荷投递模式:分为静态上下文模式与动态工具调用模式,两种模式下智能体对载荷的处理与判定逻辑一致。
    • 评测指标:攻击成功率(ASR,衡量写入持久化记忆的频率)、检索成功率(RSR,在 ASR 为真的测试用例上衡量后续会话行为受影响的频率)、真正率(TPR)与假正率(FPR)。
    • 评审方式:由独立大模型裁判分别对记忆写入与后续回复进行判定,并通过随机抽样的人工标注确认与人类判断一致。

    主结果

    主实验评估了六类攻击在 OpenClaw 和 HERMES 上的表现(据 Table 2):

    表格较宽,可左右滑动

    攻击类别信号强度OpenClaw ASR (%)OpenClaw RSR (%)HERMES ASR (%)HERMES RSR (%)
    Explicit Command InsertionStrong18.2544.2342.6786.33
    Conditional Command InsertionStrong67.8913.7976.0092.76
    Salience-Driven CompactionStrong45.1011.3185.1769.86
    Policy-Conformant Fact InjectionWeak8.335.9364.5042.12
    False Precedent InsertionWeak31.6711.7273.3335.45
    Skill-Procedure InsertionWeak未报告未报告58.3361.67
    平均值–34.2517.4066.6764.70

    注:OpenClaw 不支持 C4 写入渠道,故 Skill-Procedure Insertion 行在 OpenClaw 上标记为未报告(Table 2 原文以 † 标明不适用)。

    • 系统易受攻击性差异:作者报告 HERMES 的平均 ASR(66.67%)与平均 RSR(64.70%)均高于 OpenClaw(34.25% 与 17.40%),作者认为原因在于 HERMES 拥有更宽松的写入策略且压缩阈值更低(2200字符),且在会话启动时自动注入持久化快照而无需显式工具检索。
    • 信号强度与策略依赖:在 OpenClaw 上强信号攻击的 ASR 高于弱信号攻击(条件命令插入达 67.89%,事实注入仅 8.33%);而在 HERMES 上弱信号攻击(如事实注入 ASR 达 64.50%)与强信号差距缩小,作者认为宽松保留策略增加了推理写入成功率。
    • 跨会话持久性表现:两款智能体所有攻击类别的 RSR 均大于零,作者认为这表明记忆写入成功后,无需攻击者进一步介入即有非微不足道的概率持续操纵后续会话行为。

    现有提示注入防御的有效性评估

    • 测了什么:评测 PIGuard、DataFilter、CommandSans 和 PromptArmor 四种提示注入防御在开箱即用与重训练/适配后的 TPR 与 FPR(Table 3)。
    • 实验结果:开箱即用下,PromptArmor 的 TPR 为 67.67%、FPR 为 1.00%;DataFilter 的 TPR 为 23.00%、FPR 为 53.33%;微调或适配后,PIGuard 的 TPR 从 38.33% 升至 47.67%(FPR 为 5.33%),CommandSans 的 TPR 升至 61.00%(FPR 为 8.67%),而 PromptArmor 的 TPR 微降至 61.60%(FPR 为 2.67%)。
    • 作者的解读:作者称开箱即用下没有防御能兼顾高 TPR 与低 FPR;即使采用 70B 大模型作为护栏的 PromptArmor 也未能取得高检测率,且适配后未见增益,表明防御缺陷源自结构性差异而非模型容量或训练分布。

    防御在强弱信号攻击上的覆盖差异

    • 测了什么:测试四种防御在强信号与弱信号攻击上的检测率差异及降幅 Δ(Table 4)。
    • 实验结果:开箱即用下所有防御对弱信号攻击检测率均更低,PromptArmor 在强信号上检测率为 84.44%,在弱信号下降至 42.50%(下降 41.94 个百分点);重训练后 CommandSans 的差距为 29.49 个百分点(从 72.78% 降至 43.33%),PIGuard 差距缩小至 1.67 个百分点(强信号 48.33%、弱信号 46.66%)。
    • 作者的解读:作者认为提示注入防御无法检测在原始输入中缺乏语法异常且外观类似合法内容的弱信号对抗载荷,导致输入端检测存在结构性盲区。

    其他消融与分析

    • 压缩阈值影响:HERMES 的压缩阈值为 2200 字符,比 OpenClaw 更容易在对抗输入下被触发写入(第 4.2 节)。
    • 静态与动态投递对比:测试用例按静态上下文与动态工具调用划分,作者称处理逻辑与评估结果在两模式间一致(第 4.1.2 节)。
  5. 有什么可以进一步探索的点?

    作者指出了评估模型单一以及部分域采用上下文块模拟的局限,并提出了策略收紧、架构加固与写入后监控等防御方向。

    作者指出的局限与后续方向

    • 评估模型单一:实验在两款智能体上均使用单一模型 GPT-OSS-120B,不同模型可能表现出不同行为,ASR 与 RSR 可能存在差异(第 5 节)。
    • 载荷投递未建模真实工具调用管道:在邮件、Slack 和网页浏览等域中,基准将对抗载荷作为标注上下文块与用户查询一同提供,未建模真实部署中载荷到达所经由的工具调用与检索管道(第 5 节)。
    • 收紧记忆写入策略:作者指出收紧系统提示词中的记忆保留策略是第一道防线,需制定精确、限制范围的授权存储规则(第 5 节)。
    • 架构层记忆加固:作者提出在架构层面引入来源隔离、写入路径来源追踪以及区分可信与不可信内容的压缩过滤器(第 5 节)。
    • 写入后记忆监控:作者提出在写入后针对智能体授权行为原则进行监控,评估候选条目是否合规(第 5 节)。
    • 超出研究范围的威胁设定:作者指出具有特权访问权限(直接修改记忆、修改系统提示词或充当用户)、多用户共享记忆库、以及攻击者知晓底层模型的场景属于正交范畴,不在本研究覆盖范围内(第 3.1 节)。

    实验覆盖范围

    • 被测智能体系统为 OpenClaw 与 HERMES 两个系统,底层执行模型均为 GPT-OSS-120B。
    • 防御评测覆盖 PIGuard、DataFilter、CommandSans 和 PromptArmor 共 4 种提示注入防御。
    • 攻击评测覆盖 6 类攻击,测试用例共 3,240 个,良性评估样本共 2,997 个。
    • 任务评测覆盖文件操作、网页浏览、邮件、日历管理、Slack、代码执行与技能调用共 7 个领域。
    • 论文未报告针对其他商业模型或开源模型的泛化实验数据,未报告多次重复运行的方差或置信区间。
  6. 总结一下论文的主要内容

    系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了MPBench基准并指出提示注入防御的局限。
    • 定位:这是一项针对大语言模型智能体持久化记忆投毒攻击的系统性脆弱性分析与基准评测研究。
    • 核心问题:现代智能体依赖跨会话记忆,但外部不可信输入可能通过写入机制注入恶意内容并长期持久化,而现有研究缺乏系统漏洞分析且传统提示注入防护无法有效覆盖。
    • 方法要点:作者提出涵盖4条写入渠道、9项系统脆弱点与6类攻击的分类体系,并构建了涵盖3,240个攻击用例的双阶段基准MPBench,分离评估记忆写入与后续跨会话检索。
    • 主要实验发现:
      1. 在两款智能体系统上,GPT-OSS-120B在HERMES上的平均ASR达66.67%、平均RSR达64.70%,在OpenClaw上平均ASR为34.25%、平均RSR为17.40%(Table 2)。
      2. 弱信号攻击具有较强隐蔽性,在HERMES上策略合规事实注入的ASR达64.50%,且对现有防御构成规避(Table 2, Table 4)。
      3. 四种开箱即用提示注入防御无法兼顾高TPR与低FPR,适配后PromptArmor在弱信号攻击上的检测率仅为42.34%(Table 3, Table 4)。
    • 作者结论与启示:作者认为提升长周期任务性能的激进记忆设计(更频繁写入、自动检索)会成比例扩大投毒攻击面,揭示了记忆能力与安全性之间的内在冲突;有效的防御应从输入端过滤转向写入路径验证、溯源隔离与写入后行为监控。
阅读原文arxiv.org