PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击
When Malicious Instructions Persist: Persistent Memory Poisoning Attack on Harness-Based Agents
AI 导读
研究者提出 PMPA,一种针对基于 harness 的智能体的持久记忆投毒攻击,攻击者只需在外部来源中嵌入恶意指令,无需直接访问智能体框架。注入阶段把载荷藏在文本、图片或 PDF 的良性问答内容中,诱导智能体将其写入持久记忆;触发阶段在新会话中检索该记忆,在完成正常任务的同时执行额外动作造成隐私泄露。在 OpenClaw 与 Claude Code 上,以 DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max 为底座模型,平均注入成功率与跨会话攻击成功率为 73.7%/55.5% 和 66.9%/81.7%,同时良性任务表现保持在 80% 以上。纯文本模态攻击效果最强,OpenClaw 上注入成功率接近 100%;日历场景跨会话成功率最高,达 96.7% 和 87.8%。
论文速读
- 基于 harness 的 LLM agent(如 OpenClaw、Claude Code)把外部来源内容写入持久记忆,恶意指令可能跨会话留存并触发隐私泄露。作者指出,攻击者能否在不直接接触 agent 框架的情况下把外部来源中的恶意指令写进持久记忆,此前研究不足。
- 提出 PMPA 两阶段攻击:注入阶段把恶意指令嵌入文本、图片或 PDF 等良性外部来源,诱导 agent 在无关问答任务中将其写入持久记忆;触发阶段在新会话中由良性工作区任务(邮件、日历、共享文档、表单)检索到该规则,触发额外动作造成隐私泄露。攻击载荷含过渡句、记忆写入指令和条件恶意规则,并考察注入位置与语言风格。
- 在 OpenClaw 与 Claude Code 上、三种 backbone LLM 下评测:平均 ISR/C-ASR 为 OpenClaw 73.7%/55.5%、Claude Code 66.9%/81.7%,同时良性任务 Utility 保持较高。纯文本模态攻击效果最强,图片和 PDF 较弱但仍可注入;四类场景均可造成泄露,日历场景跨会话成功率最高。多次良性交互后 C-ASR 未见一致衰减。sandwich 式提示防御能降低注入和同会话攻击,但记忆已被污染后对跨会话攻击保护有限。
- 作者称未来将在更广设置和更多 backbone 模型上评测 PMPA,并探索更有效的针对持久记忆投毒与隐私泄露的防御方法。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出跨会话记忆投毒在 Claude Code 与 OpenClaw 上的分项成功率,并显示提示层防御对已污染记忆几乎无效。