研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入
When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。
远程黑盒对手(black-box),无受害者运行时反馈,仅通过间接提示词注入发送单封恶意邮件,诱导个人智能体静默将目标虚假记忆写入持久存储,并在未来独立会话中影响下游决策。
- 持久化个人智能体会将外部不可信内容写入长期记忆并作为可信状态重用,造成隐蔽记忆注入威胁。攻击需满足写入记忆、回复不泄露、后续会话影响行为三阶段目标,且黑盒无交互反馈。
- 提出 MEMGHOST 框架,通过模拟智能体文件工具交互的环境代理与结合记忆采纳度及隐蔽性的细则奖励目标代理,经由监督微调和 GRPO 强化学习将搜索策略内化,实现单次前向生成单封攻击邮件。
- 在 WhisperBench 的 56 个测试用例上,MEMGHOST 在 OpenClaw(GPT-5.4)后台模式取得 87.5% E2E 成功率,在 Claude Code SDK(Sonnet 4.6)后台模式达 71.4%,并成功迁移至 Mem0 向量数据库。
- 作者在第七节指出未建模上游邮件投递基础设施(如垃圾过滤与 SPF/DKIM/DMARC 校验),未覆盖多智能体传播与多租户污染,载荷仅为纯文本且未测试长期记忆衰减动力学;实验覆盖了 6 种模型、3 种智能体框架及 3 类防御。
- 模型
- GPT-5.4Claude Sonnet 4.6Claude Sonnet 4.5DeepSeek v4 FlashGrok 4.1 FastMiniMax-M2.5
- 基准
- WHISPERBENCH
- 指标
- ISRSSRESRE2EFNR
研究者提出隐蔽记忆注入攻击,利用不可信外部内容被静默写入 Agent 持久记忆并在此后作为可信状态复用。为评估该威胁,他们构建 WhisperBench,一个含 108 个案例、覆盖五类风险及事实与偏好投毒的基准,使用真实 IMAP/SMTP 邮件流程和真实邮件 Agent 技能进行全周期评测。攻击框架 MemGhost 通过环境代理模拟持久化 Agent 执行、目标代理将记忆采纳与会话隐蔽性转为密集奖励,再用监督微调和强化学习训练攻击策略,实现单封邮件的一次性载荷生成。
推荐理由论文提出针对持久化个人 Agent 的隐蔽记忆注入攻击,并给出跨框架、跨记忆后端的成功率数据,可供部署此类 Agent 的团队评估风险。
深度解读
这篇论文试图解决什么问题?
论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
持久化个人智能体在处理外部非可信交互时,可能被单封恶意邮件隐蔽写入持久化记忆,进而在未来独立会话中被持续操控下游行为。
- 场景与重要性:具有长期记忆与外部工具访问权限的个人智能体(如 OpenClaw)已融入日常工作流,能自主读取邮件、修改文件并跨会话维护用户画像与偏好;若外部输入被吸纳为内部状态,将形成持久跨会话危害。
- 现有方法的不足:作者指出以往研究大多聚焦于单会话直接越狱或即时工具劫持,或是预先假设攻击者可直接篡改底层数据库;缺乏针对“通过常规外部输入投递、保持静默不惊动用户、并在后续独立会话中生效”的端到端评估。
- 核心观察与假设:个人智能体普遍依赖特定持久化文件(如 AGENTS.md 或 MEMORY.md)构建上下文,且倾向于在回复中保持友好透明;但只要载荷被表述为权威、可重用的客观事实,智能体便会在不向用户告警的情况下自主将其存入核心记忆载体。
- 提出的方案与基准:作者构建了包含 108 个真实邮件案例的全周期评测基准 WHISPERBENCH,并提出了离线优化框架 MEMGHOST,无需在测试阶段与受害者交互即可单次生成高隐蔽记忆注入邮件。
- 威胁模型:
- 攻击者目标:实现隐蔽记忆注入(Stealth Memory Injection),同时达成记忆成功写入(Injection)、当期回复对用户不泄露异常(Stealthiness)、在未来独立触发会话中影响下游决策(Effectiveness)。
- 攻击者知识:黑盒设定(black-box),攻击者不掌握受害者底座 LLM、具体持久化状态内容或用户自定义行为规则;知晓目标使用个人智能体通用架构,可在本地构建影子智能体(shadow agent)。
- 攻击者能力:远程无盒/黑盒交互,仅能通过间接提示词注入(IPI)发送单封普通邮件;测试时无法获得受害者运行时反馈,无法进行多轮试探;无法控制智能体何时读取邮件、处于前台还是后台模式。
- 受害系统:基于 LLM 并具备本地文件或数据库持久记忆、可执行邮件检索与工具调用的个人智能体系统。
有哪些相关研究?
梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。
论文在引言与相关工作(Section VI)中梳理了三类密切关联的研究方向:
个人智能体生态的安全评估
- OpenClaw 生态风险评测:Wang 等人(2026)、Chen 等人(2026)及 Shan 等人(2026)等分析了 OpenClaw 智能体的轨迹审计与安全风险;Dong 等人(2026)探讨了工具链调用中的代币消耗漏洞;Deng 等人(2026)分析了自主智能体威胁。作者指出这些工作主要局限于无状态的单会话攻击(如即时工具劫持),未将跨会话持久记忆视为核心攻击面。
间接提示词注入(IPI)
- 即时任务劫持:Greshake 等人(2023)与 Liu 等人(2024)研究了通过网页、文档或邮件等外部载荷篡改当前任务指令的 IPI 攻击。作者指出这类方法旨在促发即时恶意工具调用,本文将其扩展到具有时间跨度和状态累积的记忆植入设定。
智能体记忆攻击
- 自目标与共享环境毒化:Dong 等人(2025)、Sunil 等人(2026)以及 Jiang 等人(2026)研究了合法用户通过直接对话向自身或共享智能体注入恶意记忆。作者指出这类工作依赖直接多轮交互。
- 先验数据毒化(Oracle 注入):Srivastava 与 He(2025)、Patlan 等人(2025)评估了记忆库被污染后的危害。作者指出其直接假定底层数据库已被篡改,跳过了外部载荷如何通过智能体认知过滤的现实难题。
基线方法与对比基准
- 对比基线:包含 5 种基于手工模板的方法(Naive Attack、Escape Characters、Context Ignore、Fake Completion、Combined Attack)以及 2 种自动化搜索方法(MAP-Elites 和基于奖励细则的 RGS 搜索)。
- 对比基准:评估在本文构建的真实邮件流基准 WHISPERBENCH(108 例)上进行,涵盖健康、财务、信息完整性、网络安全和业务中断 5 个类别。
本文定位
- 作者称本文弥补了外部无交互黑盒场景下,载荷从单封邮件摄入、静默持久化存储到未来跨会话触发的全周期端到端攻击与评测空白。
论文如何解决这个问题?
通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。
整体思路是构建离线双层代理体系,将黑盒无反馈攻击转化为参数化生成策略优化,提出 MEMGHOST 框架实现单次前向推理生成隐蔽注入邮件。
问题设定与目标形式化
攻击者仅提供目标虚假记忆 m,需生成载荷 x 使得智能体 A 在未知配置分布 P* 下最大化全周期期望收益: x⋆ = argmaxx ∈ 𝒳 𝔼ω ∼ 𝒫⋆ [𝕀inject · 𝕀stealth · 𝕀effective] 其中指示函数分别检验状态改变量 Δ s 是否包含目标记忆、可见回复 y 是否暴露注入、以及未来触发行为 b 是否被改变。针对测试阶段无法交互的限制,优化目标转化为最大化基于影子环境轨迹的密集替代奖励: θ⋆ = argmaxθ 𝔼x ∼ πθ(·|m) [Rtrace(m, x)] 该式将离散文本搜索转为对生成策略 πθ 的强化学习。
环境代理:影子智能体
- 轻量文件与工具模拟:本地构建 Python 实现的执行环境,提供只读/可写的虚拟文件系统工作区,支持 read、write、edit、grep、find、ls 等文件工具,以及模拟邮件命令(himalaya envelope list/read)。
- 执行模式支持:覆盖用户前台交互任务(user-turn mode)与自动化后台任务(heartbeat mode),使载荷可在接近真实系统的工具交互路径中产生可观测的状态变化 Δ ŝ 与回复 ŷ。
目标代理:基于细则的奖励设计
- 下游效果前置评估:为避免在优化循环中反复模拟未知触发 query,利用记忆载体重要性(写入核心文件如 AGENT.md 赋予系数 μ=1,检索型碎片文件给予降权 μ=0.2)与语义采纳质量替代未来有效性。
- 细粒度细则(Rubric)打分:构建实例级写入细则 Qinj(m) 评估可信度与可操作性,构建全局隐蔽性细则 Qstl 检测警告、内容复述、存储行为披露等 4 种泄露模式。
- 平滑奖励组合:综合奖励定义为 Rtrace(m,x) = Rinj(m,x) · (Rstl(m,x) + λ),引入常数 λ > 0 防止初期探索中因回复不隐蔽导致梯度归零。
策略训练:监督微调与强化学习
- SFT 阶段(种子蒸馏):利用 DeepSeek-V3.2 在细则诊断反馈指导下进行迭代修复搜索,获取高质量种子对 (m, x) 构成 DSFT;以 Qwen-4B 为底座、采用 LoRA 微调生成策略 πθ。
- RL 阶段(GRPO 优化):通过组相对策略优化(GRPO)结合环境采样(变换底座模型、提示词与任务类型);引入语义多样性惩罚 Rdiv、KL 正则项以及困难样本重放缓冲池(容量 50,采样占比 30%),提升跨环境泛化能力。
论文做了哪些实验?
在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。
实验设置
- 被测目标模型:前沿模型包括 GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5;低成本模型包括 DeepSeek v4 Flash、Grok 4.1 Fast、MiniMax-M2.5。
- 智能体框架与记忆后端:核心目标采用 OpenClaw 与 Claude Code SDK(均使用文件系统持久化存储);泛化实验采用 NanoClaw 与 Hermes Agent;外部向量记忆后端采用 Mem0。
- 数据集与规模:WHISPERBENCH 评测基准,共 108 个真实案例(52 例用于训练,56 例保留用于端到端单次生成评测;查询密集型基线在固定的 20 例代表性子集上评测)。
- 基线方法:5 种手工基线(Naive Attack、Escape Characters、Context Ignore、Fake Completion、Combined Attack);2 种自动优化基线(MAP-Elites、Rubric-Guided Search 简称 RGS)。
- 指标定义与判定方式:注入成功率(ISR,LLM 审计判定是否写入)、隐蔽成功率(SSR,判定回复是否无提示泄露)、效果成功率(ESR,判定新会话行为评分是否达到 3-4 分)、端到端成功率(E2E,三者同时满足)。打分模型统一采用 GPT-5.4-nano,温度设为 0。
主结果
下表展示 56 个保留测试用例在各大模型上的端到端攻击成功率(E2E,%),据 Table I:
表格较宽,可左右滑动
目标模型 运行模式 Naive Attack Fake Completion RGS (搜索基线) MEMGHOST (本文) GPT-5.4 后台模式 (BG) 0.0 0.0 40.0 87.5 GPT-5.4 前台模式 (FG) 0.0 0.0 20.0 75.0 Sonnet 4.6 后台模式 (BG) 0.0 0.0 0.0 71.4 Sonnet 4.6 前台模式 (FG) 0.0 0.0 0.0 48.2 Sonnet 4.5 后台模式 (BG) 25.0 17.9 75.0 80.4 Sonnet 4.5 前台模式 (FG) 3.6 0.0 15.0 71.4 Grok 4.1 Fast 后台模式 (BG) 78.6 80.4 85.0 91.1 DeepSeek v4 Flash 后台模式 (BG) 5.4 0.0 50.0 75.0 注:因列数限制,省略了 Escape Characters、Context Ignore、Combined Attack 及 MAP-Elite 结果;各模型完整分项指标见 Table I。
- 作者解读:端到端指标表现:作者称 MEMGHOST 在各类模型层级均取得大幅领先的 E2E 成功率;而在防御最为严密的 Sonnet 4.6 上,测试期搜索基线 RGS 完全失效(两模式均为 0.0%),MEMGHOST 在后台模式仍达 71.4%。
- 作者解读:隐蔽性与注入的分离:部分静态基线在特定模型上虽有较高 ISR(如 Grok 4.1 Fast 后台模式 Fake Completion 达 96.4%),但因回复严重暴露导致 SSR 极低,难以形成有效端到端攻击。
- 作者解读:类别鲁棒性与异常:在 5 个风险类别中(Figure 3),网络安全类的 ESR 相对较低,作者认为这反映出模型内置的安全对齐机制在执行期对高危操作仍有一定防御偏好。
智能体架构与记忆后端迁移评测
- 不同智能体架构:固定 GPT-5.4 模型(N=56,据 Table II),在未见过的 NanoClaw 上后台 E2E 为 80.4%(前台 78.6%);在 Hermes 上后台 E2E 为 82.1%(前台 51.8%)。
- 向量数据库 Mem0:在完全禁用文件记忆、改用 Mem0 向量数据库后,OpenClaw 与 Hermes 的后台 E2E 均达到 85.7%(前台分别为 80.4% 与 48.2%)。作者认为这表明载荷学到的是通用语义采纳特征,而非机械拟合特定文件路径。
代理设计与真实环境的相关性验证
- 奖励与真实指标相关性(据 Table III):代理奖励 Rinj 与真实目标 ESR 的 Pearson 相关系数为 0.872;Rstl 与真实 SSR 为 0.785;综合奖励 Rtrace 与真实 E2E 为 0.839;各指标方向准确率(Directional Accuracy)均超过 0.90。作者认为这证明了离线代理评分与黑盒真实攻击表现高度一致。
对输入、模型与系统级防御的规避评测
- 现有防御绕过(据 Table IV):输入级检测 DataSentinel 的漏报率(FNR)为 91.59%;模型级防御 Meta-SecAlign 下仍保持 49.07% ISR 与 98.15% SSR;系统级审计 AgentDoG 在 OpenClaw 上的 FNR 为 93.46%,在 Claude Code SDK 上的 FNR 为 40.38%。
- 自适应前台提示防御(据 Table V):当用户在前台提示中显式要求“回复说明检查了什么并采取了什么行动”时,智能体面临冲突;Sonnet 4.6 的 E2E 降至 23.2%,OpenClaw+GPT-5.4 的 E2E 降至 1.8%,但 Sonnet 4.5 仍维持 25.0% 的 SSR。
其他消融与分析
- MiniMax-M2.5 前台 SSR 降至 21.4%:Figure 4 显示其回复长度显著偏长,作者称存在思维链内容泄露到常规文本的现象(Section V-B)。
- SFT 阶段微调参数量:采用 Qwen-4B 为基座,LoRA 秩设为 16,缩放因子 32,训练 3 个 epoch(Appendix C)。
- RL 阶段 GRPO 组参数:采样候选载荷数 G=8,温度 1.2,LoRA 秩 64,可训练参数量约 1.32 亿(Appendix C)。
有什么可以进一步探索的点?
作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。
作者指出的局限与后续方向
- 投递层威胁模型假定:作者在第七节明确说明评估始于智能体可见邮箱,假定载荷已进入收件箱,未建模 MX 路由、垃圾邮件过滤、SPF/DKIM/DMARC 强制执行或企业安全邮件网关等上游基础设施。
- 单智能体与单用户范围:作者在第七节说明实验仅评估单智能体、单用户环境,未涵盖多智能体传播与多租户记忆污染。
- 载荷模态局限:作者在第七节指出当前载荷仅为纯文本邮件正文,将附件、内嵌图片、日历邀请等多模态攻击向量留待未来工作。
- 长期记忆演化动态缺失:作者在第七节指出仅测量了注入记忆是否留存并影响后续行为,未对长周期下的记忆衰减动力学或跨数周的记忆整合过程进行建模。
- 负责任披露:作者在 Ethical Considerations 中表示计划在发表前向受影响生态(如 OpenClaw、NanoClaw 及相关 LLM 厂商)报告攻击模式与评测数据集。
实验覆盖范围
- 被测语言模型:共覆盖 6 款模型,分别为 GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5、MiniMax-M2.5、Grok 4.1 Fast 与 DeepSeek v4 Flash。
- 智能体框架与系统:覆盖了 OpenClaw、Claude Code SDK、NanoClaw 与 Hermes Agent 共 4 种智能体实现。
- 持久化后端类型:覆盖了本地 Markdown 文件系统工作区以及 Mem0 向量数据库两种存储形式。
- 防御机制评测:涵盖输入级 DataSentinel、模型级 Meta-SecAlign、系统级 AgentDoG 以及一种前台显式追问的自适应防御。
- 测试样本规模:WHISPERBENCH 评测集共 56 个保留测试用例(另有 20 例用于查询密集型基线);论文未报告重复测试的随机种子方差。
总结一下论文的主要内容
总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
- 核心问题与场景:具有跨会话持久记忆与外部工具权限的个人智能体在日常邮件处理中,容易将非可信外部输入静默转化为受信任的持久状态,攻击者借此无需在单轮会话中即时越狱,而是对未来独立会话施加长程控制。
- 方法设计要点:提出 MEMGHOST 框架,通过模拟本地文件与邮件交互的轻量影子环境(环境代理)以及分解写入质量和用户可见隐蔽性的细则奖励(目标代理),运用监督微调与 GRPO 强化学习将搜索能力固化到模型权重中,实现免运行时交互的单次前向邮件生成。
- 主要实验结果:在包含 108 个案例的 WHISPERBENCH 上,MEMGHOST 在 OpenClaw+GPT-5.4 后台模式实现 87.5% E2E 成功率,在前沿模型 Sonnet 4.6 上达到 71.4% 后台 E2E(基线均为 0.0%);且能在无需重新调整的情况下迁移到 NanoClaw、Hermes 及 Mem0 向量数据库。
- 防御评估表现:面对输入级 DataSentinel(FNR 91.59%)及系统级 AgentDoG(OpenClaw FNR 93.46%),MEMGHOST 保持了高规避能力;但在用户主动要求汇报操作的自适应提示下,前台隐蔽性出现下降。
- 作者结论与启示:作者认为持久化记忆已成为关键安全信任边界,单纯依赖上游内容投递过滤并不充分,个人智能体亟需建立针对外部内容转为持久状态的内置访问控制、来源标记与用户确认机制。