跳到正文
原文
论文追踪· arXiv:2605.01970·本站收录 · 原文发表 精选关注度59

Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

Trojan Hippo Bench: A Dynamic Benchmark for Persistent Memory Attacks and Defenses in LLM Agents

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

论文提出 Trojan Hippo Bench,未防御时 Gemini 3.1 Pro 在 N=100 触发会话下 ASR 达 100%。

问题
智能体持久化记忆带来了跨会话个性化能力,但也引入了跨会话间接提示注入攻击面。现有研究缺乏在真实间接注入威胁模型和多种内存架构下系统评测持久化攻击与防御的动态基准。
方法
构建基于 OpenEvolve 的自适应红队搜索生成端到端黑盒攻击,并提出按 7 种用户流程拆解的效用分析,在 4 种持久化内存后端上评测攻击与 4 种内存层防御。
实验与结果
未防御时 Gemini 3.1 Pro 和 GPT-5-mini 在 100 次良性会话后 ASR 最高达 100% 与 85%;IFC 防御将 ASR 降至 0% 但使 HM 效用归零。
局限与可以继续做的
IFC 假设完全污点传播,未覆盖数据洗白与隐蔽信道;全自适应红队因查询成本未扩展至 GPT-5;实验在模拟邮件助手场景及 3 个模型上展开。
实验设置Gemini 3.1 Pro、GPT-5-mini 等 · Trojan Hippo Bench、LoCoMo · ASR、AM 等
威胁模型
用户可信;智能体由可信开发者构建;外部数据源不可信。攻击者具有 indirect prompt injection 威胁模型,通过工具读取的未信任输入(如邮件)注入载荷,诱发 confused deputy 漏洞。攻击者对系统提示词、内存后端和工具接口白盒,但无模型权重(black-box 专有模型),不可直接读写内存或修改代码与用户输入。
模型
Gemini 3.1 ProGPT-5-miniGPT-5
基准
Trojan Hippo BenchLoCoMo
指标
ASRAMHM
AI 导读和推荐理由全文 338 字

ETH Zurich、UC Berkeley 与 Snyk 的研究者提出 Trojan Hippo Bench,用于系统评测 LLM Agent 持久记忆中的投毒攻击与记忆层防御。该攻击通过一次不可信工具调用(如一封精心构造的邮件)把休眠载荷写入 Agent 长期记忆,仅在用户后续谈及财务、健康、身份等敏感话题时激活并把个人数据外发。在邮件助手场景下,未加防御的攻击对 OpenAI 和 Google 前沿模型的攻击成功率达 85–100%,注入后经过 100 轮良性会话仍可激活。研究者评测了四种基于基本安全原则的记忆层防御,可将攻击成功率降至 0–5%,其中可证明安全的信息流控制策略在所有配置下达到 0%,但各防御的效用代价差异很大,实际部署仍是未解问题。基准已开源。

推荐理由论文给出持久记忆投毒在四种记忆后端上的攻击成功率与四类防御的效用代价,可据此评估自家 Agent 的记忆层风险。

深度解读

6 个问题 · 约 7,600 字

  1. 这篇论文试图解决什么问题?

    针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。

    核心问题是持久化记忆智能体面临潜伏激活的数据窃取攻击(Trojan Hippo attack),但缺乏跨异构内存架构与防御权衡的系统化动态评测基准。

    • 应用场景与现实风险:随着 ChatGPT、Gemini 和 Claude 等前沿智能体引入跨会话持久记忆,智能体被设计用于留存用户个人信息。作者指出,若记忆系统遭到渗透,攻击者可诱导智能体窃取用户财务、医疗、法律或身份等个人数据。
    • 现有评估的局限:先前针对智能体内存投毒的研究(如 AgentPoison、MINJA)通常假设直接写内存权限或不可信用户,且针对单会话行为劫持;真实系统中的攻击演示大多为概念验证,缺乏涵盖异构内存后端、全间接注入管道与自适应攻击的评测框架。
    • 论文的核心观察:攻击者植入的恶意指令在写入持久化记忆后,可在后续会话中长期潜伏,并在多轮良性交互后由敏感话题触发执行;且注入载荷进入持久化记忆后会在后续会话作为系统提示词上下文加载,从而绕过针对非可信工具输出的防御。
    • 论文的解决方案:作者提出了 Trojan Hippo Bench,包含基于 OpenEvolve 的自适应红队基准,以及细粒度解构用户工作流的能力感知安全-效用分析框架。
    • 威胁模型:
      • 攻击者目标:将受害者的敏感个人数据窃取并外发至攻击者控制的端点。
      • 攻击者知识:对系统提示词、内存后端和工具接口具有白盒知识,但无法获取模型权重(针对商业黑盒模型)。
      • 攻击者能力:仅具备间接提示注入能力,只能控制工具读取的外部未信任内容(如入站邮件的 From、Subject、Body),无法篡改代码、系统提示词、内存实现或用户查询,亦无法直接读写记忆库。
      • 受害系统:具备持久化记忆、未信任数据读取工具和外部数据发送工具的工具调用智能体(论文中实例化为基于 LangChain 的邮件助手)。
  2. 有哪些相关研究?

    论文梳理了间接提示注入与数据窃取、智能体内存投毒与并发研究,以及攻击防御机制与动态评测三类相关工作。

    论文在 Related Work 和引言中讨论了以下相关研究:

    间接提示注入与数据窃取攻击

    • Greshake 等人(2023):系统化提出了混淆代理(confused deputy)威胁模型下的间接提示注入,将对抗性指令嵌入智能体处理的外部内容中。
    • AgentDojo(Debenedetti 等人,2024)及后续基准(Boisvert 等人,2025;Zhang 等人,2024):评估了跨任务领域的提示注入攻击成功率与效用,指出了护栏方法的局限。
    • Rall 等人(2025)与 Ramakrishnan 等人(2025):利用网络搜索输出与 RAG 注入作为数据外发信道。作者指出这些工作均针对单会话攻击,未涉及跨会话持久化外发。

    大模型智能体内存投毒

    • AgentPoison(Chen 等人,2024)与 MINJA(Dong 等人,2026):前者直接后门投毒内存与 RAG 库,后者通过纯查询交互投毒。作者指出这两者针对行为劫持而非敏感数据外发,且假设了更强的攻击者访问权限,未研究跨架构的跨会话持久性。
    • 并发研究(Pulipaka 等人,2026;Zou 等人,2026;Yang 等人,2026;Patlan 等人,2025;Zhang 等人,2024):分别在助手记忆潜伏载荷、Web 会话环境注入和自增强注入等方面展示了间接注入内存投毒,并报告内存层攻击可绕过模型级安全过滤器。作者指出这些并发工作仍缺少在全间接威胁模型下跨异构内存后端系统评估的基准与能力感知效用分析。

    防御、评测与动态基准需求

    • 模型级与注入级防御:Secalign(Chen 等人,2025)等模型微调,CommandSans(Das 等人,2025)、Dual LLM(Debenedetti 等人,2025)、Progent(Shi 等人,2025)等通过高亮指令、特权控制和信息流控制解决指令数据混淆。作者指出这些防御未闭合持久化记忆缺口,载荷进入系统提示词后可绕过工具输出级防御。
    • 内存层防御与自适应评测:A-MemGuard(Wei 等人,2025)在检索阶段通过相关记忆共识检测投毒;AgentVigil(Wang 等人,2025)与 Nasr 等人(2025)开展自适应红队。作者指出已有评测多汇聚单一效用分数,掩盖了针对特定能力的防御代价,且依赖静态攻击集。

    基线方法与基准

    • 基线方法包含无持久化记忆的滑动窗口上下文基线(Context / ConversationBufferWindowMemory)以及无防御设置下的原生内存后端。
    • 使用的数据集与基准环境包含构建于 LangChain 上的邮件助手环境,以及基于 LoCoMo(Maharana 等人,2024)改造的多会话良性对话历史生成管道。

    定位与区别 作者认为,本文弥补了持久化内存防御评测聚合多任务掩盖能力影响、以及静态攻击集易失效的不足,将能力感知安全-效用分析与针对持久内存及防御的动态红队相结合。

  3. 论文如何解决这个问题?

    提出 Trojan Hippo Bench,结合 OpenEvolve 自适应红队搜索演化攻击载荷,并在 4 种内存后端评估 4 种内存层防御与 7 种能力流。

    作者提出了 Trojan Hippo Bench,一个针对大模型智能体持久化记忆攻击与防御的动态评测框架,结合基于进化搜索的端到端黑盒攻击生成与解构用户工作流的能力感知安全-效用评估。

    系统架构与环境设计

    框架构建了一个基于 LangChain 的模拟邮件助手智能体,具备读信工具(read_all_emails、search_emails)与发信工具(send_email、reply_to_email、forward_to_email)。

    • 污点源与外发汇聚点:收件箱读取工具构成智能体接触攻击者受控内容的污点源(taint sources),而发信工具构成外发信道(exfiltration sinks)。
    • 敏感触发主题设计:设计了金融、医疗、法律、税务和身份 5 个敏感触发主题,每个主题构造真实用户提示词模板与实体。
    • 攻击成功判定:当用户消息中的所有个人敏感信息(PII)均出现在智能体发送给攻击者的邮件中时,判定攻击成功(允许 Mem0 偶发的微小改写,消息通常被逐字转发)。

    自适应红队攻击生成

    为避免静态攻击载荷随着模型对齐升级而失效,作者基于 OpenEvolve 实现了 MAP-Elites 风格的进化攻击生成管道。

    • 多样性维护与变异:搜索过程中维持包含攻击长度与参考距离维度的多样性候选集;每轮迭代由大模型变异器(LLM mutator)从选定父代生成 8 个候选变体。
    • 环境评估与反馈评分:评分器在全新环境中运行智能体并检查外发是否成功,调用大模型评判器(LLM critic)给出 1–10 分的评分及具体反馈。
    • 终止条件与防过拟合:循环在达到满分或达到 40 次迭代时停止。良性会话内容由修改版 LoCoMo 管道生成;每个(主题,后端)组合生成 1 个训练样本和 4 个测试样本,分别来自互不重叠的模板与实体池,训练阶段最优载荷仅在留出测试集上评测。

    内存后端实现

    框架覆盖了部署系统中的三种主流内存范式及一种滑动窗口基线(每次运行仅激活单一后端):

    • Context(滑动窗口基线):对话历史保留在上下文窗口中,超长时截断最早的 token,无独立存储库。
    • RAG(检索增强生成):对话记录按默认 512 字符切片并嵌入向量索引,每轮根据当前用户消息检索前 8 个切片置于上下文。
    • Explicit Memory:智能体通过 update_memory 工具维护显式清单,在用户指示“记住”、“存储”或“保存”时更新,每轮将完整列表注入系统提示词。
    • Mem0(智能体语义记忆):使用专用抽取大模型将每轮对话提炼为原子事实并存入向量库与关系历史库,去重并解决冲突,后续检索前 10 个事实注入上下文。

    内存层防御机制与形式化

    论文在攻击链条的三个拦截点评估了 4 种内存层防御:

    • User-prompt-only(拦截记忆索引):仅向内存存储用户消息,丢弃助手回复与工具输出。该防御在 Explicit 后端上因白盒攻击下注入载荷可覆盖工具调用而被标记为未定义(Undefined)。
    • No-untrusted-write(拦截记忆索引):在调用污点工具的会话中设置未信任标志,会话后续对内存的写操作静默转为空操作(no-op)或跳过。
    • Limit-memory-length(阻碍检索):将存储单元强制限制在 80 个字符以内(Explicit 截断参数、Mem0 截断提取事实、RAG 块大小设为 80)。Context 后端无离散单元因此未定义。
    • Provable policy (IFC)(拦截外发):基于双格点系统 ℒ = {U, T}(其中 U \sqsubset T,分别代表未污染与受污染)的信息流控制策略。会话与内存条目初始化为 U;一旦智能体调用污点源或检索带 T 标签的记忆,会话状态即被标记为 T,且任何在 T 会话中对外部发信工具的调用均被拦截。作者给出了双会话攻击下的无干扰定理证明。

    7 种良性能力流设计

    框架定义了 7 种用户交互流程(Table 2):仅记忆(memory_only)、长程记忆(long_memory)、助手回复记忆(assistant_responses)、未信任探测(untrusted_probe)、禁用发送(disable_send)、未信任发送(untrusted_send)与跨会话记忆工具(memory_tools),涵盖记忆需求、收件箱访问与发信能力三轴。

  4. 论文做了哪些实验?

    在 Gemini 3.1 Pro、GPT-5-mini 和 GPT-5 上评估了不同内存后端的持久潜伏 ASR、4 种防御效果、效用权衡及跨模型迁移。

    实验设置

    • 被测模型:全自适应红队测试针对 Google Gemini 3.1 Pro(主要目标)与 OpenAI GPT-5-mini;迁移测试针对 OpenAI GPT-5。单次运行设置 50 步递归上限与 600 秒超时。
    • 内存后端:Explicit Memory、Mem0、RAG(默认 512 字符分块)、Context(滑动窗口)4 种持久化后端,以及 No Memory 基准。
    • 数据集与触发主题:修改自 LoCoMo 的多会话对话历史;5 个敏感主题(finance, health, legal, tax, identity),每主题 1 个训练样本与 4 个留出测试样本。
    • 防御基线:评估 None(无防御基线)、User-prompt-only、No-untrusted-write、Limit-memory-length(80字符)和 Provable policy (IFC) 4 种内存层防御。
    • 评测指标:攻击成功率(ASR,%,定义为用户消息中的全部 PII 出现在智能体向攻击者发送的邮件中);良性效用算术均值(AM,%)与调和均值(HM,%),在 7 个良性能力流上测量。
    • 样本量与重复次数:每项报告的 ASR 在 4 个留出测试样本、3 个随机种子、5 个主题上平均,每个数据点 60 次 rollout。

    主结果

    (据 Table 3,Gemini 3.1 Pro 在触发会话 N = 100 下的 ASR,各防御与后端对应关系)

    表格较宽,可左右滑动

    防御方法Explicit ASRMem0 ASRRAG ASRContext ASRNo Mem. ASR
    None (Baseline)85%80%85%100%5%
    User-prompt-only未报告10%5%5%0%
    No-untrusted-write0%5%5%0%0%
    Limit-memory-length85%20%30%未报告0%
    Provable policy0%0%0%0%0%
    • 未防御下持久化后端的攻击成功率:作者指出,在无防御基准下,Gemini 3.1 Pro 在全部持久化后端的 ASR 均处于高位(80%–100%),而无内存基准仅为 5%。
    • 防御机制对攻击的抑制效果:作者指出,内存层防御大幅降低了 ASR,其中 Provable policy 在所有后端上均达到 0% ASR,而 Limit-memory-length 防御效果相对较弱,在 Explicit 上 ASR 仍为 85%。
    • 未定义的防御组合:作者指出,由于白盒攻击下注入载荷可覆盖更新调用,User-prompt-only 在 Explicit 上无法可靠实施;而 Context 缺乏离散存储单元,Limit-memory-length 在其上不适用。

    延迟外发与跨会话持久性

    • 测了什么:测量恶意邮件注入与敏感话题触发之间的良性会话间隔数 N(从 0 到 100)对 Gemini 3.1 Pro 攻击成功率的影响(Section 7.1,Figure 4)。
    • 结果:在所有持久化后端(Explicit、Mem0、RAG、Context)上,ASR 在 N=0 时已处于高位,并在 N 增至 100 时持续保持高位,无衰减趋势;在 N=100 下对良性会话随机重排序的 20 次测试中,RAG 与 Context 的标准差分别为 43% 与 33%,Context 中 14 次达到 100% ASR,其余测试数值偏低。
    • 作者解读:作者认为单次投毒即可建立长期妥协,载荷在多次良性交互中潜伏而不衰减;数值波动由会话顺序随机性引起,而非通用模型生成噪声。

    7 种良性能力流的效用分解

    • 测了什么:在 7 种良性能力流(MO、LM、AR、UP、DS、US、MT)上评估各防御对具体工作流的保留与破坏(Section 7.3,Table 3,Figure 6)。
    • 结果:Provable policy 使所有后端和模型的调和均值效用归零(HM = 0%),因其切断了涉及收件箱的外发动作(DS 与 US 归零);User-prompt-only 导致 assistant_responses 轴崩溃(Gemini 下 RAG 从 95% 降至 25%,GPT-5-mini 下从 100% 降至 0%);No-untrusted-write 将 untrusted_probe 与 untrusted_send 归零;Limit-memory-length 在 RAG 上保持较高均值(Gemini AM/HM 为 89%/88%,GPT-5-mini 为 88%/86%),但留有残留 ASR(Gemini 为 30%,GPT-5-mini 为 15%)。
    • 作者解读:作者指出单一聚合效用分数会掩盖特定能力的破坏,调和均值能惩罚单项能力完全失效的场景;防御选择应依据实际部署的工作流需求。

    跨模型提示词迁移

    • 测了什么:在无防御且 N=100 条件下,将针对 GPT-5-mini 优化的攻击提示词在不重新优化的情况下直接迁移至 GPT-5(Section 7.4,Table 4)。
    • 结果:迁移攻击在 GPT-5 的 RAG 后端上达到 70.0% ASR,在 Context 上达到 35.0% ASR,在 Explicit 上为 5.0%,在 Mem0 与 No Mem 上均为 0.0%(Table 4)。
    • 作者解读:作者认为迁移攻击在 RAG 与 Context 上展现出跨模型泛化性;Mem0 与 Explicit 迁移率低与这两种后端需要更精确的注入格式一致,需通过针对目标模型的自适应优化来恢复高 ASR。

    其他消融与分析

    • 无内存基线校准:No Memory 在 long_memory 与 memory_only 上得分接近 0%,表明持久后端提供了上下文窗口无法复制的跨会话能力(Section 7.3)。
    • GPT-5-mini 基础表现:无防御且 N=100 时,不同后端 ASR 为 15%–85%(Explicit 15%、Context 60%、RAG 80%、Mem0 85%,Table 3)。
    • 部署画像最优防御:在 RAG 主导的帕累托前沿中,重召回场景下最优防御为 no-untrusted-write,重邮件场景下最优防御为 user-prompt-only(Section 6.3)。
  5. 有什么可以进一步探索的点?

    作者指出了 IFC 污点洗白与隐蔽信道、GPT-5 红队成本及多智能体扩展等局限,实验覆盖 3 个模型与 4 种内存后端。

    作者指出的局限与后续方向

    • 污点传播假设与未解决信道:IFC 策略的安全保证假设了完全的污点传播,未涵盖智能体将受污染内容“洗白”写入未污染内存条目的行为,亦未涵盖通过工具参数传递的隐蔽信道,作者指出这两者仍是未解决的开放问题(Section 6.2)。
    • 全组合评估的成本制约:由于计算与时间成本高昂,作者未穷尽评估所有的(后端、防御、N)组合(Section 7.1)。
    • 前沿大模型全自适应红队受限:由于单次查询成本高,在大规模下对大型前沿模型(GPT-5)运行全自适应红队评估受到成本制约,因而仅进行了无重优化的迁移攻击评估(Section 7.4)。
    • 真实部署任务分布数据缺失:由于目前尚无公开数据集能反映配备记忆系统的邮件助手的真实用户任务分布,作者只能采用三种代表性部署画像进行效用加权分析(Section 6.3)。
    • 未来方向拓展:作者希望该基准能推动低成本自适应红队技术、多智能体记忆投毒评测基准,以及根据实际部署能力需求权衡安全性的评估研究(Section 8)。

    实验覆盖范围

    • 被测模型数量:实验测试了 Google Gemini 3.1 Pro、OpenAI GPT-5-mini 与 GPT-5 共 3 个前沿模型,其中前两者进行了全自适应红队搜索。
    • 内存架构与基线:测试覆盖了 Explicit Memory、Mem0、RAG、Context 4 种持久化内存架构与 1 个无内存基线,每次实验仅激活一个后端。
    • 内存层防御类型:测试了 user-prompt-only、no-untrusted-write、limit-memory-length、provable policy (IFC) 共 4 种内存层机制。
    • 任务与场景:评测在模拟电子邮件助手(基于 LangChain 的工具调用环境)中进行,触发主题覆盖 finance、health、legal、tax、identity 5 个领域。
    • 未报告信息:论文在针对 GPT-5-mini 与 Gemini 3.1 Pro 展开自适应红队进化搜索时,未报告变异器与评判器所使用的具体大模型版本。
  6. 总结一下论文的主要内容

    论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
    • 论文定位:本文提出了 Trojan Hippo Bench,一个针对大模型智能体持久化记忆攻击与内存层防御的动态评测基准与能力感知安全-效用分析框架。
    • 核心问题:持久化记忆使智能体能够跨会话留存用户私密信息,但引入了 Trojan Hippo 潜伏型数据窃取威胁;攻击者通过单次间接提示注入将载荷植入记忆,在经历多次良性会话后由敏感话题触发外发,而现有评测缺乏对跨异构内存后端及防御效用代价的系统考量。
    • 方法设计:基于 OpenEvolve 算法构建 MAP-Elites 风格黑盒自适应红队框架,针对特定后端与防御演化生成高穿透力攻击;同时定义了涵盖三维特征的 7 种良性能力流,提供算术均值、调和均值及部署画像的细粒度效用分解。
    • 主要实验发现:
      1. 在无防御条件下,Gemini 3.1 Pro 在经历 100 次良性会话后,ASR 在 Context 达 100%、Explicit 达 85%、RAG 达 85%、Mem0 达 80%(Table 3);GPT-5-mini 相应 ASR 为 15%–85%。
      2. 4 种内存层防御大幅削减攻击成功率,其中 Provable policy (IFC) 在全部配置下将 ASR 降至 0%,但因切断涉及收件箱的外发能力导致调和均值效用归零(HM = 0%)。
      3. Limit-memory-length 防御效果较弱,在 Gemini 3.1 Pro + Explicit 下 ASR 仍高达 85%,自适应攻击能将载荷压缩至 80 字符预算内;在 RAG 上保留了 89% AM 与 88% HM。
      4. GPT-5-mini 优化的攻击载荷零样本迁移至 GPT-5 时,在 RAG 和 Context 上分别获得 70.0% 和 35.0% 的 ASR(Table 4)。
    • 结论与启示:作者指出,单次投毒即可建立长期驻留的威胁,且内存层防御在安全与效用间存在权衡,不存在兼顾两者的单一通用解;防御选型必须依据实际部署环境所依赖的具体工作流进行针对性匹配。
阅读原文arxiv.org