Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
论文提出 Trojan Hippo Bench,未防御时 Gemini 3.1 Pro 在 N=100 触发会话下 ASR 达 100%。
- 100%Gemini 3.1 Pro、Context 后端、未防御、N=100 会话 ASR(Table 3)
- 85%GPT-5-mini、Mem0 后端、未防御、N=100 会话 ASR(Table 3)
- 0%Gemini 3.1 Pro、Provable policy (IFC)、全部后端 N=100 ASR(Table 3)
针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。
论文梳理了间接提示注入与数据窃取、智能体内存投毒与并发研究,以及攻击防御机制与动态评测三类相关工作。
提出 Trojan Hippo Bench,结合 OpenEvolve 自适应红队搜索演化攻击载荷,并在 4 种内存后端评估 4 种内存层防御与 7 种能力流。
在 Gemini 3.1 Pro、GPT-5-mini 和 GPT-5 上评估了不同内存后端的持久潜伏 ASR、4 种防御效果、效用权衡及跨模型迁移。
作者指出了 IFC 污点洗白与隐蔽信道、GPT-5 红队成本及多智能体扩展等局限,实验覆盖 3 个模型与 4 种内存后端。
论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。