评测与基准arXiv 2605.01970
Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄
- arXiv
- 2605.01970
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Gemini 3.1 Pro、GPT-5-mini、GPT-5
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。