评测与基准arXiv:2610.08871 · 10月6日CredLeak-Bench提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露网页与电脑操作·测试Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个·应用层完整解读
评测与基准arXiv:2605.01970 · 5月3日Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御AI Agent·测试Gemini 3.1 Pro、GPT-5-mini、GPT-5·应用层投毒与后门潜伏触发记忆+2+2摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。完整解读
攻击arXiv:2607.05189 · 7月6日研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆AI Agent·测试GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个·应用层投毒与后门潜伏触发记忆+2+2摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。完整解读