评测与基准arXiv:2610.08871 · 10月6日CredLeak-Bench提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露网页与电脑操作·测试Claude Sonnet 5、Claude Opus 4.8、Gemini 3.6 Flash 等 7 个·应用层完整解读
评测与基准arXiv:2605.01970 · 5月3日Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御AI Agent·测试Gemini 3.1 Pro、GPT-5-mini、GPT-5·应用层投毒与后门潜伏触发记忆+2+2摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。完整解读
攻击arXiv:2610.04589 · 10月3日StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性AI Agent·测试Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个·应用层投毒与后门编码与混淆记忆+1+1摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。完整解读
评测与基准arXiv:2610.05586 · 10月5日AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力AI Agent·测试GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini 等 10 个·应用层恶意使用RAG摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。完整解读
评测与基准arXiv:2609.32915 · 9月26日AgentTell:浏览器 Agent 的行为侧信道泄漏基准构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露网页与电脑操作·测试Claude Sonnet 5、Gemini 3.7 Flash、GPT-5.6 Luna 等 6 个·应用层Agent 危险操作摘要论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。完整解读