评测与基准arXiv 2605.01970
Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
- arXiv
- 2605.01970
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemini 3.1 Pro、GPT-5-mini、GPT-5
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
提出企业级智能体检测系统 ADR,检测提示注入与恶意 MCP
摘要提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。
提出 TPRS,量化工具命名等表征变化对智能体安全基准得分的影响
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。