攻击arXiv 2609.39065
TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
- arXiv
- 2609.39065
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- OpenClaw、OpenCode、Hermes Agent 等 11 个
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
提出跨独立 Agent 的记忆跳跃攻击,经共享工件在助手间自传播
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。