TrustProbe 在 11 个开源 Agent 中发现 104 个技能信任链漏洞
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
- arXiv
- 2609.39065
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- OpenClaw、OpenCode、Hermes Agent 等 11 个
提出 TrustProbe,挖掘技能智能体中不可信 skill 到特权操作的信任链漏洞
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 HOOKPRY,用插件钩子版本更新供应链劫持 Agent 框架
提出针对 Agent Harness 的上下文特权提升攻击
提出 EVOMAL,诱导自演化编码 Agent 在创建技能时自我投毒并蠕虫传播
摘要论文指出了自演化智能体模仿检索代码的自我毒化漏洞,提出 EVOMAL 攻击与防御,阐明了供应链新风险。
提出 ElasticBack,在单个 Agent 技能中植入条件后门
ElasticBack 是放在 LLM agent 单个 skill 里的条件后门攻击。。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 PoisonedEvolution 轨迹投毒,诱导自演化技能系统固化恶意行为
这篇论文揭示了自演化技能系统在将交互经验转化为持久指令时的安全风险。
提出 MAFIA,以探测放置与事实伪装对带审计 Agent 做查询式记忆投毒
提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。