StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
- arXiv
- 2610.04589
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 AdaLCPI,把恶意指令拆成碎片嵌入工具返回并诱导 Agent 越权执行
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 BAM 反馈编码,在 LLM 生成文本中实现隐蔽通信
提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 Relink 攻击,在 Agent 压缩边界将分散良性片段重组为恶意指令
本文研究了智能体基于摘要的提示词压缩所引入的新型安全漏洞——重链(Relinking),并提出了系统化的攻击构建方法与边界审计防御机制。
提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器
提出 STAC 框架,把恶意目标拆成多轮看似无害的工具调用链
摘要作者提出并验证了智能体在序列化工具攻击下的普遍脆弱性,指出针对累积动作序列防御的必要性。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。