攻击arXiv 2610.04589
StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
- arXiv
- 2610.04589
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 LLMLeak,把机密编进报错 URL 借网页抓取外泄
LLMLeak 研究一种隐蔽外传:本地恶意软件已拿到机密,却因为网络限制或监控不能直接连接攻击者,于是把秘密放进看起来像排障文档的 URL,让良性聊天机器人的网页抓取工具在访问时把秘密带出去。
提出 AdaLCPI,把间接提示注入拆成片段嵌入工具返回并自适应优化
提出 BAM 反馈编码,在 LLM 生成文本中实现隐蔽通信
提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。