攻击arXiv 2610.04589
StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
- arXiv
- 2610.04589
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Llama 3.1 405B、Claude 3.5 Sonnet、GPT-4o 等 13 个
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出 StegoMemory,评测智能体持久记忆作为跨会话隐写信道
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出跨独立 Agent 的记忆跳跃攻击,经共享工件在助手间自传播
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出 SkillDRE,用预执行与运行时双阶段反馈演化恶意 Agent 技能
提出 EvoBreak,以良性任务组合诱导自进化 Agent 的持久经验并削弱安全边界
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
构建 Trojan Hippo Bench,评测 Agent 持久记忆投毒与外泄
摘要论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。
用简历中的不可见指令做间接提示注入,操纵招聘推荐
摘要作者称推理在简单注入下会帮攻击圆谎,在不合逻辑的复杂注入下又会把欺骗漏出来。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。