研究实测五套 Agent 记忆系统均不执行撤销标记
评测智能体记忆软撤回是否生效,并提出陈旧检索防护
- 研究定位:该研究首次系统性实证评估了多款主流大语言模型智能体记忆框架在软撤回机制下的运行时安全边界与撤回执行有效性。
- 核心问题:现代记忆系统普遍采用将陈旧知识标记为无效而非物理删除的软撤回设计,但默认检索机制是否会在读取时拦截失效记录、避免智能体依据作废策略采取危险操作,此前未有深入验证。
- 评测与防御设计:研究在直接与间接两种插入模式下向 5 款记忆系统写入作废与替代策略,跨越 9 个模型评估其检索暴露与不安全决策表现;针对系统未默认过滤的现状,提出了在检索返回路径进行元数据校验与成对冲突检测的 Stale-Retrieval Guard 组件。
- 主要实验发现:直接写入且无防御时,两款暴露系统(Graphiti与mem0 exp.)将作废记录全部返回且排在首位,导致智能体平均在 43.1%(699/1,620)的试验中执行不安全行动(Table 6);即使提示词明确禁止危险操作,模型不安全率仍有 12.9%(Table 8);存储级过滤虽能在单次交互中将不安全率归零,但在智能体将决策回写记忆库后,3 跳内的不安全率迅速反弹至 83.1%(Table 14)。
- 作者结论与启示:作者指出记忆系统的安全盲区并非源于外部投毒或数据来源伪造,而是内部合规生命周期中缺乏检索时有效性校验;仅依赖写入来源证明或模型提示词无法抵御作废策略,必须在读取管道上强制实施严格的陈旧记录过滤。