防御arXiv 2610.05162
MemAdapter:用反事实适配缓解记忆诱发的谄媚
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
- arXiv
- 2610.05162
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
摘要检索后三阶段调节记忆角色。
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 VAL 框架,并用确认门与参数沙箱约束智能体高风险工具调用
提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构
把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 AgentKernel,用四支柱强制中介 Agent 的输入、工具与记忆
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出依赖引导回滚修复,恢复记忆增强 Agent 的回答与状态