防御arXiv 2610.05162
MemAdapter:用反事实适配缓解记忆诱发的谄媚
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
- arXiv
- 2610.05162
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- DeepSeek-V4-Flash、GPT-5.6-sol、Qwen3-8B
摘要检索后三阶段调节记忆角色。
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 MemAdapter,在检索后约束记忆对智能体推理的影响
MemAdapter 是给长期记忆智能体用的检索后调节框架,用来处理记忆诱发谄媚。
提出 IntentFlux 测量 Agent 意图漂移并提出 StateForge 修复
这篇工作把“用户改口后,过时意图仍影响答案或工具动作”做成可评分的多轮失败,并试验在生成前显式维护活跃状态。
定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出依赖引导回滚修复,恢复记忆增强 Agent 的回答与状态
提出 RARE-Guard,阻止逆向观察被提升为指令或已验证声明
作者定义的失败是:LLM 辅助逆向中,忠实提取的二进制观察获得它并未赢得的指令权限、声明证据或可信状态。
提出间接数据投毒攻击,操纵科研智能体得出虚假结论
提出 SecureForge,在推理时优化系统提示以减少编码智能体的代码弱点
SecureForge是一条只用 API 和静态分析、在推理时加固编码模型的流水线。