防御arXiv 2609.02127
论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
- arXiv
- 2609.02127
- 发表
- 层
- 应用层
- 场景
- AI Agent
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。