- 防御arXiv 2609.02127
论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
- arXiv
- 2609.02127
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
已经到底了
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。