防御arXiv 2609.02127
论文提出带类型溯源与断言护栏,防止持久化 AI Agent 把不可信输入当作自身历史
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
- arXiv
- 2609.02127
- 发表
- 层
- 应用层
- 场景
- AI Agent
提出类型化溯源与断言护栏,约束持久 Agent 的自传断言释放
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。