攻击arXiv 2609.01222
研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
- arXiv
- 2609.01222
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
- 测试
- GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个
提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。