防御arXiv 2609.17648
多智能体 LLM 流水线中的信任传播与结构隔离
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
- arXiv
- 2609.17648
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- gemma4:31b-cloud
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
提出针对 Agent Harness 的上下文特权提升攻击
提出 SkillMisevo-Bench,量化自改进 Agent 的技能误演化
提出 SYNCHAIN,诱导计算机使用 Agent 自合成潜伏技能并跨任务触发
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。