防御arXiv 2609.17648
多智能体 LLM 流水线中的信任传播与结构隔离
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
- arXiv
- 2609.17648
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 被测模型
- gemma4:31b-cloud
摘要结构性授权拦住了记忆投毒的未授权执行,持密钥时承重的是策略预言机。
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出任务绑定令牌与策略预言机,在多智能体流水线中拦截未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
作者提出 CONFLICTGUI 基准,覆盖指令内部冲突与指令和 GUI 上下文冲突两类场景,用于研究 GUI Agent 的冲突感知终止能力。
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。