跳到正文
原文
论文追踪· arXiv:2607.19595· Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner·本站收录 · 原文发表

Twin Agent:面向权限分离智能体的上下文残差压缩

Twin Agent: Context Residual Compression for Privilege Separated Agents

AI 导读

研究者提出 Twin Agent,一种受残差编码启发的通用权限分离设计模式,用于抵御来自不可信上下文的提示注入攻击。该设计由两个近似对称的智能体组成:Explore Agent 检查不可信信息,Safe Agent 执行特权操作;Explore Agent 以 Safe Agent 当前上下文为条件,只向其传递关于下一步动作的紧凑提示,从而减少维持任务效用所需的信息量。作者通过测量提示长度变化时效用与攻击成功率的变化,验证了该设计在安全与效用之间取得更好的权衡。在 SWE-bench Lite 的长程软件工程任务以及 AgentDojo、DecodingTrust-Agent 的异构多工具交互任务上,Twin Agent 在保持高任务效用的同时阻止了提示注入攻击,表现优于无防御智能体和权限分离基线。

阅读原文arxiv.org