研究:任务范围授权可将工具调用有害执行降至零
用配对回放评测任务范围授权能否阻断越权工具执行
- arXiv
- 2610.05840
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Llama 3.2 3B Instruct Q4 K M、Qwen3 4B Instruct、Gemma 3 4B 等 8 个
用配对回放评测任务范围授权能否阻断越权工具执行
提出 PACE,在工具调用前做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
为 Agent 提出资源层授权系统 Pincer,用数字分身执行动态最小权限
Pincer 是加在现成 coding agent 上的资源层授权防御:用只受用户侧信息影响的 digital twin 做动态最小权限,并与 tool-call 层防御并存。要处理的是用户维护策略带来的权限蠕变和授权疲劳,以及不学习用户策略的 tool-call 分类器。作者引述工作称 auto mode 会放行多数不安全操作,并认为推理代码或复杂 shell 的效果在这一层不实际。
提出 ToolFence,以能力蓝图和确定性授权拦截 Agent 未授权工具调用
提出多智能体系统提示注入的威胁模型与四层架构防御
提出企业 MCP 零信任授权与发现扩展,在架构上拒绝提示注入下的越权调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出 IntentCap,按来源字段所有权合成并裁决 Agent 能力租约
IntentCap 是把智能体能力绑到当前任务意图、并按上下文来源划分字段所有权的权限机制。
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SkillGuard,用可达性限制污染后的 Agent 能力
提出 PACE,用策略认证与签名决策记录拦截 DeFi 智能体违规交易
构建自演化基准 ActBench,评测协作智能体的行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
提出 Janus 前瞻守卫,在长程智能体执行有害动作前拦截潜在风险