APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 648 篇论文还没打上分类标签,暂不在筛选结果里。
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 OATS,用确定性解析器在运行时治理 Agent 技能动作
摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门 OATS,展示了双层防御组合的必要性。
提出 STAR-Guard 双层防御,缓解长程智能体跨轮遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 COBRA,用分支能力约束与代理拦截防御计算机使用 Agent 的分支引导攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 PACE,用签名策略记录拦住 DeFi 智能体违规交易
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出 UCM,用 DOM 掩码与类型受限隔离模型隔开网页智能体与不可信内容
提出 PACE,在工具调用前对 Agent 做路径隔离与效果授权
PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。
提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。
提出契约约束的工具调用修复协议,在执行前拦截非法补丁
提出 RegLLM,诊断受监管 Agent 的有限自主与升级决策
REGLLM 是诊断有界自主的框架,示例是 UK FCA 合规智能体。作者把它做成 smoke 规模演示,而不是完整基准验证。
提出 CaMeLoT,在执行前用 CTL 静态验证 Agent 计划
CaMeLoT 是 CaMeL 的神经符号扩展:在工具调用之前,用模型检验判断受限 Python 计划是否满足时序安全策略和从提示词抽出的任务性质。
提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出可安装护栏技能 SkillSonar,在运行时分流技能增强 Agent 的敏感动作