APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 592 篇论文还没打上分类标签,暂不在筛选结果里。
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 APEX,在执行边界用预编译授权契约防御 Agent 间接提示注入
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 OATS,用确定性解析器在运行时治理 Agent 技能动作
摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门 OATS,展示了双层防御组合的必要性。
提出 STAR-Guard 双层防御,缓解长程智能体跨轮遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 Approval Token 绑定编程智能体的审批与执行
摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 FlowReview,用对象解析与确定性提交门控制多智能体组合信息流
这篇工作把多智能体安全写成一件必须同时成立的事:拦住组合信息所启用的禁止使用,并完成同一场景里任务所需的授权使用。
提出 ZeroGate,把精确动作批准与放行时持久准入分开
ZeroGate 把智能体动作的批准提前,并要求放行前仍能核对这份批准是否适用。它的对象是短期、精确动作、单次使用的 ActionPass。签发方对具体规范动作签名。
提出 AgentKernel,强制中介 Agent 的身份、感知、认知与执行
AgentKernel 是把安全做成组织原则的智能体 OS 架构,不是带跑分的攻防评测。
提出 ZoneClaw,用信任区隔离计算机使用 Agent 的持久记忆权限
提出 PACE,用签名策略记录拦住 DeFi 智能体违规交易
提出 WebMCP-Phalanx,用能力凭证与双智能体隔离浏览器工具面
WebMCP-Phalanx针对浏览器里的 WebMCP 智能体:在 SOP 下补工具所有权,并把语义检查从有工具权的执行中分开。
提出 SkillGuard,用可达性切断污染后通往禁止状态的技能调用
提出有状态策略引擎 Sapien,拦截被劫持智能体的越权工具调用
Sapien 是面向通用 AI 智能体的有状态策略引擎:执行前把用户提示词译成任务策略,运行时只放行该策略承认的工具调用序列。
提出契约约束的工具调用修复协议,在执行前拦截非法补丁
提出 RegLLM,诊断受监管 Agent 的有限自主与升级决策
REGLLM 是诊断有界自主的框架,示例是 UK FCA 合规智能体。作者把它做成 smoke 规模演示,而不是完整基准验证。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
提出 Sentinel-RL,将拓扑推理卸载到图策略并约束遏制动作
Sentinel-RL 是面向 SOC 的神经符号架构:拓扑决策离开 LLM,改由认证图上的 HetGAT 与 PPO 完成。