APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Kimi K3、Claude Fable 5.1、Claude Sonnet 5 等 14 个
另有 275 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出多层监控网关 ClawSentry,拦截恶意技能供应链与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
构建 TOOLPRIVBENCH 评测 Agent 的过度特权选择并提出特权感知后训练
作者研究 LLM 智能体的 over-privileged tool selection:低权限工具已经足够时,仍选择或在短暂失败后升级到高权限工具。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出可安装护栏技能 SkillSonar,在运行时分流技能增强 Agent 的敏感动作
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 RSI-Master 以约束自主后训练动作并抑制奖励作弊
提出 Pictionary,将不可信文本渲染为图像以防御提示注入