跳到正文
10月8日 · 周四

红队 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2609.22076 ·

    APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权

    提出APort Vault,评测支付智能体授权层对越权转账的拦截

    测试
    Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个应用层
    场景
    AI Agent
    摘要22.5 万次重放评估显示,工具边界的确定性授权层在放行合规支付的同时拦截了全部越权转账。
    • 定位与核心问题:论文发布了 APort Vault 基准,旨在解决工具调用型智能体中越权支付风险仅依赖模型端拒答而缺乏工具边界确定性授权检查量化评估的问题。
    • 评测方法与体系:基于银行 CTF 中 1,128 个会话的 4,371 次真实人类攻击,在 14 款模型、5 级策略配置和单/多轮轨道下,重放对比裸模型与接入 OAP 确定性策略引擎的双架构状态变更。
    • 越权转账被有效阻断:在 Level 2 至 Level 4 中,裸模型在 76,842 次评估中产生 140 次非许可转账,而授权层在 69,297 次评估中为 0 次(按源会话聚类上限为 0.38%),在 68,970 组严格匹配三元组中为 105 对 0(Table 2、Section 4.5)。
    • 正常支付未受抑制:授权层在 Levels 2 至 4 成功执行了 25,370 笔合规支付,评估的 25,640 次转账调用中仅拒绝了 187 次,两架构间的成对请求率差异仅为 +0.084 个百分点(Table 2、Table 4)。
    • 失效高度集中且迁移性弱:140 次违规转账有 47.9%(67 次)源于单个会话,伪造凭证攻击主导了 Level 2 的 111 次多轮违规;多轮攻击无一攻破超过 5 款模型,模型端安全表现无法预测跨层级鲁棒性(Section 5.1、5.2、5.4)。
    • 作者结论与启示:作者认为单靠选择最佳模型无法消除部署残留风险,而在工具边界实施确定性策略检查能够在维持智能体执行效用的同时为越权风险提供可验证的确定性保障。
    完整解读
已经到底了