APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 268 篇论文还没打上分类标签,暂不在筛选结果里。
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
提出 VAL 防御栈,用确认门与参数沙箱约束 Agent 的高风险工具调用
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出 MOLE 基准,评测监控器对智能体内部威胁的检出能力
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
提出 FlowSeal,在工具边界用信息流控制阻断 Agent 隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出企业 MCP 的零信任授权扩展,拒绝提示注入下的越权工具调用
作者把零信任放在 MCP 工具调用边界:智能体即使被提示注入,也不能调用其凭证范围之外的工具。问题来自三点部署性质。调用意图会随不可信上下文改变。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
提出身份绑定且只收窄的能力令牌,用上下文外钱包约束智能体
代表人类行动的分布式智能体,需要一种不把密钥放进语言模型上下文的授权方式。
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出状态控制攻击 DART 与预执行防御 SAGE,拦截工具 Agent 的有害状态转移
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。