APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 516 篇论文还没打上分类标签,暂不在筛选结果里。
构建 APort Vault 基准,对比裸模型与确定性授权对越权支付的拦截
提出流匹配逆向框架,从多向量视觉文档索引重构页面
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 Skill-as-API,防止协作通道泄露 skill 代码与系统提示词
Skill-as-API 是面向智能体软件工程的协调协议,用来在跨组织调用时把 skill 的代码和系统提示词留在所有者进程。作者针对三条威胁:经通道或命名空间抽取专有方法,用注入让被调用模型输出系统提示词,以及协作结束后权限继续保留。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出 FlowSeal,在工具边界用信息流控制阻断 Agent 隐私泄露
摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 Skilder,用角色技能包和 MCP 路由硬拦截越权工具调用
Skilder 把企业工具型智能体的能力按角色打包,经一个 MCP 服务器做渐进发现,使工具范围由服务器而不是提示词来执行。
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出状态控制攻击 DART 与预执行防御 SAGE,拦截工具 Agent 的有害状态转移
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。