APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 75 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
提出 VAL 框架并用确认门与参数沙箱约束高风险工具调用
提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
综述智能体执行链路中的越狱攻击、防御与实践权衡
Mia 等人把越狱安全从单轮回复扩展到智能体的规划、记忆、工具和智能体间通信,并问既有结论在更强原生对齐下是否还成立。
提出威胁分类 T 并映射智能体红队研究与安全基准的覆盖
提出 BadAction,通过动作触发器给交互式视频生成植入后门
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
提出 AdvPIE,在黑盒下搜索表面无害却生成有害图像的提示
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出 Ajar,测量 Agent 防御放行任务不需要的工具调用
Ajar 量的是智能体防御留下的开放权限:任务不需要、但防御仍会允许的工具调用。
提出 TempQ-Jail,以查询受限候选排序越狱文生视频模型
待补读全文。
提出 RISE,迭代演化可复用策略对文生图模型做红队
提出工具智能体的状态攻击 DART 与预执行防御 SAGE
摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。