评测与基准arXiv 2609.22076
APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。
在模拟环境中复现级联失准行为并降低审计诱导开销
摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全
提出 Ajar,测量 Agent 防御放行任务不需要的工具调用
Ajar 量的是智能体防御留下的开放权限:任务不需要、但防御仍会允许的工具调用。