评测与基准arXiv 2609.22076
APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
- arXiv
- 2609.22076
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Fable 5.1、Claude Sonnet 5、Claude Haiku 4.5 等 14 个
另有 981 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
构建 BazaarBench,评测去中心化交易智能体的违规与失信
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。