APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读另有 95 篇论文还没打上分类标签,暂不在筛选结果里。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 ECLIPSE 双通道自演化提示注入,劫持长程智能体动作轨迹
完整解读提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读构建多模态技能图像攻击基准 MMSkillRisk 并设计 NCVA