APort Vault 发布:用 4,371 条人工攻击评测 AI Agent 支付授权
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
提出 STAR-Guard 双层防御缓解长程智能体遗忘安全约束
提出 MOLE 基准,评测智能体内部威胁的完成情况与监控漏检
MOLE 是首个针对前沿 AI 实验室智能体内部威胁检测的开放基准,旨在评估在有限每日审查预算与日常研发业务背景下识别恶意账号的能力。。
红队评估编码智能体的阻断监视器,并提出 Auto Mode++加固
提出 EvasionBench,测量任务压力下智能体对同步监控的规避
完整解读