微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 757 篇还没有研究类型,暂不在这些分类里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 DelegationBench,评测智能体该请示用户时是否实际询问
DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 APort Vault,评测支付智能体授权层对越权转账的拦截
完整解读提出 Trojan Hippo Bench,评测智能体持久记忆攻击与防御
提出 PatchBench 局部协议,评测激活补丁修复越狱的附带损伤
提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
审计由智能体从零构建并部署的真实应用的安全缺陷
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数
论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 Trust Layer,事后复核智能体基准成绩的真实性、诚实性与稳定性
提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化
本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读用 COPEX 基准在固定协议栈下评测智能体抵御 MCP 攻击的能力
完整解读揭示类型化决策模型按选项标签而非定义规则作答
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
发布 UndoBench,分离工具型智能体的任务能力与故障恢复能力
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。