微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
完整解读
另有 1065 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
构建 AGENTTELL 基准,测量浏览器智能体跨站行为侧信道泄露
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件