微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 386 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 CredLeak-Bench,评测智能体在钓鱼场景下的凭据泄露
完整解读提出 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点
审计由智能体从零构建并部署的真实应用的安全缺陷
评测人类开发者在协作编程中能否发现编码智能体的隐蔽破坏
完整解读提出 DIBench,评测界面注入对移动智能体选择决策的操纵
提出 HarnessSecurity-Bench,横向评测编码智能体框架的安全机制
完整解读提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 EvoRiskBench,评测工作区智能体的运行时安全风险
构建 ActBench 评测协作智能体多步执行中的操作级行为安全
提出影子评测,检验前沿智能体能否独立完成开放式科研
构建无污染的 SRE-Bench,评测智能体在真实规模二进制上的逆向能力
作者构建并评测 SRE-Bench,一个从零编写、用于测量智能体逆向工程而非利用开发的基准,并称它同时满足污染控制与真实软件规模。
提出 MobileCybench,用可执行探针评测编程智能体的漏洞发现与利用
完整解读重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳
这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。
提出 CLASHBENCH,评测特权智能体抢占资源并破坏既有任务
提出 OpenART 竞技场,用 EMHA 演化持久环境以评测智能体安全
完整解读构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
评测编码智能体记忆文件中的提示注入及其跨会话持久性
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力