微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 377 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
构建统一滥用监视基准,用危害窗口评测跨威胁动作监控
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
重评提示注入检测器,检验基准分数对智能体部署的预测力
构建 THINKINGBOX 沙盒与基准,评测有状态业务工作流中智能体的执行稳定性
提出 AgentGym2 基准,在去理想化环境中评测智能体端到端任务能力
完整解读构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力
用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限
FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。
提出诊断阶梯,揭示关键词工具调用评测的假阳性
作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。
提出 Drift-Bench++与 GRIP,评测智能体在错位与静默漂移下的意图对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 SYNCHAIN,以定向微调诱导智能体自合成跨任务潜伏工件
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
提出 ScopeBench,测量渗透智能体在目标压力下的范围遵从
完整解读