微软研究院发布 CAVEAT
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
另有 1033 篇论文还没打上分类标签,暂不在筛选结果里。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
揭示类型化决策模型按选项标签而非定义规则作答
评测启用工具调用后多模态模型拒答有害图文请求的变化
论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。
重评提示注入检测器,检验基准分数对智能体部署的预测力
构建 MLCommons 越狱基准以测量模型的单轮越狱韧性
提出 AgentGym2 基准,在去理想化环境中评测智能体端到端任务能力
完整解读构建 COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲 GEO 的防御
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
完整解读提出 VLoc Bench,评测智能体仅凭弱点类型在完整仓库中定位漏洞
提出 PATCHBENCH,评测编程智能体对 C/C++漏洞的真实修补能力
提出诊断阶梯,揭示关键词工具调用评测的假阳性
作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力
完整解读构建 SciSlopBench 评测科学灌水,并用 SciSlopHarness 约束修订
完整解读提出 Drift-Bench++与 GRIP,评测智能体在错位与静默漂移下的意图对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出 AgentCyberRange,评测智能体自主实施网络攻击的能力
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御