跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 51 篇

另有 377 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.05532 ·

    DelegationBench 发布:Agent 判断该问用户时

    提出 DelegationBench,评测智能体该请示用户时是否实际询问

    AI Agent测试Claude Sonnet 5、Claude Opus 4.8、GPT-5.6 Sol 等 10 个应用层
    摘要论文揭示一致率指标的系统性误导,为智能体授权决策建立了兼顾判断与执行的评测协议。

    DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。

    完整解读
  2. 评测与基准arXiv:2610.07359 ·

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数

    AI Agent测试claude-haiku-4-5-20251001、claude-sonnet-5、claude-opus-5 等 6 个应用层
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    完整解读
  3. 评测与基准arXiv:2610.03938 ·

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    AI Agent测试Claude Opus 4.6、Claude Opus 4.7、AdaReasoner-7B-Randomized 等 13 个应用层
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    完整解读
  4. 评测与基准arXiv:2610.03448 ·

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    AI Agent测试Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个应用层

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读