跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 10 篇

另有 383 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.07359 ·

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 指标,测量智能体动作门禁堆叠的错误相关性与等效层数

    AI Agent测试GPT-5.5 (gpt55)、claude-haiku-4-5-20251001、claude-sonnet-5 等 6 个应用层
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    完整解读
  2. 评测与基准arXiv:2610.03938 ·

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    AI Agent测试Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个应用层
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    完整解读
  3. 评测与基准arXiv:2609.32691 ·

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    提出卡点评测框架,以实参级谓词审计间接提示注入评测的测量偏差

    AI Agent测试gpt-5.6-terra、llama3.1:8b、gemma4:12b 等 4 个应用层

    摘要论文揭示了 IPI 评测中导致指标虚高的系统性缺陷,通过构建有效评测框架纠正了多项安全与模型能力结论。

    完整解读
已经到底了