跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 5 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 383 篇还没打标签,不在筛选结果里。

另有 383 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.03938 ·

    论文发现多模态模型启用工具后拒答失败率最高上升 68.7%

    评测启用工具调用后多模态模型拒答有害图文请求的变化

    AI Agent测试Gemini-2.5-Pro、Gemini-3.1-Pro-Preview、Claude Opus 4.6 等 13 个应用层
    摘要论文揭示了工具调用范式削弱 MLLM 拒答能力的现象,分析了稀释与偏移机制并验证了重注缓解方案。

    论文系统评估了智能体工具调用范式对多模态大语言模型拒答能力的影响,指出了工具增强视觉推理背后的安全隐患。核心探讨的问题在于:当 MLLM 从单次推理转向通过 ReAct 循环调用外部工具(打标、缩放、OCR、代码执行)时,工具使用机制本身是否会降低模型拒答有害请求的概率。

    完整解读
  2. 评测与基准arXiv:2610.03448 ·

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    AI Agent测试Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个应用层

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  3. 评测与基准arXiv:2608.18066 ·

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    网页与电脑操作测试GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个应用层
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    完整解读
  4. 评测与基准arXiv:2609.03221 ·

    FairMedAgent:临床 LLM 智能体公平性审计中的随机噪声下限

    用 FairMedAgent 测量临床智能体在输入不变时的动作不稳定性下限

    LLM 应用测试claude-haiku-4-5、claude-sonnet-5、llama3.1:8b-instruct 等 7 个应用层
    摘要先测同一输入下的动作不一致率,再用它解读人口学翻转率。

    FairMedAgent 把临床智能体公平审计里的采样噪声单独量出来:输入不变时动作仍会改变,这个比率就是解读翻转率的下限。。

    完整解读
已经到底了