跳到正文
10月10日 · 周六

全部论文

找到 6 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 378 篇还没打标签,不在筛选结果里。

另有 378 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.03448

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重测提示注入检测器在 Agent 工具输出上的检出与任务阻断

    发表
    场景
    AI Agent
    被测模型
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个

    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    深度解读完整解读
  2. 其他arXiv 2609.08832

    自进化智能体框架缩小 LLM 智能体的「一致性差距」

    提出离线两阶段框架,诊断易翻转步骤并生成记忆指南以稳定智能体

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-OSS-120B
    摘要用离线一致性诊断生成记忆指南,在 AppWorld 上提高重复全通过率。

    作者要缩小的是 LLM 智能体平均通过、重复不稳之间的 consistency gap,即 Mean@k 减 Passˆk。

    深度解读完整解读
  3. 评测与基准arXiv 2608.18066

    Salesforce AI Research 重测自改进 Agent

    重测记忆型自改进 Agent 的运行方差与任务顺序敏感性

    发表
    场景
    AI Agent
    被测模型
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    深度解读完整解读
  4. BioSecBench-Refusal:面向智能体生物安全风险评估的配对基准

    提出 BioSecBench-Refusal,评测智能体生物研发拒答与隐蔽危害识别

    发表
    被测模型
    Opus 4.8、Opus 4.7、Opus 4.6 等 10 个
    摘要配对基准显示拒绝多由 API 触发,合法任务常被拒得不少于隐蔽危害。

    BioSecBench-Refusal 把生物研发智能体的谨慎程度和识别隐蔽危害的能力放在同一套任务上测量。

    深度解读完整解读
已经到底了