跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2610.03448 ·

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
    • 研究定位:评估主流提示注入检测器在智能体工具输出环境下的真实防御效能,检验公开基准分数是否具备跨环境预测力。
    • 核心问题:现有基准使用非结构化文本且存在数据重合,导致评测得出的高分无法反映检测器在智能体工具输出中的表现与误报阻断代价。
    • 评测方法:基于无 LLM 的真实调用重放构建良性工具输出,结合环境差异重放构建并标注注入样本,在 1% FPR 运行点下对比 15 个检测器与 2 个 LLM 评审,并审计训练集重合。
    • 关键实验发现:基准间检测排名缺乏显著迁移性(相关系数 0.01 至 0.31),在 BIPIA 达 95.1% 检出率的 PIGuard 在 AgentDojo 仅检出 2.1%;而在无数据重合但采用智能体风格数据训练的 Horizon-Labs 检出率达 82.2%(AgentDojo)与 100.0%(τ-bench);同时检测器在工具输出上的误报率高达 0% 至 90% 以上,可导致高达 69.1% 的良性任务中断。
    • 机理与启示:检测器的有效性高度依赖于输入数据形态与训练集的相似度,而非对注入指令本身的通用理解;针对智能体部署的检测防御应在真实工具输出上以低误报率为基准进行评测,并严格审计训练数据泄漏,将检测器作为纵深防御中的过滤层使用。
    完整解读
  2. 评测与基准arXiv:2608.19741 ·

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    构建THINKINGBOX沙盒与基准,评测有状态业务工作流中智能体的执行稳定性

    测试
    Claude Opus 5、GPT-5.4、GPT-5.6-sol 等 14 个应用层
    场景
    AI Agent
    摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
    • 研究定位:该研究提出了面向多轮有状态业务工作流的智能体交互沙箱 THINKINGBOX 及包含 507 个任务的评测基准 THINKINGBOX-BENCH。
    • 解决的核心问题:针对现有工具调用评测偏向代码与单次 API 语法正确性、忽视真实业务持久化状态变更与附带破坏的问题,构建了端到端可验证的闭环环境。
    • 方法设计要点:基于 MCP 协议实现任务级别的独立会话隔离与确定性重置,由受限的模拟用户配合多轮澄清,结合终端数据库状态比较与副作用提取实施严格的合取式判题。
    • 重要实验结果:评测 18 个模型展示出探索上限与重复执行稳定性的显著落差,Claude Opus 5 的 pass@1 为 66.50%,而在 20 次重复试验中全部成功的 passˆ20 降至 47.53%;Kimi-K3 的 pass@20 达 93.89%,但 passˆ20 仅为 17.60%;在 79,853 次失败轨迹中,工具使用错误占比达 79.9%,且 80.88% 的失败试验仍能正常终止并调用写工具。
    • 强化学习与基准价值:基于沙箱确定性奖励使用 GRPO 算法对 Qwen3.8-27B 进行全参数微调,其 pass@1 达 60.78%,超过专有模型 GPT-6 Astra(58.31%);相比 HumanEval+ 狭窄的分数区间,该基准有效拉开了不同智能体在复杂流程下的能力区分度。
    • 作者结论与启示:作者认为智能体偶然找到单次成功路径并不等同于具备稳定的业务执行能力,在面向高影响业务流程时,评测必须深入到底层持久化状态与附带损伤,而非仅依赖表层回复文本或工具调用格式。
    完整解读
  3. 评测与基准arXiv:2608.18066 ·

    Salesforce AI Research 重测自改进 Agent:多次运行方差增大、打乱任务顺序后性能下降 4.5%

    重测记忆型自改进智能体,揭示任务顺序和多次运行带来的性能不稳

    测试
    GPT-5-mini、Gemini-2.5-Pro、GPT-OSS-120B 等 4 个应用层
    摘要论文揭示了基于记忆的自改进智能体在多次运行和乱序下的脆弱性,并指出规约不完备是诱发退化的关键瓶颈。

    这篇论文是对基于文本记忆的自我改进智能体在复杂环境中评估可靠性的实证研究。

    完整解读
已经到底了