跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 103 篇
  1. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult 并评测 Agent 动作门禁堆叠的错误相关性

    发表
    场景
    AI Agent
    被测模型
    AgentTrust runtime (174 rules)、GPT-5.5 (gpt55)、claude-haiku-4-5-20251001 等 7 个
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  2. 评测与基准arXiv 2610.06748

    BazaarBench:评估 LLM Agent 在去中心化 C2C 市场中的代理安全

    构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为

    发表
    被测模型
    GPT-5.5、GPT-5.4、GPT-5.4-mini 等 5 个
    摘要论文提出挂钩底层资产的 C2C 交易评测基准,发现时间压力与对抗指令显著推高了智能体的违规承诺与欺诈行为。

    BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。

    深度解读完整解读
  3. 评测与基准arXiv 2610.05622

    UndoBench 发布:分离工具型 Agent 的任务能力与故障恢复能力

    提出 UndoBench,解耦工具型 Agent 的任务能力与故障恢复能力

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.2-3B-Instruct、Gemini 3.8 Flash 等 4 个

    摘要UndoBench 通过成对反事实和双预言机解耦智能体任务能力与故障恢复,揭示恢复能力高度依赖外部变异所处阶段。

    深度解读完整解读
  4. 评测与基准arXiv 2610.05532

    DelegationBench

    提出 DelegationBench,评测 Agent 何时应先请示用户再行动

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna 等 10 个
    摘要论文揭示一致率指标的系统性误导,为智能体授权决策建立了兼顾判断与执行的评测协议。

    DelegationBench 是一项针对 AI 智能体授权决策的评测基准,旨在评估模型在执行日常操作时何时应直接执行、何时应先请示用户。

    深度解读完整解读
  5. 分析与理论arXiv 2610.06191

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B、Llama-3.1-8B、Qwen3-8B 等 7 个
    摘要论文揭示智能体判定工具失效却无法转化为停止行动,证实通过框架规则强制整合判定可提升表现。

    本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。

    深度解读完整解读
  6. 防御arXiv 2610.04975

    论文提出长程智能体自生子目标的运行时授权机制

    提出长程工具智能体自生子目标的运行时授权机制

    发表
    场景
    AI Agent
    摘要用版本化目标图授权保住重规划,并挡住自生成子目标变成新权威。

    长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。

    深度解读完整解读
  7. 分析与理论arXiv 2610.04375

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改

    发表
    被测模型
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个

    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。

    深度解读完整解读
  8. 防御arXiv 2610.04699

    CoVer:用干预检验为 Agent 构造可判定规则边界

    提出 COVER,用干预门判定 Agent 规则谓词能否自动执行

    发表
    场景
    AI Agent
    被测模型
    Claude Sonnet、Claude Opus、GPT-4o 等 5 个
    摘要自可判定不能向模型索取。

    这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。

    深度解读完整解读
  9. 防御arXiv 2610.02861

    论文提出在 Kubernetes 上保护 AI Agent 的七层纵深防御框架与参考架构

    提出 Kubernetes 运维智能体的七层纵深防御框架与参考架构

    发表
    场景
    AI Agent
    摘要把运维智能体当不可信租户,用七层控制在完全攻破假设下约束行动。

    把 Kubernetes 上的运维智能体当作不可信租户,在假定提示注入已完全控制其工具选择的前提下,用基础设施重建数据面与控制面的边界。要解决的是:智能体读日志、注解、工单或 MCP 工具描述时,这些内容可以变成它带着自身凭据执行的命令。模型对齐和分类器只降低概率。

    深度解读完整解读
  10. 防御arXiv 2610.02664

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束

    提出 STAR-Guard 双层防御,抑制长程 Agent 遗忘跨轮安全约束

    发表
    场景
    AI Agent
    被测模型
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个

    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    深度解读完整解读
  11. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击

    发表
    被测模型
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  12. 评测与基准arXiv 2610.01508

    OverAct:衡量并缓解 LLM 工具调用智能体的主动越权取数

    发布 OVERACT 衡量工具智能体主动越权取数并评测 SELFAUDIT

    发表
    场景
    AI Agent
    被测模型
    Qwen3.6-Flash、Qwen3.6-Plus、Qwen3.7-Max 等 7 个
    摘要七模型普遍超额调用。

    七个来自四个家族的工具调用模型,在保守的字面授权准则下会检索超出请求的私人数据。作者把该行为称为 proactive over-authorization,用 OVERACT 做无 LLM 评审的测量,并用 SELFAUDIT 做不依赖 oracle 的执行前过滤。

    深度解读完整解读
  13. 防御arXiv 2610.01349

    PACE:面向工具调用 LLM Agent 的来源感知能力强制执行

    提出 PACE,在工具调用前做路径隔离与效果授权

    发表
    场景
    AI Agent
    被测模型
    gpt-5.6-luna、DeepSeek-V4-Flash、Qwen-3.8-27B
    摘要PACE 在工具边界做路径割与效果核验。

    PACE 是面向工具调用型 LLM 智能体的运行时调解:当准入证据无法区分会改变行为的规格时,不在出口站点上撤销调解,而在最后一次工具调用前同时检查表示出的影响路径和请求权限。

    深度解读完整解读