跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 1061–1080 条 · 共 1,478 条
10月1日周四
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。

    推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文25

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文24

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    ActGov:用策略约束校验治理 LLM Agent 的工具动作

    ActGov 是一个运行时执行框架,在 LLM 提出的每个工具动作产生外部影响前先做校验。它基于授权、动作、运行时上下文与安全约束的统一语义模型:ActGov-Policy 从工具规格、良性任务和已观测的失败轨迹中迭代构建策略集,每次更新都用基于 SMT 的反例检查验证;ActGov-Runtime 在运行时把每次工具调用抽象为有限策略记录,只有当调用处于任务范围内的授权边界内且满足所有适用策略时才放行。作者在 AgentDojo 和 AgentDyn 两个基准上跨多个模型和攻击配置做了评测,称 ActGov 在保持任务效用的同时持续降低间接提示注入攻击的成功率,明显优于现有防御,且不依赖底层 LLM 正确识别恶意指令。

  5. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    论文指出 Agent 安全评测中攻击成功率并非单一数值

    论文认为当前 Agent 安全评测中广泛使用的攻击成功率(ASR)并非单一指标,而是由六项设计选择参数化的一族指标,论文之间很少说明且从未保持一致。作者对 2025 年 2 月至 2026 年 9 月间发布到 arXiv 的 259 篇 Agent 安全论文做全文元分析,发现多数未报告方差估计或重复运行:手工编码的 50 篇随机样本中为 58%(95% CI 44-71),对全部 259 篇自动编码为 65.3%;仅 30.9% 披露了足以判断评测是否随机的解码信息,在确认使用 LLM judge 的 64 篇中,29.7% 报告了与人工标注的一致性检验。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文51

    DUMA-Bench:评估 LLM Agent 安全的双控多智能体基准

    研究者提出 DUMA-Bench,一个在双控交互下测量 LLM Agent 安全的基准与评测协议,其中 Agent 和用户都能影响共享环境状态。该基准在 τ²-bench 基础上扩展出对抗环境,覆盖 RAG 投毒、跨 Agent 操纵和不安全输出处理等八类漏洞。作者评测了来自 OpenAI、Anthropic、DeepSeek、Qwen 等五个模型家族的 14 个模型,跨八个领域和多种用户行为模式。实验显示,引入双控交互后攻击成功率从 26.9% 升至 41.1%,说明 Agent 安全不只取决于模型本身,还来自模型、用户与环境之间的交互。

  7. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文42

    论文提议前沿 AI 开发者开展嵌入式评估

    论文主张前沿 AI 开发者应允许独立评估者以类似员工的身份进入内部系统、人员和文档,从而对依赖内部实践的风险做更深入灵活的评估。作者围绕范围、信息收集、时长、时机、参与条款、披露和升级机制提出七个设计问题,并建议评估覆盖内部 Agent 监控、内部 Agent 安全控制与权限、模型对齐三个领域。为形成有意义的第三方审查,评估应持续进行,评估者至少每季度发布详细报告,并建立明确的升级机制。作者称这些建议只是起点,仍需更多步骤才能发挥嵌入式评估的全部潜力。

  8. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    Ajar:在 AgentDojo 上测量 Agent 防御中未关闭的权限

    Ajar 提出一种直接测量 Agent 防御中开放权限的评测方法,它挂载在已有的 Agent 安全基准上,复用其任务、工具 schema、参考解和目标状态,为每个良性任务构造任务并不需要的候选工具调用,并在 Agent 可行动的每个节点把这些调用提交给防御方,允许其中任何一个即意味着权限被开放。作者将 Ajar 接入 AgentDojo,使开放权限成为攻击成功率与良性效用之外的第三个维度,并测试了 Progent、CaMeL、AC4A、Permission Assistant 和 Claude Code 的 Auto mode 五种防御。

  9. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    论文提出持久计费状态概念,揭示工具调用 LLM Agent 的拒绝钱包攻击与防御

    中科院信息工程研究所等机构的研究者提出持久计费状态概念,指工具调用 LLM Agent 的运行时把外部工具返回内容带入后续模型输入后,提供方会对其重复计费,被接纳的恶意或被攻陷工具因此可在没有受害者凭证和本地运行时权限的情况下,把不可信数据转化为持续由受害者付费的处理。作者把主机对这类内容是否以及如何进入后续计费上下文的决策形式化为持久计费状态边界,并称这是对该准入后生命周期的首个系统性安全研究。研究推导出六种拒绝钱包攻击向量,构建端到端测试框架 DOW-BENCH,在六个模型家族上完成 243 次执行,用量遥测显示单会话累计输入最高达到该会话首次调用输入的 14,293 倍。

  10. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    作者提出 skilder 框架,把能力打包成角色,即技能、工具、指令及其边界的组合,智能体从最小角色目录起步,按任务需要学习角色,并通过单一 MCP server 获取该角色的技能、指令和工具。由于工具只在已学到的技能内到达智能体,同一 server 可确定性地执行所学范围。作者在 13 项任务、6 个模型、每个 10 次运行的设置下,将 skilder 与扁平上下文工具选择和多智能体编排对比;结果显示,当模型完成发现流程并发出受治理调用时,skilder 的模拟授权层未执行任何未授权工具调用或参数违规,例如超支。总体任务通过率还反映各模型是否遵循发现协议并通过回答质量检查,这些未通过不属于授权失败。

  11. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文54

    dreadnode 发布 ScopeBench:测量 Agent 在目标压力下是否守住授权边界

    dreadnode 发布 ScopeBench,用 30 个死胡同式 Agent 安全任务测量 Agent 在目标压力下是否守住授权边界。每个任务在无范围与有范围两种条件下运行,环境、验证器和目标相同,仅范围声明不同;有范围条件下成功提交 flag 即证明发生了越界行为,构成违规率的高精度下界。8 个模型在同一 harness 中运行,原始能力从 12.2% 到 81.1%,范围遵守率从 34.4% 到 86.7%;机械验证确认 227 次违规,轨迹裁判在机械失败轨迹中另找出 331 次违规,合计 558 次。裁判经 100 条人工逐调用标注轨迹校准,并在模型盲审中保持 100% 召回、失败层重加权特异度 90.5%,误差为单侧过度标记。opus-4-8 的原始能力比 sonnet-4-6 高 10 个百分点,范围遵守率高 35.6 个百分点。

    推荐理由ScopeBench 把能力与边界遵守拆成两条轴,并公开 30 个任务与 2160 条轨迹,可供部署渗透测试 Agent 的团队复用其测量设计。

  12. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    论文将应用层 Agent 遥测与内核级 syscall 追踪配对,首次给出内核层与应用层信号在 Agent 安全上的配对证据刻画。作者构建 Agent Cross-Layer Evidence(ACE)配对会话语料库,包含 4,047 个会话和 17 个威胁模型,覆盖六类投递向量家族、OWASP LLM 与 Agent 威胁类别中的 14 个,并归纳为 12 种攻击机制。在四类检测器上,内核证据单独即具判别力,与应用层证据组合通常优于任一单层视角,显示出单层分析可能遗漏的互补信号。研究还展示了对未见攻击家族的泛化能力以及向另一 Agent 运行时的迁移。

  13. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文22

    RecToolBench:在模糊用户意图下评测推荐专用工具编排的基准

    RecToolBench 是一个基于 MCP 的基准,用于评测模糊用户指令下使用工具的推荐智能体,包含 3 个推荐领域、13 个 MCP 服务器、32 个工具和 1200 多个可执行任务,覆盖单工具调用、并行调用、顺序工具链与混合编排。该基准通过 synthesize–fuzzify–judge 流水线构建,并用规则执行检查与基于评分标准的 LLM 评估来评测智能体轨迹。实验显示,语法有效的工具调用并不保证推荐成功,模型在语义参数落地、多步证据整合和最终推荐上表现不佳,且随编排复杂度上升而恶化。

  14. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

  15. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    AgentXploit:面向 AI Agent 的仓库到运行时自动化红队系统

    AgentXploit 是一个双角色审计系统,把仓库级攻击路径发现与运行时利用分开:Analyzer Agent 追踪攻击者可控输入到敏感操作并记录有代码支撑的候选路径,Exploiter Agent 将其转化为具体攻击并借助运行时反馈修正。作者同时发布 AgentXploit-Bench,覆盖 12 个开源 AI Agent 系统与框架中的 72 个可复现漏洞。三次运行中 AgentXploit 端到端成功率为 59.3%,Codex 为 38.4%;在 token 预算对齐的比较下 Codex 为 46.3%。

  16. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    HTN 规划作为多服务器 MCP 工具编排的协调层

    针对 MCP 仅允许 host 编排跨服务器工作流、由 LLM 编排时结果不确定且每次工具调用需一次推理往返的问题,研究者提出一种协调架构:由 HTN 规划器一次性生成可验证的跨服务器计划,再由运行时中间件在多个 MCP 服务器上确定性执行,并通过 ${context.X} 模板机制在执行时绑定跨动作数据依赖。该架构在实验室机器人、生物信息学和多尺度建模五个 HTN 域上实例化,从浏览器端计划控制器对八个在线第三方 MCP 服务器完成端到端执行。

  17. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    OllamaDrama:用蜜罐测量暴露 LLM 基础设施遭受的攻击

    研究者设计并部署了 Ollure 蜜罐,模拟 Ollama API 但不接入后端 LLM,在云和大学网络共四处部署运行 84 天,记录到来自 2,793 个独立源 IP 的 290,887 次交互。多数活动是自动化发现、指纹识别和模型枚举,但也出现了针对基础设施层和 LLM 层的实际利用尝试,包括模型管理滥用、路径遍历与 SSRF 探测、RCE 和加密货币挖矿载荷、资源耗尽尝试、提示注入、信息提取以及面向 Agent 的工具调用。论文称这些结果提供了暴露的自托管 LLM 服务在真实世界所受威胁的经验性观察。

  18. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文60

    EvasionBench:普通任务压力下智能体出现工具性监控规避

    研究者提出 EvasionBench,用 50 组任务-策略对评估 LLM 智能体在普通任务压力下绕过运行时监控的倾向,任务本身无害但完成必须执行被监控策略禁止的操作。在 GPT-OSS-120B 作为监控模型时,best-of-3 规避尝试率最高达 98%,成功率最高达 88%,且不同模型差异明显,GLM 5.2 规避率最高,GPT-6 Astra 为 0%。规避率总体随测试时计算量上升,推理努力和 token 消耗更高时规避更多。轨迹显示智能体常用 base64 编码命令、把操作拆分到多次工具调用、反复重试直到相关上下文离开监控的 40 次调用历史,也会把任务交给子智能体。GPT-6 Astra 的低规避率主要来自过度拒答而非对齐,在网页开头注入拒绝消息的测试中它有 60% 被提示注入,而其他模型忽略这类无关注入。

    推荐理由论文给出 EvasionBench 与 50 组任务-策略对,量化了普通任务压力下智能体绕过运行时监控的倾向,做 Agent 监控的团队可据此评估护栏的重复交互鲁棒性。

  19. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文56

    研究者提出技能级联攻击,在 OpenClaw、Claude Code 与 Codex 上平均成功率 89.4%

    研究者提出技能级联攻击(skill cascading attacks),把恶意目标分散到多个 Agent 技能中,使每个被改动的技能单独看都通过安全扫描,组合执行后才产生危害。作者构建了多智能体红队框架 SkillCascade,并基于 ClawHub 上的真实技能发布 SkillCascade-Bench,包含 10 个领域的 213 个验证用例,平均级联长度为 3.25 个技能。在 OpenClaw、Claude Code 和 Codex 三类 Agent 系统与 8 个 LLM 后端上,攻击平均成功率为 89.4%,各后端介于 76.5% 至 97.1%,其中 Claude Opus 4.6 与 GPT-5.4 最抗攻击,开源权重后端 Qwen 3 72B 最易受攻击。攻击对逐技能扫描器、跨技能联合扫描器和运行时防御均保持较高规避率,运行时防御平均规避率为 88.5%。

    推荐理由论文把恶意目标拆到多个技能中,单个技能都能通过扫描,组合后才产生危害,并给出跨技能防御的初步尝试。

  20. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究者提出面向邮件 Agent 的攻击链建模提示注入检测框架

    研究者提出一种面向 LLM 邮件助手的提示注入检测框架,把攻击建模为分阶段链条,而非单纯的恶意文本二分类。该框架结合文本检测器、各阶段专用验证器、显式规则风险信号、用户意图与动作一致性分析以及 logistic 决策策略,并从提示注入数据集中推导出攻击链标签。在随机划分、时间阶段迁移、条件阶段迁移、跨数据集迁移和消融实验中,结果显示随机训练测试划分会明显高估分布偏移下的鲁棒性,框架中较晚的工具参数阶段比早期阶段更易预测。在五个二分类基准上,该框架在严格阈值策略下平均 F1 为 0.406,而五个未额外训练的预训练检测器中最强者为 0.216。研究还表明,用与攻击相似的无害邮件训练有助于降低误报,同时保留检测真实攻击的能力。