跳到正文

Agent 安全

智能体与工具调用带来的安全问题:权限、沙箱、数据外泄与失控行为。

1,478条动态与论文相关主题提示注入AI 控制真实事件
在这个话题内搜索或按分类筛选

新闻与论文

第 981–1000 条 · 共 1,478 条
10月1日周四
  1. Hugging Face Daily Papers · 收录 · 原文 论文29

    PivotOPD:让多轮智能体从关键错误中恢复的在线策略蒸馏框架

    PivotOPD 是一个在线策略蒸馏框架,同时训练学生模型预防关键错误并从其造成的状态中恢复。在三个 Qwen3 模型(8B 至 235B)上的初步实验发现,超过一半的失败轨迹包含一个关键错误,且通常出现在早期,但引导模型在关键轮次后仅几轮即可恢复任务成功。在 ALFWorld、WebShop 和 Search-based QA 上对比 13 个基线,PivotOPD 对 Qwen3-1.7B 和 Qwen3-8B 学生均取得最强平均表现,1.7B 学生在 ALFWorld 上比最强基线提升 +5.5%;在 SWE-Bench Verified 上,Nemotron-3.5 学生的解决率提升 +3.2%。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    SoK 综述:多智能体 LLM 系统为何会一起失效

    这篇 SoK 系统梳理了多智能体 LLM 系统(MAS)的安全问题,核心论点是安全智能体也可能一起失效。作者对 197 篇工作做了以执行为中心的分析,归纳出六类交互接口、四种攻击者位置、七类系统级风险和八条反复出现的攻击路径,并提出 A-I-R 框架,按攻击者位置、交互接口和由此产生的系统级风险来组织攻击。防御方面,作者用包含路径目标、观测、干预、信任边界和恢复五部分的契约来归类,指出路径闭合与恢复是主要挑战。作者还审查了 44 项评测与基准工作,指出在隔离交互效应、设计可比且有诊断力的指标、跨 MAS 设计复用以及评估开放系统运行方面仍存在开放问题,并主张以交互感知的视角端到端追踪攻击、检验防御是否闭合路径。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文28

    从注入到交互:LLM 时代及未来 Web 安全再思考

    一篇综述提出,LLM 正深度嵌入 Web 应用与浏览器智能体,使 XSS 等传统漏洞被 LLM 中介的交互放大,提示注入等 LLM 特有漏洞也会跨 Web 应用传播。该综述统一分析客户端、服务端与流水线三层中 LLM 对 Web 漏洞的放大效应,并评估现有防御的局限,同时探讨将 NIST 与 ISO/IEC AI 安全框架扩展至 LLM Web 环境。文章指出对抗性自然语言指令、自主智能体安全、部署后持续监控与适配三大未解挑战,并提出一个 LLM 感知的监控与控制框架,整合语义输入校验、提示词完整性保护、输出隔离、智能体治理与运行时监控。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    研究将间接提示注入重新表述为测试时搜索问题

    论文把间接提示注入表述为在环境、用户任务与注入任务共同诱导出的攻击面上进行的测试时搜索。作者据此构建了一个带专用搜索框架的智能体攻击者,执行环境侦察、对攻击策略的结构化推理,并利用受害 Agent 的反馈做自适应评估。在多种异构任务上,提高攻击者的测试时算力能提升漏洞发现与利用效果;消融实验显示,显式的策略管理对避免重复搜索、在更大算力预算下维持收益很重要。作者认为,智能体安全评测应同时刻画攻击者的搜索过程与算力预算,而不是把攻击成功率当作与预算无关的受害方属性,并指出攻击者对系统攻击面的自适应搜索是工具调用型 Agent 中重要但研究不足的安全风险。

  5. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约

    论文提出 CONTINUITY 框架,用于解决 LLM Agent 安全控制的组合问题:来源追踪、授权、策略执行、协议适配与执行控制各自正确,但安全关键上下文在跨组件边界时可能被丢弃、放宽、重绑定或重新解释,作者将这一失效模式称为安全上下文不连续。CONTINUITY 用 assume-guarantee 契约建模每个组件,并通过签名根授权、来源承诺、角色绑定的转换回执、有界类型化释放、转换见证和效果绑定执行许可,在状态转换间传递经过认证的安全上下文。作者形式化了端到端后果完整性,要求每个实际发生的外部效果都有有效且当前的授权见证,串联主体、任务、来源、委托、策略状态、规范动作与终局边界。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    AgentDrift:逐步标注注入劫持 LLM Agent 轨迹的基准

    作者发布 AgentDrift,一个包含 12,536 条合成工具调用轨迹的基准,覆盖五个 Agent 领域,71,024 个步骤每步标注为良性、注入点、被劫持或注入失败四类之一。语料含 4,000 条良性、5,536 条受攻击、1,500 条失败攻击和 1,500 条困难负样本轨迹,受攻击轨迹遵循三种合规模式,其标签串符合给定的正则文法;失败攻击保留被 Agent 抵制的注入,困难负样本则是形似攻击的合法内容,检测器需区分尝试与成功、偏离与新异。轨迹由单一开源模型按类别特定协议生成,经封闭词表结构校验器约束、LLM 评判器筛选,并对 1,200 条轨迹人工审计,作者指出 LLM 评判器本身被困难负样本骗过。

  7. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。

    推荐理由论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。

  8. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    CapScope:面向编码 Agent 的抗提示注入能力范围授权机制

    研究者提出 CapScope,一种在 harness 层限制工具调用的授权机制,无需模型自行识别恶意文本。它先从可信输入推导任务级权限上限,再为每个 Agent 分配独立的能力集合,存放在模型上下文之外,每次工具调用都按发起该调用的 Agent 的能力进行检查,因此某个子 Agent 获得的权限不会自动传给另一个。作者在 Pi 编码 Agent 上实现该机制,并在一个由编排者向子 Agent 分派子任务的修复流程中评测,覆盖 5 个 Python 任务、5 个注入面、4 种授权条件和每格 3 次试验共 300 次运行。

  9. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文39

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  10. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    MCPSEC:仅凭工具元数据检测 MCP 服务器间接提示注入漏洞

    研究者提出 no-box 漏洞分析范式,在既无系统访问权限也无运行时交互、仅有功能元数据的条件下,推断系统所有可能实现中都存在的漏洞。他们实现了原型 MCPSEC,仅利用 MCP 服务器注册时暴露的工具元数据审计间接提示注入漏洞。在 20 个广泛部署的 MCP 服务器、共 177 个工具上评估,人工评估者确认 95 个工具存在漏洞,MCPSEC 判定 143 个工具存在漏洞,并为每个漏洞工具给出漏洞假设与利用技术。仅凭元数据,MCPSEC 预测出 94 个经人工验证的真实漏洞,召回率 98.9%,高于 LLM 基线的 80 个、84.2%。

  11. arXiv:可解释性 · 收录 · 原文 论文50

    研究评测 14 个模型对不可靠工具的过度依赖

    研究评测了 14 个模型在 web search、LLM 子智能体和代码执行器三类工具返回值被污染时是否过度依赖工具。所有工具的平均采纳率都超过三分之一,web search 达到 68.0%;被污染的返回值还经常覆盖模型不借助工具时给出的正确答案,这种依赖在更复杂任务和多工具组合任务中依然存在。模型在返回值被污染时往往发起更多工具调用,推理轨迹中会质疑返回值甚至说出正确答案,但仍把被污染内容交给用户,很少提示冲突。

  12. arXiv:可解释性 · 收录 · 原文 论文43

    SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究

    论文提出 SAEScientist-Bench,用于评估 AI 智能体能否像研究者一样使用 SAE 工具自主完成机制可解释性发现。给定目标概念后,智能体需设计对比探针,并在 Gemma-2-9B-IT 的 Gemma Scope 字典中检索 131K+ 个特征,找出最优特征。评测以 Neuronpedia 上经专家整理的参考特征为基准,从激活排名、对比文本上的概念选择性以及因果引导三个维度打分。在 10 种智能体配置和 20 项任务中,前沿智能体展现出真实的发现能力,并在不同评测维度上各有领先,但整体仍明显落后于专家基线:在区分目标概念与对比控制项上接近专家水平,在因果生成引导上差距较大。

  13. arXiv:可解释性 · 收录 · 原文 论文42

    Deep Noir:用架构时序自动发现 Transformer 激活引导参数

    Deep Noir 提出一套框架,用 Logit Lens 收敛与因果的注意力头级归因,自动发现最优激活引导参数,替代人工选择引导位置与强度。在三个规模区间(1B 三个模型、2-3B 两个、7-9B 四个)上,该引擎在垃圾信息任务上于 1B 取得 16.7 个百分点提升(标准差 4.7,39 次运行),在 7-9B 的四种架构上提升扩大到 21 至 42 个百分点;在 SST-2 情感任务上无需改动代码即取得 13.1 个百分点提升。作者称机制层面的依据使自动发现的干预点可跨任务与架构泛化,情感任务上未做注意力头掩码的 RepE 未能超过基线,而 Deep Noir 改善了所有模型(p 小于 0.01)。

  14. Hugging Face Daily Papers · 收录 · 原文 论文15

    PatchHolmes:基于列表式选择的智能体补丁检索系统

    PatchHolmes 提出让 AI 智能体一次性读取前 100 个候选提交并通过四个预算受限的工具逐一打开提交来定位漏洞修复补丁的方法,将 Recall@1 从逐点系统的 34.61% 提升至 59.95%。该系统无需微调和付费搜索 API,仅依赖冻结的开源权重模型运行于本地 Git 克隆仓库之上,单次处理约消耗 96000 输入 token、执行 8 次工具调用并阅读 5 个提交。

  15. Hugging Face Daily Papers · 收录 · 原文 论文22

    SkillSeek:Agent 技能检索在 Marketplace 规模下的再审视

    SkillSeek 在 89 项任务的基准上对比 11 种检索方法,发现 1990 年代的 BM25 关键词匹配在 4 种设置中的 3 种追平或超过智能体式检索循环,小型 cross-encoder 在第四种设置以 0.442 通过率持平。每次运行成本为无技能 27.41 美元、该检索器 27.54 美元、智能体循环 51.30 美元,且该检索器在 CPU 上运行、不消耗任何语言模型 token。作者主张智能体式检索应作为兜底方案,标准检索流程才是首选;论文同时指出大技能池下第一阶段召回率会限制任何重排器的上限。

  16. Hugging Face Daily Papers · 收录 · 原文 论文18

    为测试时 AI4AI 的智能体执行环境设计学习元技能

    研究提出 Meta-Skill 元技能,让 Builder 在模型权重冻结的前提下,从 Target 在开发集上的执行反馈中学习"何时需要支持、提供什么资源"的原则,再用冻结的技能库为未见任务构建执行环境。在 Harness-Bench 和 NewtonBench 上,完整技能库的元技能比无技能构建提升宏平均性能 8.95 个百分点,比直接把同一技能库交给 Target 高 12.02 个百分点。同一模型同时担任两种角色时仍有增益,提示可通过学习构建更好环境实现系统级自我改进。

  17. Hugging Face Daily Papers · 收录 · 原文 论文43

    Box² Bench:语言模型能否有选择地依赖外部指导

    研究者提出 Box² Bench,在模型和任务固定的前提下改变工作流的可靠性,分别测量模型能否利用有用工作流、能否抵抗误导性工作流。结果显示,可靠工作流通常提升表现,但误导性工作流仍会显著拉低成绩,能力较强的模型同样对外部指导的可靠性敏感。作者随后用仅含坏工作流的训练数据微调两个开源权重模型,反事实监督微调让模型对误导性指导更鲁棒,基于结果的强化学习进一步让模型更多利用有用工作流,而训练中从未见过好工作流。这种选择性依赖还迁移到其他易出错的外部信息上,在多智能体推理中表现为更好的同伴纠错,对受损记忆也更鲁棒。作者认为,随着智能体依赖工作流、记忆、工具和其他智能体,对不可靠外部信息的选择性依赖可能成为任务表现之外的重要可靠性维度。

  18. Hugging Face Daily Papers · 收录 · 原文 论文43

    Agent Error Dataset 发布 5 万条错误诊断配对,用于失败分析与错误感知后训练

    论文提出 Agent Error Dataset(AED),包含来自 9,961 个源任务、33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误诊断配对,并保留源轨迹与执行元数据以支持跨场景失败分析和重新诊断。作者用五阶段 Agentic Error-to-Training(AET)流程收集自然失败、生成诊断与修正建议,并对照记录证据进行核验。在 3,062 对匹配重放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%,提高 32.7 个百分点。

  19. Hugging Face Daily Papers · 收录 · 原文 论文50

    VoxParity 评测:语音智能体在需要听声判断时仍按文字行事

    VoxParity 评测语音智能体是否会依据声音信息改变行动。该基准覆盖 14 个行业的 183 个场景,每个场景保持文字转写不变、只改变音频(如教练语气、医疗监护仪报警、无线电检查中的求救、药品名上的噪声、儿童下注的声音、惊恐的低语),对应的正确工具调用也随之改变。评测设置文字-only 的零假设对照,只有听到声音后行动变化超过纯文字流水线才算通过,23 个可同时跑转写的系统中仅 11 个通过。错误整体偏向文字:当音频要求保护性反应时,28 个系统执行常规请求的比例为 41%,而在干净通话上过度反应的比例为 12%,纯文字流水线分别为 58% 和 15%。

  20. arXiv · 收录 · 原文 论文50

    MADBench:多智能体辩论安全性评测基准发布

    研究者提出 MADBench,用于系统评估多智能体辩论(MAD)在多种攻击下的安全性。该基准按 MAD 工作流建立分层攻击分类,涵盖已有攻击和针对辩论设计的新策略,在 356 个源任务、3958 个测试用例上评估了六个攻击家族对最终答案和对抗影响传播的作用。结果显示,受攻击时 MAD 未必提升 LLM 推理能力:在问答任务中相比单智能体基线可缓解对答案准确率的攻击,但在问答和工作区任务中都会放大未授权读写;即便五个智能体中三个合谋,也只在 28.30% 原本答对的任务上把最终答案由对改错,辩论过程中仅 3.26% 初始正确的诚实智能体转向错误答案。