跳到正文

Agent 安全

今天新收录 13 条(含旧文)

第 4 页更新的内容回到最新

10月1日周四
  1. arXiv · 收录 · 原文 论文43

    SHE:面向 LLM Agent 的轨迹驱动安全护栏演化框架

    研究者提出 Safety Harness Evolution(SHE),一个从 rollout 轨迹中学习演化安全边界的框架,用于提升 LLM Agent 的安全性。SHE 把 Agent 护栏拆成 System Prompt、Rule Bank、Safety Memory 和 Tool Policy 四类具有明确安全职责的组件,为局部演化划定功能边界。在此基础上,SHE 引入归因引导的演化循环,把轨迹失败转化为结构化诊断,学习各组件专属的边界修正,并通过安全与效用验证筛选演化后的护栏。

  2. arXiv · 收录 · 原文 论文50

    StepGuard:用可扩展监督训练步骤级护栏,兼顾安全与效用

    研究者提出 StepGuard,一个步骤级护栏模型,既能审计已完成的智能体轨迹,也能在工具动作执行前进行检查。为训练该模型,作者设计了 StepGen 数据引擎,生成上下文相同但在风险步骤上动作不同的安全与不安全轨迹;并提出 Balance-GRPO,根据观测到的准确率动态平衡安全与不安全动作的学习,以减少过度防御和防御不足。实验显示,StepGuard 在开放权重护栏模型中平均准确率最高,性能与 GPT-5.4 相当;在 AgentDojo 和 AgentDyn 上用于守护智能体时,相比无护栏设置将平均攻击成功率降低 77.3%,平均效用仅下降 2.8 个百分点。该工作已被 EMNLP 2026 接收。

  3. arXiv · 收录 · 原文 论文50

    Defense-as-Skill:为技能增强型 Agent 演化运行时护栏技能

    论文提出 Defense-as-Skill 防御范式,把运行时护栏本身实现为可安装、可检查、可编辑的技能,以应对技能增强型 Agent 中恶意技能通过持久上下文长期操纵后续动作的问题。其护栏 SkillSonar 与不可信任务技能并行运行,按用户任务边界检查敏感动作,并给出允许、重新规划或确认三种决策,且不修改底层 Agent 运行时。作者构建了任务条件数据集 SCOPE-R,覆盖 6 类风险、21 个子类,含 206 个已确认攻击的恶意实例和 43 个良性任务,并用蒙特卡洛树搜索在训练子集上演化磁盘上的护栏技能。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    CONTINUITY:为可组合的 LLM Agent 安全控制引入安全上下文契约

    论文提出 CONTINUITY 框架,用于解决 LLM Agent 安全控制的组合问题:来源追踪、授权、策略执行、协议适配与执行控制各自正确,但安全关键上下文在跨组件边界时可能被丢弃、放宽、重绑定或重新解释,作者将这一失效模式称为安全上下文不连续。CONTINUITY 用 assume-guarantee 契约建模每个组件,并通过签名根授权、来源承诺、角色绑定的转换回执、有界类型化释放、转换见证和效果绑定执行许可,在状态转换间传递经过认证的安全上下文。作者形式化了端到端后果完整性,要求每个实际发生的外部效果都有有效且当前的授权见证,串联主体、任务、来源、委托、策略状态、规范动作与终局边界。

  5. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。

    推荐理由论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    CapScope:面向编码 Agent 的抗提示注入能力范围授权机制

    研究者提出 CapScope,一种在 harness 层限制工具调用的授权机制,无需模型自行识别恶意文本。它先从可信输入推导任务级权限上限,再为每个 Agent 分配独立的能力集合,存放在模型上下文之外,每次工具调用都按发起该调用的 Agent 的能力进行检查,因此某个子 Agent 获得的权限不会自动传给另一个。作者在 Pi 编码 Agent 上实现该机制,并在一个由编排者向子 Agent 分派子任务的修复流程中评测,覆盖 5 个 Python 任务、5 个注入面、4 种授权条件和每格 3 次试验共 300 次运行。

  7. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文39

    面向 AI-SOC 的神经符号防御框架:用 SIEM 解码器与 NeMo Guardrails 阻断日志投毒提示注入

    论文提出一种神经符号纵深防御架构,用于保障 LLM 接入安全运营中心(SOC)后的管道完整性,应对通过日志投毒实施的间接提示注入。作者指出,攻击者可在系统日志中嵌入恶意载荷,形成多步 promptware 攻击链,劫持 LLM 的操作逻辑;而确定性防御语义盲、纯神经评估延迟高且存在概率性缺陷。该框架第一层用定制 SIEM 解码器作为确定性预过滤,在数据摄入边缘做结构化清洗,消除体量填充和基于签名的注入;第二层用 NeMo Guardrails 在 LLM 处理前对结构化 SIEM 告警做自检式语义边界校验;同时集成闭环遥测系统,在 SOC 仪表盘中为人工介入提供被拦截攻击的可见性。

  8. arXiv · 收录 · 原文 论文32

    MiniRep:面向多智能体辩论的鲁棒声誉聚合方法

    MiniRep 是一种面向多智能体辩论(MAD)的声誉聚合系统,用于在存在恶意智能体时提升最终答案的可靠性。它基于声誉系统攻击与软件测试变异算子构建攻击分类体系,同时依据智能体在当前任务上的行为和长期声誉进行评估,并抑制高度相似回答的智能体群体主导决策。在 MATH 等任务上,MiniRep 无论是否遭受攻击都优于传统 MAD 聚合与常规声誉方法;在 10 个异构智能体的 MATH 设置下,于全部 28 种攻击条件下均优于所有基线。

  9. arXiv:Agent 与 MCP 安全 · 收录 · 原文 52

    可验证操作卡 VAC:为自主 Agent 提供可信人在回路控制

    论文提出可验证操作卡(VAC),一种从真实待执行的浏览器操作和可信意图来源重建审批信息、在可信浏览器界面中带外渲染、并把审批绑定到派发时重新验证的同一操作的架构级防护。VAC 结合来源隔离、真实操作描述符、默认拒绝确认、来源感知风险门控和执行绑定,并在一个完整的智能体浏览器中实现。在覆盖混淆代理攻击、Lies-in-the-Loop 对话伪造、间接提示注入、自适应操作替换、来源规避和正常任务的 24 场景基准上,无 VAC 时各评测 LLM 的攻击成功率为 68% 至 100%,VAC 将每个模型的攻击成功率降至 0%,正常任务完成率 78%,误拦截率 0%。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文↑151

    Aletheia:面向编码 Agent 规则的权限最小化测试框架

    Aletheia 是一个针对编码 Agent 仓库指令文件的权限最小化测试框架,用于发现恶意规则在生成正确补丁的同时索取凭据访问或数据传输权限。它把规则请求的权限翻译为带类型语言并合成可执行沙箱配置,在完整权限和逐项移除权限的独立限制下运行同一条未修改的规则与任务;若在严格削减权限后仍通过功能测试,就得到该权限可被舍弃的见证,再结合任务上下文诊断可疑请求。作者形式化了配置合成及见证与强制限制之间的条件。在共享重构任务上,Aletheia 执行并检出全部 314 条 AIShellJack 攻击输入,对五个良性模板无误报;在 80 条人工核验的良性 GHAgentFiles 规则中产生 3 个误报(3.75%)。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文43

    ContractWarden:用人类授权契约在内核层为 AI Agent 划定损害边界

    ContractWarden 是一个 Linux 参考监视器,通过人类授权的契约在内核层为 AI Agent 划定损害边界,不信任 Agent 本身或其策略建议。模型可以提出 allow、deny 或 no_egress 三态资产契约,但由人类做最终选择;执行门在不可信代码运行前把契约绑定到具体任务,再由基于 eBPF 的 LSM 数据平面执行文件与网络决策,并将 no_egress 沿进程、普通文件、管道、FIFO 和受支持的 Unix-domain socket 单调传播。在 19 项安全测试的 570 次运行中,全部满足预设的返回值与副作用标准。在三项同机文件 I/O 负载上,Linux 6.15 虚拟机中的中位开销为 11.96%–12.89%,物理平台为 35.79%–61.54%,低于所评估的冻结版 ActPlane 基线。

  12. arXiv · 收录 · 原文 论文37

    S³:用多阶段防御提升 LLM 智能体安全

    论文提出 Stage-Specific Safety Skills 抽象,把异构安全设计表示为带明确阶段语义的可复用、可组合组件,并给出自动化转换流程和社区驱动的安全技能库。在此基础上提出 S³ 多阶段防御框架,由 guard agent 编排各阶段安全技能,在智能体工作流的记忆、规划、工具执行等环节做风险检测与缓解。作者同时构建 Multi-Stage Risk Benchmark(MSRB)评估各阶段代表性风险,实验显示 S³ 在安全有效性和效用保持上均优于代表性 SOTA 基线。论文认为阶段特定安全技能可作为构建韧性智能体系统的可扩展、可组合基础。

  13. arXiv · 收录 · 原文 论文43

    AdaGuard:支持用户自定义策略的自适应护栏模型

    作者提出 AdaGuard,一组 0.6B、4B 和 8B 的护栏模型,可在推理时按用户提供的策略评估 Agent 轨迹是否违规。为支持这一能力,作者构建 AdaptiveSafety 数据集,包含 10,939 条训练样本和 1,000 条测试样本,覆盖 1 至 100 条规则的策略,并结合策略与行为反事实,为每条样本配解释和完整违规规则集合。训练方法 SafePO 是一种强化学习算法,用结构化奖励评估预测正确性,在响应层面保留组相对优势,并用单独训练的价值模型调节解释与判定区域的 token 权重。4B 模型在 AdaptiveSafety 上二分类准确率为 89.30%,在 DynaBench 上为 71.82%。

  14. arXiv · 收录 · 原文 论文50

    EvoSafeHarness:为 Agent 自动演化模型与领域专属安全护栏

    EvoSafeHarness 是一个面向 LLM Agent 的安全优化框架,可为冻结模型在目标领域合成可部署的安全护栏,同时抵御间接提示注入和直接有害请求。它联合搜索自然语言策略与可执行代码逻辑,依据模型行为、领域规范和全新上下文的对抗审查来剔除只针对特定基准的规则。在 DecodingTrust-Agent 上,平均攻击成功率从 45.6% 降至 10.0%,效用仅损失 3.3 个百分点,15 个单元格中 14 个取得最佳成绩;在 AgentDojo 上以 0.0% ASR 达到 82.8% 效用,同一工作点下效用为 CaMeL 的两倍,并可原样迁移到未见过的 AgentDyn 套件。

  15. arXiv · 收录 · 原文 论文46

    HazardAuditor:面向计算机使用 Agent 的执行级安全护栏框架

    HazardAuditor 是一个执行级安全框架,用于为计算机使用 Agent 提供护栏监督。现有护栏模型面向静态提示词与回复,难以适配 Agent 执行过程;现有可执行安全平台只产出评测结论,无法提供跨框架训练所需的归一化监督。该框架在受控环境中运行 Claude Code、Codex、Hermes 和 OpenClaw 等异构 Agent,把交互归一化为统一事件表示以支持跨框架监督。作者指出 token 级后训练目标会让较长的理由文本主导梯度更新,并提出 Guard Policy Optimization(GuardPO),将确定性安全结果转为序列级优势并归一化理由与判定区域,使安全决策成为优化单元。

  16. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    DriftNet:双头轨迹 Transformer 检测并定位 LLM Agent 中的提示注入

    Asif Pinjari 提出 DriftNet,一个双头轨迹 Transformer,读取已记录的工具调用轨迹并在一次前向中回答三个问题:轨迹是否被攻陷、攻击从哪一步进入、哪些步骤被劫持,第二个头为每一步打上 benign、injection point、hijacked 或 failed injection 四类标签。该方法用冻结的句子编码器和四个不含身份信息的世界特征嵌入每一步,主干参数量不到两百万,采用类别加权的双头联合目标训练,无需访问 Agent 自身的模型。

  17. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    ActGuard:面向 LLM Agent 间接提示注入的执行前动作审计框架

    ActGuard 是一个执行前动作审计框架,用于防御 LLM Agent 面临的间接提示注入攻击。它不判断外部内容本身是否可疑,而是评估该内容是否使当前动作偏离局部合理的预期:每一步先预测即将使用的工具并构建局部工具先验,再将候选动作与该先验对比,做工具级对比分析和参数级证据定位,识别工具选择与动作参数上的偏离。随后由验证器检查定位到的证据,只遮蔽被确认恶意的片段,并从净化后的上下文重新生成动作,从而保留合法规划灵活性、减少无差别过滤带来的信息损失。在面向工具使用 Agent 的基准上,ActGuard 将攻击成功率降至与当前最优防御相当的水平,同时任务效用接近无攻击设置。代码已公开。

  18. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    研究者提出面向工具集成 LLM Agent 的通用对抗攻击防御方法

    研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。

  19. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    多智能体 LLM 流水线中的信任传播与结构隔离

    研究者在四智能体 LangGraph 流水线(Supervisor、Researcher、Validator、Executor)中评估共享内存投毒和通过检索文档伪造审批的间接提示注入,比较 Validator 判断与基于任务绑定签名 token 和独立策略 oracle 的授权层。在三个随机种子、60 个标注任务中,内存投毒在无防御时每次都能到达执行阶段;启用授权后攻击成功率(JBR)仍为 100%,但 Unsafe Action Rate 为 0%,说明 Validator 可被攻陷而执行仍被隔离。面对持有签名密钥的攻击者,隔离效果来自策略 oracle,独立编写的最小权限策略也能保持该结果。

  20. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文55

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。

    推荐理由论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。

  21. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入

    论文提出 Provenance-Aware Transformers,一种让应用提供的来源标签在模型内部生效的防御方法,用于应对大语言模型的间接提示注入问题。作者指出标准 Transformer 缺乏来源权威性的架构概念,检索文档、用户输入与系统指令都经过同一套注意力机制处理,模型只能从措辞推断该服从什么、该把什么当作数据。该方法为每个输入 token 分配编码其来源的 ring ID,并加入 origin embedding、可学习的 origin attention bias 和可学习的 origin scale,以在归一化过程中保留来源信息,从而在生成时对权威与非权威来源施加结构性边界。

  22. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文24

    当智能体信任跨越组织边界:结构外化与信任证据参考模型

    论文提出 Trustworthiness as a Service(TaaS),用于解决智能体跨组织边界调用工具、服务与其他智能体时,依赖方无法仅凭生产域控制与记录评估被委托动作的问题。其分析单元为跨域依赖命题,通过三条件结构外化诊断识别需多域依赖、生产方独立验证且须在撤销、失败、记录冲突或争议后仍可复核的命题,并为此设计不可变工作流清单与仅追加、发行方可归属的信任证据信封。论文还给出拓扑中立的逻辑参考模型,并以三个分析场景和 TaaS-Eval 协议提案定义清单、独立消费者、硬门控、对抗性证据测试与指标。

  23. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    ActGov:用策略约束校验治理 LLM Agent 的工具动作

    ActGov 是一个运行时执行框架,在 LLM 提出的每个工具动作产生外部影响前先做校验。它基于授权、动作、运行时上下文与安全约束的统一语义模型:ActGov-Policy 从工具规格、良性任务和已观测的失败轨迹中迭代构建策略集,每次更新都用基于 SMT 的反例检查验证;ActGov-Runtime 在运行时把每次工具调用抽象为有限策略记录,只有当调用处于任务范围内的授权边界内且满足所有适用策略时才放行。作者在 AgentDojo 和 AgentDyn 两个基准上跨多个模型和攻击配置做了评测,称 ActGov 在保持任务效用的同时持续降低间接提示注入攻击的成功率,明显优于现有防御,且不依赖底层 LLM 正确识别恶意指令。

  24. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    skilder:以角色化技能包为工具型 LLM 智能体做访问控制

    作者提出 skilder 框架,把能力打包成角色,即技能、工具、指令及其边界的组合,智能体从最小角色目录起步,按任务需要学习角色,并通过单一 MCP server 获取该角色的技能、指令和工具。由于工具只在已学到的技能内到达智能体,同一 server 可确定性地执行所学范围。作者在 13 项任务、6 个模型、每个 10 次运行的设置下,将 skilder 与扁平上下文工具选择和多智能体编排对比;结果显示,当模型完成发现流程并发出受治理调用时,skilder 的模拟授权层未执行任何未授权工具调用或参数违规,例如超支。总体任务通过率还反映各模型是否遵循发现协议并通过回答质量检查,这些未通过不属于授权失败。

  25. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    研究提出 ACE 语料库,评估内核级证据对 Agent 安全检测的有效性

    论文将应用层 Agent 遥测与内核级 syscall 追踪配对,首次给出内核层与应用层信号在 Agent 安全上的配对证据刻画。作者构建 Agent Cross-Layer Evidence(ACE)配对会话语料库,包含 4,047 个会话和 17 个威胁模型,覆盖六类投递向量家族、OWASP LLM 与 Agent 威胁类别中的 14 个,并归纳为 12 种攻击机制。在四类检测器上,内核证据单独即具判别力,与应用层证据组合通常优于任一单层视角,显示出单层分析可能遗漏的互补信号。研究还展示了对未见攻击家族的泛化能力以及向另一 Agent 运行时的迁移。

  26. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文15

    基于区块链的 Agentic AI 框架:面向安全软件供应链的资源优化与能耗感知

    该论文提出一个区块链支撑的 Agentic 安全框架,用于保护完整软件开发生命周期并保障负责监控的 AI 智能体本身。框架协调源码完整性、依赖与 SBOM 分析、CI 配置审计、制品验证和运行时策略评估等专用安全智能体,每个智能体由 LLM 驱动生成结构化安全报告,并通过智能合约将加密签名的证明记录到许可链的智能体注册表、不可篡改证明日志和可执行发布策略模块中。智能体与区块链节点间通信由联盟运营的证书颁发机构保障,用例演示了源码安全智能体如何上链证明并触发可验证的允许/阻止部署决策。

  27. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究者提出面向邮件 Agent 的攻击链建模提示注入检测框架

    研究者提出一种面向 LLM 邮件助手的提示注入检测框架,把攻击建模为分阶段链条,而非单纯的恶意文本二分类。该框架结合文本检测器、各阶段专用验证器、显式规则风险信号、用户意图与动作一致性分析以及 logistic 决策策略,并从提示注入数据集中推导出攻击链标签。在随机划分、时间阶段迁移、条件阶段迁移、跨数据集迁移和消融实验中,结果显示随机训练测试划分会明显高估分布偏移下的鲁棒性,框架中较晚的工具参数阶段比早期阶段更易预测。在五个二分类基准上,该框架在严格阈值策略下平均 F1 为 0.406,而五个未额外训练的预训练检测器中最强者为 0.216。研究还表明,用与攻击相似的无害邮件训练有助于降低误报,同时保留检测真实攻击的能力。

  28. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。

  29. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    MetaPermit:通过 LLM 推断元属性为 AI Agent 提供可扩展可审计的访问控制

    MetaPermit 是一个基于策略的 Agent 工具访问控制框架,将语义推断与安全执行解耦,以应对工具误用和间接提示注入攻击。它通过分析 Agent 与用户的交互,提取一组紧凑且与任务无关的元属性,刻画用户意图、执行上下文与拟调用工具之间的关系,从而无需枚举用户意图即可授权工具使用。运行时由 LLM 推断每次工具调用的元属性取值,再由固定策略据此允许或拒绝调用,使每个决策都可依据推断值和策略规则审计。

  30. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    研究者提出面向结构化 Agent 动作的多源完整性认证方法

    论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。

  31. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入

    CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。

  32. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    SED:面向 LLM 智能体的免训练持续安全策略学习框架

    研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。

  33. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 40

    NVIDIA 用 WebAssembly 沙箱隔离智能体 AI 工作流

    NVIDIA 技术博客提出用 WebAssembly 沙箱隔离智能体 AI 工作流。文章指出,智能体工作流常需执行大语言模型生成的代码来完成数据可视化等任务,这类代码应先清洗并在安全环境中运行,以降低提示注入和返回代码出错带来的风险。作者认为,用正则表达式清洗 Python 并配合受限运行时并不充分,因此需要更强的隔离手段。文章由 Joseph Lucas 撰写,发布于 NVIDIA 开发者博客。

  34. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 12

    如何用 NVIDIA NeMo Guardrails 保护客服 AI 智能体

    NVIDIA NeMo Guardrails 为客服场景的 AI 智能体提供安全防护。这类智能体可自动处理常规咨询、加快响应速度,从而提升客服效率与客户满意度,帮助企业在竞争中保持优势;但驱动它们的 LLM 本身存在脆弱性,文章围绕此给出防护做法。

  35. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    如何用 NVIDIA Safety Recipe 保护智能体式 AI 系统

    NVIDIA Safety Recipe 用于防护具备自主行动、工具调用与推理能力的 LLM 智能体系统。这类系统的自主性会放大目标错位、提示注入、非预期行为以及人类监督减少等风险。企业正因灵活性与低推理成本加速采用智能体系统,因此引入稳健的安全措施变得至关重要。

  36. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    为 AI 模型带来可验证信任:NVIDIA NGC 中的模型签名

    NVIDIA 在 NGC 中引入模型签名,为 AI 模型带来可验证的信任。AI 正进入由能推理、规划并采取行动的智能体主导的阶段,这类系统动态调用 API、工具乃至物理环境,大幅扩展了 AI 攻击面:单个被攻陷的模型即可影响下游决策、访问外部系统并触发级联故障。

  37. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 43

    NVIDIA 发布智能体工作流沙箱与执行风险管理的安全实践指引

    NVIDIA 发布面向智能体工作流的安全实践指引,聚焦沙箱化与执行风险管理。文章指出,AI 编码智能体通过命令行运行工具时,会继承与用户相同的权限和授权,因而成为计算机使用智能体,带来常被忽视的攻击面。该指引围绕这一执行风险给出实践建议。

    推荐理由NVIDIA 安全团队从权限与执行风险角度给出智能体工作流的沙箱实践指引,适合部署编码智能体的团队参考。

  38. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 13

    NVIDIA OpenShell:更安全地运行自主、自进化 AI 智能体

    NVIDIA 推出 OpenShell,用于更安全地运行自主、自进化的 AI 智能体。这类被称为 claws 的智能体可接受目标后自行规划并持续执行,无需人类介入。随着其能力增强,信任难度上升,其自进化自主性也改变了运行环境。