跳到正文

提示注入

今天还没有收录新动态

第 2 页更新的内容回到最新

10月1日周四
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    ActGuard:面向 LLM Agent 间接提示注入的执行前动作审计框架

    ActGuard 是一个执行前动作审计框架,用于防御 LLM Agent 面临的间接提示注入攻击。它不判断外部内容本身是否可疑,而是评估该内容是否使当前动作偏离局部合理的预期:每一步先预测即将使用的工具并构建局部工具先验,再将候选动作与该先验对比,做工具级对比分析和参数级证据定位,识别工具选择与动作参数上的偏离。随后由验证器检查定位到的证据,只遮蔽被确认恶意的片段,并从净化后的上下文重新生成动作,从而保留合法规划灵活性、减少无差别过滤带来的信息损失。在面向工具使用 Agent 的基准上,ActGuard 将攻击成功率降至与当前最优防御相当的水平,同时任务效用接近无攻击设置。代码已公开。

  2. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    研究者提出面向工具集成 LLM Agent 的通用对抗攻击防御方法

    研究者提出一套统一框架下的通用防御策略,用于应对工具集成 LLM Agent 面临的直接提示注入、间接提示注入、记忆投毒和后门攻击四类对抗攻击。方法包含两类基于工具的防御:Attacker Tool Filtering 用异常检测(如 Isolation Forest)识别并移除可疑工具,Normal Tool Recalling 则在规划前以白盒方式恢复 Agent 的原始工具集;同时引入 Chain-of-Thought 提示与自我反思等基于提示的防御,并通过任务改写缓解攻击。

  3. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文46

    多智能体 LLM 流水线中的信任传播与结构隔离

    研究者在四智能体 LangGraph 流水线(Supervisor、Researcher、Validator、Executor)中评估共享内存投毒和通过检索文档伪造审批的间接提示注入,比较 Validator 判断与基于任务绑定签名 token 和独立策略 oracle 的授权层。在三个随机种子、60 个标注任务中,内存投毒在无防御时每次都能到达执行阶段;启用授权后攻击成功率(JBR)仍为 100%,但 Unsafe Action Rate 为 0%,说明 Validator 可被攻陷而执行仍被隔离。面对持有签名密钥的攻击者,隔离效果来自策略 oracle,独立编写的最小权限策略也能保持该结果。

  4. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文55

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。

    推荐理由论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。

  5. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文43

    Provenance-Aware Transformers:用来源感知架构分离可信边界以防御间接提示注入

    论文提出 Provenance-Aware Transformers,一种让应用提供的来源标签在模型内部生效的防御方法,用于应对大语言模型的间接提示注入问题。作者指出标准 Transformer 缺乏来源权威性的架构概念,检索文档、用户输入与系统指令都经过同一套注意力机制处理,模型只能从措辞推断该服从什么、该把什么当作数据。该方法为每个输入 token 分配编码其来源的 ring ID,并加入 origin embedding、可学习的 origin attention bias 和可学习的 origin scale,以在归一化过程中保留来源信息,从而在生成时对权威与非权威来源施加结构性边界。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文50

    ActGov:用策略约束校验治理 LLM Agent 的工具动作

    ActGov 是一个运行时执行框架,在 LLM 提出的每个工具动作产生外部影响前先做校验。它基于授权、动作、运行时上下文与安全约束的统一语义模型:ActGov-Policy 从工具规格、良性任务和已观测的失败轨迹中迭代构建策略集,每次更新都用基于 SMT 的反例检查验证;ActGov-Runtime 在运行时把每次工具调用抽象为有限策略记录,只有当调用处于任务范围内的授权边界内且满足所有适用策略时才放行。作者在 AgentDojo 和 AgentDyn 两个基准上跨多个模型和攻击配置做了评测,称 ActGov 在保持任务效用的同时持续降低间接提示注入攻击的成功率,明显优于现有防御,且不依赖底层 LLM 正确识别恶意指令。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文41

    研究者提出面向邮件 Agent 的攻击链建模提示注入检测框架

    研究者提出一种面向 LLM 邮件助手的提示注入检测框架,把攻击建模为分阶段链条,而非单纯的恶意文本二分类。该框架结合文本检测器、各阶段专用验证器、显式规则风险信号、用户意图与动作一致性分析以及 logistic 决策策略,并从提示注入数据集中推导出攻击链标签。在随机划分、时间阶段迁移、条件阶段迁移、跨数据集迁移和消融实验中,结果显示随机训练测试划分会明显高估分布偏移下的鲁棒性,框架中较晚的工具参数阶段比早期阶段更易预测。在五个二分类基准上,该框架在严格阈值策略下平均 F1 为 0.406,而五个未额外训练的预训练检测器中最强者为 0.216。研究还表明,用与攻击相似的无害邮件训练有助于降低误报,同时保留检测真实攻击的能力。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文29

    基于加密绑定身份验证能力令牌协调分布式 AI 智能体的提案

    针对自主 AI 智能体面临的提示注入攻击与凭证泄露风险,该提案提出一种基于能力安全原则的框架,利用 OAuth Agent Authorization Profile 及 W3C DID 和 VC 标准,让智能体通过加密绑定其身份与签发者身份、并限定作用域的令牌访问服务。服务方可验证委托链仅涉及权限衰减后再执行令牌操作。该安全层位于语言模型上下文窗口之外的安全模块中,使智能体能在可强制执行的安全边界内行动。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    MetaPermit:通过 LLM 推断元属性为 AI Agent 提供可扩展可审计的访问控制

    MetaPermit 是一个基于策略的 Agent 工具访问控制框架,将语义推断与安全执行解耦,以应对工具误用和间接提示注入攻击。它通过分析 Agent 与用户的交互,提取一组紧凑且与任务无关的元属性,刻画用户意图、执行上下文与拟调用工具之间的关系,从而无需枚举用户意图即可授权工具使用。运行时由 LLM 推断每次工具调用的元属性取值,再由固定策略据此允许或拒绝调用,使每个决策都可依据推断值和策略规则审计。

  10. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文53

    研究者提出面向结构化 Agent 动作的多源完整性认证方法

    论文提出一种面向 LLM 智能体结构化动作的多源完整性认证器,用于抵御间接提示注入篡改动作关键字段。该方法要求每个字段满足其证据结构支持的规则:在腐败可区分的证据类别上设定有界腐败半径并以最小命中集计数,避免重复发布或洗白副本凑出多数;对互补字段做确定性调和;证据仅剩单一来源时引入可信锚点。作者形式化两种鲁棒性概念,通过消融验证各机制,并在制裁名单(70,966 个实体)与软件供应链溯源(450 个包)上测量多源前提的成立频率,发现真实佐证在上界代理下均为少数现象,朴素证明计数会高估独立性。

  11. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    CoDeL:用协同演化防御抵御 LLM 智能体的间接提示注入

    CoDeL 是一种针对 LLM 智能体间接提示注入的协同演化防御方法,在三个 IPI 基准、九个基线和两个基座模型上把攻击成功率降低 88.5%,并比其他基线高出 38.0%。作者指出,现有训练式防御多在静态的显式注入分布上优化,学到的是表层形式线索而非区分服务用户与服从注入目标的边界,因此当恶意意图被折叠进看似合理的工作流并延迟数轮后就会失效。CoDeL 让防御方每轮通过基于 LoRA 的 GDPO 更新,在安全、任务进度和格式合规的解耦奖励下训练,使拒答注入与完成用户任务共同构成适应度。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文52

    SED:面向 LLM 智能体的免训练持续安全策略学习框架

    研究者提出 Self-Evolving Defense(SED),一个免训练框架,把有害的智能体轨迹蒸馏为可复用的安全策略,不更新模型权重,并在未来任务中检索相关策略以持续适应新攻击。作者在 DeepSeek V4 Flash、GLM 5.2 和 Kimi K3 三个开源模型、覆盖越狱、提示注入和不安全代码生成的八个基准上测试 SED。结果显示,SED 将 AGENTDOJO 上的定向提示注入成功率降至 0.42%,最佳基线防御为 3.7%;在 HARMBENCH 上把自适应 X-TEAMING 攻击成功率控制在 7.8%,最佳基线为 35.2%,同时保持良性任务效用。论文共 39 页、6 张图,代码已公开。

  13. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 14

    如何用 NVIDIA Safety Recipe 保护智能体式 AI 系统

    NVIDIA Safety Recipe 用于防护具备自主行动、工具调用与推理能力的 LLM 智能体系统。这类系统的自主性会放大目标错位、提示注入、非预期行为以及人类监督减少等风险。企业正因灵活性与低推理成本加速采用智能体系统,因此引入稳健的安全措施变得至关重要。

  14. Embrace The Red · 收录 · 原文 50

    OpenAI 新论文详解基于 URL 的数据外泄缓解措施

    OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详细说明其为语言模型智能体新增的 URL 数据外泄缓解措施。作者曾在 2023 年初向 OpenAI 报告零点击数据外泄漏洞,当时 OpenAI 尚无漏洞赏金计划,问题未获修复;同期微软在 2023 年 5 月通过 Content-Security-Policy 头修复了 Bing Chat 的同类问题。

  15. Failure-First · 收录 · 原文 43

    IHDec:用发散度引导对比解码维护多轮指令层级

    Liu 等人提出 IHDec,一种免训练、推理时的干预方法,通过实时 logit 调整维护大语言模型的指令层级(System ≻ User ≻ Assistant ≻ Data)。作者用 Jensen-Shannon 散度作为诊断工具,当低优先级角色对下一 token 分布的影响超过高优先级角色时触发冲突集,再用专家与反专家对比解码生成校正向量,并采用 ϵ=1×10−8 的归一化项和 0.97 的衰减因子保证稳定性。在 IHEval 基准上,IHDec 比训练式方法 ISE 提升 11.98 个百分点;在 Llama-3.1-8B-Instruct 的多轮冲突场景达到 50.68% 准确率,而 ISE 为 12.60%。

  16. Google Threat Intelligence · 收录 · 原文 15

    Google 详解 AI 辅助漏洞管理:从确定性管控到 ZDR 的操作蓝图

    Google Threat Intelligence 旗下 Mandiant Consulting 发文,针对企业将 LLM 智能体接入 CI/CD 做自动化漏洞挖掘与修复的场景,给出一套操作护栏建议。文中援引 Mandiant M-Trends 2026 报告称平均利用时间(TTE)已降至 -7 天,并强调应把代码库视为不可信输入以防源码注释中的间接提示注入,同时落实云服务商的零数据留存(ZDR)、工作负载隔离与人主导的红队测试。

  17. Google Security · 收录 · 原文 50

    Chrome 公布智能体能力的分层安全架构

    Chrome 安全团队公布了针对 Gemini 智能体浏览能力的分层防御设计,核心应对威胁是间接提示注入。团队引入 User Alignment Critic,由与不可信内容隔离的独立模型在规划完成后复核每个拟执行动作,判断其是否符合用户目标,不通过则否决并反馈给规划模型重新规划。Chrome 还扩展同源隔离理念提出 Agent Origin Sets,把每个会话的来源分为只读与可读写两类,只允许智能体读取任务相关来源的数据,并限制数据只能流向可写来源,模型生成的 URL 需经确定性检查限定为已知公开 URL。

    推荐理由Chrome 安全团队公开了智能体浏览的分层防御架构,包括独立审查模型与来源集合限制,可供做浏览器智能体的团队参考。

  18. Simon Willison · 收录 · 原文 28

    MCP Colors:系统化应对提示注入风险

    Tim Kellogg 提出用颜色分类 MCP 工具来应对提示注入风险:红色代表会接触不可信指令的工具,蓝色代表攻击者不应触发的关键操作,智能体可据此避免两类工具同时混用。他建议用 _meta 对象记录 MCP 工具与资源的颜色,并借助 LLM 为约 200 个工具批量打标,使分类标准可扩展到初始工具集之外。

  19. Simon Willison · 收录 · 原文 48

    OpenAI 上线 Lockdown Mode,限制提示注入后的数据外泄

    OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。

9月30日周三
  1. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文51

    Tracekit:面向自主编码 Agent 的防篡改意图-推理-动作审计系统

    Tracekit 是一个开源、无依赖的审计系统,为每个 Agent 会话捕获人类意图、模型自述推理和实际执行动作三条通道,写入哈希链账本并交叉核对。它接入 Claude Code 生命周期事件、重建多 Agent 层级、在工具调用前做策略拦截,并支持其他 Agent 通过 SDK 或 HTTP API 上报事件。

  2. Google Security · 收录 · 原文 33

    Google Workspace 如何持续缓解间接提示注入攻击

    Google 通过持续发现新攻击、扩充漏洞目录并迭代防御,缓解 Workspace with Gemini 面临的间接提示注入(IPI)威胁。其手段包括人工红队测试、自动化红队测试、Google AI 漏洞奖励计划(VRP)和公开攻击情报收集,并用 Simula 生成合成数据,使合成数据生成量提升 75%。

已经到底了