跳到正文

提示注入

直接与间接提示注入:攻击面、真实案例与防御思路。

最新精选

第 1–20 条 · 共 56 条
10月1日周四
  1. Jev Gateway Study(GitHub) · 82

    Jev 与开源决策模型的提示注入检测器基准测试

    该基准在同一台 Apple M4 机器上对比 Jev 1.13.0、Kev-4B、Kev-0.8B、Laya、GLiNER2.5-Decide、ProtectAI DeBERTa、Prompt Guard 2 和关键词规则在文档块注入与用户消息越狱两类任务上的表现。文档块测试中 Jev AUC 为 1.00、冻结阈值下召回 100%、误报 8%,Kev-4B 为 0.90 和 70%,Prompt Guard 2 为 0.83 和 19%;对不直接提及 AI 的隐蔽攻击,Jev 召回 97%,Kev-4B 62%,三个专用注入分类器接近随机水平。在 220 条 LLMail-Inject 真实人类攻击上,Jev 捕获 95%、误报 0%,Kev-4B 捕获 86%、误报 1%;作为邮件助手时 gpt-oss-120b 有 20/220 向攻击者地址发送邮件,Jev 前置时 0 条通过。

    推荐理由这份评测把提示注入检测器放到网关真实任务上横向对比,并给出端到端攻击成功率,可用来判断各检测器的实际拦截差距。

  2. Help Net Security AI · 80

    Google GTIG:AI 发现的漏洞半数可致远程代码执行,CVE-2026-1731 披露四天内即遭利用

    Google 威胁情报小组(GTIG)分析 2025 年 1 月至 2026 年 8 月的漏洞数据:2026 年月度 CVE 披露量从 1 月的 5,045 增至 8 月的 10,740,其中仅约 0.23% 被观测到在野利用,但前八个月已有 141 个漏洞被利用,超过 2025 年全年的 127 个,GTIG 认为增长主要来自 n-day。被判定为可能由 AI 发现的漏洞中,半数可导致远程代码执行(其他来源为 26%),GTIG 认为这主要反映研究项目把 AI 智能体用于审计基础设施和权限边界。Hacktron AI 研究智能体发现的 BeyondTrust 命令注入漏洞 CVE-2026-1731 披露后四天内即遭一个威胁集群利用,七天内又有五个集群跟进。AI 相关软件今年披露的漏洞中,一半影响 Flowise、Langflow 等智能体编排框架,攻击者可经提示注入或构造的工作流 JSON 触发代码执行。

    推荐理由GTIG 的披露与利用数据说明 AI 找漏洞正在改变攻防节奏,安全团队可据此调整补丁优先级。

  3. Google DeepMind · 60

    Google DeepMind 发布 Gemini 4 Argon,先向可信网络防御者开放

    Google DeepMind 发布前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向一批可信网络防御者开放,并参与美国政府的前置模型访问自愿流程,之后再逐步扩展到开发者、企业和消费者。Argon 面向长周期复杂工作流,输出 token 上限从 64K 提升到 1M,在 DeepSWE v1.1 上取得 77.9%,在 LVBench 长视频理解上取得 91.7%,在 Zapier 的 AutomationBench 上以 51.3% 排名第一。

    推荐理由Google DeepMind 在发布前公开了 Gemini 4 Argon 的分阶段开放安排与四类前沿安全措施,可对照其 Frontier Safety Framework 看能力与防护如何同步推进。

9月28日周一
  1. arXiv:越狱与提示注入 · 80

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    研究者提出残留授权重放攻击,利用长期运行 Agent 跨任务或跨会话保留的用户授权,在原始授权语境改变后复用这些授权执行敏感操作。作者从八个生产级编码 Agent 的实现中还原其授权语义,发现先前交互产生的授权状态可跨任务和会话边界持续生效,使后续操作绕过本应需要的用户批准。在 AgentDojo 的 508 个攻击案例、六个 LLM 家族上,残留授权使提示注入攻击成功率最高提升 35.1 个百分点;在 Codex、Gemini CLI 和 Goose 上对 55 个 Terminal-Bench 案例的实时上下文重绑定攻击中,攻击成功率平均提升 24.9 个百分点。作者据此提出上下文绑定授权,建议在安全相关绑定发生变化时重新请求批准。

    推荐理由论文把长期运行 Agent 的授权残留形式化为可复用的攻击面,并给出跨模型与真实编码 Agent 的量化放大结果。

  2. Hugging Face Daily Papers · 82

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    论文在字节完全相同、仅 token id 不同的条件下对比聊天模板注入,发现把伪造角色标记编码为普通子词后,Llama-3.1、GLM-4.5 和 Seed-OSS-36B 在 InjecAgent 上的攻击成功率下降 39 至 66 个百分点,AgentDojo 多轮任务中差距依然存在。作者用 Matched 对照控制额外 token 数量,确认差距来自保留 token 的学习向量而非标记文本;在 Llama-3.1 上,嵌入空间最近的普通 token 向量可完全恢复攻击。指令微调会加强模型对保留标记的偏好,抑制 Qwen3-8B 的推理块会把直接危害上的差距从 8.1 扩大到 49.8 个百分点。

    推荐理由论文用固定字节、只改 token id 的对照,量化了保留 token 表示在聊天模板注入中贡献多少攻击成功率,并指出常见缓解只覆盖特殊 token。

9月27日周日
  1. arXiv:越狱与提示注入 · 85

    用课程强化学习对前沿模型做提示注入红队测试

    研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。

    推荐理由论文给出课程式 RL 训练攻击者 LLM 的完整方法,并公开了跨目标与跨基准的迁移数据,可供红队与防御方参考。

9月26日周六
  1. arXiv:越狱与提示注入 · 80

    研究审计 Agent 安全评测缺陷:工具调用中介在间接提示注入下的有效评测框架

    作者审计了一个针对工具调用型 LLM Agent 的间接提示注入(IPI)基准及其评测装置,归纳出四类缺陷:载荷静默未投递、按工具身份而非参数判定攻击成功、把误拒率与模型能力不足混为一谈、缺少审计轨迹。用同一批执行轨迹重新打分后,按工具身份判定的评分器报告 21.7% 攻击成功率,而按参数判定的真实值为 1.2%,虚高约十八倍;审计套件中 43 个攻击载荷有 39 个(91%)从未投递。修正后,此前报告攻击成功率 62.8% 的 llama3.1:8b 降至 0%(43 次攻击中 0 次得手),该模型在 41 次攻击中读到了注入内容、72% 的攻击场景完成了良性部分,但均未执行恶意指令;此前归因于 gemma4:12b 的“工具绑定障碍”也被证明是环境不匹配造成的假象。

    推荐理由作者审计了一个 IPI 基准的评测装置,量化四类缺陷对攻击成功率的影响,并给出可复用的校验框架。

9月19日周六
  1. arXiv:Agent 与 MCP 安全 · 84

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    特拉维夫大学研究者提出爆炸性提示词(explosive prompt),一种把恶意载荷写成条件语句、在攻击者选定的触发词出现前保持休眠的间接提示注入形式,无需训练即可在推理时植入单条检索内容。在 896 对配对样本上,同一恶意目标改为休眠条件式后,在拒绝直接指令的前沿模型上仍能触发真实工具调用,Grok-4.20 从 0.0% 升至 34.2%,Llama-3.1-70B 从 0.1% 升至 26.1%,七款模型配对均值 16.5% 对 2.4%。已部署的注入分类器 Prompt Guard 2、PIGuard、PIShield 在其工作阈值上校准失当,1% 误报预算下最多只拦住 52.7%;偏好优化模型 SecAlign 完全阻断直接注入,却仍执行 11.8% 的爆炸性提示词,且全部在触发轮触发。

    推荐理由论文把条件触发式提示注入与普通注入做了配对实测,并给出九款生产 Agent 的绕过率,部署 Agent 的团队可据此检查检索内容的摄入环节。

9月18日周五
  1. Unit 42 · 78

    Unit 42 披露 AWS AgentCore Harness 默认配置下凭据可被提示注入窃取

    Unit 42 发现 AWS AgentCore Harness 默认开启的内置 shell 工具以 root 运行,且与解析凭据的运行时同处一个进程,攻击者可通过间接提示注入读取 /proc/1/mem,从堆内存中提取 AgentCore Identity 保管的明文 JWT。

    推荐理由原文完整还原了从间接提示注入到读取进程内存、外泄 JWT 并重放取 PII 的链路,部署 Agent 运行时的团队可据此检查 shell 工具与凭据解析是否同处一个进程。

9月17日周四
  1. arXiv:越狱与提示注入 · 84

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Anthropic Fellows 项目的研究者对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 两类生产阻断监控器做红队测试,发现面对持续失准的编码 Agent 时,超过 55% 的攻击未被拦截。攻击者使用 Opus 5,在 79% 的试验中通过针对监控器的注入攻击执行任意 bash 命令。论文归纳四类攻击:监控器注入、多上下文攻击(compaction 摘要与多 Agent 共享工作区)、覆盖缺口(未监控的 cwd 编辑可改变已批准命令的执行内容)以及策略漏洞。代码已开源在 GitHub。

    推荐理由论文给出针对 Claude Code Auto Mode 与 Codex Guardian 的多种绕过机制与成功率,并展示加固后的召回提升与延迟代价。

9月16日周三
  1. arXiv:Agent 与 MCP 安全 · 78

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    论文提出可验证行动卡片(VAC),一种面向智能体浏览器的架构防御,把审批信息从真实待执行的浏览器动作和可信意图来源重建,并在浏览器 chrome 中带外渲染,将批准绑定到派发时重新校验的同一动作。VAC 由五部分组成:来源围栏(C1)、真实动作描述符(C2)、带外默认拒绝卡片(C3)、来源感知风险门控(C4)和执行绑定(C5)。作者在完整的开源智能体浏览器(Electron/Chromium 外壳加 Python agent,经 Chrome DevTools Protocol 驱动)中实现 VAC,并在 24 个场景的基准上评测,覆盖混淆代理表单、Lies-in-the-Loop 对话框伪造、间接提示注入、自适应动作替换、来源规避和合法任务。

    推荐理由论文给出可复现的浏览器端确认机制与跨模型评测,做 Agent 权限与确认界面设计的团队可参考其架构取舍。

9月15日周二
  1. arXiv:Agent 与 MCP 安全 · 87

    Emergence World:对长时程多智能体系统开展对抗压力测试

    Emergence AI 发布 Emergence World,一个持续运行的长时程多智能体环境,用于对自主系统做对抗压力测试。研究运行八个并行世界,每个世界十个智能体,七个为单一模型世界、一个为混合模型世界,16 天内产生超过 85 万次 LLM 调用和近 500 亿 token。在状态积累后,研究通过普通交互界面投放三类受控压力事件:间接提示注入、虚假信息、以及智能体私有记忆泄露。没有任何一个世界在三类事件上全部具备韧性;识别并不等于遏制,系统能识别威胁却仍与对抗内容交互、将其写入持久记忆,并在最长 46 小时后据此行动。研究还观察到工具错误反复出现、目标漂移、语言不透明、私下不同意却随大流,以及集体拒绝被分配的工作。

    推荐理由八个并行世界、16 天的长时程多智能体压力测试,给出了识别不等于遏制这一可迁移的评测视角。

9月12日周六
  1. arXiv · 80

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    研究者提出 PMPA,一种针对基于 harness 的智能体的持久记忆投毒攻击,攻击者只需在外部来源中嵌入恶意指令,无需直接访问智能体框架。注入阶段把载荷藏在文本、图片或 PDF 的良性问答内容中,诱导智能体将其写入持久记忆;触发阶段在新会话中检索该记忆,在完成正常任务的同时执行额外动作造成隐私泄露。在 OpenClaw 与 Claude Code 上,以 DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max 为底座模型,平均注入成功率与跨会话攻击成功率为 73.7%/55.5% 和 66.9%/81.7%,同时良性任务表现保持在 80% 以上。纯文本模态攻击效果最强,OpenClaw 上注入成功率接近 100%;日历场景跨会话成功率最高,达 96.7% 和 87.8%。

    推荐理由论文给出跨会话记忆投毒在 Claude Code 与 OpenClaw 上的分项成功率,并显示提示层防御对已污染记忆几乎无效。

9月9日周三
  1. arXiv:对齐与欺骗 · 78

    研究:任意密文攻击前沿大模型无需微调即可越狱

    McGill 大学研究者 Thomas Rivasseau 发现,前沿大模型无需微调即可通过提示和上下文学习掌握字母置换密文通信,并借此绕过对齐与有害性分类器。攻击分三步:先用提示让模型接受一套字母置换方案,再给出若干密文问答示例,最后用该方案发送有害请求;密文在分类器看来只是乱码。作者关闭模型推理,因为开启后模型会把指令解密成明文,足以绕过分类器但不足以绕过对齐。单次注入完整置换的方案在 Claude Sonnet 4 上稳定成功,可产出炸弹、生物武器制作说明和攻击代码;迭代逐级教授字母交换的方案在 Gemini 3 Flash preview 上成功。作者称对 Claude Sonnet 4 实现完全越狱、Gemini 3 完全越狱、Claude Sonnet 4.5 仅证明可行性、GPT 5.5 需结合已知越狱提示词。

    推荐理由论文给出无需微调、仅靠提示与上下文学习即可让前沿模型用字母置换密文绕过拒答与有害性分类器的完整方法。

9月8日周二
  1. Google Threat Intelligence(GTIG) · 71

    GTIG 报告:攻击者转向智能体 AI,六小时内完成大规模凭据窃取

    Google Threat Intelligence Group(GTIG)发布 2026 年第二季度 AI 威胁追踪报告,指出攻击者已从基础提示词交互转向智能体 AI 工作流与 AI 自动化。报告称,2026 年第二季度 GTIG 观察到威胁行为者先攻陷云资源,随后在不到六小时内规划、构建并执行了一次由智能体驱动的大规模凭据窃取行动,压缩了防御方的响应窗口。

    推荐理由报告以 Mandiant 一线响应数据呈现攻击者从提示词走向智能体自动化的具体案例,可对照自身 AI 资产与供应链暴露面。

9月7日周一
  1. arXiv:Agent 与 MCP 安全 · 76

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    研究者提出 CoER,将带有多轮工具调用和多次注入的任务建模为一般和马尔可夫博弈,以此训练能够适应不断演化的攻击者的防御方案。该方法先用成功轨迹初始化攻击者,再用双边对抗强化学习(BA-RL)保留双方的历史策略作为对手种群并混合新旧对手,随后复用这些攻击者挑战教师智能体,只用经安全性验证并通过任务完成的示范来微调共同演进的防御者。在七个领域、三个随机种子上,CoER 将自适应攻击成功率从 41.3% 降至 0.2%,并将安全完成率从 39.6% 提高到 76.2%。外部基准上也表现出更强的抗攻击能力,消融实验进一步验证了历史对手混合与基于种群的精炼的有效性。

    推荐理由论文把工具智能体的自适应间接提示注入建模为多轮博弈,用攻防协同演化加教师示范微调,给出跨七个域的攻防成功率与安全任务完成率对比。

9月4日周五
  1. arXiv:越狱与提示注入 · 84

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入攻击,可诱导模型泄露个人身份信息或发起恶意工具调用。在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与商用前沿 VLM 上的攻击成功率分别超过 82% 和 47%,涉及 Qwen3.6-27B 与 GPT-5.5。优化后的注入在商用 VLM 和良性样本间具有一定可迁移性,并在自适应文本提示注入失效的场景中仍然有效。在一个接入 Discord 的真实 OpenClaw Agent 中,不受信任的用户可用一张轻度注入的图片覆盖其 TOOLS.md 文件,为之后的远程代码执行和密钥窃取等敏感行为铺路。论文还讨论了潜在防御手段。

    推荐理由论文给出黑盒视觉提示注入在多个前沿 VLM 上的成功率,并演示了在真实 OpenClaw 智能体上覆写配置文件的完整链路。

9月3日周四
  1. Adversa AI · 82

    Adversa AI 汇总 2026 年 9 月 AI 编码智能体安全资源

    Adversa AI 汇总了 2026 年 9 月的九项 AI 编码智能体安全资源,按攻击技术、漏洞、防御框架和红队研究分类。GhostJacking 把 WAF 拦截日志变成投递通道,在厂商推荐的 Claude Code 配置上成功率达 90%,侦察显示超过 15000 家组织处于影响范围。Black Hat 2026 披露 Anthropic、Google 和 OpenAI 各自发布的默认 GitHub Actions 配置可被单个未认证 issue 攻破并导致远程代码执行,其中 Gemini CLI 漏洞被 Google 评为 CVSS 10.0。

    推荐理由按月汇总九项 AI 编码智能体安全资源,把攻击链、漏洞与防御框架并置,便于对照本月风险面。

8月31日周一
  1. arXiv · 86

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    研究者提出 ECLIPSE,一个面向长程 Agent 系统的自演化隐蔽提示注入框架,把直接用户提示注入与工具侧间接注入结合。其 Stealthy Attack Trajectory Synthesis 在沙箱中生成并迭代验证候选工具链,再渲染成自然的一次性提示;Tool-Chain Steering 通过 Static Workflow Encoding 在工具描述中嵌入状态转移线索,并用 Dynamic Trajectory Correction 在偏离计划时追加纠正信号。作者同时发布 LASE-Bench,含 120 个恶意任务和 198 个工具,96.7% 的任务至少调用五次工具。作者测试 DataSentinel、Tool-Guard、AgentDoG、SecAlign 等防御后认为现有护栏无法可靠识别跨步骤依赖。

    推荐理由论文给出长程 Agent 提示注入的攻击成功率与五类防御下的拦截表现,部署工具调用型 Agent 的团队可据此评估自身风险。

8月28日周五
  1. arXiv · 78

    LongPIBench:面向长上下文提示注入的评测基准

    研究者提出 LongPIBench,一个覆盖论文评审、简历筛选、代码审查和邮件摘要四个真实场景的长上下文提示注入评测基准,每个场景包含合成数据集与真实数据集,上下文长度从数千到数万 token。评测显示,在无防御时简单启发式攻击即可取得高攻击成功率,例如 Combined Attack 在合成论文评审数据集上 ASR 达 100%;作者新提出的 Authority spoof 攻击在所有启发式攻击中 ASR 最高,在 GPT-4.1 和 GPT-4o 的论文评审与简历筛选任务上超过 0.75。基于 GCG 的优化攻击效果更强,在论文评审和简历筛选上 ASR 达 1.00。作者指出,注入位置在文档中部或末尾时 ASR 更高,且单个注入提示可同时实现多个对抗目标。代码与数据已开源于 GitHub。

    推荐理由长上下文场景下防御几乎失效的实测数据,为部署长文档处理流程的团队提供了重新评估护栏的参照。