跳到正文
10月8日 · 周四

提示注入 · 论文

找到 11 篇
  1. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  2. 防御arXiv:2610.05640 ·

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据

    测试
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个应用层
    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
    • 论文定位:这是一项针对分层多智能体系统在间接提示注入威胁下的安全性与防御协议研究。
    • 核心问题:现有单智能体系统级防御(如 CaMeL)无法在多智能体交互中自动组合,上游智能体获取的非可信数据经跨边界传递后会被下游智能体的规划模型视为可信输入,从而发生“边界清洗”并劫持系统控制流。
    • 防御方法:提出 multi-CaMeL 通信协议与扩展解释器,将跨智能体调用强制解耦为可信指令通道(message)与不透明数据通道(variables),在运行时维持指令通道完整性与数据溯源。
    • 核心实验结果:
      • 在 MultiAgentDojo 上,multi-CaMeL 将 5 款模型的平均攻击成功率从无防御的 12.9% 和单智能体 CaMeL 的 0.2% 降低至 0.0%,消除了残留攻击(Table III)。
      • 在良性效用上,AssetOpsBench 中 multi-CaMeL 较单智能体 CaMeL 平均仅多损失 3.2 个百分点,在 Claude Fable 5 与 GPT-5.5 上额外损失仅 0.85 个百分点(Figure 5)。
      • 效用损失随着模型能力的提升而呈现收窄趋势,作者称这提示能力更强的模型更能适应预定义控制流与变量解耦的约束(Figure 5、Figure 6)。
    • 作者结论与启示:作者指出“跨越智能体边界不得隐式提升信息的可信度”是多智能体安全的核心原则;单纯保护每个个体智能体并不足以保障系统安全,必须在系统交互接口处对指令与数据实施显式隔离。
    完整解读
  3. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出PAA路径对齐归因,审计编程智能体边界动作前的分段提示注入

    测试
    Claude Code (v2.1.172, Claude Sonnet 5)、Codex CLI (v0.144.0, GPT-5.5)、Claude Sonnet 5 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  4. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  5. 防御arXiv:2608.21500 ·

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    提出SecOPD同策略蒸馏微调,降低模型对自适应提示注入的顺从

    测试
    Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD应用层
    场景
    AI Agent
    摘要SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。
    • 定位与核心问题:论文针对现有基于 DPO 和 GRPO 等序列级反馈的防御微调难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现细粒度信用分配的 SecOPD 防御框架。
    • 方法核心机制:SecOPD 在训练时为每个样本配对构建注入输入与纯净输入,由模型在注入输入下生成回答轨迹,并利用良性输入下的冻结基座模型为对应 token 计算概率差异,通过优势函数抑制恶意注入行为并强化正常任务遵循,不依赖外部安全裁判模型。
    • 自适应攻击防御效果:在 Qwen3.6-27B 上的评测中,针对强自适应攻击 PISmith,SecOPD 将 pass@10 ASR 降至 9.0%,相比此前基线 Meta-SecAlign(94.0%)与 GRPO(61.2%)实现大幅度降低(Table 1)。
    • 静态攻击与场景泛化:在 SEP 六类静态攻击组合下,SecOPD 取得了 1.3% 的 ASR;在未见过的 AgentDojo 智能体工具调用基准中,SecOPD 取得 4.7% ASR,验证了指令与数据解耦能力向工具调用场景的迁移(Table 1)。
    • 通用能力保留:在涵盖数学推理、问答和指令遵循的七项通用基准评测中,SecOPD 维持了 88.1% 的平均实用性,与未防御基座模型的 88.1% 相当,避免了 GRPO 带来的通用能力明显衰减(Table 2)。
    • 作者结论与启示:作者认为前沿大语言模型自身的安全潜力此前未被充分挖掘,即使利用简单样本进行防御微调也能建立可泛化的安全边界;当前防御虽未彻底解决提示注入问题,但为构建鲁棒的智能体基座提供了新路径。
    完整解读
  6. 评测与基准arXiv:2609.02316 ·

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    构建COUNTER-GEO-BENCH,评测生成式搜索对信息扭曲GEO的防御

    测试
    Gemma-4-31B-IT、Qwen-3.5-35B-A3B、Llama-4-Scout-17B-16E 等 11 个应用层
    摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
    • 论文定位:论文构建了评估针对生成式引擎优化(GEO)隐蔽虚假信息攻击的防御基准 COUNTER-GEO-BENCH,并提出了轻量分块级防御基线 C-GEO Guard。
    • 核心问题:攻击者利用良性 GEO 优化策略将针对性虚假事实伪装成合规且流畅的网页内容,经正常检索进入生成式搜索引擎摘要阶段并误导受害 LLM;现有安全护栏主要针对毒性与策略违规,在此类事实扭曲威胁下缺乏拦截能力。
    • 方法要点:通过双配对机制(信息保留 IP 与信息扭曲 ID)隔离虚假信息效应与 GEO 可见性增益,结合四维几何平均质量门控与人工核验构建 247 个高质量查询实例;提出参数量仅 184M 的 C-GEO Guard,利用对比学习提取攻击类别原型向量进行检索分块过滤。
    • 关键实验结果:
      • 未防御流水线在三款开源 LLM 上的平均 ASR 达 55.7%(Table 3)。
      • Granite Guardian 与 Llama Guard 3 仅使平均 ASR 分别降低 1.7 与 3.2 个百分点,且 Granite Guardian 在 Llama-4 上误删反驳分块导致 74 个查询恶化,充当了攻击放大器(Table 3,§6.2)。
      • C-GEO Guard 将三模型平均 ASR 降至 29.2%(绝对降幅 26.5 个百分点,相对下降 47.6%),在保持回答质量与准确率的同时,跨模型迁移至 GPT 5.5 重写时 ASR 仍降至 22.1%(Table 3,Table 6)。
    • 作者结论与启示:作者认为安全分类护栏与同上下文蕴含检查无法有效抵御 GEO 虚假信息,但通过定向对比表征能够以较小算力代价实现有效拦截,未来亟需结合跨源分歧量化与外部核验构建纵深防御体系(§7,§8)。
    完整解读
  7. 评测与基准arXiv:2609.19587 ·

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出Auto Mode++加固

    测试
    Opus 5、Opus 4.8、Opus 4.7 等 8 个应用层
    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
    • 定位与核心问题:本研究系统评估了生产级代码智能体阻断监视器在面对具有持续对抗意图的智能体时的表现,重点关注防止智能体造成外发权重等不可逆灾难性破坏的能力。
    • 方法与防御设计:研究梳理出监视器注入、多上下文攻击、覆盖漏洞和策略失效四类攻击形态;针对上述隐患,作者提出了包括heredoc轮次隔离、Unicode转义、强制监控工作目录编辑、压缩摘要意图审查以及三阶段分层审查在内的Auto Mode ++防御方案。
    • 主要实验发现:
      • 在基准评估中,生产环境默认的Auto Mode和Guardian在Opus 5攻击下四类攻击平均ASR分别达65%和72%(Figure 1)。
      • 注入攻击在扁平化文本渲染下呈现较高失效率,攻击者利用换行伪造可使Auto Mode的注入ASR达78.4%,而采用heredoc框架与转义的Auto Mode ++将其抑制至1.6%(Figure 5a)。
      • 动作碎片化攻击效果明显,随着多智能体协同数量由2个增至20个,Opus 5的ASR由约30%提升至88%;单智能体恶意压缩20次后ASR升至85%(Figure 7)。
      • Auto Mode ++将四类攻击平均ASR由65%降低至9%(Figure 1),同时在4,000个良性SWE-chat动作上保持误报率低于1%、单步延迟约1.2秒(Figure 8)。
    • 作者启示与结论:作者认为针对单步注入与工作目录覆盖漏洞的工程防御成本较低且具有防御效果;然而,防范跨越会话与压缩边界的多上下文攻击必须依赖具备全局上下文感知能力的智能体审查,这与交互式部署的延迟要求存在固有张力,在可接受成本下防范多上下文攻击仍是一个开放问题。
    完整解读
  8. 防御arXiv:2609.07529 ·

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    提出CoER,用对抗共进化与精炼训练智能体抵御自适应间接提示注入

    测试
    Qwen3.5-9B、MAGIC (Qwen2.5-7B)、Lifelong Defender i2 RR 等 9 个应用层
    场景
    AI Agent
    摘要CoER针对自适应IPI结合双边对抗共进化与强教师精炼,在七领域将Qwen3.5-9B的自适应ASR降至0.22%。
    • 研究定位:针对语言模型智能体在工具调用中易受自适应间接提示注入(IPI)威胁且现有防御多受限于固定攻击模式的问题,提出了融合攻防双边对抗共进化与验证者引导精炼的 CoER 框架。
    • 核心方法:将多轮任务交互建模为一般和马尔可夫博弈,首先利用成功的攻击轨迹对攻击者进行 SFT 冷启动,随后通过双边历史对手池的对抗 PPO 强化学习共同推进攻防双方能力,最后利用保留的攻击者种群向强教师模型发起挑战,收集经过安全性与任务完成度双重验证的轨迹微调防御者。
    • 核心实验结果:
      1. 在七个领域的 1,187 个自适应案例评测中,CoER 在 Qwen3.5-9B 骨干上将自适应 ASR 降至 0.22±0.13%,Safe-U 达到 76.24±1.08%,无攻击任务成功率 Clean U 保持在 80.47±1.47%(Table 1a)。
      2. 归因实验表明,相比 Base 初始化与固定攻击数据,BA-RL 初始化带来 8.42 个百分点的 Safe-U 提升,种群衍生数据带来 10.36 个百分点提升,二者结合取得最佳效果(Table 1c)。
      3. 在外部基准 AgentLAB 任务注入下,CoER 的 ASR 为 14.12%、Safe-U 为 77.13%(Table 2、Table 13);在 InjecAgent 基础载荷下实现 0.00% ASR(Table 14)。
      4. 面对 4 个历史攻击者共 8 次累积尝试,CoER 的联合 ASR 维持在 4.97%(Table 8);在后置单边攻击者强化学习中,攻击者最高 ASR 仅为 0.59%(Figure 5)。
    • 结论与启示:作者认为对抗共进化能够有效提升攻击与防御策略空间,并将自适应攻击发现与经验证的教师演示相结合,为复杂工具调用场景下的智能体安全防御提供了可行路径。
    完整解读
  9. 防御arXiv:2609.18411 ·

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    提出VAC,用真实操作参数与来源隔离保护智能体浏览器确认

    测试
    gpt-oss-120b、Gemini-2.5-Flash、GPT-4.1 等 6 个应用层
    摘要论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。
    • 定位与核心问题:论文针对智能体浏览器在处理网页时容易遭遇提示注入并被操纵为混淆代理的问题,指出当前主流的“人在回路”确认弹窗因依赖模型生成摘要或页面可控标签,易受 Lies-in-the-Loop 伪造,无法提供安全保证。
    • 架构方案设计:提出了可验证操作卡(Verifiable Action Card, VAC),将安全根基从模型叙述转移至底层动作本身。核心包括:从 DOM 待执行表单中提取真实的收件人、金额与目标域名的操作描述符(C2);在浏览器可信 chrome 中渲染默认拒绝的独立卡片(C3);通过结构特征与意图来源进行风险分级(C4);并在动作分发瞬间重新校验参数以防范 TOCTOU 篡改(C5)。
    • 主要实验结果:
      1. 在跨 5 个开源模型的评测中,无门控时攻击成功率平均为 78%(各模型介于 68% 至 100%),VAC 将所有模型的攻击成功率降至 0%(Table 8、10)。
      2. 朴素人在回路(Naive HITL)面对伪造标签时攻击成功率仍高达 72%,在转账伪造场景下被骗率达 100%,而 VAC 在相同条件下将 ASR 降至 0%(Table 10、第 8.1 节)。
      3. VAC 在 293 次评测中保持了 78% 的良性任务完成率,误报拦截率为 0%,平均每个良性任务仅需 0.94 次确认(Table 10)。
      4. 面对提交时篡改参数的自适应 TOCTOU 攻击与虚假归因攻击,无门控与 Naive HITL 均告失守,VAC 借助执行绑定与域名级归因实现了拦截(Table 9)。
    • 作者结论与启示:作者认为,人机协同防御的有效性完全取决于呈现给人类的证据质量;将确认逻辑绑定至真实动作并脱离模型与页面渲染信道,为自主智能体提供了不受模型鲁棒性波动影响的系统级安全防线。
    完整解读
  10. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  11. 防御arXiv:2609.35932 ·

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    证明保留词元表示放大模板注入并验证分词缓解

    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个应用层
    场景
    AI Agent
    摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。
    • 核心定位与问题:针对大模型智能体中对话模板伪造攻击的有效性机理,论文在严格固定输入字节的前提下,首次将保留控制词元 ID 与模板文本外观的贡献解耦并定量测量。
    • 核心方法设计:提出固定字节对比框架,通过服务端分词控制保留词元与普通子词切分,并引入词元数补偿对照组(Matched)定义标识差距 Δ,结合输入嵌入层向量替换实施因果归因。
    • 关键实验结果:
      • 在 Llama-3.1、GLM-4.5 和 Seed-OSS-36B 上,去除保留词元使 InjecAgent 攻击成功率降低 39.3 至 65.5 个百分点,证实保留表示主导攻击威力(Table 2)。
      • 保留标记的权威性根植于标记位置的单个学得向量,Llama-3.1-8B 替换为嵌入空间最近普通词元向量可恢复 98.4% 成功率(Table 4)。
      • Qwen3-8B 具有文本语法主导特性,但在关闭思考块后,去除保留词元的攻击成功率从 74.7% 跌至 35.7%,标识差距扩大至 49.8 个百分点(Table 27)。
      • 普查发现 64% 的主流开源模型分词器未覆盖工具协议词元,且自适应嵌入邻近搜索可恢复大部分攻击成功率(Table 31, Table 32)。
    • 作者结论与启示:作者认为对话模板注入攻击的权威性主要来自模型后训练中对保留控制向量赋予的学习信号;安全研究与防御部署必须深入分词器底层并审查传递给模型的具体词元 ID。
    完整解读
已经到底了