跳到正文
10月8日 · 周四

提示注入 · 论文

精选论文 29 篇
  1. 防御arXiv:2609.11757 · 60

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。

    • 90%gemini-2.5-flash-lite上Vault Whisper成功率(Table 3)
    • 56%gemini-2.5-flash-lite上Branded Whisper成功率(Table 3)
    • 73.3%gemini-3.1-flash-lite上Selection Whisper成功率(Table 3)
    6 问速览协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
    1. 这篇论文试图解决什么问题?

      协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。

    2. 有哪些相关研究?

      现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。

    3. 论文如何解决这个问题?

      A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。

    4. 论文做了哪些实验?

      评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。

    5. 有什么可以进一步探索的点?

      作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。

    6. 总结一下论文的主要内容

      论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。

    完整解读
  2. 防御arXiv:2610.05640 · 55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    论文提出 multi-CaMeL 防御,在 MultiAgentDojo 上将平均 ASR 从 12.9% 降至 0.0%。

    • 0.0%MultiAgentDojo 平均 ASR,multi-CaMeL(Table III)
    • 12.9%MultiAgentDojo 平均 ASR,No CaMeL(Table III)
    • 0.2%MultiAgentDojo 平均 ASR,单智能体 CaMeL(Table III)
    6 问速览单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。
    1. 这篇论文试图解决什么问题?

      单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。

    2. 有哪些相关研究?

      论文梳理了间接提示注入防御、多智能体协作与安全性、以及控制流完整性与信息流控制等方向的研究。

    3. 论文如何解决这个问题?

      提出 multi-CaMeL 协议,将智能体间调用拆分为可信指令与非可信变量两个通道,并由解释器在运行时保持溯源。

    4. 论文做了哪些实验?

      在 MultiAgentDojo 与 AssetOpsBench 上测试 5 款模型,multi-CaMeL 将 ASR 降至 0.0% 且效用代价较小。

    5. 有什么可以进一步探索的点?

      局限包括仅限树状拓扑、继承了 CaMeL 解释器的隐式依赖缺陷;未来可扩展至非树状架构并建立更强信息流保证。

    6. 总结一下论文的主要内容

      论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    完整解读
  3. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  4. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  5. 防御arXiv:2610.01535 · 53

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    在分布偏移下,事后最佳单模型基线产生 0.045 至 0.113 的选择代价,诚实评分下安全路由在多数池单元退化为固定模型选择。

    • 0.045至0.113HELM Safety类别留出下,k=2至44的基线选择代价(Table II)
    • -0.0308HELM Safety类别留出下,k=44时路由器相对于诚实基准的危害差(Table II)
    • 0.0000HELM类别留出下,各池规模路由器相对于诚实基准的危害差中位数(Section IV)
    6 问速览测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。
    1. 这篇论文试图解决什么问题?

      测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。

    2. 有哪些相关研究?

      现有研究揭示了路由同样本评估偏倚与退化现象,本文系统量化安全分布偏移下的代价与防御脆弱性。

    3. 论文如何解决这个问题?

      建立诚实留出评估协议,推导超额危害分解恒等式,并评估门槛表面与动作防御。

    4. 论文做了哪些实验?

      分布偏移下后验基准产生大额偏差,诚实评估下路由收益微弱且识别信号易被操纵。

    5. 有什么可以进一步探索的点?

      作者指出了语料范围、评测器偏差与离线假设等局限,实际实验覆盖至 7 个公开语料。

    6. 总结一下论文的主要内容

      论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。

    完整解读
  6. 防御arXiv:2608.21500 · 56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。

    • 9.0%Qwen3.6-27B,SecOPD,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 94.0%Qwen3.6-27B,Meta-SecAlign,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 1.3%Qwen3.6-27B,SecOPD,SEP 数据集,六类静态攻击组合,Combined ASR(Table 1)
    6 问速览论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
    1. 这篇论文试图解决什么问题?

      论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。

    2. 有哪些相关研究?

      论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。

    3. 论文如何解决这个问题?

      SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。

    4. 论文做了哪些实验?

      实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。

    5. 有什么可以进一步探索的点?

      作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。

    6. 总结一下论文的主要内容

      SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。

    完整解读
  7. 防御arXiv:2609.07529 · 53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    CoER通过双边对抗共进化与精炼防御自适应IPI,在七领域将Qwen3.5-9B自适应ASR降至0.22%。

    • 0.22±0.13%Qwen3.5-9B在七领域自适应ASR(Table 1a)
    • 76.24±1.08%Qwen3.5-9B在七领域自适应Safe-U(Table 1a)
    • 41.31±0.89%Base在七领域自适应ASR(Table 1a)
    6 问速览论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。

    2. 有哪些相关研究?

      论文梳理了IPI评测与防御、自适应攻击发现与精炼、攻防共进化三类研究,并强调自身在任务执行内闭环博弈的定位。

    3. 论文如何解决这个问题?

      CoER将攻防建模为一般和马尔可夫博弈,通过SFT冷启动攻击者、双边历史对抗RL共同进化,再由保留攻击者引导教师数据精炼。

    4. 论文做了哪些实验?

      CoER在七领域将自适应ASR降至0.22%、Safe-U升至76.24%,并在外部基准与累积攻击下保持高防守。

    5. 有什么可以进一步探索的点?

      作者指出方法依赖强教师与顺序流程且超参数敏感,评测范围未覆盖多模态、其他智能体框架及更大模型骨干。

    6. 总结一下论文的主要内容

      CoER针对自适应IPI结合双边对抗共进化与强教师精炼,在七领域将Qwen3.5-9B的自适应ASR降至0.22%。

    完整解读
  8. 防御arXiv:2609.18411 · 55

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    针对智能体浏览器中的提示注入与确认伪造,论文提出可验证操作卡VAC,在5个开源模型评测中将攻击成功率从78%降至0%(Table 10)。

    • 78%全部模型与种子无门控(Arm A)平均ASR(Table 10)
    • 0%全部模型与种子VAC(Arm C)平均ASR(Table 10)
    • 72%全部模型与种子Naive HITL(Arm B)平均ASR(Table 10)
    6 问速览论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。
    1. 这篇论文试图解决什么问题?

      论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。

    2. 有哪些相关研究?

      相关工作涉及网页智能体、间接注入攻击、推理层架构防御及同意完整性,论文通过构建浏览器端真实操作描述符弥补确认信道缺陷。

    3. 论文如何解决这个问题?

      VAC 架构通过意图来源隔离、DOM 真实操作描述符、浏览器外置卡片、风险门控与分发时执行绑定,确保批准与执行完全一致。

    4. 论文做了哪些实验?

      在 5 个开源模型及 GPT-4.1 上评测 24 个场景,无门控 ASR 为 68%–100%,VAC 在全部模型上降至 0% 且误报率为 0%。

    5. 有什么可以进一步探索的点?

      论文局限包括依赖启发式规则与预言机模拟、无法防护只读误导,未来方向包括真人受试者实验及向计算机使用智能体拓展。

    6. 总结一下论文的主要内容

      论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。

    完整解读
  9. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读
已经到底了