SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。
关注间接提示注入(indirect prompt injection):用户提示词可信,外部环境数据不可信,攻击者仅控制该不可信数据并插入攻击目标 g;假设系统能明确区分可信与不可信输入,受害模型须遵循受信任用户指令 I 并将外部数据仅作为上下文,而不执行其中嵌入的指令。
- 提示注入是 AI 智能体面临的重要安全威胁。攻击者将恶意指令注入外部不可信数据以操纵模型执行。现有基于序列级反馈(如 DPO、GRPO)的防御微调将整个回答统一定分,无法精细识别哪些输出 token 是不安全的,在自适应攻击下依然易被攻破。
- 提出 SecOPD 防御微调方法,将同策略蒸馏引入提示注入防御。模型在受攻击输入上生成回答,由未受攻击的纯净输入送入基座模型评估对应 token 的对数概率,提供 token 级别的优势信号,促使模型输出如同未出现注入指令一样的回答。
- 在基于 Qwen3.6-27B 的实验中,SecOPD 将 SEP 上的 PISmith 自适应攻击 ASR 降至 9.0%(Meta-SecAlign 为 94.0%,Table 1);并在未见过的 AgentDojo 工具调用基准上取得 4.7% ASR,同时平均实用性达 88.1%(Table 2)。
- 仅针对间接提示注入且假设系统能明确区分可信与不可信输入,不适用于越狱和直接提示注入;模型推理链不包含对注入的察觉,可能影响基于推理链的检测防御;实验仅在 Qwen3.6-27B 单一模型上进行,且评测时关闭了思考模式。
- 模型
- Qwen3.6-27B (Undefended)Meta-SecAlignGRPOSecOPD
- 基准
- SEPAgentDojoAlpacaEval2SEP UtilityMMLU-ProGPQA-DiamondGSM8KMinerva-Math
- 指标
- ASRpass@10 ASRUtilityAdvUtilitylength-controlled win rate
加州大学伯克利分校研究者提出 SecOPD,用同策略蒸馏为防御微调提供 token 级反馈,替代 DPO、GRPO 等序列级信号。训练时学生模型在含注入的输入上生成 rollout,冻结的初始化模型在去掉注入的干净输入上为同一批 token 打分,与可信任务一致的 token 被鼓励、跟随注入的 token 被抑制。在 Qwen3.6-27B 上,面对 SoTA 自适应攻击 PISmith,SecOPD 的攻击成功率为 9.0%,此前 SoTA 的 Meta-SecAlign 为 94.0%,GRPO 为 61.2%;静态 SEP 攻击下 SecOPD 为 1.3%。在训练未见的 AgentDojo 工具调用场景,SecOPD 为 4.7%,Meta-SecAlign 为 5.5%,GRPO 为 0.7% 但效用降至 82.5%。代码与模型已开源。
推荐理由论文给出 token 级反馈的防御微调配方,并报告在自适应攻击与工具调用场景下的 ASR 对比,可作防御方案选型参考。
深度解读
这篇论文试图解决什么问题?
论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
论文试图解决大语言模型及 AI 智能体在面对强自适应提示注入攻击时防御微调容易失效的问题。
- 问题场景与现实风险:AI 智能体需要与外部环境(如网页、文档、邮件)交互,不可信数据中可能潜藏提示注入指令;作者称提示注入是 AI 智能体面临的重要威胁,已导致相关部署延期并引发数据泄露或恶意工具调用等风险。
- 现有防御的不足:现有模型级防御(如 DPO、GRPO)依赖序列级反馈,将整个回答作为单一单元打分;作者指出这种方式难以处理同时回答良性任务与注入指令的混合回复,无法提供 token 级别的精准监督信号。
- 论文核心观察:作者认为同策略蒸馏(OPD)能够提供细粒度的逐 token 反向 KL 监督;在训练时可通过向基座模型提供去除了注入指令的纯净输入来构建天然安全的教师分布。
- 提出的解决方案:论文提出了 SecOPD(Secure On-Policy Distillation)防御微调方法,利用良性与受攻击配对样本生成 token 级别的优势信号来微调模型。
- 威胁模型:
- 攻击目标:诱导受害模型忽略良性用户指令,转而执行外部不可信数据中插入的恶意攻击目标 g。
- 攻击者能力:攻击者无法修改系统或良性用户指令,仅能控制外部不可信数据(untrusted external data)并在其中插入特定表述的注入文本。
- 攻击者知识:针对目标模型的提示词结构与防御机制展开自适应攻击,通过强化学习(如 PISmith)或启发式替换优化攻击载荷。
- 受害系统:基于大语言模型(如 Qwen3.6-27B)构建的文本生成及智能体工具调用系统。
有哪些相关研究?
论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。
- 系统级防御:
- 外部防护与过滤(ProtectAI, 2024; Zarfati, 2024; Chennabasappa et al., 2025 等)——通过在模型外围部署提示词护盾、输入过滤器或安全隔离机制来防御注入。作者指出这类方法适用于黑盒模型,但无法直接改变模型本身的指令遵循行为。
- 模型级防御微调:
- 消息类型封装与注入微调(Wallace et al., 2024; Chen et al., 2025a,c 等)——增加新的消息角色封装不可信数据,并在微调中加入模拟注入指令,训练模型将外部数据仅作为上下文使用。
- 序列级偏好与强化学习(Chen et al., 2025c; Guo et al., 2026)——Meta-SecAlign 采用 DPO 优化成对偏好,Guo et al. 采用 GRPO 并由语言模型裁判给出整句标量奖励。作者指出 DPO 和 GRPO 仅提供整句层面的反馈,无法对混合回复中的具体 token 进行针对性奖惩。
- 上下文蒸馏(Snell et al., 2022)——训练模型复现由辅助系统提示词诱导的行为。作者指出本文与之相关,但目标是训练模型在受攻击输入下的输出逼近其在纯净输入下的行为。
- 自适应提示注入攻击:
- 静态模板与基于搜索或梯度的自适应攻击(Zverev et al., 2025; Zou et al., 2023; Chao et al., 2025 等)——静态模板攻击不含针对目标模型的优化;自适应攻击则针对防御模型的提示结构优化注入文本,包括梯度优化与分支搜索方法。
- 强化学习自适应攻击(Wen et al., 2025; Yin et al., 2026)——PISmith 利用强化学习针对目标受害模型专门训练攻击者模型,通过黑盒反馈迭代生成高成功率的注入文本。
- 同策略蒸馏:
- 实用性同策略蒸馏(Gu et al., 2024; Lu and Lab, 2025)——在学生模型采样的输出轨迹上提供 token 级别的反向 KL 监督信号。作者指出据其所知,此前同策略蒸馏仅被用于提升模型的通用任务能力。
- 基线方法与评测基准:
- 基线方法包括未防御的 Qwen3.6-27B 原生模型、基于 DPO 偏好优化的 Meta-SecAlign 以及基于序列级强化学习的 GRPO 方案;评测基准包括文本提示注入基准 SEP、智能体工具调用基准 AgentDojo,以及 AlpacaEval2、MMLU-Pro 等六项通用实用性基准。
- 与既有工作的区别定位:
- 作者将本文定位为将同策略蒸馏机制引入提示注入防御,利用配对输入构建无注入的安全教师分布,提供细粒度的 token 级监督以解决序列级反馈在混合回复下的信用分配问题。
- 系统级防御:
论文如何解决这个问题?
SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。
论文提出 SecOPD(Secure On-Policy Distillation)防御微调方法,利用良性与受攻击配对输入,以未受注入干扰的基座模型作为天然安全的教师,在学生模型自身生成的轨迹上计算逐 token 的优势值并实施微调更新。
问题设定与形式化
- 设定良性用户指令为 I,良性外部数据为 c,纯净输入由渲染函数 R 组织为结构化消息。
- 攻击者仅能控制外部数据,受攻击输入表示为 pa = R(I, A(c, g)),其中 g 为注入目标,A 为将 g 插入良性数据 c 的注入构造器。
- 防御目标是促使模型在面对 pa 时依然完整遵循 I 并忽略外部数据中夹带的 g,同时在纯净输入上维持原有的良性任务完成能力。
配对训练数据构建
- 成对样本生成:对每个良性指令遵循样本 (I, c),分别构建良性输入 pc 与受攻击输入 pa,两者具有相同的受信任指令与良性上下文,区别仅在于外部数据中是否注入恶意指令。
- 注入样式覆盖:遵循 Meta-SecAlign 的设定,大部分训练样本采用直接插入(置于外部数据开头或结尾),少部分样本采用基于补全样式的分隔符伪造,使模型同时接触直接指令覆盖与角色边界跨越攻击。
- 数据集来源:从 Cleaned-Alpaca 数据集中筛选包含非空输入字段的样本,构建出规模为 19K 的训练集。
跨上下文 Token 级别打分
- 同策略生成与双上下文评估:学生模型在受攻击输入 pa 下自采样生成轨迹 z,包含已生成的全部前序 token;随后学生模型在受攻击输入上下文下计算各 token 对数概率,而冻结的基座模型在纯净输入上下文下计算同一批 token 的对数概率。
- 优势信号计算:根据反向 KL 散度估计,第 t 个 token 的优势函数定义为 At = sg[ℓteacher,t − ℓθ,t],其中教师与学生的对数概率之差反映了该 token 在纯净语境下的相对合理性,sg 表示停止梯度。
- 细粒度信用分配:若生成的 token 遵循了受信任指令,教师在纯净输入下同样会赋予较高概率,产生正向优势;若 token 因响应注入指令而产生,教师在纯净输入下赋予较低概率,从而产生负向优势予以抑制。
训练配置与参数设定
- 去中心化监督:微调过程无需调用外部安全裁判模型或特定任务的奖励模型,全部监督信息均由相同初始化模型在纯净输入下的表现提供。
- 适配器参数微调:学生与教师模型均以 Qwen3.6-27B 初始化,教师模型权重全程保持冻结,仅更新学生的 LoRA 适配器参数,LoRA rank 设置为 128(Table 8)。
- 训练超参数:学习率设为 1 × 10^-4,采样温度设为 1.0,最大生成长度设为 16K,并在提示词中采用明确区分的 user 角色与 input 角色(Table 8)。
论文做了哪些实验?
实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。
实验设置
- 被测模型:评测以 Qwen3.6-27B 为基座的四种模型变体:未防御模型 Undefended、Meta-SecAlign、GRPO 以及 SecOPD(各微调模型均使用 LoRA rank 128)。
- 评测基准:安全评测采用包含 9.1K 样本的文本指令基准 SEP,以及包含 949 个任务对的智能体工具调用基准 AgentDojo v1.2.1(涵盖 Banking、Slack、Travel、Workspace 四个领域);实用性评测采用 AlpacaEval2、SEP Utility、MMLU-Pro、GPQA-Diamond、GSM8K 与 Minerva-Math。
- 攻击方法:在 SEP 上测试六类无优化的静态攻击组合、基于近邻嵌入替换标记的 Qwen 定制基本自适应攻击(Basic Adaptive),以及基于强化学习定制训练攻击者的 PISmith 自适应攻击;在 AgentDojo 上测试 important_instructions 静态攻击。
- 主要指标:安全评估采用攻击成功率 ASR,其中 PISmith 报告采样 10 次的 pass@10 ASR;实用性评估采用 AlpacaEval2 长度控制胜率、AgentDojo 良性任务成功率(Utility)及各问答推理基准准确率。
- 评审与判定协议:SEP 采用两阶段判定,先对抽取的模型回答做 witness 关键词匹配初筛,命中者由 gemini-3.1-flash-lite 与带 4,096 思考预算的 gemini-3-flash-preview 分别调用 3 次(共 6 次),全部判定 YES 才计为攻击成功;AgentDojo 以是否触发攻击者指定的恶意工具调用判定攻击成功。
- 评测规模与解码配置:PISmith 自适应攻击在 1,024 个 SEP 测试样本上进行,目标模型在关闭思考模式下解码且最大长度为 1,024(附录 F);AgentDojo 开启思考模式,SecOPD 与 GRPO 最大上下文为 32,768(附录 H)。
主结果
据 Table 1(安全评测 ASR,越低越好):
表格较宽,可左右滑动
防御方法 SEP Static SEP Basic Adaptive SEP PISmith Adaptive AgentDojo Static Undefended 99.4% 99.0% 97.9% 26.7% Meta-SecAlign 28.9% 5.5% 94.0% 5.5% GRPO 15.0% 2.3% 61.2% 0.7% SecOPD 1.3% 0.2% 9.0% 4.7% - 静态鲁棒性在优化攻击下出现明显回落:作者指出 Meta-SecAlign 虽将 SEP 静态 ASR 降至 28.9%、基本自适应 ASR 降至 5.5%,但在 PISmith 强自适应攻击下 ASR 达 94.0%,接近未防御模型的 97.9%,说明静态攻击结果容易高估模型在自适应优化下的防御效果。
- SecOPD 在强自适应攻击下大幅降低 ASR:针对被测模型单独训练攻击者的 PISmith 评测中,SecOPD 的 ASR 降至 9.0%,相比此前基线 Meta-SecAlign 降低了一个数量级,同时在静态与基本自适应设定下分别取得 1.3% 与 0.2% 的低 ASR。
- 防御能力向未见过的智能体工具调用泛化:在训练未覆盖的 AgentDojo 工具调用基准上,SecOPD 将 ASR 降至 4.7%(低于 Meta-SecAlign 的 5.5%),作者认为这反映了模型学到的提示与数据解耦能力不仅适用于特定文本标记。
通用实用性与防御能力的平衡
- 测试设置:在 AlpacaEval2、SEP Utility、AgentDojo、MMLU Pro、GPQA Diam、GSM8K、Minerva-Math 七项基准上测试未受攻击时的良性任务表现(Table 2)。
- 评测结果:Meta-SecAlign 平均实用性为 88.5%(未防御模型为 88.1%),但自适应安全性较弱;GRPO 的平均实用性降至 83.1%(在 SEP 降至 79.5%、AgentDojo 降至 82.5%、Minerva-Math 降至 85.1%);SecOPD 平均实用性保持在 88.1%,在 SEP、AgentDojo 与 Minerva-Math 上分别达到 88.6%、90.7% 与 94.3%(Table 2)。
- 作者解读:作者指出 SecOPD 是唯一在实现 9.0% 低 PISmith ASR 的同时广泛维持原有任务能力的防御方案,较好化解了 GRPO 带来的能力退化。
AgentDojo 各领域迁移表现
- 测试设置:在 AgentDojo 的 Banking、Slack、Travel、Workspace 四个子领域分别评测良性任务成功率(Utility)、注入下任务成功率(AdvUtility)和攻击成功率(ASR)(Table 6)。
- 评测结果:在 Banking 领域 SecOPD ASR 为 4.9%(Meta-SecAlign 为 13.2%);Slack 领域 ASR 为 24.8%(Meta-SecAlign 为 31.4%);Travel 领域 ASR 为 6.4%(Meta-SecAlign 为 0.0%);Workspace 领域 ASR 为 0.5%(Meta-SecAlign 为 0.0%);全领域平均 AdvUtility 达到 79.8%(Table 6)。
- 作者解读:作者认为纯文本训练获得的防御机制能够较好迁移至工具调用交互,但在 Slack 等交互场景中仍存在相对较高的攻击成功率。
Minerva-Math 错误样本归因分析
- 测试设置:针对未防御模型回答正确而 SecOPD 回答错误的全部 46 道 Minerva-Math 题目进行人工分类审查(Table 5 与 Section J.1)。
- 评测结果:仅 4 例(8.7%)属于真实数学推理错误;20 例(43.5%)为最终回答切换至无关问题或答案损坏,12 例(26.1%)解法正确但因抽取或格式被判错,10 例(21.7%)未完成最终答案输出但均包含 </think> 标记表明属于提前终止而非长度截断。
- 作者解读:作者认为这表明微调导致的性能损失主要源于答案组织与格式抽取问题,而非数学推理能力的系统性衰减。
其他消融与分析
- SEP 六类静态攻击细分:SecOPD 在 Straightforward(0.3%)、Straightforward-Before(0.0%)、Ignore(0.5%)、Ignore-Before(0.5%)、Completion(0.0%)、Completion-Ignore(0.0%)各变体上 ASR 均不高于 0.5%(Table 7)。
- 静态 SEP 评测标签人工复核:对 300 个样本(33 个模型判定阳性、267 个阴性)进行人工核验,人工判定与自动化评测系统达成 100% 一致(Table 3)。
- Qwen 自适应分隔符稳定性搜索:针对官方 delimiter 找到近邻嵌入替代 token,例如
<|im_end|>对应西里尔近邻 token 214946,<|im_start|>对应 eihna token 175459(Table 4)。
有什么可以进一步探索的点?
作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。
作者指出的局限与后续方向
- 仅适用于间接提示注入:论文明确指出该工作关注用户提示词良性、环境数据恶意的间接提示注入,不适用于越狱、直接提示注入以及用户本身为恶意攻击者的场景(Limitations 节)。
- 依赖可信边界的明确信号:论文指出方法基于系统能明确区分哪些输入部分可信的假设,无法保护需要自行根据上下文判断哪些输入属于可信指令的智能体(Limitations 节)。
- 推理链未包含注入感知:SecOPD 促使模型在推理与回答时表现得如同未发生注入,推理链中不包含对注入出现的识别或迟疑,虽然未降低输出实用性,但可能影响依赖推理链分析的下游检测防御;作者将开发具备注入感知推理链的鲁棒 LLM 列为后续工作(Limitations 节)。
- 面对未来更强攻击的潜在脆弱性:论文指出尽管针对 PISmith 攻击将 ASR 降至 9.0%,但未来随着前沿 LLM 能力增强可能出现更先进的攻击手段打破现有防御,因此作者并未宣称彻底解决了提示注入问题,而是将其定位为迈向该目标的一个阶段成果(Limitations 节)。
实验覆盖范围
- 被测模型范围:实验仅在 Qwen3.6-27B 单一基座模型及其衍生的微调版本上开展评测(Section 5.1)。
- 推理模式配置:在 PISmith 自适应攻击评测中,受害模型均在关闭思考模式(non-thinking mode)下进行测试(附录 F);AgentDojo 评测则开启了思考模式(附录 H)。
- 攻击者训练设定:PISmith 自适应攻击者模型基于 QWEN3-4B-INSTRUCT-2507 初始化,在来自 PIArena 的 100 条样本上训练,评测以 pass@10 ASR 汇报(附录 F)。
- 训练数据单一来源:防御微调数据集完全构建自 Cleaned-Alpaca 筛选出的 19K 样本,未混入其他领域的训练数据(Section 5.1)。
- 未报告的信息:论文未报告全参数微调或其他 LoRA rank 下的防御表现,也未报告更大或更小模型参数规模下的实验数据。
总结一下论文的主要内容
SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。
- 定位与核心问题:论文针对现有基于 DPO 和 GRPO 等序列级反馈的防御微调难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现细粒度信用分配的 SecOPD 防御框架。
- 方法核心机制:SecOPD 在训练时为每个样本配对构建注入输入与纯净输入,由模型在注入输入下生成回答轨迹,并利用良性输入下的冻结基座模型为对应 token 计算概率差异,通过优势函数抑制恶意注入行为并强化正常任务遵循,不依赖外部安全裁判模型。
- 自适应攻击防御效果:在 Qwen3.6-27B 上的评测中,针对强自适应攻击 PISmith,SecOPD 将 pass@10 ASR 降至 9.0%,相比此前基线 Meta-SecAlign(94.0%)与 GRPO(61.2%)实现大幅度降低(Table 1)。
- 静态攻击与场景泛化:在 SEP 六类静态攻击组合下,SecOPD 取得了 1.3% 的 ASR;在未见过的 AgentDojo 智能体工具调用基准中,SecOPD 取得 4.7% ASR,验证了指令与数据解耦能力向工具调用场景的迁移(Table 1)。
- 通用能力保留:在涵盖数学推理、问答和指令遵循的七项通用基准评测中,SecOPD 维持了 88.1% 的平均实用性,与未防御基座模型的 88.1% 相当,避免了 GRPO 带来的通用能力明显衰减(Table 2)。
- 作者结论与启示:作者认为前沿大语言模型自身的安全潜力此前未被充分挖掘,即使利用简单样本进行防御微调也能建立可泛化的安全边界;当前防御虽未彻底解决提示注入问题,但为构建鲁棒的智能体基座提供了新路径。