SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
提出SecOPD同策略蒸馏微调,降低模型对自适应提示注入的顺从
- 定位与核心问题:论文针对现有基于 DPO 和 GRPO 等序列级反馈的防御微调难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现细粒度信用分配的 SecOPD 防御框架。
- 方法核心机制:SecOPD 在训练时为每个样本配对构建注入输入与纯净输入,由模型在注入输入下生成回答轨迹,并利用良性输入下的冻结基座模型为对应 token 计算概率差异,通过优势函数抑制恶意注入行为并强化正常任务遵循,不依赖外部安全裁判模型。
- 自适应攻击防御效果:在 Qwen3.6-27B 上的评测中,针对强自适应攻击 PISmith,SecOPD 将 pass@10 ASR 降至 9.0%,相比此前基线 Meta-SecAlign(94.0%)与 GRPO(61.2%)实现大幅度降低(Table 1)。
- 静态攻击与场景泛化:在 SEP 六类静态攻击组合下,SecOPD 取得了 1.3% 的 ASR;在未见过的 AgentDojo 智能体工具调用基准中,SecOPD 取得 4.7% ASR,验证了指令与数据解耦能力向工具调用场景的迁移(Table 1)。
- 通用能力保留:在涵盖数学推理、问答和指令遵循的七项通用基准评测中,SecOPD 维持了 88.1% 的平均实用性,与未防御基座模型的 88.1% 相当,避免了 GRPO 带来的通用能力明显衰减(Table 2)。
- 作者结论与启示:作者认为前沿大语言模型自身的安全潜力此前未被充分挖掘,即使利用简单样本进行防御微调也能建立可泛化的安全边界;当前防御虽未彻底解决提示注入问题,但为构建鲁棒的智能体基座提供了新路径。