用课程强化学习对前沿模型做提示注入红队测试
Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning
AI 导读
研究者提出用课程学习解决 RL 提示注入红队中的冷启动问题:直接针对前沿目标训练攻击者 LLM 时全部攻击失败、奖励恒为零,无法学习。方法是在一系列鲁棒性递增的目标 LLM 上依次训练同一个攻击者 LLM,每阶段从上阶段结果热启动,并要求每阶段结束后攻击者对下一目标已有部分成功。在 AgentDyn 上,课程 GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 的 ASR@10 分别达 93.8% 和 45.0%,而 RL-Hammer 与 PISmith 直接训练均为 0%。
论文速读
- 基于 RL 的 prompt injection 红队方法在攻击前沿 LLM(如 GPT-5.6-Luna/Terra)时遇到 cold-start 问题:初始 attacker LLM 的每次攻击都失败、奖励全为零,无法获得学习信号,PISmith、RL-Hammer 等 SOTA 方法 ASR 为 0%。
- 作者提出 curriculum learning:让同一个 attacker LLM 依次针对一系列鲁棒性递增的目标 LLM 训练,每一阶段从上一阶段的 attacker LLM 热启动,RL 算法、prompt 模板和训练数据保持不变。关键设计原则是每个阶段结束后 attacker LLM 必须能对下一目标偶尔成功,从而产生非零奖励;作者用冻结模型在下一目标上的 pre-stage ASR 作为廉价检验。
- 在 AgentDyn 上,curriculum GPT-5-nano → GPT-5.6-Luna → GPT-5.6-Terra 对 GPT-5.6-Luna 和 GPT-5.6-Terra 达到 93.8% 和 45.0% ASR@10,而直接训练或 RL-Hammer、PISmith 为 0%;用 GPT-4o-mini 替代 GPT-5-nano 或去掉 GPT-5.6-Luna 中间阶段会使 ASR 大幅下降。训练出的 attacker LLM 可零样本迁移到六个未见目标(如 GPT-6-Luna 47.3% ASR@10)和 AgentDojo 全部四个 suite,对 SecOPD 防御也达 87.1% ASR@10;以它为初始化继续 RL 可将 Muse-Spark-1.2 的 ASR@10 从 35.5% 提升到 82.3%,并迁移到 Muse-Spark-1.3。
- 作者未对 GPT-5.6-Sol 跑 RL 阶段,只报告直接迁移的弱 ASR,留待更大查询预算的未来工作;pre-stage ASR 为 0 只说明在给定预算内信号不可用,并不证明成功概率严格为零;实验限于公开 benchmark 的沙箱环境。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出课程式 RL 训练攻击者 LLM 的完整方法,并公开了跨目标与跨基准的迁移数据,可供红队与防御方参考。