跳到正文
原文
arXiv· arXiv:2608.16465· Xiaoyu Wen·原文 · 入选 精选关注度76

JailbreakSkill:用可复用可演化技能扩展自动化红队

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

AI 导读

上海 AI 实验室等机构提出 JailbreakSkill,把攻击方法封装为可复用、可演化的技能,用于扩展自动化红队。框架将技能分为改写技能、失败分析技能和演化技能三类,由规划器通过统一接口选择与排序;Stage 1 用风险条件 UCB 扫描初始 16 个改写技能并记录失败轨迹,Stage 2 对未解决样本做失败诊断,通过精炼、组合或发现生成新改写技能并回填技能库。在 AdvBench 与 HarmBench 上,技能演化使宏平均 ASR 分别提升 17.5 和 13.4 个百分点,其中对 GPT-5.4 在 AdvBench 上提升 48.6 个百分点,并产生把直接请求改写为未完成文档补全任务等新策略。部分演化技能无需额外适配即可迁移到未见提示词和目标模型,代码已开源。

论文速读

问题
自动化红队攻击策略散落在提示词和工作流中,难以系统集成、复用和规模化改进;目标模型与护栏日益稳健,一次性攻击不再可靠,需要可复用、可演化的攻击能力。
方法
提出 JailbreakSkill,把攻击策略打包成模块化、agent 可用的技能:rewrite 技能生成对抗提示,failure-analysis 技能诊断失败模式,evolution 技能通过 refine、combine、discover 生成新技能并回填技能库;planner 用风险条件 UCB 排序调用技能。
实验与结果
在 AdvBench 和 HarmBench 上跨多种目标模型评测,宏观平均 ASR 分别提升 17.5 和 13.4 个百分点,对 GPT-5.4 在 AdvBench 上提升 48.6 个百分点;演化出把直接请求重构为未完成文档补全任务等新策略,部分技能无需再适配即可泛化到未见提示和目标模型。
局限与可以继续做的
材料未明确列出局限;作者提到演化技能可跨行为、风险类别和目标模型复用,并评估了跨基准迁移,但未给出进一步可继续做的方向。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

把攻击方法封装成可复用、可演化的技能库,并给出在 AdvBench 与 HarmBench 上的 ASR 提升幅度,红队工程化可参考。

阅读原文arxiv.org