跳到正文
原文
论文追踪· arXiv:2606.11425· Ge Shi, Jun Yin, Donglin Xie, Fangyi Liu, Yucan Li, Menglin Liu·本站收录 · 原文发表

JailbreakOPT:工具辅助的迭代越狱提示词优化框架

JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

JailbreakOPT在AdvBench上把Claude的TAP ASR从0.96%提到56.54%。

威胁模型black-box compatible 的 stateless single-turn:每次向目标LLM提交一条独立standalone prompt,不依赖对话状态。

问题
固定模板的单轮越狱容易被护栏压住,迭代改写又要很多次目标查询,且经验很少跨攻击回合复用。作者在无状态单轮设定下,同时追求更高ASR和更低的成功前查询数。
方法
JailbreakOPT把原子越狱工具收成库,以嵌套编码与逆序解码组成仍独立的提示词,在回合内搜索;回合间用情境Thompson采样,按历史轨迹选择下一工具。
实验与结果
AdvBench上,随机选工具的TAP把Claude的ASR从0.96%提到56.54%,GPT-5.1从29.46%提到83.46%(Table 1)。宽3深8且用情境采样时,Gemini的ASR为98.08%(Table 2)。
局限与可以继续做的
作者指出未报告逐结果的重复试验和统计检验,未与多轮越狱及成套防御直接对比;工具库为手工构造,评测只含文本。实验使用Section 4.1的8个目标模型,以及AdvBench与HarmBench。
实验设置Vicuna-13b-v1.5、LLaMA-3-8b 等 · AdvBench、HarmBench · ASR、No.A
威胁模型
black-box compatible 的 stateless single-turn:每次向目标LLM提交一条独立standalone prompt,不依赖对话状态。攻击者组合工具库中的原子工具,在查询预算内最大化ASR并降低No.A。成功由LLM评审判定,分数超过预设阈值即成功;论文未给出该阈值。
被测模型
Vicuna-13b-v1.5LLaMA-3-8bGPT-4oGPT-5.1Gemini-3-flashClaude-haiku-4-5-20251001Qwen3-235b-a22b-instruct-2507DeepSeek-v3.2
基准
AdvBenchHarmBench
指标
ASRNo.A
AI 导读JailbreakOPT 将多种原子越狱提示词组织为攻击工具库,通过统一的单轮优化抽象组合生成更强的独立攻击提示词,并把工具选择建模为上下文赌博机问题,用上下文 Thompson 采样指导探索与利用。在多个目标 LLM 和攻击目标上,该框架相比原子单轮攻击和已有迭代优化基线提升了攻击成功率(ASR),同时减少了成功所需攻击次数(No.A)。

JailbreakOPT 将多种原子越狱提示词组织为攻击工具库,通过统一的单轮优化抽象组合生成更强的独立攻击提示词,并把工具选择建模为上下文赌博机问题,用上下文 Thompson 采样指导探索与利用。在多个目标 LLM 和攻击目标上,该框架相比原子单轮攻击和已有迭代优化基线提升了攻击成功率(ASR),同时减少了成功所需攻击次数(No.A)。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    黑盒兼容的无状态单轮越狱中,用工具组合与跨回合学习提高ASR并减少查询。

    如何在黑盒兼容的无状态单轮设定下,同时提高越狱成功率并减少成功前的目标查询。

    • 场景:作者认为对齐与防御加强后,许多早期越狱已经失效,因此需要能组合攻击策略、服务自动化红队的提示词生成框架。本文只处理 black-box compatible 的 stateless single-turn:每次目标查询都是一条独立的 standalone prompt。
    • 现有不足:作者认为原子单轮方法表达力强但静态,固定模式被护栏压住后变脆;迭代单轮方法能按反馈改写,但常依赖低层或通用变异,目标查询很多。两者主要在单个 episode 内优化,不系统复用跨回合经验。
    • 目标:把越狱提示词生成写成预算约束优化,最大化 attack success rate(ASR),同时最小化 number of attacks until success(No.A)。一个 episode 是同一攻击目标、目标模型与评测配置下的一次完整优化。
    • 威胁模型:
      • 目标:诱导目标 LLM 违反安全策略,并在预算内提高 ASR、降低 No.A。
      • 知识:作者称为 black-box compatible。目标每次只看到一条独立提示词,不保留受害对话状态。
      • 能力:攻击者维护候选前沿,从工具库选择原子工具并组成链,查询目标,再用评审反馈更新搜索。
      • 受害系统:被查询的目标 LLM。作者明确不在这一基准上比较依赖对话历史的 stateful multi-turn 越狱。
    • 本文提出:JailbreakOPT。回合内把原子单轮工具组成更强的独立提示词;回合间把工具选择写成 contextual bandit,用 contextual Thompson sampling 按历史结果探索和利用。
  2. 有哪些相关研究?

    论文把单轮原子攻击、迭代优化、多轮对话和跨回合红队分开,并用统一搜索抽象定位本文。

    单轮越狱

    • 原子单轮:Code Chameleon(Lv et al., 2024)、Flip Attack(Liu et al., 2024b)、Persuasion Attack——用模板或变换构造一条独立提示词。Related Work 将 Persuasion 引为 Zeng et al. (2024),Table 4 引为 Yi et al. (2024)。
    • 迭代单轮:TAP(Mehrotra et al., 2024)、AutoDAN(Liu et al., 2024a)、GCG(Zou et al., 2023a)在候选独立提示词上搜索;方法节还把 PAIR 纳入同一搜索结构。作者称这些工作促成了统一抽象,并据此问表达力强的原子工具能否改进迭代优化。
    • 更早的单轮讨论:附录 A.1 还写到 Jailbroken(Wei et al., 2023)、GPTFuzzer(Yu et al., 2023)、h4rm3l(Doumbouya et al., 2024),以及把多轮轨迹压成单轮提示的 M2S(Ha et al., 2025)。

    有状态多轮越狱

    • 对话状态攻击:Crescendo(Russinovich et al., 2024)从良性上下文逐步升级;Li et al. (2024) 与 Wang et al. (2024) 代表多轮人类或智能体越狱。作者称它们依赖目标维持的对话上下文,与每次独立评测的无状态单轮基准不能直接比较。附录 A.1 另列 RED QUEEN、MRJ-Agent、MultiBreak。

    跨回合学习与红队

    • 回合内适应:作者称现有迭代单轮方法主要在一个 episode 内适应,很少把经验迁到其他攻击目标或目标配置。
    • 记忆式红队:AutoDAN-Turbo(Liu et al., 2025a)与 Auto-RedTeamer(Zhou et al., 2025a)检索以往攻击日志来指导后续攻击。作者用 contextual Thompson sampling(Cortes, 2019; Lu et al., 2010; Zhou, 2016)做对比定位。附录 A.3 还讨论 AutoDAN-Reasoning、ASTRA、JailExpert、MAJIC。

    基线与基准

    • 基线方法:原子基线为 Code Chameleon、Flip Attack、Persuasion;迭代基线为 TAP、AutoDAN、GCG。工具增强变体再与无工具版本对比。
    • 基准:AdvBench 全部 520 条有害指令;HarmBench 标准文本子集 200 条。

    作者把本文放在无状态单轮优化上:统一多种迭代算法的搜索模块,用工具库做回合内组合,并用情境老虎机而不是日志检索来复用跨回合经验。

  3. 论文如何解决这个问题?

    JailbreakOPT以嵌套工具链做回合内搜索,并用情境Thompson采样跨回合选择工具。

    JailbreakOPT把迭代单轮越狱收成同一套搜索抽象,动作用攻击工具库实现,再把已评测轨迹交给情境老虎机选工具。

    统一的回合内搜索

    • 对象:迭代 t 维护候选前沿 Ft 和动作池 A。编排器给出分配 Pt = O(Ft, A, Ht),变异器生成候选 Ct,评审器对目标 T 返回分数 s 与辅助信息 e,选择器更新下一前沿和历史。
    • 停止:Algorithm 1 在预算 B 内若 Success(e)=1 即返回该提示词,否则返回前沿中分数最高者。作者称 PAIR、GCG、AutoDAN、TAP 只是动作与模块实例不同,对应关系在 Table 3。
    • 范围:作者称该抽象不绑定某一种搜索拓扑或访问假设,束搜索和粒子群也可写入;灵感来自 TextAttack 一类模块化工具包。

    工具库与嵌套链

    • 单工具:每个原子工具是一对编码与解码。编码把攻击目标变成看起来无害的用户提示,解码作为解释指引,常放在系统提示一侧。附录 A.2 与 Table 4 列出 12 个工具,分 LLM-based 与 rule-based;此处不复述各工具的改写方式。
    • 组链:每一轮追加一个工具,变异时对攻击目标施加整条链,输出仍是一条独立提示词。两条工具的复合为 enc(a0,a1)=enca1∘ enca0、dec(a0,a1)=deca0∘ deca1:编码由内向外,解码逆序。
    • 合法顺序:作者称工具一般不可交换。附录 A.2 用每个工具的 forbidden-predecessor 集合 B(a) 做手工偏序约束;若禁止前驱已在链中,就不能再追加。作者举例,高层角色或说服包装可以作外层,低层密码或翻转可能更靠近原目标。

    工具级遗传操作

    • 为何上移:作者称 AutoDAN 式的词元或句子交叉会破坏编码—解码结构,因此交叉和变异改在工具层。
    • 操作:交叉把两条链切成子链并交换后缀后拼接;变异把链中一个工具换成另一个合法工具。两者都受同一组合法顺序约束。Figure 2 对比单工具与多工具链。

    跨回合的情境老虎机

    • 轨迹:每个完成的回合内搜索被写成 Action-History–Augmented Decision Process。前沿宽度决定同一深度并行展开多少条轨迹;在第一次出现成功的深度评完,或预算用尽后停止。
    • 标签:只有停止深度上的成功轨迹为正例;其余已评测轨迹为负例。若全程无成功,该回合全部为负例。附录 B.5 给出记录字段。
    • 决策:工具选择写成 contextual multi-armed bandit。记录为 (c, a, y),上下文 c 编码当前候选、完整动作历史、目标模型身份和可选评审统计。策略用 logistic Thompson sampling,以便用全部正负记录增量更新。4.3 节实验用的是 bootstrapped logistic Thompson sampling。伪代码在附录 B.1。
    • 与 4.2 节的差别:4.2 节的工具增强变体不用学习策略,编排器在合法工具上均匀随机抽样;学习到的编排只在 4.3 节评估。

    成功如何判定

    • 评审:沿用 PAIR 的 LLM-judge。评审给 1 到 10 分,超过预设阈值记为成功。论文写有该阈值,但未给出实验里的具体数值。完整评审提示词在附录 C.1。
    • 两个指标:ASR 是预算内至少有一次被判违反安全约束的攻击目标比例。No.A 只在成功 episode 上平均,并计入直到停止点的全部已评测候选,不只是成功路径的长度。
  4. 论文做了哪些实验?

    Table 1中工具增强提高多个难目标的ASR;Table 2在更小查询预算下继续提高。

    实验设置

    • 目标模型:Vicuna-13b-v1.5、LLaMA-3-8b、GPT-4o、GPT-5.1、Gemini-3-flash、Claude-haiku-4-5-20251001、Qwen3-235b-a22b-instruct-2507、DeepSeek-v3.2。目标与评审温度为 0.0,攻击生成温度为 1.0,目标最大生成长度 512。Table 5 对部分推理型目标把 thinking 设为 Low。
    • 其他模型:攻击生成用 Qwen3-30B-A3B-Instruct-2507;评审用 gpt-oss:20b。Vicuna、LLaMA 与评审模型用 vLLM 自托管,其余经 OpenRouter 调用(附录 B.3)。
    • 数据:AdvBench 520 条;HarmBench 标准文本子集 200 条。论文写 HarmBench 共有 510 个功能性有害行为,本文只用其中文本子集。
    • 基线与变体:原子工具为 Code Chameleon、Flip Attack、Persuasion。迭代基线为 TAP、AutoDAN(loss 与 LLM-judge)、GCG,并各有无工具与有工具版本。4.2 节有工具版本的编排器是均匀随机,不是老虎机。
    • 预算:4.2 节前沿宽度 8、深度 8,每 episode 最多 64 次目标查询。4.3 节宽度 3、深度 8,最多 24 次;AdvBench 固定种子分成 10 折,9 折训练、1 折留出。
    • 指标与判定:ASR、No.A 定义见第 3 问。成功阈值的具体数值论文未给出。论文未报告主结果的重复次数。Table 1 中 GCG 与 AutoDAN(loss)只给出 Vicuna 和 LLaMA,其余为 –。

    主结果

    下表是 AdvBench 的 ASR(Table 1)。有工具行在 4.2 节为随机选工具。

    表格较宽,可左右滑动

    目标模型TAP无工具TAP有工具AutoDAN评审无工具AutoDAN评审有工具
    Vicuna99.62%99.81%99.62%99.23%
    LLaMA95.77%97.56%93.08%97.69%
    GPT-4o88.75%99.62%93.27%99.81%
    GPT-5.129.46%83.46%60.19%91.15%
    Gemini9.79%20.19%69.81%76.73%
    Claude0.96%56.54%0.38%59.81%
    Qwen380.96%100%16.15%100%
    DeepSeek98.08%99.62%91.35%100%
    • 原子工具:作者称没有单一工具在所有目标上占优。AdvBench 上 Flip 在 GPT-4o 为 82.31%、DeepSeek 为 99.23%,Claude 为 0%;Code Chameleon 在 Claude 为 40.77%、Gemini 为 63.65%;Persuasion 在 Claude 为 0%,Vicuna 为 26.73%。三者 No.A 均为 1。
    • 作者解读:作者称无工具的通用改写在强防御目标上不均匀;加入工具库后,难目标上的 ASR 提高。表中也有例外:Vicuna 上 AutoDAN(LLM-judge)有工具 ASR 低于无工具。
    • 查询数:作者称若干设置下 No.A 下降,例如 TAP 在 GPT-4o 从 15.82 到 9.74、GPT-5.1 从 29.01 到 13.86;GCG 在 Vicuna 从 64 到 1.57、LLaMA 从 64 到 1.27。并非处处下降:AutoDAN(LLM-judge)在 Vicuna 的 No.A 从 8.00 到 14.06,LLaMA 从 9.34 到 14.57。GCG 加工具后 LLaMA 的 ASR 从 92% 到 90%,Vicuna 仍为 94%。

    HarmBench

    • 测了什么:Table 7 用与 Table 1 相同的回合内设置,比较同一批范式。作者称定性趋势与 AdvBench 一致。
    • 结果:作者称有工具 TAP 相对无工具 TAP,在 GPT-5.1、Gemini、Claude、DeepSeek 上 ASR 提高;表中对应为 42.5% 到 80.0%、25.5% 到 44.0%、44.5% 到 63.0%、94.0% 到 99.5%。有工具 AutoDAN(LLM-judge)在 GPT-4o、Qwen3、DeepSeek 为 100%,GPT-5.1 从 45.5% 到 63.5%。
    • 例外:有工具 TAP 的 ASR 并非每个模型都更高:GPT-4o 从 78.5% 到 78.11%,Qwen3 从 92.5% 到 92.04%。这两行的 No.A 则从 10.64 到 35.91、从 13.19 到 53.72。

    跨回合工具选择

    • 测了什么:4.3 节只在 TAP 上学习编排,预算改为最多 24 次,目标为回合内 ASR 较低的 GPT-5.1、Gemini、Claude。上下文是工具使用史的二元向量和目标身份的 one-hot。
    • 结果:Table 2 无上下文 ASR 为 19.23%、30.77%、5.77%。只加工具史升至 53.85%、82.69%、36.54%。两者都加时为 61.54%、98.08%、40.38%,No.A 为 13.83、3.75、17.35。只加目标身份时,Claude 为 26.92%,低于只加工具史的 36.54%。
    • 作者解读:作者称轻量执行级上下文足以在更小预算下指导选工具,并称相对 Table 1 最多 64 次查询的设定,在难目标上仍有竞争力,尤其是 Gemini。Figure 4 没有给出可逐折抄录的端点数值;作者称增加训练轨迹通常提高 ASR、并可能降低 No.A,单目标策略只能部分迁移,混合训练的迁移更稳。

    预算、人工一致性与成本

    • 预算热图:Figure 3 在 AdvBench 上把宽度和深度从 1 变到 8。作者称 ASR 随任一维增加而上升,宽度的边际作用略大。正文未列出各格数值。
    • 人工对照:4 名博士标注者按同一 1–10 标尺评 25 条目标回复。Spearman ρ = 0.660(p < 0.0001),精确一致 38%,相差不超过 1 分的占 63%。Figure 5 展示这 100 条人工评分的分布。
    • 成本:作者只测了 Claude-Haiku-4.5 上的 AutoDAN:平均 41.50 步,墙钟 304.9 秒,估计每个完整 episode 3.38 美元。作者称这不是跨方法成本比较,只用来说明额外攻击尝试带来的近似线性成本。

    其他消融与分析

    • Table 10:在工具史加目标身份上再加评审分数,GPT-5.1 ASR 从 61.54% 到 48.08%,Claude 从 40.38% 到 30.77%,Gemini 仍为 98.08%,其 No.A 从 3.75 到 4.19。
    • Table 10 再加目标类别:Claude ASR 38.46%、No.A 16.7,ASR 仍低于不加这两项的 40.38%。
    • Figure 10,Fold 9:flip_attack 与 code_chameleon_attack 的频率变化,GPT-5.1 为 +0.199、+0.179,Claude 为 +0.179、+0.148,Gemini 为 +0.212、+0.204;正文写成 +0.20、+0.18、+0.18、+0.15、+0.21、+0.20。
    • 附录 D.2:Flip 的平均 ASR 在 DeepSeek 为 98%、GPT-4o 为 80%、Claude 为 0%、GPT-5.1 为 4%;Code Chameleon 从 GPT-5.1 的 12% 到 DeepSeek 的 94%。
    • Figure 9:Code Chameleon 与 Flip 的 ASR 相关,跨类别为 0.9,跨目标模型为 0.6;Persuasion 与二者在目标模型上的相关为 -0.1 与 -0.2。
    • AdvBench 上 AutoDAN(loss)只报告两个开源模型:无工具 Vicuna 98.27%(No.A 9.57)、LLaMA 100%(8.25);有工具为 98.46%(8.50)与 100%(8.00)。
  5. 有什么可以进一步探索的点?

    作者指出未报告逐结果统计检验,工具库手工构造,且未做多轮与成套防御对比。

    作者指出的局限与后续方向

    • 覆盖不到所有相邻设置:作者写,由于页数、目标查询成本和算力,实验不能穷尽每个相邻威胁模型、基准、模型版本、解码设置或防御配置(Section 6)。
    • 未做逐结果的重复与区间:作者写,没有为每个结果报告重复试验、置信区间或统计检验;随机攻击生成、评审噪声和模型服务波动可能影响 ASR 与 No.A(Section 6)。
    • 比较范围:比较限于具有无状态目标查询语义的方法,未与依赖对话历史和交互策略的 stateful multi-turn 越狱直接比较;也未对每一种 lifelong 或自动化红队系统做大规模实证比较(Section 6,并指向附录 A.1、A.3)。
    • 老虎机只实例化一种:回合间学习只用 contextual Thompson sampling,未做完整的 contextual-bandit 扫描。作者写收益并不均匀,有的配置 ASR 上升但 No.A 增加;目标身份或目标类别这类 one-hot 特征,不重新训练可能无法泛化到未见模型或危害类别(Section 6)。
    • 工具库手工构造:合法顺序约束也是手工指定的,未实现自动建库或约束学习。作者称后续可以把 JailbreakOPT 与 AutoRedTeamer 式的发现结合起来扩充工具库(Section 6;附录 A.2 也把自动学习约束称为后续方向)。
    • 防御、评审与模态:作者写未对成套 LLM 防御机制做基准;评测依赖 LLM 评审,虽有小规模人工一致性研究,混淆型工具、组合提示词和语义漂移仍可使自动评审带噪声。实验只做文本,未覆盖多模态、智能体、检索增强或接入应用的系统(Section 6)。

    实验覆盖范围

    • 模型:Section 4.1 评测 8 个目标 LLM;Table 5 的攻击生成模型是 Qwen3-30B-A3B-Instruct-2507,评审模型是 gpt-oss:20b。
    • 数据与语言:AdvBench 使用全部 520 条,HarmBench 使用标准文本子集 200 条(附录 B.2)。伦理声明写本研究只覆盖英语自然语言。
    • 预算与编排:4.2 节宽度 8、深度 8,最多 64 次查询,有工具编排为均匀随机。4.3 节宽度 3、深度 8,最多 24 次,AdvBench 做 10 折,策略为 bootstrapped logistic Thompson sampling。
    • 基线出现范围:实验基线为 Code Chameleon、Flip Attack、Persuasion、TAP、AutoDAN、GCG。Table 1 与 Table 7 中 GCG 和 AutoDAN(loss)只给出 Vicuna 与 LLaMA 的数字,其余格为 –。
    • 论文未报告的判定信息:主 ASR 的重复次数未报告;ASR 所用分数阈值的具体数值未给出。人工一致性为 4 名标注者、25 条回复(Section 4.2)。附录 A.5 讨论优化型攻击与不同防御的关系,Section 6 写未做成套防御评测。
  6. 总结一下论文的主要内容

    JailbreakOPT用工具链和情境采样做无状态单轮越狱优化,难目标ASR上升且部分查询减少。

    JailbreakOPT 是一个工具辅助的无状态单轮越狱提示词优化框架,面向 black-box compatible 的独立查询,而不是有状态多轮对话。

    • 要解决的问题:原子模板表达力强但容易被固定模式防御压住;迭代改写能适应反馈,却常常要很多次目标查询,而且一个 episode 的经验很少被下一个 episode 复用。作者把目标写成预算内同时提高 ASR、降低 No.A。
    • 做法:用编排、变异、评审、选择四个模块统一迭代单轮搜索。原子工具做成编码—解码对,按由内向外的编码和逆序解码连成链,输出仍是一条独立提示词,顺序受手工的前驱约束。4.2 节在合法工具上随机选择;4.3 节把选择写成情境老虎机,用 Thompson 采样读取历史轨迹。
    • 回合内结果:AdvBench、宽度 8、深度 8、随机编排时,工具增强 TAP 的 Claude ASR 为 56.54%,无工具为 0.96%;GPT-5.1 为 83.46%,无工具为 29.46%(Table 1)。同表 AutoDAN(LLM-judge)加工具后,这两项目标为 59.81% 与 91.15%。作者称查询数在部分格子下降,例如 GCG 在 Vicuna 的 No.A 从 64 到 1.57;也有 ASR 上升而 No.A 上升的格子。
    • 跨回合结果:宽度 3、深度 8、以 TAP 为底时,工具史加目标身份使 GPT-5.1、Gemini、Claude 的 ASR 达到 61.54%、98.08%、40.38%(Table 2)。作者称最多 24 次查询的这一设置相对最多 64 次的回合内设定仍有竞争力,尤其在 Gemini 上。
    • 作者的结论:作者称该组合相对原子工具和迭代基线提高了攻击成功率与查询效率,并称较大增益出现在 GPT-5.1、Gemini、Claude 等更强目标上。作者同时写明工具库是手工的,未做逐结果统计检验,也未直接比较多轮越狱、成套防御和非文本系统。
阅读原文arxiv.org