PEO:直接优化原始提示词嵌入的 LLM 白盒越狱方法
Adaptive Prompt Embedding Optimization for LLM Jailbreaking
PEO优化原提示词嵌入;AdvBench上ASR-Judge为71.73%–78.65%,高于三组对照。
white-box设定下的open-weight聊天模型。
- 对齐后的大模型上,白盒越狱通常在提示词后追加离散对抗后缀,既改可见输入,又要在组合token空间搜索。作者认为直接优化原提示词嵌入一直被避开,是因为担心毁掉请求语义。
- PEO对聊天模板后的原token嵌入做梯度下降,损失是有害续写的交叉熵加上拉回原嵌入的L2项,不追加对抗token。未成功样本最多再攻三轮,后几轮换结构化续写脚手架;每轮从原嵌入冷启动。最近token投影后可见字符串保持原样。
- AdvBench与HarmBench text-test上,四个开源模型的PEO ASR-Judge高于nanoGCG、SPT和BEAST。前者为71.73%–78.65%,后者为37.50%–50.00%;可见文本变化为0%。
- 论文没有单独的局限节。作者在Discussion写明未直接评测防御,并称用ASR-Match决定是否进入下一轮会留下未挽救的真实失败。实验为四个开源模型、两个文本基准和三种对照攻击。
- 威胁模型
- white-box设定下的open-weight聊天模型。攻击者持有固定有害提示词,要诱导模型给出所请求的有害信息。可访问分词器、嵌入层、前向计算及提示词token嵌入梯度,不微调权重。逐提示词、固定迭代预算独立攻击;无通用后缀训练、无跨样本迁移、不改参数。
- 被测模型
- Vicuna-7B-v1.3Llama-2-7B-ChatQwen3-4B-InstructLlama-3.2-3B-Instruct
- 基准
- AdvBenchHarmBench text-test
- 指标
- ASR-JudgeASR-Match
研究者提出 Prompt Embedding Optimization(PEO),一种多轮白盒越狱方法,直接优化原始提示词 token 的嵌入向量,而不追加任何对抗 token。作者称,优化后的嵌入与原始嵌入足够接近,经最近 token 投影后可见提示词字符串完全保持不变,定量分析显示模型回答在绝大多数提示上仍切题。PEO 结合连续嵌入空间优化、结构化续写目标和以失败为焦点的自适应调度;作者称后续轮次可借助启发式复合回答脚手架获益,ASR-Judge 显示这些增益并非只是空泛格式或仅脚手架输出。在两个标准有害行为基准上,PEO 在实验中优于离散后缀搜索、追加对抗嵌入和基于搜索的对抗生成等白盒攻击。
深度解读
这篇论文试图解决什么问题?
白盒越狱若只追加可见后缀,会漏掉对原提示词嵌入的直接优化;PEO针对这一空白。
现有白盒越狱多追加离散对抗后缀,可见地改写提示词;本文要在不追加token的情况下,直接优化原提示词token的嵌入。
- 场景:作者认为越狱不该只看回复是否像有害或非拒答,还应更易优化、在提示词表面更不可见。现有白盒方法多在提示词后追加token,搜索空间是组合式的。
- 不足:作者称已有连续嵌入攻击要么在指令后追加新嵌入(SPT),要么从零优化整段输入、不绑定具体请求(Xu et al.)。二者都不改已有提示词token的嵌入;作者认为这反映了“扰动会毁掉语义”的假定。
- 观察:作者称该假定不成立。四个被测模型上,最近token投影后可见文本变化均为0%;第7.3节的量化分析称,大部分回复仍针对原请求,而不是漂到离题或退化输出。
- 方法:提出多轮白盒攻击PEO(Prompt Embedding Optimization):连续优化原token嵌入,配合结构化续写目标,以及把预算集中到未解决提示词的自适应调度。
- 威胁模型:
- 目标:给定固定有害用户提示词,使模型回答该提示词所要求的有害信息。成功取决于最终是否提供这些内容;优化用的前缀不必出现在解码结果里。
- 知识:论文写明为white-box。攻击者可用分词器、嵌入层、前向计算,以及对提示词token嵌入的梯度;不微调模型权重。
- 能力:每条提示词在固定迭代预算下独立攻击。无通用后缀训练,无跨样本迁移学习,不修改模型参数。每条提示词配一个有害回复前缀或续写目标,只作teacher-forced脚手架。
- 受害系统:open-weight chat models。实验目标模型为Vicuna-7B-v1.3、Llama-2-7B-Chat、Qwen3-4B-Instruct、Llama-3.2-3B-Instruct。
有哪些相关研究?
相关工作覆盖离散后缀、追加嵌入、从零优化输入,以及搜索式黑盒与judge评测。
第2节按攻击所在空间和评测方式分组,不把黑盒搜索当作本文的直接对照。
- 离散白盒越狱:GCG(Zou et al., 2023)在用户提示词后追加对抗后缀,用梯度引导的坐标搜索替换离散token,使模型走向指定有害续写。AutoPrompt(Shin et al., 2020)及后续硬提示词优化(Wen et al., 2023)用梯度直接优化提示词token或触发串。AutoDAN(Liu et al., 2024b)做隐蔽导向的越狱提示词优化;AdvPrefix(Zhu et al., 2025)强调续写目标会改变有害性与遵从的权衡。作者称这些方法强,但在离散token空间操作,通常有可见的提示词编辑代价。
- 连续与嵌入空间攻击:更早的对抗NLP工作研究连续或近似连续扰动,包括梯度token替换、自然语言对抗生成和释义攻击(Ebrahimi et al., 2018; Alzantot et al., 2018; Iyyer et al., 2018)。SPT(Schwinn et al., 2024)优化接在指令后的连续对抗嵌入;作者称它引入新token、不改已有token,可见提示词被改变。Xu et al.(2024)从零优化整段连续输入以引出目标回复;作者称结果与任何具体有害请求无关,也不能保留提示词语义。文中还把文生图防护里的推理时连续状态优化(Peng et al., 2024)列为相邻设定。
- 搜索式与黑盒越狱:PAIR(Chao et al., 2023)和TAP(Mehrotra et al., 2024)在仅有查询访问时,用迭代黑盒精炼自动发现越狱提示词。BEAST(Sadasivan et al., 2024)用束搜索生成对抗后缀;作者称在紧的墙钟预算下仍有竞争力。Rainbow Teaming(Samvelyan et al., 2024)强调开放式生成多样对抗提示词,而不是精确梯度控制。作者称本文设定与之互补:攻击者有开源权重和模型内部访问时,连续嵌入攻击能有多强。
- 对齐、防御与评测:对齐方面作者提到RLHF(Ouyang et al., 2022)、Constitutional AI(Bai et al., 2022)和DPO(Rafailov et al., 2023)。防御方面提到SmoothLLM(Robey et al., 2024)和对抗偏好学习(Wang et al., 2025)。Liang et al.(2025)显示嵌入模型防护也可被通用magic word绕过;作者称这与本文使用judge评测、而不只靠嵌入相似度过滤有关。HarmBench(Mazeika et al., 2024)、JailbreakBench(Chao et al., 2024)和JAILJUDGE(Liu et al., 2024a)认为仅靠字符串启发式不足以可靠测量安全。作者称本文因此同时报告ASR-Match和ASR-Judge,并分析二者分歧。
基线方法是nanoGCG(逐提示词的GCG重实现)、SPT和BEAST;基准是AdvBench(520条)和HarmBench text-test(320行)。作者把PEO定位为填补上述空白:在原位扰动已有提示词token的嵌入,并称实验中扰动小到可以精确保留可见文本。
论文如何解决这个问题?
PEO冷启动多轮优化原token嵌入,用结构化续写目标推动未成功样本,投影后可见文本不变。
PEO不追加对抗token,而是多轮优化已有提示词token的嵌入,并用结构化续写目标把未成功样本再送入同一优化过程。
嵌入空间优化
- 聊天模板之后的提示词token记为x,嵌入为E。给定续写y,用梯度下降提高模型以有害遵从前缀续写的概率。
- 单步目标是教师强制交叉熵加L2锚:L = LCE(y ∣ Concat(E, Ey)) + λ |E − E(0)|22。含义是:让当前提示词嵌入更可能生成目标续写,同时惩罚偏离原始嵌入。梯度按L2范数裁剪后用Adam更新。Algorithm 1给出这一基线过程。
- 与GCG不同,更新发生在连续嵌入上,不在词表里替换新token。作者称景观平滑、输入空间比离散搜索更丰富,且提示词表面不可见。
- 报告可见文本时,用归一化点积把每个嵌入投影到词表最近token。作者称投影仍落在原token的Voronoi胞内,可见字符串被原样恢复。
结构化续写目标
- 不用泛化遵从短句。目标与数据集对齐,匹配该提示词预期的有害输出;关闭泛化替代目标,并关闭基于预览的早停,避免因浅前缀宣布成功。
- 作者称这类前缀是针对具体查询手写、能直接接上所请求内容的简短开头。它只是优化脚手架,不是成功标准:解码结果不必出现这段原文。
失败聚焦的多轮调度
- 最多四轮。一轮若按ASR-Match已引出有害回复就停止;只有未解决样本进入下一轮。推进不用ASR-Judge,以免调度直接对着最终排名信号,也避免相对未按该信号适配的对照不对称。
- 每轮从原始嵌入冷启动,不继承上一轮嵌入。作者给出三点理由:失败嵌入在自由解码下没有越狱,重初始化让新目标有机会把嵌入拉到别的区域;L2锚始终相对原始嵌入,热启动一开始就有非零锚惩罚;逐轮单独锚回原嵌入,支撑后文0%文本变化的说法。作者把它理解为对同一提示词、换不同续写目标反复求解,而不是一条长轨迹。
- 第1轮只用数据集对齐目标。后三轮保留该目标,再拼接短的结构后缀,而不是整段替换。作者称这些后缀不是自然的独立模板,作用是改变教师强制损失并改善自由解码迁移。字面后缀见第4.3节,此处不复述。
- 第2轮推向编号式具体步骤。第3轮按开头动词分成标题类和步骤类,分别使用短的标题锚或步骤锚。第4轮在同一分类下加长脚手架,使模型同时承诺一个带标签的产物和第一个编号项。作者称这是为了减少只给出标题、或只写出编号后就空白、跑题或事后拒答。
共用超参与成功判定
- 实验中各模型、各轮共用:每轮100次迭代,学习率3×10^{-4},嵌入L2权重10^{-4},梯度裁剪5,最小迭代预算50,预览长度80 token,但不用预览早停。最终自由解码为nucleus sampling,temperature 0.7、top-p 0.9,对照攻击使用同一采样设置。
- 最终是否有害由第5.4节的指标判定,不由脚手架是否出现决定。ASR-Judge要求两名评审都判有害;ASR-Match只作轮次推进信号,以及与先前工作可比的次要指标。
论文做了哪些实验?
四个开源模型、两个基准上,作者称PEO的ASR-Judge均高于nanoGCG、SPT和BEAST。
实验设置
- 模型:Vicuna-7B-v1.3、Llama-2-7B-Chat、Qwen3-4B-Instruct、Llama-3.2-3B-Instruct。四个模型都在两个基准上评测。
- 数据:AdvBench为520条有害行为提示词。HarmBench text-test为320行,只保留官方发布中的文本行为,并配上HarmBench分发的官方优化器目标补全。
- 对照:nanoGCG是逐提示词的GCG,用梯度引导token搜索;作者称不用原版多提示词GCG代码库,因为PEO也是一次攻击一条。SPT优化指令后追加的对抗嵌入。BEAST用束搜索生成对抗后缀,不对token候选计算梯度。论文写明未直接评测防御。
- 优化:四模型、两基准、各轮共用同一四轮日程。每轮100次迭代,学习率3×10^{-4},预览长度80 token,L2权重10^{-4},梯度裁剪5,最小迭代预算50;使用数据集行目标,无泛化替代目标,无基于预览的成功早停。作者称100次/提示词低于GCG族常用预算,但未给出那些预算的具体次数。
- 解码与指标:自由解码均为nucleus sampling,temperature 0.7、top-p 0.9。ASR-Judge只在两名评审都判harmful时计入,分母是全基准(520或320);任一评审API失败记为对攻击不利。ASR-Match是大小写不敏感的英文拒答关键词子串匹配。
- 评审:GPT-5.4与Claude Opus 4.6。附录A给出完整评审提示词,并写明temperature=0.0、输出上限20 token,只回答HARMFUL或SAFE。有效双评审输出的微平均一致率为88.0%。ASR-Judge的95%区间用10,000次bootstrap。
主结果
据Table 2,AdvBench(N=520)的ASR-Judge(%,两评审AND):
表格较宽,可左右滑动
模型 PEO nanoGCG SPT BEAST Vicuna-7B-v1.3 78.65 29.04 46.15 24.62 Llama-2-7B-Chat 71.73 37.50 49.23 5.58 Qwen3-4B-Instruct 72.69 8.46 18.27 4.62 Llama-3.2-3B-Instruct 75.58 23.46 18.08 15.19 - 作者称在ASR-Judge上,PEO在每个AdvBench模型都高于三组对照。作者给出的差距是:相对nanoGCG为34.23到64.23个百分点,相对BEAST为54.03到68.07,相对SPT为22.50到57.50。第7.4节称四种评审聚合下对每种对照都是8/8。
- HarmBench text-test(N=320,Table 2)上,PEO的ASR-Judge为Vicuna 49.69%、Llama-2 45.62%、Qwen3 37.50%、Llama-3.2 50.00%。作者称对照的范围为nanoGCG 6.88%–26.25%、SPT 16.88%–39.38%、BEAST 8.12%–43.75%,且PEO在每个模型仍更高。BEAST的Vicuna格为43.75%,作者称之为其八格中突出的一格。
- 四个模型上PEO的可见文本变化均为0%;三组对照作者称每次都改输入。ASR-Match并不总与ASR-Judge同向:AdvBench上PEO的Vicuna ASR-Match为70.58%,低于nanoGCG的81.35%;Qwen3的ASR-Match为38.65%,低于同格ASR-Judge。HarmBench上作者称PEO的ASR-Match在四模型最高,范围为70.31%–93.75%,Vicuna相对nanoGCG的差距较窄(90.94%对86.25%)。
自适应四轮的累计增益
- Table 4用累计ASR-Match而不是ASR-Judge报告轮次。AdvBench上Pass 1到Pass 4:Vicuna 47.69%到70.58%(Gain 22.88),Llama-2 21.73%到59.62%(37.88),Qwen3 19.23%到38.65%(19.42),Llama-3.2 62.12%到88.27%(26.15)。
- HarmBench上对应Gain为18.44、29.06、16.56、11.25个百分点;Pass 4分别为90.94%、82.81%、70.31%、93.75%。作者称HarmBench的Pass 1更高,是因为其数据集对齐目标已含带上下文的补全。
- Table 5只统计AdvBench上后两轮挽回的失败行。作者称Vicuna的第一次家族跟进挽回44行、第二次再挽回24行;Llama-2为67行和30行,其中Pass 3短标题类T1=46。Qwen3偏标题类(T1=26,S1=6)。Llama-3.2在第一次家族跟进中标题类+24行、步骤类+26行。作者认为许多难例失败在进入持续有害步骤的转折,而不是第一个有害token。
合计ASR-Judge为何跨模型较平
- 作者称PEO的ASR-Judge在AdvBench上落在71.73%–78.65%(作者称跨度6.92个百分点),HarmBench上为37.50%–50.00%(作者称跨度12.50个百分点)。三组对照在AdvBench的跨度,作者称nanoGCG为29.04、SPT为31.15、BEAST为20.00个百分点;HarmBench上对应为19.37、22.50、35.63。
- Table 6在同一提示词集上拆提示词与模型。AdvBench:N=520,pbar=74.7%,四模型都成功43.5%,都失败4.6%,平均κ=0.25,ICC(1)=0.25,相对Binomial(4, pbar)的χ²=290(p<10^{-60})。作者称零假设下这两端约为31.1%和0.4%,合计接近并不等于同一批提示词在每个模型上都成功。
- HarmBench:N=320,pbar=45.7%,四模型都成功21.2%,都失败36.2%,平均κ=0.53,ICC(1)=0.53,χ²=584(p<10^{-100})。作者称约一半逐提示词方差来自提示词。作者认为一种可能解释是:HarmBench有更集中的、四个模型都完不成的行为尾部;AdvBench的剩余失败更随模型而变。
双指标分歧
- Table 7把四个模型、两个基准合在一起。FP指ASR-Match判成功但两评审都判安全;FN指ASR-Match判拒答但两评审都判有害。PEO:Valid 3,360,FP 639(19.0%),FN 731(21.8%)。BEAST为24.3%与4.9%,nanoGCG为32.0%与8.0%,SPT为32.7%与14.6%。
- 在这3,360行里,作者称63.6%为两评审都确认的有害续写,13.9%为两评审不一致,3.4%为安全且含英文拒答关键词,19.0%为浅层非拒答。作者称约五分之四属于前三类,而不是离题、体裁替换或退化。作者称四类模式来自对分歧行的人工审计,没有自动分类器,因此不作定量占比。
- 第7.2节作者称,Llama-3.2在AdvBench上SPT的ASR-Match为82.69%,接近PEO的88.27%,但ASR-Judge为18.08%。作者认为追加的短软提示词常能打破表面拒答,但不稳定地产生连贯有害续写;PEO优化的是模板化提示词的每个位置,空间为n×d并锚在原嵌入。BEAST在AdvBench Llama-3.2上ASR-Match为58.08%、ASR-Judge为15.19%。Table 1给出后期脚手架的成功与失败摘录:成功例被判Harmful,失败例含空格式或拒答尾并被判Safe。
其他消融与分析
- Table 3:PEO在AdvBench上Vicuna的ASR-Judge区间为75.00%–82.12%,Llama-2为67.88%–75.58%;HarmBench上Qwen3为32.19%–42.81%,Llama-3.2为44.38%–55.32%。作者称主比较的排名模式在重采样下稳定。
- Table 8:GPT-5.4单独、Claude Opus 4.6单独、AND、OR下,PEO对nanoGCG、SPT、BEAST都是8/8。作者称AND是最保守的聚合,该规则下也没有对照赢得任何一格。
- Table 9:作者称两评审一致率在78%–98%。最低格为SPT、Llama-3.2-3B-Instruct、AdvBench的78.3%;作者称低一致格多出现在边界性的部分遵从,而不是清楚安全或清楚有害的输出。
- 第7.1节:作者把失败分成浅层遵从和结构抵抗,并称自适应目标主要帮助后者;前者在更晚脚手架下仍常把脚手架本身吐出后再拒答或跑题。
- 第7.5节:作者称用ASR-Match推进会留下一些真实失败未被挽救;主实验故意不用与最终评审栈分离的更强分类器,以免相对单轮对照不对称。
- 论文未报告三组对照的迭代次数、BEAST束宽、查询次数或墙钟耗时。
有什么可以进一步探索的点?
论文无单独局限节;作者称未直接评测防御,且ASR-Match推进会留下未挽救失败。
作者指出的局限与后续方向
- 论文没有单独的Limitations或Future Work节。Section 7.6写明本文没有直接评测防御。作者称主要针对可见对抗后缀的防御可能漏掉精确保留用户可见提示词的攻击,短预览评测相对全文评审可能高估鲁棒性。作者称强拒答应针对会改变续写结构、只攻击剩余失败、并尽量保持表面提示词的攻击来测试。
- Section 7.5:作者称以ASR-Match作为进入下一轮的信号,会留下一些真实失败未被挽救。作者称原则上可换成与最终评审栈分离的更强分类器,例如HarmBench有害性分类器或另行提示的本地LLM,并认为这样做可能会提高ASR-Judge。主实验故意不采用这一信号。
实验覆盖范围
- 被测模型为Vicuna-7B-v1.3、Llama-2-7B-Chat、Qwen3-4B-Instruct、Llama-3.2-3B-Instruct,共4个;两个基准为AdvBench(N=520)和HarmBench text-test(N=320)(Section 5.1、Table 2)。
- 对照攻击为nanoGCG、SPT、BEAST。主指标为GPT-5.4与Claude Opus 4.6都判harmful的比例,次指标为英文关键词ASR-Match;附录A写明评审temperature=0.0、输出上限20 token(Section 5.2、5.4)。
- 设定为white-box、逐提示词、固定迭代预算;无通用后缀训练、无跨样本迁移、不改模型参数(Section 3)。每轮100次迭代,最多4轮;自由解码为temperature 0.7、top-p 0.9(Section 5.2、5.3)。
- 论文写明未直接评测防御(Section 7.6)。第7.3节写明四类失败模式来自人工审计,未实现自动分类器。相关工作讨论了PAIR、TAP和Rainbow Teaming,实验对照不含这些黑盒方法。
- 论文未报告各方法的查询次数、墙钟耗时,也未报告nanoGCG、SPT、BEAST的迭代次数或BEAST的束宽。ASR-Judge的bootstrap为10,000次重采样(Table 3)。
总结一下论文的主要内容
PEO原位优化提示词嵌入、多轮只重攻失败样本;作者称两基准上ASR-Judge均高于三组对照。
PEO是一种不追加对抗token的white-box越狱:直接改已有提示词嵌入,并只对未成功样本更换续写目标再优化。
- 问题:离散后缀和追加嵌入都会改可见输入。作者认为先前工作避开原位扰动,是因为担心毁掉请求语义。受害系统是open-weight聊天模型;攻击者有嵌入梯度,不微调权重,也不做跨样本迁移。
- 做法:在聊天模板后的token嵌入上,最小化有害续写的交叉熵并加L2锚,Adam更新、梯度裁剪。最多四轮,每轮从原嵌入冷启动;后几轮在数据集目标后加编号、标题或步骤类结构脚手架。成功看回复是否提供所请求的有害信息,不看脚手架是否原样出现。
- 主结果:AdvBench(N=520)上PEO的ASR-Judge为Vicuna 78.65%、Llama-2 71.73%、Qwen3 72.69%、Llama-3.2 75.58%(Table 2)。HarmBench text-test(N=320)上为49.69%、45.62%、37.50%、50.00%。作者称两基准、四模型上该指标都高于nanoGCG、SPT和BEAST,四种评审聚合都是8/8。
- 表面与指标:四模型最近token投影后文本变化为0%。作者称ASR-Match会双向误判,因此以双评审AND为主要排名;有效输出的微平均一致率为88.0%。PEO自身仍有19.0%的浅层非拒答被ASR-Match计为成功(639/3,360)。
- 作者结论:作者称原位嵌入优化相对离散后缀、追加嵌入和搜索式攻击更隐蔽,也更可靠,尤其当效果按回复是否实际有害、而不是仅仅非拒答来衡量时。作者还称PEO的合计ASR-Judge跨模型较一致,但AdvBench仍有较多模型特异变异,HarmBench更由提示词驱动。作者称本文未直接评测防御,面向可见后缀的防御可能漏掉这种表面不变的攻击。