研究者提出提取对齐 LLM 安全分类器的越狱攻击方法
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
作者抽出surrogate再攻击:Llama 2用50%时迁移ASR 70%(数据集未写),直接攻击摘要为22%。
白盒(white-box):需访问对齐 LLM 的权重。
- 对齐用于让 LLM 遵守安全等准则,但越狱会改写输入、诱出不安全输出。作者认为现有白盒越狱运行时间和显存高,启发式又缩小对抗搜索空间,既限制效力,也限制对鲁棒性的评估。
- 作者假设对齐在模型内嵌入 safety classifier。从第一层起截取连续 decoder,接线性分类头,用拒绝检测器对模型输出打的拒绝/合规标签训练出 surrogate,再以误分类目标改写 GCG 并迁回原 LLM。
- 四个开源模型上,作者称良性 F1 高于 80% 时结构可少至 20%。Llama 2 用 50% 结构的迁移 ASR,作者写为 70%(未写数据集);摘要写直接攻击为 22%。引言还给出 350s/样本、14 GB,对照 850s/样本、31 GB。
- 作者将中间层结构、temperature 和黑盒迁移留作后续。实验覆盖四个开源对齐模型、AdvBench 与 OR-Bench、白盒 GCG,以及从第一层起的 decoder。附录称弱对齐与 unlearning 不在范围内。
- 威胁模型
- 白盒(white-box):需访问对齐 LLM 的权重。攻击者抽出其 safety classifier 的近似(surrogate classifier),对 surrogate 做对抗优化,使不安全输入被判为合规并迁回原 LLM。作者称行动者可以是审计模型的 red-teamer。成功看输出是拒绝还是合规,指标为 ASR 与 transferability rate。
- 被测模型
- Llama-2-7b-chatQwen2.5-7B-Instructgemma-7b-itgranite-3.1-8b-instructLlama-3.1-8B-InstructMistral-7B-Instruct-v0.3Zephyr_RMU
- 基准
- AdvBenchOR-Bench
- 指标
- F1ASRtransferability rate
研究者提出一种新的越狱攻击技术,通过从 LLM 的部分架构中构建候选分类器,提取其内部安全分类器的近似替代模型。评估显示,最佳候选分类器仅用 20% 的模型架构即可达到 80% 以上的 F1 一致率。在替代分类器上生成的对抗输入可高成功率迁移到原 LLM:仅用 50% 的 Llama 2 模型构建的替代分类器,攻击成功率达 70%,内存占用和运行时间减半,而直接攻击 LLM 的成功率仅为 22%。作者认为,提取替代分类器是建模并应对对齐模型越狱脆弱性的有效且高效手段。代码已公开,该工作已被 IEEE SaTML 接收。
深度解读
这篇论文试图解决什么问题?
作者假设对齐在 LLM 中嵌入 safety classifier,并抽取 surrogate 加以攻击、再迁回原模型。
对齐把是否拒绝嵌进 LLM,但白盒越狱开销高且依赖启发式;作者要抽出该 safety classifier 的近似并攻击它。
- 出现场景:作者称对齐用于执行安全等准则,却会在对抗输入下失效,形成越狱:不安全输入被当作安全输入接受。他们称白盒攻击运行时间和显存高,并用启发式(例如最大化某一输出句的似然,或对输入做固定改动),缩小了对抗输入的搜索空间。
- 核心假设:作者假设对齐在 LLM 中嵌入 safety classifier,决定输入是安全(合规)还是不安全(拒绝)。他们假定输出前的最后中间状态已足以判断输出是否为拒绝。
- 本文做法:从 LLM 结构子集构建 candidate classifier,在良性与对抗设置下看它是否跟上模型决策,选出 surrogate,再攻击 surrogate 并把对抗输入迁回 LLM,用来评估对齐对对抗输入的鲁棒性。
- 威胁模型:
- 知识:论文写明 white-box,即需要模型权重。Section V-B 称威胁模型限于 white-box。
- 目标:抽出目标对齐模型 safety classifier 的近似。越狱本身是给不安全输入加扰动,使模型合规。作者称抽取成功后,后续白盒越狱可以避开直接攻击的计算开销。
- 能力与行动者:选用模型子集、训练分类头,并对 surrogate 生成对抗后缀。作者称行动者可以是审计模型的 red-teamer。
- 受害系统与判定:受害系统是对齐后的 chat LLM。分类看输出是拒绝还是合规,而不是输出是否含不安全信息。成功用误分类比例 ASR,以及一方做出的对抗输入被另一方误分类的 transferability rate。
有哪些相关研究?
作者把本文放在越狱、表示探测与剪枝之间:抽出嵌入的 classifier,而不是只训不能反传的 probe。
引言、背景和 Section VI 把相关工作分成对齐判定、越狱、表示与组件、剪枝四组。
对齐与输出判定:SFT 用人工回复微调;RLHF(Christiano 等,2017;Bai 等,2022)另训奖励网络;DPO(Rafailov 等,2023)把 LLM 自身当作奖励模型。不安全行为有分类体系,论文举 Llama Guard(Inan 等,2023)。早期用拒绝关键词判定输出(Zou 等,2023);也有粒度不同的 LLM judge(Inan 等,2023;Mazeika 等,HarmBench,2024)。论文指出 judge 也可被攻击,从而可能把不安全输出判成安全(Mangaokar 等,2024;Raina 等,2024)。
越狱攻击:白盒方面,GCG(Zou 等,2023)用贪心坐标梯度处理嵌入到 token 没有直接映射的问题;后续工作改进算法、更换目标,或利用 logits、特殊 token 与生成过程。论文称 GCG 一类攻击在多数开源模型上平均 ASR 高于 50%(转述 Mazeika 等,2024)。黑盒方面,论文描述了字符画变换、低资源语言、既有模板和搜索算法,并称 ArtPrompt 在 GPT-3.5 上 ASR 可高达 80%。这些是论文对既有攻击的转述,不是本文实验。
表示、probe 与组件:论文称拒绝与接受在某些表示上须线性可分,因为输出显式线性依赖最后嵌入(Lin 等,2024);decoder 层和注意力头上都有分离的报告。线性 probe 被用来分类这些表示,但论文指出它们没有从嵌入到 token 的梯度,不能直接产生 token 级对抗样本。已有用法包括消融、对嵌入做干预,以及对输入做优化;论文称干预得到的扰动不一定对应可行的输入扰动。
剪枝:深度、宽度、长度剪枝可组合。论文提到安全对齐可被低秩隔离(Wei 等,2024),剪枝也可提高拒绝抵抗(Hasan 等,2024)。论文指出这些技术通常会改动模型的选定部分。
基线方法:直接对完整 LLM 使用 GCG 的 nanogcg 实现。基准/数据集:增强版 AdvBench,以及 OR-Bench 的随机子集。
作者把本文定位为:把对齐看成模型内部的 classifier 并抽出它,使越狱能产生 token 级对抗输入。相对只在表示上训练、不能反传到 token 的 probe,以及会改动模型部件的剪枝,作者称选择线性探测是为了少训练、少损失决策边界上的信息。
论文如何解决这个问题?
从前若干 decoder 加线性头拟合拒绝/合规,再用误分类目标攻击该 surrogate 并迁回 LLM。
整体上,作者把越狱收成对嵌入 safety classifier 的误分类:用模型子集加分类头得到 surrogate classifier,再以误分类目标攻击它,并把对抗输入迁回 LLM。
问题设定
- 任务:fθ 是上下文窗口为 N、词表为 V 的 LLM。规则 R 把输出映到类别。安全任务是二分类:不安全提示为正类(对应拒绝),安全提示为负类(对应合规)。越狱是假阴性,假阳性是 over-refusal。
- 本文的 R:作者用一个分类器判断输出是拒绝还是合规,关注回答类型,而不是输出是否包含不安全信息。
- 抽取目标:结构 fθ(θ 为 θ 的子集)加分类头 C,使对任意输入 x 有 R(fθ(x))=C(fθ∗(x))。该式表示 candidate 与 LLM 在这一分类任务上一致。
- 分离观察:作者用 silhouette score 看两类嵌入是否分开。分数从 -1 到 1;他们引用的标准是低于 0 为重叠,高于 0.25 或 0.5 为弱分离或尚可分离。Figure 2 横轴是 normalized decoder position,纵轴是 Silhouette Score(刻度 0.0 到 0.6)。作者称分数到最大后下降,四个模型趋势相同、两个数据集幅度不同,并把下降解释为后续层加入了与安全无关的信息。
从结构抽出 candidate
- 三步:选定结构;收集结构特征与 R(fθ(x));训练分类头。结果称为 candidate classifier。作者称保留判对和判错的标签,因为目标是抽出 classifier,不是改进它。
- 结构:作者假设 classifier 在 decoder 级,且相关信息在序列末端,故分类头只看结构输出的最后一个向量,输入维度为 d。结构记为 fi,i+δ,δ 为 candidate size,Dδ 为占 LLM decoder 数的比例。本文把 i 固定为 1,即从第一层起的连续 decoder。隔离中间 decoder 被留到后续。
- 分类头:为避免复杂头过拟合,用线性探测:输出是 sigmoid(Ah+b),再经阈值 T 分成两类。T 取训练集上使 F1 最大的值。
- 训练:5 折交叉验证。Table I 给出学习率 0.001、batch size 32、epochs 500、Adam、patience 15、折数 5。生成时 temperature 为 0,每步取 logits 最大的 token。R 使用 distilroberta-base-rejection-v1。
数据与攻击目标
- 数据补全:缺少安全提示时,用一个 LLM 把不安全提示改成结构相同的安全版本,并人工核对两条性质:不索取不安全信息,结构与原提示相同。论文有改写例句,此处不复述。原始 GCG 还需要目标输出串;缺失时用 LLM 生成可能的合规输出。承担这两步的 LLM,论文未点名。
- 攻击流程:用 GCG 在 candidate 上生成对抗样本,再看它们是否使 LLM 误分类。作者称这与换一个源模型做迁移类似,但源是目标 LLM 的子集。
- 目标改写:原 GCG 最大化某一目标 token 序列的对数概率。作者认为合规输出空间无限,把搜索绑到某一句会限制效力。candidate 给出安全标签后,目标改为在对抗后缀上最大化 L(C(fθ∗(x1… xT+A)), y),其中 y 是 LLM 的预测标签,L 例如二元交叉熵。作者称,若 candidate 满足上面的一致式,提高合规句的似然就意味着更接近被判为安全,因而该目标在完美 candidate 下包含原 GCG 目标。
- 实现选择:nanogcg,num_steps=250,topk=512,search_width=512,攻击长度 20;candidate 上用 PyTorch 二元交叉熵。主实验把不安全输入推向合规。作者未把 BEAST、AutoDAN 用作主攻击,理由是前者不基于梯度,后者的优化目标难以映到误分类;也未采用 AmpleGCG,理由是它增加复杂度,不符合去掉启发式的目标。
论文做了哪些实验?
四个开源模型上,Llama 2 用 50% 结构的迁移 ASR 作者写为 70%,直接攻击摘要写为 22%。
实验设置
- 模型:主实验四个开源对齐 chat 模型,Transformers 4.46.2:Llama-2-7b-chat、Qwen2.5-7B-Instruct、gemma-7b-it、granite-3.1-8b-instruct。图表简称依次为 Llama 2、Qwen 2.5、Gemma 1、Granite。附录 C 另报 Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Zephyr_RMU 的良性 F1,未报告对它们的攻击迁移数字。
- 数据:增强 AdvBench 为 520 条原不安全指令加 520 条安全指令。OR-Bench 随机 1000 条,不安全与安全各 500;作者称出于计算原因抽样。
- 标签与指标:temperature 为 0。拒绝或合规由 distilroberta-base-rejection-v1 判定。candidate 用 F1。ASR 是被攻击改过的输入里被模型误分类的比例。transferability rate 是在一方上做出的对抗输入被另一方误分类的比例。
- 协议:分类头 5 折;Figure 4 的 Test F1 为 5 次试验的中位数。攻击为 nanogcg 版 GCG,num_steps=250,topk=512,search_width=512,长度 20。对抗评测用各折里分类头没见过的提示,阈值取训练 F1 最大者。
- 算力:NVIDIA A100,40 GB 显存。作者称对模型的攻击约 2000 GPU 小时,对 candidate 约 500 GPU 小时。效率为 100 个样本的平均。分类头训练作者称不足 1 分钟,且对全部样本只做一次。
- 对照:直接对完整 LLM 跑同一 GCG。作者称原目标每步都要生成输出序列并与目标序列比较。
主结果
表格较宽,可左右滑动
模型(表中名) AdvBench 直接 ASR OR-Bench 直接 ASR 50% 结构迁回 LLM Gemma 1 0.62 0.67 未报告 Granite 0.91 0.88 未报告 Llama 2 0.22 0.12 70%(未写数据集) Qwen 2.5 0.94 0.88 未报告 前两列据 Table III。70% 出自正文与 Takeaway 6,指攻击 Llama 2 的 50% 结构后迁回该 LLM;该句未写是 AdvBench 还是 OR-Bench。摘要和引言里的直接攻击 22% 同样未在该句写数据集。
- 直接攻击:作者写 Llama 2 与 Qwen 2.5 的 ASR 相差约 70%,并归因于 Llama 2 对齐强、偏向拒绝(见 Section A)。除 Gemma 1 外,OR-Bench 上的直接 ASR 低于 AdvBench;作者称这可能与 OR-Bench 强调 over-refusal 有关。Gemma 1 相反:AdvBench 0.62,OR-Bench 0.67。
- surrogate:作者称 Figure 9 不随 candidate size 单调上升。其中三个模型在 normalized candidate size 接近 60% 时峰值高于 70%,论文未点名是哪三个。后文又称所有模型只用一半结构时迁移率高于 70%。Llama 2 的具体数字是 50% 结构、ASR 70%,作者称高于直接攻击基线。
- 目标函数:作者称差别来自对抗目标。文本输出需要用特定目标句判断越狱;改成误分类后搜索空间更大。δ 太小抓不住攻击所需信息,δ 太大则会掺入与安全分类正交的信息。
良性一致与跨数据集
- 同分布:作者称 Figure 4 中性能随 candidate size 上升或持平,且四个模型在 normalized candidate size 低至 20% 时 F1 高于 80%。OR-Bench 上 candidate 的 F1 更低,作者写所有模型 losing 5%,未说明是百分点还是相对降幅。Table II 中 LLM 自身 F1:AdvBench 上 Gemma 1 与 Qwen 2.5 为 0.97,Granite 0.94,Llama 2 0.93;OR-Bench 上依次 0.95、0.89、0.88、0.83。
- 跨数据集:Figure 5 是在未参与训练的数据集上的中位 F1。作者称最大 candidate size 下换分布后下降不大,但收敛更慢。Gemma 1 在 Figure 4a 中,normalized size 高于 20% 时 F1 为 0.9;Figure 5a(AdvBench 训练、OR-Bench 测试)要到 50%。作者认为 candidate 会过拟合数据集格式,另一数据集给出的是 δ 的下界。
LLM 到 candidate 的对抗迁移
- 样本量:先攻击 LLM,只保留被 LLM 误分类的对抗输入。Figure 8 标注:AdvBench 上 Gemma 1 n=320,Granite n=473,Llama 2 n=113,Qwen 2.5 n=487;OR-Bench 上依次 n=334、443、59、441。
- 作者对 Figure 8 的表述:迁移率至少用到一半模型才收敛。正文写 Llama 2 只有超过一半模型时迁移率才高于 90%;Takeaway 4 写使用超过 50% 时超过 95%。两处阈值不同,正文未给逐点读数。
- 数据集差异:作者称 OR-Bench 上迁移率收敛到 80% 以上,AdvBench 为 60% 到 80%,Llama 2 是唯一例外。OR-Bench 上使用不到 40% LLM 的多数 candidate 不稳定。作者把 OR-Bench 上更高的收敛值归因于被判为不安全的样本更多;并称 Llama 2 不受此趋势影响,因为它把安全输入误判为不安全的比例最高。
效率
- 引言中的 Llama 2:50% 结构对照直接攻击,作者写 350s/sample 对 850s/sample,14 GB 对 31 GB,并写 less than half。摘要则写 half the memory footprint and runtime,未给出这四个数。
- Figure 10:图注写虚线为直接攻击 LLM 的平均基线 840s 与 31 GB;曲线是随 candidate size 制作一个对抗样本的 runtime 与 VRAM,对 100 个样本平均。图注未写模型名。作者称二者都未达到 31 GB 与 840s,并把基线更慢归因于每步生成输出序列。作者称攻击 50% 模型时 20 GB 显存即够;这句是作者的推论,不是图上标注的读数。
- 参数规模:作者称所评 LLM 参数量小于 9 billion,使用 50% 即够做这一攻击。
其他消融与分析
- 附录 B 改为攻击安全输入、诱使拒绝。Table IV 的 ASR:Gemma 1 为 AdvBench 0.4、OR-Bench 0.47;Granite 0.68、0.7;Llama 2 均为 0.99;Qwen 2.5 为 0.88、0.85。作者称 Llama 2 在不安全输入上 ASR 最低,在安全输入上最高。
- 附录 B:作者称迁移趋势与主实验相似,多数模型有峰值,Llama 2 例外;OR-Bench 上 candidate 的 ASR 与迁回 LLM 的比例一致。拒绝目标句见附录,此处不复述。
- 附录 C、Table V,模型自身 F1:Llama 3 为 AdvBench 0.84、OR-Bench 0.63;Mistral 0.74、0.77;Zephyr RMU 0.7、0.62。作者称三者在 OR-Bench 上 F1 都低于 0.8。
- 附录 C:作者称 Figure 14a 在某一 candidate size 后收敛,但 F1 低于主实验模型;Figure 14b 在模型中部下降。Figure 15 为跨数据集曲线,正文未给逐点数字。
- 作者对附录 C 的解释:所引 Mistral 模型卡称该演示没有 moderation mechanisms;Llama 3 调整了拒绝语气,使检测分类更难;Zephyr RMU 经 unlearning 后仍可能对不安全输入合规并给出安全输出,作者认为 unlearning 可能去掉 safety classifier 的一部分。
- Figure 2 的正文未给出各点 silhouette 数值。作者称 OR-Bench 的 silhouette 一致低于 AdvBench。
有什么可以进一步探索的点?
作者将中间层结构、temperature 与黑盒迁移留作后续,附录称弱对齐和 unlearning 不在范围内。
作者指出的局限与后续方向
- 中间层结构:本文只研究从第一层起的 f1,1+δ。作者写 i>1 时需要新方法,使 candidate 不使用更早 decoder 的信息,并把该探索留待后续(Section V-C)。
- temperature:实验将 temperature 设为 0,以保证可复现并降低计算。作者写 temperature 及其对拒绝、合规概率的影响留待后续(Section V-C)。
- 黑盒:作者写本文将威胁模型限于 white-box,因为抽取 surrogate 需要权重;并称研究源 LLM 的 safety classifier 能否迁到另一个目标 LLM 是一个方向(Section V-B)。
- 其他对齐失败:恶意代码、幻觉、不诚实、偏见和不公平不能直接写成分类问题。作者称可以构造受控环境,用特定格式的提示让 LLM 充当分类器,再套用这一做法(Section V-A)。
- 弱对齐与 unlearning:附录 C 写该方法不适合对齐较弱、或用不同于传统对齐的方式加固的模型。作者认为经 unlearning 加固的模型与本文范围正交,因为 unlearning 可能去掉 safety classifier 的一部分(Appendix C)。
实验覆盖范围
- 主结果的被测模型为 Llama-2-7b-chat、Qwen2.5-7B-Instruct、gemma-7b-it、granite-3.1-8b-instruct,共 4 个。附录 C 另报 Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Zephyr_RMU 的良性 F1 与跨数据集曲线;论文未报告这 3 个模型的攻击 ASR 或迁移率。
- 数据集为增强 AdvBench(520 条不安全加 520 条安全)和 OR-Bench 随机 1000 条(各 500)。标签器为 distilroberta-base-rejection-v1,生成 temperature 为 0。论文未报告该标签器与人工判定的一致性,也未点名数据增强所用 LLM。
- 白盒攻击算法为 GCG(nanogcg),超参为 num_steps=250、topk=512、search_width=512、长度 20。作者在 Section IV-A 说明 BEAST 不基于梯度、AutoDAN 的目标难以映到误分类,故未用作主攻击;AmpleGCG 因增加复杂度且不符合去掉启发式的目标而未采用。
- 结构为从第一个 decoder 起的连续前缀。良性 F1 为 5 折,Figure 4 与 Figure 5 写的是 5 次试验的中位数。Figure 8 给出计算迁移率的 n;Figure 10 为 100 个样本平均。论文未在 Figure 9 图注中写各点样本量。
- 附录 B 报告了把安全输入攻成拒绝的 ASR(Table IV)。Section V-B 讨论了对 safety classifier 做对抗训练、增大 classifier,以及推理时用它提前丢弃不安全输入;论文未报告这些防御的实验结果。
总结一下论文的主要内容
抽出 safety classifier 近似再攻击迁移。Llama 2 用 50% 结构时作者写 ASR 70%,直接攻击写 22%。
作者提出一种白盒越狱做法:抽出对齐 LLM 内部 safety classifier 的近似,再攻击该近似并迁回原模型。
- 问题:对齐应让不安全输入被拒绝,但越狱能让这类输入被接受。作者认为直接白盒攻击开销高,且用目标句等启发式限制了搜索。
- 方法:从第一层起截取连续 decoder,加线性分类头,拟合模型输出是拒绝还是合规。再用误分类目标替换 GCG 的目标句似然,攻击选出的 surrogate。
- 良性:作者称四个主模型上,candidate 用少至 20% 结构即可使 F1 高于 80%。Table II 里这些 LLM 自身在 AdvBench 上的 F1,最低是 Llama 2 的 0.93,最高是 Gemma 1 与 Qwen 2.5 的 0.97。
- 攻击:Table III 中直接 GCG 的 AdvBench ASR,最低是 Llama 2 的 0.22,最高是 Qwen 2.5 的 0.94;OR-Bench 最低 0.12、最高 0.88。作者称 Llama 2 用 50% 结构时迁移 ASR 为 70%,该句未写数据集;摘要中的直接攻击为 22%,同样未在该句写数据集。
- 开销:引言把上述 Llama 2 设置写成 350s/sample、14 GB,对照 850s/sample、31 GB;摘要写成一半显存和运行时间。Figure 10 图注的平均基线是 840s 与 31 GB,且未写模型名。
- 作者结论:作者认为这类近似足以用来查看对齐部署的安全性,也为针对对齐的攻击提供途径;并认为因此可以降低研究对齐鲁棒性时的显存和运行时间。幻觉、不公平等其他对齐失败,作者认为也可能用同一做法来看。