PatchBench 提出激活补丁局部评测协议,揭示越狱修复的附带损伤
PatchBench: Measuring Collateral Damage in Activation Patching
研究者用 PatchBench-Local 评测激活补丁,发现在 Llama 8B 上 CAST 的 MMLU 仅降 0.07 百分点但良性保留得分下降 26.3 点。
- 现存越狱评测多为提示词库与全局聚合指标,无法区分模型激活补丁是精准针对特定行为的修复,还是连带造成词汇/结构层面的过度拒绝抑制;且若模型原本已拒绝某提示词,该提示词无法作为补丁修复的目标。
- 从 37 个公开越狱数据集中筛选出 8 个开源模型真实产生的 400 个有害回答作为修复目标(PatchBench),并提出 PatchBench-Local 协议:针对每个有害提示词生成有害变体、同结构良性提示词和含关键词良性提示词,分别评估有害变体拒绝率和良性邻域保留率。
- 评测 AST、CAST、AdaSteer 和 AlphaSteer 四种激活引导方法,发现模型在全局 MMLU 下降极小的情况下仍可能出现严重的局部良性邻域拒绝。例如在 Llama 8B 上,CAST 的 MMLU 仅下降 0.07 个百分点,但良性保留得分 BNPS 骤降 26.3 点;无条件引导方法 AST 则在多模型上造成广泛的局部过度拦截。
- 作者指出 PatchBench 侧重精度而牺牲了广度,未覆盖所有越狱策略、有害领域或模型行为;MMLU 仅提供粗粒度能力检验,无法替代特定任务效用评估;激活补丁对超参数选择敏感;扩展到新模型需手动生成。当前实验仅覆盖 8 个开源模型构建基准、4 个密集模型与 1 个 MoE 模型评测补丁。
- 威胁模型
- 作者在白盒设置下研究针对越狱故障的激活补丁修复,目标是在抑制已确认模型可利用危害回答及其变体的同时,保留结构或词汇相近的良性提示词行为。
- 模型
- Qwen2.5-3B-InstructQwen2.5-14B-Instructgemma-3-4b-itgemma-3-12b-itLlama-3.1-8B-InstructLlama-4-ScoutMistral-7B-Instruct-v0.3Ministral-3-14B-Instruct
- 基准
- PatchBenchPatchBench-LocalMMLU
- 指标
- Harmful Neighbour Correction Score (HNCS)Benign Neighbour Preservation Score (BNPS)MMLU 5-shot accuracy
研究者发布 PatchBench,一个面向激活补丁(activation patching)的越狱修复评测基准,包含 400 条经人工核验的模型特定越狱失败样本,覆盖 8 个开源指令微调模型。构建流程从 RedBench 的 27,870 条提示出发,人工筛选保留 15,314 条,查询模型得到 122,512 组提示-回答,经 WildGuard 过滤、成对 Elo 排序和人工复核,每个模型保留 50 条能产生可操作有害回答的失败样本。配套的 PatchBench-Local 为每条有害源提示生成 29 条局部提示,包括 19 条保留恶意意图的有害变体,以及结构匹配和复用有害词汇的两类良性提示,分别用有害邻域纠正分(HNCS)和良性邻域保持分(BNPS)衡量。
推荐理由PatchBench 把越狱修复评测从全局指标转向局部邻域,揭示补丁可能只压制表面措辞却误伤相近良性提示。
深度解读
这篇论文试图解决什么问题?
现有评估无法区分激活补丁是精准修复还是广泛抑制,论文提出局部评估基准与协议。
现存越狱修复评估主要依赖模型级聚合指标,无法检验内部表征干预是否在局部邻域产生连带过度拒绝或泛化不足。
- 场景与重要性:大语言模型(LLM)易受越狱攻击诱导产生危害内容;激活补丁(activation patching)等推理期表征干预方法因无需修改权重、可靶向抑制特定不安全行为而备受关注。
- 现有方法的不足:作者称现有越狱基准(如 RedBench、JailbreakBench)主要是提示词库,未指明特定模型在具体提示词上是否真正发生危害故障;同时全局指标(如攻击成功率、拒绝率、MMLU)无法分辨补丁是精准修复,还是在局部邻域进行了广泛的不当抑制。
- 核心观察与假设:一个有效的安全补丁不仅要在确切的有害源提示词及其有害变体上引发拒绝,还必须保留结构相似或复用关键词的邻近良性提示词的正常回答;全局能力无明显变化不代表局部良性行为未受损。
- 论文的提出内容:作者构建了包含 400 个模型特异性可利用危害故障的基准 PatchBench,并提出了评测有害邻域纠正与良性邻域保留的局部评估协议 PatchBench-Local。
有哪些相关研究?
梳理了越狱对齐、激活引导与越狱基准三类工作,指出此前缺乏局部精确性评测。
论文将相关研究和背景主要分为三类,并对比了现有越狱评测与局部干预评估:
LLM 越狱与安全对齐
- 对齐方法:Ouyang et al. (2022) 等提出了基于人类反馈的强化学习与监督微调方法,用于提升模型安全性与有用性。
- 越狱脆弱性分析:Carlini et al. (2024)、Qi et al. (2024)、Russinovich et al. (2026) 等指出模型安全行为常依赖脆弱的输出层模式,越狱提示词仍能绕过安全护栏;模型重训练与微调成本高且可能影响不相关行为。
激活引导与推理期干预
- 无条件引导:Turner et al. (2024)、Arditi et al. (2024) 等发现语言模型内部存在介导拒绝行为的单一方向,但在推断期无条件施加拒绝方向(AST)会增加对无害输入的误拒。
- 条件/自适应引导:Lee et al. (2025) 提出条件激活引导(CAST);Zhao et al. (2025) 提出结合有害性方向调节的 AdaSteer;Sheng et al. (2026) 提出零空间约束的 AlphaSteer。作者指出这些方法此前主要通过全局攻击成功率、拒绝率或效用得分评测,未检验修复故障点周围的局部行为精度。
越狱基准与安全分类器
- 越狱数据集与评测:Chao et al. (2024) 提出 JailbreakBench;Dang et al. (2026) 提出 RedBench;Jiang et al. (2024) 提出 WildTeaming;Shen et al. (2024) 收集真实越狱提示词。作者指出这些基准多为通用提示词库,缺乏针对特定模型确已失守并生成具体危害回答的样本对。
- 安全分类器:Han et al. (2024) 提出 WildGuard,Inan et al. (2023) 提出 Llama Guard。作者指出它们通常用于独立输出或全局基准打分,而非围绕干预点构建结构化局部邻域。
基线方法与基准
- 基线方法:论文对比了未引导模型(Unsteered)以及 AST、CAST、AdaSteer、AlphaSteer 四种激活引导方法。
- 评测定位区别:作者定位 PatchBench 与传统基准的不同在于它提供模型特异性已证实危害输出,PatchBench-Local 则首次显式解耦有害变体纠正与良性变体保留两种局部指标。
论文如何解决这个问题?
构建 400 个模型故障对,通过大模型生成三类局部邻域并定义 HNCS 与 BNPS 指标。
论文通过构建经验证的危害故障库 PatchBench 与基于局部邻域提示词生成的评估协议 PatchBench-Local 来解决该问题。
PatchBench 故障库构建流程
- 源数据初筛:从聚合了 37 个公开基准的 RedBench(27,870 条提示词)出发,手动过滤重复内容、非生成式与弱危害意图项,保留 15,314 条提示词。
- 贪婪生成与初检:用原生聊天模板和贪婪解码查询 8 个开源模型产生 122,512 个回答;使用 WildGuard 过滤,仅保留判定为不安全且回答了危害请求的 6,380 个候选对。
- 成对 Elo 排序与人工终审:针对每个模型分别进行成对 Elo 排序(K 因子设为 40,每候选至少 50 场对比),人工核验排名前 200 的候选项,每个模型最终保留 50 个高置信度危害回答,共计 400 个故障样本对。
PatchBench-Local 邻域提示词生成
针对每个有害源提示词,利用 Mistral Large(附录中用 GPT-4o 验证稳定性)按照固定 JSON 模板生成 29 个邻域提示词,共计 30 个评测提示词,分为三个家族(Figure 4):
- 有害意图族(19 条):保持恶意意图并变换表层形式,包含 10 条改写、2 条翻译(法语、西班牙语)、3 条标点变换、1 条大小写反转、3 条拼写或语法错误。
- 结构匹配良性族(5 条):保留原请求骨架结构(含选择题结构),但将有害意图替换为良性意图。
- 关键词复用良性族(5 条):在良性或信息性语境中复用核心有害词汇,去除可能存在的选项块。
局部评估指标计算
利用 WildGuard 的拒绝(refusal)判别信号评估打补丁后模型在 30 个提示词上的行为:
- 有害邻域纠正得分(HNCS):定义源提示词及 19 个有害变体的目标行为为拒绝,被判定为拒绝记 1 否则记 0,平均得分即为 HNCS(0–100%)。
- 良性邻域保留得分(BNPS):定义 10 个良性邻域提示词的目标行为为不拒绝,未被判定为拒绝记 1 否则记 0,平均得分即为 BNPS(0–100%)。
激活引导补丁实施
在附录 F 中统一实现了四种干预方法的参数微调与推断介入:
- AST 与 CAST 形式化:AST 在中间半数 Transformer 层施加固定的拒绝方向 h′(l) ← h(l) + α r(l);CAST 则引入门控判定,仅在满足条件时激活:
h′(l) ← h(l) + α 1[sim(h(l), projc h(l)) > θ] r(l)- AlphaSteer 与 AdaSteer:AlphaSteer 引入投影到良性激活正交补空间的自适应矩阵;AdaSteer 动态拟合拒绝方向(RD)与有害性方向(HD)的双系数仿射变换。所有方法超参数均在独立验证集上搜索确定。
论文做了哪些实验?
实验显示激活补丁存在纠正与良性保留的权衡,MMLU 几乎不变时局部良性退化依然严重。
实验设置
- 被测模型:主实验评测 4 个代表性模型,涵盖 4 家厂商:Qwen2.5-3B-Instruct、Mistral-7B-Instruct-v0.3、Llama-3.1-8B-Instruct、gemma-3-4b-it;附录 D 补充了 Mixture-of-Experts 架构模型 Llama-4-Scout-17B-16E-Instruct(109B 参数)。
- 数据与规模:主实验针对每个模型分别使用其专属的 50 个 PatchBench 源故障及其生成的 29 个邻域提示词(每个模型评测 1,500 次局部交互);全局通用能力采用 5-shot MMLU。
- 对比方法:未引导基线(Unsteered)、AlphaSteer、AdaSteer、AST、CAST。
- 指标定义:有害邻域纠正得分(HNCS,0–100)、良性邻域保留得分(BNPS,0–100)、MMLU 5-shot 准确率(%)。
- 评审方式:使用 WildGuard 自动标注拒绝信号;附录 B 中通过 3 位人类评估员在 202 个样本上验证,与多数票一致性达 92.6%(Cohen's κ=0.841)。
- 解码设置:采用确定性贪婪解码;主实验结果为固定测试集上的确定性基准测量。
主结果
下表展示了 PatchBench-Local 在 4 个基础模型上的局部修复效果(据 Table 1):
表格较宽,可左右滑动
方法 Qwen 3B HNCS Qwen 3B BNPS Mistral 7B HNCS Mistral 7B BNPS Llama 8B HNCS Llama 8B BNPS Gemma 4B HNCS Gemma 4B BNPS Unsteered 40.1 98.6 32.2 99.2 31.2 97.1 18.2 98.8 AlphaSteer 92.5 94.2 73.2 95.8 87.7 73.8 65.8 94.8 AdaSteer 87.9 84.4 77.2 96.0 88.5 65.3 87.6 86.7 AST 95.6 66.8 89.9 63.2 88.4 47.8 87.1 28.4 CAST 82.5 82.4 67.5 91.4 81.5 70.8 58.5 76.8 - 有害纠正与良性保留的权衡:作者称强有害邻域纠正通常伴随明显的良性邻域降级,高 HNCS 并不意味着高 BNPS。
- 无条件引导的严重退化:AST 在多个模型上取得极高 HNCS,但在 Qwen 3B 上 BNPS 损失 27.4 点,在 Llama 8B 损失 17.5 点(相比 AdaSteer),在 Gemma 4B 上 BNPS 仅为 28.4。
- 条件与自适应方法的表现:AlphaSteer 在 Qwen 3B 上表现优异(HNCS 92.5, BNPS 94.2);CAST 表现相对保守,纠正率偏低但良性损失较小。
全局能力与局部退化的脱节
- 测了什么:在 4 个模型上测试打补丁后的 5-shot MMLU 准确率,并与局部 BNPS 下降对比(据 Table 2)。
- 结果:在 Llama 8B 和 Gemma 4B 上,CAST 的 MMLU 仅下降 0.07 和 0.52 个百分点(分别为 68.21% 与 57.88%),但其 BNPS 分别下降了 26.3 和 22.0 点;AlphaSteer 在 Llama 8B 上 MMLU 仅降 2.50 个百分点,BNPS 下降 23.3 点。
- 作者的解读:作者指出全局能力保留与局部良性保留不等价,标准多任务基准(如 MMLU)无法捕捉发生在修复故障点周围的严重附带损伤。
良性退化的类型分解分析
- 测了什么:将良性邻域损失解耦为词汇过度拦截(Lexical loss)与结构过度拦截(Structural loss)(据 Figure 6)。
- 结果:AlphaSteer 在 Llama 8B 上词汇损失为 5.8,结构损失高达 46.7;AdaSteer 在 Llama 8B 上词汇损失为 37.3,结构损失为 32.0;CAST 在 Llama 8B 上结构损失为 38.4,在 Gemma 4B 上词汇损失为 34.4、结构损失为 12.0;AST 在 Gemma 4B 上两类损失分别达 72.0 和 71.2。
- 作者的解读:作者称良性退化在不同方法和模型上表现出不同的形态,部分表现为对请求格式的过度泛化,部分表现为对有害词汇的过度敏感。
其他消融与分析
- 生成模型敏感度分析(据 Table 6 聚合结果):使用 GPT-4o 替代 Mistral Large 生成邻域,各方法在两生成器下的聚合 BNPS 分别为:AlphaSteer(89.7 vs 89.8)、AdaSteer(83.1 vs 85.1)、AST(51.5 vs 52.8)、CAST(80.3 vs 73.9)。
- MoE 模型扩展测试(据 Table 7):在 109B 参数的 Llama-4-Scout 上,未引导模型的 HNCS/BNPS 为 18.0/98.6;AlphaSteer 达到最高的 79.7 HNCS,但 BNPS 最低(74.8);AST 与 CAST 的 BNPS 分别为 94.5 与 94.6,HNCS 分别为 62.5 与 44.6。
有什么可以进一步探索的点?
作者指出基准重在精度而牺牲广度且调参敏感,实验覆盖了 8 个开源模型与 4 种补丁方法。
作者指出的局限与后续方向
- 基准覆盖面有限:PatchBench 侧重评测精度而牺牲了广度,未打算覆盖所有越狱策略、有害领域或模型行为,也无法用于证明广泛的鲁棒性(出自 Section 7)。
- 全局能力检验较粗:MMLU 仅提供粗粒度的全局能力检验,无法替代针对特定任务的效用评估(出自 Section 7)。
- 对超参数高度敏感:当前激活引导方法对超参数选择依然敏感,超参数变化会同时影响有害邻域纠正与良性邻域保留(出自 Section 7)。
- 扩展至新模型需人工成本:将基准扩展到新模型需要针对模型生成并经过人工筛选,产生了一次性的人工成本(出自 Section 7)。
- 多故障同时修复的尺度扩展:作者指出未来核心方向是研究局部指标如何超越孤立邻域;当同时修复多个故障时,需要解决局部区域间的相互干扰及良性退化的累积问题(出自 Section 7)。
实验覆盖范围
- 基准构建涵盖的模型:PatchBench 的 400 个故障项分布于 8 个开源指令微调模型(Qwen2.5-3B-Instruct、Qwen2.5-14B-Instruct、gemma-3-4b-it、gemma-3-12b-it、Llama-3.1-8B-Instruct、Llama-4-Scout、Mistral-7B-Instruct-v0.3、Ministral-3-14B-Instruct),每模型各 50 项。
- 评测的补丁修复方法:评测覆盖了 4 种激活引导方法(AlphaSteer、AdaSteer、AST、CAST)。
- 评测的模型架构:补丁评测主实验覆盖了 4 个密集模型(Qwen 3B、Mistral 7B、Llama 8B、Gemma 4B),附录补充了 1 个 MoE 模型(Llama-4-Scout)。
- 邻域生成规模:每个有害源提示词生成 29 个局部邻域提示词(19 个有害变体、5 个同结构良性提示词、5 个复用有害词良性提示词)。
- 论文未报告的信息:论文未报告其他推理期安全干预(如安全解码算法)在 PatchBench 上的修复效果,亦未报告多提示词联合打补丁时的干预表现。
总结一下论文的主要内容
论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
- 研究定位:针对大模型激活引导补丁缺乏局部行为精度评估的问题,提出了首个基于真实有害回答构建的模型特异性故障库 PatchBench,以及解耦评测有害纠正与良性保留的 PatchBench-Local 协议。
- 核心问题:标准安全基准主要是未验证模型是否会失守的提示词集合,且 MMLU 等全局指标无法察觉模型在有害提示词周围产生的局部过度拒绝。
- 方法设计:从 RedBench 筛选出 8 个开源模型真实产生的 400 个高质量有害回答(每模型 50 个);利用大模型为每个源提示词生成 19 个有害变体与 10 个良性变体(结构相同或关键词复用),以 WildGuard 评估打补丁后的有害邻域纠正得分(HNCS)与良性邻域保留得分(BNPS)。
- 关键实验发现:在 4 个模型上评测 AST、CAST、AdaSteer 和 AlphaSteer,发现修复普遍存在纠正与保留的权衡;在 Llama 8B 上 CAST 的 MMLU 仅下降 0.07 个百分点,BNPS 却下降了 26.3 点;无条件 AST 虽然有害纠正最高(在 Qwen 3B 上 HNCS 达 95.6%),但导致严重的良性邻域误拒(BNPS 降至 66.8%)。
- 作者结论与启示:作者认为激活补丁不应仅仅压制有害行为,更应实现局部精准修复;全局能力指标往往掩盖了局部的附带损伤,未来安全补丁研究需同时衡量有害纠正与良性邻域保留。