SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性
When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs
作者评测技能合并模型的自适应越狱鲁棒性,发现静态安全不反映动态鲁棒性,如Qwen数学合并模型GCG ASR达0.280。
- 模型合并常用于为对齐模型赋予新技能,但现有安全性评测普遍依赖静态拒答测试。由于安全对齐主要集中在生成的最初几个 token 中,静态评测无法反映模型在自适应攻击下的脆弱性。
- 作者提出 SkillSafe-Bench 基准,在多基座、技能及合并方法网格下,使用双裁判 AND 规则评测静态与自适应越狱表现;并提出投影去除安全子空间重叠成分的 SubSafe-Merge。
- 静态安全与自适应鲁棒性解耦:在 Qwen 与 Gemma 上,静态安全的数学合并模型在自适应攻击下 ASR 升高(Qwen 从静态 0.100 升至 GCG 0.280);而 Llama 与 Phi-4 保持鲁棒。SubSafe-Merge 能消除同配方擦除引起的静态劣化。
- 安全子空间估计依赖特定擦除模型,仅能检测同配方擦除而对 SFT 去审查无效;自适应 ASR 受固定计算预算限制构成脆弱性下界;权重空间几何指标无法预测基座的自适应脆弱性。
- 模型
- Qwen2.5-7B-InstructLlama-3.1-8B-InstructMistral-7B-Instruct-v0.3Qwen2.5-14BPhi-4-miniGemma-2-9B
- 基准
- HarmBenchJailbreakBenchGSM8KMMLUHumanEvalIFEval
- 指标
- Static ASRAdaptive ASRStatic–Adaptive GapGSM8K accuracy
研究者提出 SkillSafe-Bench,在合并方法、迁移技能、基座模型与合并系数的受控网格上同时评测静态拒答、自适应越狱鲁棒性和能力保留,采用 HarmBench 分类器与 Llama Guard 3 的双评审 AND 规则。在六个开源基座(五个模型家族、两种规模)上,静态安全无法预测自适应鲁棒性:静态筛查下同样安全的 Qwen2.5-7B 与 Llama-3.1-8B,在语义模板攻击下 Qwen 的数学技能合并模型被越狱 66%–76%,Llama 为 22%–24%;Gemma-2-9B 静态最安全却被越狱 60%,Phi-4-mini 保持鲁棒。研究还发现合并的静态安全效应取决于基座对齐强度,并提出无数据的几何信号,即任务向量与安全子空间的重叠度,可区分同配方的消融式拒答移除与真实技能,进而给出 SubSafe-Merge 投影方法,在保持能力的同时消除这类侵蚀。
推荐理由论文用受控网格对比静态拒答与自适应攻击下的表现,为评估模型合并后的安全风险提供了可复现的基准设计。
深度解读
这篇论文试图解决什么问题?
论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。
论文试图解决的核心问题是:基于静态拒答测试的评测方法高估了技能合并大模型的安全性,无法反映模型在自适应越狱攻击下的真实脆弱性。
- 场景与重要性:模型合并(Model Merging)已成为向已对齐基座模型注入数学、代码等领域技能的常见方式,无需重新训练即可组合任务向量,但这一过程可能损害基座原本的安全对齐。
- 现有评测的不足:现有合并研究主要依靠固定的有害提示词进行静态拒答测试。作者指出安全对齐具有浅层性,通常集中在生成的最初几个 token,导致静态拒答表现良好的合并模型容易被能够规避初始拒答的自适应攻击攻破。
- 核心观察与假设:作者假设模型合并可能优先破坏更深层、抵抗自适应攻击的对齐成分,而保留浅层拒答层;同时模型的脆弱性往往继承自基座模型本身,而非合并操作所凭空产生。
- 威胁模型:设定为开放权重(open-weight)环境。攻击者目标是促使合并模型针对有害行为生成顺从的有害回答;知识与能力方面,攻击者拥有与模型交互的访问权限,可在固定计算预算下运行 GCG、PAIR 或 Crescendo 等自适应攻击算法,论文明确不考虑攻击者直接编辑权重、闭源模型或多模态输入;受害系统为良性从业者构建的技能合并模型。
- 论文提出的方案:作者提出了针对良性技能合并模型自适应越狱鲁棒性的受控评测基准 SkillSafe-Bench(作者称据其所知为首个受控研究),并设计了基于数据无关几何签名的子空间投影防御方法 SubSafe-Merge。
有哪些相关研究?
论文梳理了模型合并、对齐脆弱性、自适应越狱及安全感知合并等工作,指出现有合并安全研究普遍欠缺自适应攻击检验。
论文在相关研究中重点讨论了以下四个方向的工作:
模型合并方法:Wortsman et al. (2022) 与 Ilharco et al. (2023) 确立了权重平均与任务算术(Task Arithmetic);Yadav et al. (2023) 提出 TIES-Merging 以减少干扰;Yu et al. (2024) 提出 DARE 进行参数稀疏化与重缩放。作者指出这些方法旨在优化任务能力保留与参数冲突,而非安全对齐。
安全对齐的脆弱性与浅层特征:Qi et al. (2024) 与 Lermen, Rogers-Smith, and Ladish (2023) 发现良性微调或 LoRA 微调会损害对齐模型的安全性;Qi et al. (2025) 提出对齐具有浅层性,拒答主要由前几个 token 承载;Wei et al. (2024) 发现负责安全的参数稀疏且与能力解耦;Arditi et al. (2024) 报告激活空间中的拒答由近似一维的方向介导。
自适应越狱攻击与基准:Tramer et al. (2020) 在对抗鲁棒性中确立了防御必须通过针对其自适应调整的攻击来检验的标准;具体攻击包括 GCG (Zou et al. 2023)、PAIR (Chao et al. 2023) 与 Crescendo (Russinovich, Salem, and Eldan 2025);标准化评测工具包括 HarmBench (Mazeika et al. 2024) 与 JailbreakBench (Chao et al. 2024)。
安全感知合并研究:SafeMERGE (Djuhera et al. 2026)、域与对齐插值 (Thakkar et al. 2025)、安全子空间掩码 (Yang et al. 2025)、LED-Merging (Ma et al. 2025) 和 RESTA (Bhardwaj, Do, and Poria 2024) 等开展了安全合并探索。作者指出这些工作多使用静态测试并在较窄的模型或技能集上评估;Hammoud et al. (2024) 发现朴素合并会破坏安全性,但其评测基于 Llama-Guard 静态分类,修复方案依赖合成数据重新优化。
基线方法与基准数据集:论文对比的合并基线包括 Linear 合并 (Wortsman et al. 2022)、Task Arithmetic (Ilharco et al. 2023)、TIES (Yadav et al. 2023)、DARE-TIES (Yu et al. 2024)、稀释任务向量的 Model Soup,以及层选择性合并方法 SafeMERGE (Djuhera et al. 2026)。评测数据集采用 HarmBench 与 JailbreakBench,能力基准采用 GSM8K、MMLU、HumanEval 与 IFEval。
与现有工作的定位区别:作者将本文定位为评估良性合并模型在输入空间自适应越狱攻击下表现的受控阶乘基准,并提供了无需训练数据的几何特征与投影修复机制,与此前依赖静态测试或合成微调数据的研究形成对比。
论文如何解决这个问题?
论文提出 SkillSafe-Bench 受控评测基准,并设计基于安全子空间正交补投影的 SubSafe-Merge 防御方法。
作者构建了受控评测基准 SkillSafe-Bench,系统评测不同基座、技能和合并方法在静态与自适应攻击下的表现,并提出基于无数据几何签名的 SubSafe-Merge 投影算法来消除安全侵蚀。
问题设定与模型合并形式化
- 任务向量与合并公式:设已对齐基座模型参数为 θbase,在技能 i 上微调后的参数为 θi,任务向量定义为 τi = θi − θbase。合并后的模型参数计算如下: θmerge = θbase + ∑i λi f(τi) 其中 λi 为合并系数,f 为具体合并算法的处理函数(Task Arithmetic 为恒等映射,TIES 为参数修剪与符号选择,DARE 为随机丢弃与重缩放,模型均值法则对应均匀平均)。
安全子空间的构建与几何验证
- 安全子空间定义:定义对齐向量 τsafe = θbase − θunsafe,其中 θunsafe 取自基座对应的公开去审查擦除(abliterated)模型,无需有害训练数据。在每一层 ℓ 上,安全子空间 S(ℓ) 取自 τsafe(ℓ) 的前 k 个左奇异向量所张成的空间,PS 与 PS⊥ 分别表示向 S 及其正交补空间的投影。
- 有效性对照验证:作者在 Qwen2.5-7B 上验证将基座参数投影至正交补空间 PS⊥ 的效果,移除第一主方向(k=1)后,静态 ASR 从 0.20 升至 0.64,而 GSM8K(从 0.80 到 0.79)与 MMLU(从 0.74 到 0.73)保持稳定,作者称这证实 S 是与通用能力解耦的有效安全子空间。
- 几何重叠特征:通过计算任务向量在 S 内的能量占比(子空间重叠度),能够在合并前无数据识别同配方擦除型去审查向量(重叠度约 0.99),而良性数学、代码、医学、金融、法律等任务向量与 S 近乎正交(重叠度约为 0.001)。
SkillSafe-Bench 评测协议设计
- 受控阶乘网格:基准涵盖基座模型(Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3)、技能类型(数学、去审查,以及代码与领域微调)、合并方法(Linear、Task Arithmetic、TIES、DARE-TIES)与合并系数 λ ∈ {0.2, 0.4, 0.6, 0.8, 1.0}。
- 双分类器 AND 判决规则:每条回答由 HarmBench 分类器(HarmBench-Llama-2-13b-cls)与 Llama Guard 3 共同判定,仅当两位裁判同时标记为不安全时才计为攻击成功。人工抽检显示该规则与人类评估的 Cohen's κ 为 0.66,降低了误报率。
- 攻击与能力指标:静态评测使用 HarmBench 400 个标准有害行为;自适应攻击在固定的 50 个行为子集上运行 GCG(100 步与 500 步)、Best-of-6 提示词模板、PAIR 与多轮 Crescendo;能力保留通过 GSM8K、MMLU、HumanEval 和 IFEval 评测,避免以能力崩溃换取表观安全。
SubSafe-Merge 投影修复机制
- 正交补投影机制:针对同配方擦除型任务向量侵蚀安全的问题,SubSafe-Merge 在合并前将各方法处理后的任务向量投影到每层安全子空间的正交补空间: θmerge = θbase + ∑i λi PS⊥(f(τi)) 该公式移除了任务向量中与安全子空间重叠的成分,保留与其正交的实用能力。默认秩设为 k=8(使用随机低秩 SVD 估计),且作者报告该方法在 k=1 到 k=8 之间均表现不敏感。
论文做了哪些实验?
实验发现静态安全与自适应鲁棒性解耦,部分模型在攻击下越狱率上升;SubSafe-Merge 能有效修复同配方擦除侵蚀。
实验设置
- 被测模型:主实验包含 3 款开源基座模型(Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3),扩展复现涵盖 Qwen2.5-14B、Phi-4-mini 与 Gemma-2-9B,共 6 款。
- 数据集与规模:静态评测采用 HarmBench 标准文本行为集(400 个行为,涵盖 7 个危害类别);自适应攻击采用固定随机种子的 50 个行为子集;能力评测采用 GSM8K(5-shot 严格匹配)、MMLU、HumanEval 与 IFEval。
- 基线方法:未合并基座模型(Base)、常规任务算术合并(plain)、Linear 合并、TIES、DARE-TIES、稀释系数的 Model Soup,以及层选择性合并 SafeMERGE。
- 评价指标:静态 ASR、自适应 ASR(GCG、Template、PAIR、Crescendo)、Static–Adaptive Gap(自适应 ASR 减静态 ASR)及 GSM8K 准确率。
- 判决协议:HarmBench 分类器与 Llama Guard 3 构成双裁判 AND 规则(两者皆判违规才计为成功);100 条人工审计样本显示 Cohen's κ = 0.66。
- 攻击参数:GCG 搜索 100 步(补充实验 500 步),search width=128,topk=256;Crescendo 最大 10 轮及 10 次回溯;合并系数 λ 覆盖 0.2 至 1.0 的 5 档。
主结果
下表展示了三种基座在未合并状态及代表性合并配置(λ=0.6)下的静态与自适应攻击结果(据 Table 1,Task Arithmetic,50 行为子集,双裁判 AND 规则):
表格较宽,可左右滑动
模型与配置 (task-arith.) 静态 ASR GCG ASR Static–Adaptive Gap Qwen2.5-7B Base 0.240 0.480 +0.24 Qwen2.5-7B +math (λ=0.6) 0.100 0.280 +0.18 Qwen2.5-7B +uncens. (λ=0.6) 0.520 0.540 +0.02 Llama-3.1-8B Base 0.200 0.220 +0.02 Llama-3.1-8B +math (λ=0.6) 0.060 0.120 +0.06 Llama-3.1-8B +uncens. (λ=0.6) 0.300 0.340 +0.04 Mistral-7B-v0.3 Base 0.500 0.500 +0.00 Mistral-7B-v0.3 +math (λ=0.6) 0.640 0.540 -0.10 - 静态安全与自适应安全解耦:作者称 Qwen 与 Llama 静态测试均表现安全(基座静态 ASR 分别为 0.240 与 0.200,数学合并后降至 0.100 与 0.060),但在 GCG 攻击下 Qwen 数学合并模型 ASR 达 0.280(平均差距 +20 个百分点),而 Llama 数学合并模型保持在 0.120 以下(平均差距约 +3 个百分点)。
- 合并对静态安全的影响取决于基座对齐强度:强对齐基座(Qwen、Llama)在融入良性数学技能后静态 ASR 均低于基座,而弱对齐基座 Mistral 在融入数学或去审查技能后静态 ASR 均升至基座以上(0.51–0.65,据 Table S1)。
- 良性合并轻微提升静态拒答属判决伪影:作者检查发现数学技能合并后静态 ASR 略有下降主要源于裁判对版权相关行为的误判,经官方 MinHash 逐字重现复核后并未发现实际版权违规,作者认为并非真正的安全增益。
跨模型家族与规模的自适应脆弱性复现
- 评测设计:在代表性数学合并设置(λ=0.6)下,将测试扩展至 Qwen2.5-14B、Phi-4-mini 和 Gemma-2-9B,并采用 6 种公共越狱模板(Best-of-6 Template)作为统一探针(据 Table S2)。
- 实验结果:Qwen2.5-14B 数学合并模型静态 ASR 为 0.14,模板攻击下升至 0.70;Gemma-2-9B 数学合并模型静态 ASR 仅为 0.02,模板攻击下升至 0.60;Phi-4-mini 数学合并模型静态 ASR 为 0.14,模板攻击下保持为 0.14(据 Table S2)。
- 作者解读:作者称脆弱性(Qwen 系列、Gemma)与鲁棒性(Llama、Phi-4)在静态安全相似的条件下跨家族存在,排除了单一模型假象;同时指出 Gemma 的脆弱性源于基座本身(未合并基座模板 ASR 即为 0.64),而非合并引入。
SubSafe-Merge 防御效果与边界分析
- 防御修复效果:在 Qwen2.5-7B 上合并同配方去审查模型(λ=0.6, k=8),常规合并静态 ASR 升至 0.460、GCG 升至 0.54,SubSafe-Merge 将静态 ASR 恢复至 0.182、GCG 降至 0.36,同时 GSM8K 能力保持在 0.80(据 Table 3);Llama 上同样恢复至基座水平(静态 0.180,GCG 0.16,GSM8K 0.71)。
- 基座固有脆弱性边界:在弱对齐的 Mistral 上,SubSafe-Merge 将静态 ASR 从 0.590 恢复至基座水平的 0.480,但 GCG ASR 仍高达 0.66(基座本身为 0.50)(据 Table 3);作者指出该方法仅能消除合并引入的侵蚀,无法修复基座固有的自适应脆弱性。
- 子空间外部侵蚀边界:面对域外 SFT 去审查模型(Orion,重叠度仅 0.001),常规合并静态 ASR 为 0.47、GCG 为 0.62,SubSafe-Merge 无法消除侵蚀(静态 0.45,GCG 0.60,据 Table S4);面对 Alpaca 微调,SubSafe-Merge 后的静态 ASR 为 0.29(常规合并为 0.28,基座为 0.20,据第 9 页)。
攻击模态与基线对比
- 攻击方式不变性:在 Qwen 与 Llama 上对比 GCG、Template 和 PAIR,Qwen 脆弱而 Llama 鲁棒的相对排序保持一致;将 GCG 步数提升至 500 步时,Llama 保持在 0.12,而 Qwen 升至 0.40(据第 7 页)。
- 多轮 Crescendo 攻击结果:在 Qwen 基座/普通合并/SubSafe 上运行 Crescendo,基座 ASR 为 0.20,普通合并为 0.14,SubSafe 为 0.16(据 Table S8),作者称合并未增加超出基座自身的多轮自适应风险。
- 与 SafeMERGE 基线对比:在同配方去审查合并任务中,SafeMERGE 与 SubSafe-Merge 在静态 ASR(0.165 对 0.182)、模板 ASR(0.74 对 0.76)及 GSM8K(0.81 对 0.80)上表现相当(据 Table S8),SafeMERGE 较低的 GCG ASR(0.24)在配对检验中不显著(McNemar p=0.24)且未在模板攻击中复现,作者认为属于优化难度的测量假象。
其他消融与分析
- 合并算法影响:在三种基座上,Task Arithmetic、Linear、TIES、DARE-TIES 四种方法的静态 ASR 差异在 0.035 以内且排序一致(Table S1)。
- 子空间投影秩 k 的敏感性:Qwen 去审查合并在 k=1 与 k=8 时静态安全恢复效果相当(第 10 页)。
- 真实技能子空间重叠度:Qwen 上代码为 0.0012,医学为 0.0011,金融为 0.0011,法律为 0.0012,均在约 0.001 基线(Table S5)。
- 公开去审查权重重叠度调查:6 款 Qwen 检查点中仅同配方版本重叠度达 0.99,其余两款为 0.29–0.32,三款低至 0.001–0.003(Table S6)。
- 部分重叠检查点修复效果:合并重叠度 0.32 的 Josiefied v2,常规合并静态 ASR 升至 0.62,SubSafe 仅部分修复至 0.42(Table S7)。
- 配对显著性检验:Qwen 数学合并在 λ=0.6 时静态安全但自适应不安全的翻转经检验显著(McNemar p=0.008,Table S8 后正文)。
有什么可以进一步探索的点?
作者明确指出了子空间估计依赖特定来源、自适应 ASR 为下界、自动裁判误差及缺乏权重几何解释等局限。
作者指出的局限与后续方向
- 安全子空间估计依赖特定来源:安全子空间源自公开擦除模型的估计,其质量决定了几何信号和修复方法的效果,且仅对同配方擦除有效,无法覆盖 SFT 去审查等子空间外的侵蚀形式(Section 8 与 Section 7)。
- 自适应 ASR 仅为脆弱性下界:评测采用固定计算预算,更强算力或更优攻击可能推高绝对越狱率,当前测得的自适应 ASR 仅是从下方界定真实脆弱性(Section 8)。
- 模型规模与技能多样性有待扩展:实验主要覆盖 7–8B 规模基座与数学、去审查两种主技能,扩展至 14B 以上模型及更多技能类型留待后续工作(Section 8)。
- 自动裁判存在残余误差:双裁判 AND 规则在 100 条人工标注样本上的 Cohen's κ 为 0.66,虽然缓解了单一分类器偏见,但未能完全消除判定误差(Section 8)。
- 缺乏预测基座脆弱性的权重几何机制:在分析的 5 个基座中,安全子空间的有效秩或奇异值间隙等权重空间几何指标均无法单调预测基座的自适应脆弱性(Section 8)。
- 定量风险预测器尚未建立:在当前 3 个基座 × 2 种技能的规模下,留一基座交叉验证的 Spearman 相关系数与置换随机分布无显著差异,未能构建出有效的定量预测模型(Section 6)。
实验覆盖范围
- 被测模型范围:实验覆盖 6 款开源基座模型(Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B、Phi-4-mini、Gemma-2-9B),涵盖 5 个模型家族与 2 种参数规模(7–9B 与 14B)(Section 4 与 Section 5)。
- 技能与微调领域:阶乘网格测试了数学 LoRA 与去审查微调,几何重叠测试包含了代码、医学、金融、法律及 Alpaca 指令微调共 5 种领域技能(Section 4、Section 6 与 Section S5)。
- 合并方法与系数:评测了 Linear、Task Arithmetic、TIES、DARE-TIES 四种通用合并算法及安全基线 SafeMERGE,合并系数 λ 覆盖 0.2、0.4、0.6、0.8、1.0 五档(Section 4 与 Section 7)。
- 攻击方法配置:包含 100 步及 500 步 GCG、Best-of-6 提示词模板、本地小模型 PAIR,以及 10 轮上限与 10 次回溯上限的多轮 Crescendo 攻击(Section 4、Section 5 与 Section S2、S5)。
- 未报告信息:论文未测试闭源模型、多模态输入或针对模型权重的白盒直接修改(Section 3)。
总结一下论文的主要内容
论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
- 问题定位:针对业界普遍利用任务算术等方法合并领域技能而依赖静态拒答评估安全的做法,指出安全对齐的浅层特性使得静态安全表现无法保证动态攻击下的安全性,容易产生虚假安全感。
- 核心方法:提出了控制干扰变量的阶乘评测基准 SkillSafe-Bench,采用双裁判 AND 规则评估静态与自适应越狱鲁棒性;并基于公开擦除模型提取安全子空间,提出无数据预合并检测指标与正交补投影算法 SubSafe-Merge。
- 关键实验结果:
- 静态与自适应安全发生解耦:在代表性数学合并(λ=0.6)下,Qwen2.5-7B 静态 ASR 仅为 0.100 但 GCG 攻击下达到 0.280(Table 1),Best-of-6 模板攻击下达到 0.70(Table S8);而 Llama-3.1-8B 在两项指标下分别保持在 0.060 与 0.120(Table 1)。
- 跨家族与规模复现:Gemma-2-9B 数学合并模型静态 ASR 仅 0.02,模板攻击下升至 0.60;Qwen2.5-14B 静态 0.14,模板攻击下达 0.70;而 Phi-4-mini 在两项测试中均为 0.14(Table S2)。
- 几何重叠的区分能力:同配方去审查向量在安全子空间能量占比达 0.993,而数学、代码等真实技能重叠度约为 0.001(Table 2)。
- 防御修复与边界:SubSafe-Merge 能将 Qwen 同配方去审查合并的静态 ASR 从 0.460 降至 0.182、GCG 降至 0.36(Table 3),但无法修复基座固有的脆弱性(Mistral GCG 仍为 0.66),也无法防御重叠度仅 0.001 的 SFT 域外去审查侵蚀(Table S4)。
- 结论与启示:作者认为自适应评测对于技能合并模型而言是必需而非可选的标准,表观静态安全最强的模型往往蕴含显著的自适应越狱风险;同时防御手段能够修复合并引入的定向破坏,但模型的鲁棒上限依然受制于基座本身的对齐质量。