SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性
研究者提出 SkillSafe-Bench,在合并方法、迁移技能、基座模型与合并系数的受控网格上同时评测静态拒答、自适应越狱鲁棒性和能力保留,采用 HarmBench 分类器与 Llama Guard 3 的双评审 AND 规则。在六个开源基座(五个模型家族、两种规模)上,静态安全无法预测自适应鲁棒性:静态筛查下同样安全的 Qwen2.5-7B 与 Llama-3.1-8B,在语义模板攻击下 Qwen 的数学技能合并模型被越狱 66%–76%,Llama 为 22%–24%;Gemma-2-9B 静态最安全却被越狱 60%,Phi-4-mini 保持鲁棒。研究还发现合并的静态安全效应取决于基座对齐强度,并提出无数据的几何信号,即任务向量与安全子空间的重叠度,可区分同配方的消融式拒答移除与真实技能,进而给出 SubSafe-Merge 投影方法,在保持能力的同时消除这类侵蚀。
推荐理由论文用受控网格对比静态拒答与自适应攻击下的表现,为评估模型合并后的安全风险提供了可复现的基准设计。