评测与基准arXiv:2608.08542 · 8月9日SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个·模型层场景模型与 API·攻击者白盒模型加固越狱拒答失当微调与开源权重摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。完整解读