评测与基准arXiv:2610.02827 · 10月2日MLCommons 发布 Jailbreak Benchmark v1.0构建 MLCommons 越狱基准以测量模型的单轮越狱韧性模型与 API·测试Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个·提示层越狱摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。完整解读
评测与基准arXiv:2608.08542 · 8月9日SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御模型与 API攻击者白盒·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个·模型层模型加固越狱拒答失当微调与开源权重摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。完整解读