MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%
构建MLCommons越狱基准以测量模型的单轮越狱韧性
- 基准定位:MLCommons Jailbreak Benchmark v1.0是首个实现完整端到端执行的单轮文本越狱评测基准,将攻击机制分类学、独立安全基线标准与负责任披露控制深度整合。
- 核心问题:针对现有越狱评测缺乏独立安全基线、混淆评估器误差与系统韧性、缺乏分类覆盖标准以及开放测试集易受对抗污染等关键问题提供标准化解决方案。
- 方法架构:基于AILuminate Assessment Standard v1.4解耦正当化与使能双维度,采用成对实验设计对比原始种子与越狱变换;通过包含多阶段检测的自动化大模型集成实施判决,并经由人工真值校准。
- 核心实验发现:在8款开源模型与11类危害评测中,整体不安全回复率从基准的11.08%升至攻击下的18.65%(平均韧性差距7.57%);暴力犯罪与无差别武器类危害的安全降级最明显;角色扮演与模板类攻击表现出最高的攻击有效率(35.7%)。
- 异常反转与尺度差异:31B以下模型平均韧性差距约21%,而在5款大模型中有3款出现负韧性差距(攻击下不安全率低于基准);作者指出这可能源于模型理解障碍、解码失效或越狱特征拒绝。
- 行业与治理启示:作者强调基准自身测量误差与治理规范的重要性,倡导在不公开可直接利用的攻击载荷的前提下推进第三方独立审计与测量保证。