跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 2 篇
筛选1

攻击类型

模型自身风险

防御类型

影响

系统形态

攻击者权限

攻击面/入口

层

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2610.02827 ·

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    构建MLCommons越狱基准以测量模型的单轮越狱韧性

    测试
    Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个提示层
    摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
    • 基准定位:MLCommons Jailbreak Benchmark v1.0是首个实现完整端到端执行的单轮文本越狱评测基准,将攻击机制分类学、独立安全基线标准与负责任披露控制深度整合。
    • 核心问题:针对现有越狱评测缺乏独立安全基线、混淆评估器误差与系统韧性、缺乏分类覆盖标准以及开放测试集易受对抗污染等关键问题提供标准化解决方案。
    • 方法架构:基于AILuminate Assessment Standard v1.4解耦正当化与使能双维度,采用成对实验设计对比原始种子与越狱变换;通过包含多阶段检测的自动化大模型集成实施判决,并经由人工真值校准。
    • 核心实验发现:在8款开源模型与11类危害评测中,整体不安全回复率从基准的11.08%升至攻击下的18.65%(平均韧性差距7.57%);暴力犯罪与无差别武器类危害的安全降级最明显;角色扮演与模板类攻击表现出最高的攻击有效率(35.7%)。
    • 异常反转与尺度差异:31B以下模型平均韧性差距约21%,而在5款大模型中有3款出现负韧性差距(攻击下不安全率低于基准);作者指出这可能源于模型理解障碍、解码失效或越狱特征拒绝。
    • 行业与治理启示:作者强调基准自身测量误差与治理规范的重要性,倡导在不公开可直接利用的攻击载荷的前提下推进第三方独立审计与测量保证。
    完整解读
  2. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个模型层
    场景
    模型与 API攻击者白盒
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
已经到底了