跳到正文
10月8日 · 周四

开源模型安全 · 论文

精选论文 15 篇
  1. 评测/基准arXiv:2610.02827 · 53

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    MLCommons评测8款开源模型,攻击使平均不安全回复率从基准11.08%升至18.65%(据Table 2)。

    • 7.57%全部8款SUT在11类危害下的平均韧性差距(据Table 2)
    • 18.65%全部8款SUT在11类危害下的越狱不安全回复率(据Table 2)
    • 11.08%全部8款SUT在11类危害下的基准不安全回复率(据Table 2)
    6 问速览论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。
    1. 这篇论文试图解决什么问题?

      论文旨在解决越狱评测缺乏独立安全基线、难以区分评估器误差、缺乏统一分类学及公开测试集易受污染等方法学缺陷。

    2. 有哪些相关研究?

      论文梳理了独立安全评估基准、越狱基准与自动化攻击、智能体对抗评测,指出已有工作缺乏独立基准锚定与负责任披露控制。

    3. 论文如何解决这个问题?

      论文通过配对端到端流水线、基于热度与体量分级的SUT选取、双阶段种子筛选、双维度评估标准及校准集成实现标准化评测。

    4. 论文做了哪些实验?

      在8款开源模型、11类危害与11种越狱攻击上开展配对评测,攻击使整体不安全率升至18.65%,大模型出现负韧性差距。

    5. 有什么可以进一步探索的点?

      作者指出评估器误差偏高、人工标注规模较小及大模型负差距待解等局限;测试覆盖仅限于8款开源模型与单轮文本攻击。

    6. 总结一下论文的主要内容

      论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。

    完整解读
  2. 评测/基准arXiv:2608.08542 · 53

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    作者评测技能合并模型的自适应越狱鲁棒性,发现静态安全不反映动态鲁棒性,如Qwen数学合并模型GCG ASR达0.280。

    • 0.280Qwen2.5-7B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.120Llama-3.1-8B+math(λ=0.6)的GCG ASR(Table 1)
    • 0.60Gemma-2-9B+math(λ=0.6)的模板ASR(Table S2)
    6 问速览论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。
    1. 这篇论文试图解决什么问题?

      论文指出静态拒答评测无法反映技能合并模型的真实安全性,旨在系统评测并缓解合并模型在自适应越狱攻击下的脆弱性。

    2. 有哪些相关研究?

      论文梳理了模型合并、对齐脆弱性、自适应越狱及安全感知合并等工作,指出现有合并安全研究普遍欠缺自适应攻击检验。

    3. 论文如何解决这个问题?

      论文提出 SkillSafe-Bench 受控评测基准,并设计基于安全子空间正交补投影的 SubSafe-Merge 防御方法。

    4. 论文做了哪些实验?

      实验发现静态安全与自适应鲁棒性解耦,部分模型在攻击下越狱率上升;SubSafe-Merge 能有效修复同配方擦除侵蚀。

    5. 有什么可以进一步探索的点?

      作者明确指出了子空间估计依赖特定来源、自适应 ASR 为下界、自动裁判误差及缺乏权重几何解释等局限。

    6. 总结一下论文的主要内容

      论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    完整解读
  3. 评测/基准arXiv:2608.11816 · 53

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    作者对9款VLM进行敏感图像审计,发现中文提示下状态对齐框架率为15.98%(英文5.85%),代际间拒答减少而重构增加。

    • 15.98%全量21,708次试验中中文提示词下的状态对齐框架率(据 Table 1)
    • 5.85%全量21,708次试验中英文提示词下的状态对齐框架率(据 Table 1)
    • 18.38%中国模型在高敏感图像上的状态对齐框架率,主评审Opus 4.7(据 Table A10)
    6 问速览论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。
    1. 这篇论文试图解决什么问题?

      论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。

    2. 有哪些相关研究?

      论文梳理了文本模型审查与偏置、多模态安全性与先验偏差,以及大模型作为裁判等方向的研究脉络。

    3. 论文如何解决这个问题?

      论文构建解耦拒答与重构的六维审计体系,结合敏感图像基准、图文对照与视觉抽象探针,经双前沿LLM与专家验证。

    4. 论文做了哪些实验?

      实验完成21,708次试验,测得中文提示对齐几率比达3.67倍,Qwen代际演进中拒答下降而重构升至33.0%。

    5. 有什么可以进一步探索的点?

      作者指出了研究的观察性性质与架构混杂局限;实验覆盖范围受限于开源检查点、中性提示与非思考模式。

    6. 总结一下论文的主要内容

      论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    完整解读
已经到底了