跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 4 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 分析与理论arXiv:2610.02586 ·

    研究发现类型化决策模型主要按选项标签而非定义作答

    揭示类型化决策模型按选项标签而非定义规则作答

    测试
    von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个提示层
    摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
    • 一句话定位:论文系统分析了 Jev 风格类型化决策模型中普遍存在的选项标签偏差,揭示其物理根因为输入渲染而非决策头结构。
    • 要解决的问题:在类型化决策接口中,开发者在 criteria 字段中为选项编写规则定义,期待模型以后验概率输出决策。然而,当标签自身带有语义时,模型输出究竟受定义驱动还是受标签驱动此前缺乏实证隔离与机理判定。
    • 方法要点:设计双通道解耦实验与规则仅存在于定义中的 PolicyBench 合成基准;通过修改代码单行表达式,在保持模型权重完全不变的情况下,进行输入前缀拼接的双向因果干预;提出无需权重的双调用黑盒检测方法。
    • 核心实验结果:
      1. 在 PolicyBench-XF 上,将语义标签替换为 A/B 任意标签使 LAYA-TD 准确率提升 +0.1511(达到 0.8931,Table 2, 3)。
      2. 在分类任务中,当标签与定义冲突时,LAYA-TD 准确率暴跌至 0.136,而代码中未拼接标签前缀的 VON 保持在 0.851 不受影响(Table 5)。
      3. 双向打补丁干预使 LAYA 的标签依赖完全消失(对比差归为 +0.0000),同时使 VON 出现标签敏感性与冲突崩溃(降至 0.228,Table 5)。
      4. 类型化模型在面对否定词前缀时决策翻转率高达 0.9656 至 0.9825(Table 10);且在标签冲突时置信度 AUROC 倒挂至 0.2433(Table 6)。
    • 作者结论与启示:类型化决策模型的定义字段并未真正成为可靠的逻辑约束。若业务场景依赖自定义规则,应使用无语义标签(如 A、B)并将规则全量写入定义;不能单凭置信度阈值过滤错误,建议采用双渲染一致性校验。
    完整解读
  2. 评测与基准arXiv:2610.02827 ·

    MLCommons 发布 Jailbreak Benchmark v1.0,八款开源模型平均韧性差距 7.57%

    构建MLCommons越狱基准以测量模型的单轮越狱韧性

    测试
    Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个提示层
    摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。
    • 基准定位:MLCommons Jailbreak Benchmark v1.0是首个实现完整端到端执行的单轮文本越狱评测基准,将攻击机制分类学、独立安全基线标准与负责任披露控制深度整合。
    • 核心问题:针对现有越狱评测缺乏独立安全基线、混淆评估器误差与系统韧性、缺乏分类覆盖标准以及开放测试集易受对抗污染等关键问题提供标准化解决方案。
    • 方法架构:基于AILuminate Assessment Standard v1.4解耦正当化与使能双维度,采用成对实验设计对比原始种子与越狱变换;通过包含多阶段检测的自动化大模型集成实施判决,并经由人工真值校准。
    • 核心实验发现:在8款开源模型与11类危害评测中,整体不安全回复率从基准的11.08%升至攻击下的18.65%(平均韧性差距7.57%);暴力犯罪与无差别武器类危害的安全降级最明显;角色扮演与模板类攻击表现出最高的攻击有效率(35.7%)。
    • 异常反转与尺度差异:31B以下模型平均韧性差距约21%,而在5款大模型中有3款出现负韧性差距(攻击下不安全率低于基准);作者指出这可能源于模型理解障碍、解码失效或越狱特征拒绝。
    • 行业与治理启示:作者强调基准自身测量误差与治理规范的重要性,倡导在不公开可直接利用的攻击载荷的前提下推进第三方独立审计与测量保证。
    完整解读
  3. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个模型层
    场景
    模型与 API攻击者白盒
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
  4. 评测与基准arXiv:2608.11816 ·

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个模型层
    摘要论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下:

    完整解读
已经到底了