跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 62 篇还没打标签,不在筛选结果里。

另有 62 篇论文还没打上分类标签,暂不在筛选结果里。

  1. SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    发表
    攻击者
    白盒
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    深度解读完整解读
  2. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  3. 评测与基准arXiv 2609.40286

    研究者提出 COVER:在语言预算下选择源语言实现跨语言遗忘

    提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘

    发表
    测试
    Tiny Aya Global、Qwen3-4B-Instruct-2507、Llama-3.2-3B-Instruct
    摘要COVER 在语言预算下选源语言,以降低未监督语言上相对 oracle 的残余访问。

    语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。

    深度解读完整解读
已经到底了