跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 6 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 90 篇还没打标签,不在筛选结果里。

另有 60 篇还没有研究类型,暂不在这些分类里。

  1. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    模型与 API攻击者白盒测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个模型层
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
  2. 评测与基准arXiv:2608.11816 ·

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    模型与 API测试Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个模型层
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    完整解读
  3. 评测与基准arXiv:2609.35902 ·

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    模型与 API测试InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个模型层
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    完整解读
  4. 评测与基准arXiv:2610.02142 ·

    关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯

    提出诊断阶梯,揭示关键词工具调用评测的假阳性

    模型与 API测试VectraYX-600M、VectraYX-1B模型层
    摘要宽松 B4 把不会调用的 1B 记成会调用。

    作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。

    完整解读
已经到底了