跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 56 篇还没打标签,不在筛选结果里。

另有 56 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  2. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    InternLM2.5-20B、InternLM2.5-7B、InternLM2.5-1.8B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  3. 评测与基准arXiv 2610.02142

    关键词式评测会误判小模型工具调用能力,论文提出廉价诊断阶梯

    提出诊断阶梯,揭示关键词工具调用评测的假阳性

    发表
    测试
    VectraYX-600M、VectraYX-1B
    摘要宽松 B4 把不会调用的 1B 记成会调用。

    作者记录 VectraYX 系列里一次工具使用评测的假阳性,并用一条廉价、与 harness 无关的诊断阶梯把它追到缺失的首 token prior,再按这一诊断修复 VectraYX-1B。

    深度解读完整解读
  4. 评测与基准arXiv 2609.13556

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    提出 JU 与 JI 基准,并用组件分解定位术语知识

    发表
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-8B-UltraMedical
    摘要医学微调的 UltraMedical 在两项术语任务上不如 Instruct,偏差来自少数组件被加重。

    作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。

    深度解读完整解读
已经到底了