跳到正文
10月9日 · 周五

开源模型安全 · 论文

找到 13 篇

另有 59 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-14B、OLMo-3-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  2. 评测与基准arXiv 2608.11816

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    发表
    测试
    Pixtral-12B、Qwen2-VL-7B、Qwen2.5-VL-7B 等 9 个
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    深度解读完整解读
  3. 评测与基准arXiv 2609.35902

    QH-Bench:面向中国青少年内容安全的细粒度中文基准

    构建中文青少年内容安全基准 QH-Bench,评测单轮与多轮回复的安全与有用性

    发表
    测试
    DeepSeek-V2-Lite、DeepSeek-LLM-7B、InternLM2.5-20B 等 13 个
    摘要QH-Bench 分单轮与多轮评测中文青少年内容安全,总均分高仍不消除线下接触和关系压力上的负分。

    QH-BENCH 是面向中国社会文化情境的中文青少年内容安全基准,用单轮细粒度风险和多轮跨轮机制两条轨道,评测模型回复是否既守住安全边界又提供适合年龄的帮助。

    深度解读完整解读
  4. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Mistral-7B-Instruct-v0.3、Llama 3.1-8B-Instruct、Gemma 3-4B-IT
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  5. 可解释性arXiv 2609.35210

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    提出 swap readout 分析蒸馏对学生特征的重加权

    发表
    测试
    DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、DeepSeek-R1-Distill-Qwen-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    深度解读完整解读
  6. 可解释性arXiv 2609.35261

    Imprint Reader:从权重更新读出到行为干预

    用 SMaRT 从冻结权重更新读出知识与行为并用 MetaEdit 干预

    发表
    测试
    DeepSeek-V4-Flash、Qwen3-14B、Qwen3-30B-A3B-Instruct-2507
    摘要SMaRT 读出冻结更新,MetaEdit 用同坐标梯度在无目标任务数据时改原模型行为。

    Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。

    深度解读完整解读
已经到底了