跳到正文
10月8日 · 周四

开源模型安全 · 论文

找到 11 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 90 篇还没打标签,不在筛选结果里。

另有 60 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2609.25518 ·

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    AI 导读作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。

    测试gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    完整解读
  2. 分析/可解释性arXiv:2609.08322 ·

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    AI 导读研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。

    测试Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    完整解读
  3. 分析/可解释性arXiv:2609.13556 ·

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    作者用 JU/JI 两个术语基准比较 Llama-3.1-8B-Instruct 与医学微调 UltraMedical,发现通用模型更准,并用组件重加权缩小差距。

    测试Llama-3.1-8B-Instruct、Llama-3.1-8B-UltraMedical
    摘要医学微调的 UltraMedical 在两项术语任务上不如 Instruct,偏差来自少数组件被加重。

    作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。

    完整解读
  4. 分析/可解释性arXiv:2609.35210 ·

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    AI 导读研究用稀疏 crosscoder 分析 on-policy distillation(OPD)究竟向学生模型内部表征注入了什么,并提出 swap readout 方法,让每个学生 checkpoint 独立读取自身特征激活,从而衡量训练如何改变学生对特征的使用。

    测试DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、Skywork-OR1-Math-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    完整解读
  5. 分析/可解释性arXiv:2609.35261 ·

    Imprint Reader:从权重更新读出到行为干预

    Imprint Reader 用 SMaRT 从冻结权重更新读出知识与行为,并用 MetaEdit 梯度干预 Qwen3-14B。

    测试Qwen3-14B、Qwen3-30B-A3B-Instruct-2507、DeepSeek-V4-Flash
    摘要SMaRT 读出冻结更新,MetaEdit 用同坐标梯度在无目标任务数据时改原模型行为。

    Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。

    完整解读
已经到底了