跳到正文
10月8日 · 周四

Meta · 论文

找到 7 篇
筛选

模型自身风险

影响

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 19 篇还没打标签,不在筛选结果里。

另有 10 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2609.25518 ·

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    AI 导读作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。

    测试gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    完整解读
  2. 分析/可解释性arXiv:2609.08322 ·

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    AI 导读研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。

    测试Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    完整解读
  3. 分析/可解释性arXiv:2609.13556 ·

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    作者用 JU/JI 两个术语基准比较 Llama-3.1-8B-Instruct 与医学微调 UltraMedical,发现通用模型更准,并用组件重加权缩小差距。

    测试Llama-3.1-8B-Instruct、Llama-3.1-8B-UltraMedical
    摘要医学微调的 UltraMedical 在两项术语任务上不如 Instruct,偏差来自少数组件被加重。

    作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。

    完整解读
  4. 分析/可解释性arXiv:2608.29461 ·

    因果模型定位并解锁模型中的故意藏拙行为

    AI 导读论文提出一个因果模型,描述故意藏拙(sandbagging)如何沿残差流传递:早期层把藏拙意图写入残差流的单一轴,后续层读取该轴并决定最终答案。

    测试Qwen2.5-7B、Llama-3-8B、Mistral-7B
    摘要因果模型规定单层 graft 的窗口。

    作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。

    完整解读
已经到底了