跳到正文
10月8日 · 周四

可解释性 · 论文

找到 8 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 118 篇还没打标签,不在筛选结果里。

另有 118 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.08559

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    分析激活引导去偏方向,发现其编码的是置信度而非公平性

    发表
    测试
    Llama-3.1-8B、Llama-3.1-8B-Instruct、Falcon3-7B-Base 等 8 个

    摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。

    深度解读完整解读
  2. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  3. 可解释性arXiv 2609.10060

    研究者提出基于参考的隐藏状态相对表示偏见检测方法

    用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变

    发表
    测试
    Llama 3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Gemma 3-4B-IT
    摘要相对表示上的∆B 在多数微调设置中与三个基准的输出层偏见变化共变。

    Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。

    深度解读完整解读
  4. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  5. 可解释性arXiv 2609.07037

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    提出 Steering Vector Dissection,用 SAE 拆解转向向量

    发表
    测试
    Qwen2.5-7B-Instruct、Llama3.1-8B-Instruct
    摘要用 SAE 把 DiffMean 拆成可区分基向量,并靠去掉拒绝方向改变不安全转向的效果。

    Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。

    深度解读完整解读
  6. 可解释性arXiv 2609.08322

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象

    发表
    测试
    Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    深度解读完整解读
  7. 可解释性arXiv 2609.19366

    研究揭示细粒度危害信号在 LLM 安全中的作用

    抽取正交类别残差并用激活转向检验其有害性与拒答作用

    发表
    测试
    Gemma-2-9B-IT、Llama-3-8B-Instruct、Qwen2.5-7B-Instruct
    摘要类别残差可携带有害性并诱发拒答,也常加强下游的一般有害对齐。

    作者分离出与一般有害方向正交的类别残差,用来检查细粒度有害信号是否参与 LLM 的安全行为。

    深度解读完整解读
已经到底了