跳到正文
10月9日 · 周五

Google DeepMind · 论文

找到 4 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 15 篇还没打标签,不在筛选结果里。

另有 15 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.38389

    研究揭示多轮攻击中危害性表征的几何演化

    分析多轮攻击中有害性与拒答表征的几何演化

    发表
    测试
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-2-9B-it
    摘要多轮中 harmfulness 渐可分且与 refusal 弱对齐,单轮静态探针可能因此变差。

    作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。

    深度解读完整解读
  2. 可解释性arXiv 2609.29781

    研究检验幻觉神经元是否存在:稀疏探针定位并不唯一

    提出五步诊断协议,检验幻觉神经元定位是否唯一

    发表
    测试
    Gemma 3 4B、MedGemma 4B
    摘要检测和群体因果效应成立,但稀疏选择来自相关簇,不是唯一定位。

    这项工作用诊断协议复查 H-Neurons 的定位主张。问题是:L1 探针在相关激活上可以选出能预测幻觉的少量神经元,但这不等于这些神经元唯一编码该行为。

    深度解读完整解读
  3. 可解释性arXiv 2609.08322

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象

    发表
    测试
    Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    深度解读完整解读
已经到底了