跳到正文
10月8日 · 周四

全部论文

找到 5 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 717 篇还没打标签,不在筛选结果里。

另有 717 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.14759

    研究:拒答只读取模型道德表征中的伤害切片

    用几何投影与因果交换干预,分析拒绝机制读取的道德表征

    发表
    测试
    GPT-OSS-20B、OLMo-3-7B-Instruct、OLMo-3-7B base 等 9 个
    摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。

    本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。

    深度解读完整解读
  2. 可解释性arXiv 2609.25518

    Matryoshka Attribution:把语言模型输出归因到表示与权重

    提出 Matryoshka Attribution,把模型输出归因到表示与权重

    发表
    测试
    gpt2-small、Qwen2.5-0.5B、gemma-2-2b 等 6 个
    摘要MAttr 用随机预算的 sigmoid top-k 学嵌套归因,并在电路基准和拒答权重上给出结果。

    Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。

    深度解读完整解读
  3. 分析与理论arXiv 2609.32717

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    发表
    测试
    GPT-4.1 mini、GPT-5.3 Instant、Llama3-8B-Instruct 等 10 个

    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    深度解读完整解读
已经到底了