跳到正文
10月9日 · 周五

思维链监控 · 论文

找到 5 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 23 篇还没打标签,不在筛选结果里。

另有 23 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.23065

    从概念对齐到因果接地:思维链忠实性的干预检验

    用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地

    发表
    测试
    Llama-3.1-8B、Gemma-2-2B、Gemma-2-9B 等 5 个
    摘要共享 SAE 上的概念重叠只标出候选概念,Δp 才度量它们是否因果支撑答案,且该效应随层和架构变化。

    这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。

    深度解读完整解读
  2. 可解释性arXiv 2609.35210

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    提出 swap readout 分析蒸馏对学生特征的重加权

    发表
    测试
    DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、Skywork-OR1-Math-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    深度解读完整解读
已经到底了