跳到正文
10月8日 · 周四

思维链监控 · 论文

找到 8 篇
筛选

系统组件

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 43 篇还没打标签,不在筛选结果里。

另有 27 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2609.38107 ·

    研究:iGSM 基准显示正确答案常伴随无效思维链

    AI 导读作者在合成小学数学基准 iGSM 上程序化逐步检验思维链,发现答案正确与推理过程有效并不总是一致。

    测试124M-parameter GPT-2-style models(12-layer, hidden size 768, rotary embeddings)
    摘要iGSM 上答案正确、轨迹合法与极简性可以分开,分布偏移下差距变大。

    iGSM 上的程序可检查实验:正确答案并不保证思维链是合法推导。。作者针对一个被用于监测和解读的假设:发出的轨迹忠实于、或至少可靠相关于模型如何得到答案。

    完整解读
  2. 分析/可解释性arXiv:2609.23065 ·

    从概念对齐到因果接地:思维链忠实性的干预检验

    作者用共享 SAE 把 CoT 忠实性写成概念对齐与因果接地,五模型四数据集上相关对齐高但与 Δp 弱相关,因果忠实性随层变化。

    测试Llama-3.1-8B、Gemma-2-2B、Gemma-2-9B 等 5 个
    摘要共享 SAE 上的概念重叠只标出候选概念,Δp 才度量它们是否因果支撑答案,且该效应随层和架构变化。

    这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。

    完整解读
  3. 分析/可解释性arXiv:2608.27340 ·

    研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    AI 导读研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。

    测试Qwen3-32B、OLMo-3-32B-Think、GPT-5-mini
    摘要能力型与安全型口头 eval-awareness 对服从的符号相反,聚合抑制率因此不能代表安全相关成分。

    作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。

    完整解读
  4. 分析/可解释性arXiv:2609.35210 ·

    研究用稀疏 crosscoder 揭示 on-policy distillation 只重加权既有特征

    AI 导读研究用稀疏 crosscoder 分析 on-policy distillation(OPD)究竟向学生模型内部表征注入了什么,并提出 swap readout 方法,让每个学生 checkpoint 独立读取自身特征激活,从而衡量训练如何改变学生对特征的使用。

    测试DeepSeek-R1-Distill-Qwen-1.5B、JustRL-DeepSeek-1.5B、Skywork-OR1-Math-7B 等 6 个
    摘要OPD 与教师 rollout 上的 SFT 都不增加特征,而是重加权学生与教师已经共享的特征。

    作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。

    完整解读
已经到底了