研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
揭示类型化决策模型按选项标签而非定义规则作答
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读测绘去安全开源模型的生产、重分发与下游应用留存机制
作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
作者用 JU/JI 两个术语基准比较 Llama-3.1-8B-Instruct 与医学微调 UltraMedical,发现通用模型更准,并用组件重加权缩小差距。
作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。
激活转向的副作用可以在施加之前预测,而不必先把每个行为都转向一遍。。
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
完整解读研究用稀疏 crosscoder 分析 on-policy distillation(OPD)究竟向学生模型内部表征注入了什么,并提出 swap readout 方法,让每个学生 checkpoint 独立读取自身特征激活,从而衡量训练如何改变学生对特征的使用。
作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。
Imprint Reader 用 SMaRT 从冻结权重更新读出知识与行为,并用 MetaEdit 梯度干预 Qwen3-14B。
Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。