东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
完整解读
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
完整解读