Google DeepMind · 论文
另有 19 篇还没有研究类型,暂不在这些分类里。
分析/可解释性arXiv:2609.01832 · 分析/可解释性arXiv:2609.08322 · 多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。
完整解读把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
分析/可解释性arXiv:2609.34572 · 论文提出 Nudgeability:推理模型会跟随置信信号却不追踪自身能力
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
完整解读
已经到底了