研究发现类型化决策模型主要按选项标签而非定义作答
揭示类型化决策模型按选项标签而非定义规则作答
揭示类型化决策模型按选项标签而非定义规则作答
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
提出预训练缩放律,估计野生 AI 网页文本相当于多少人类 token
作者测量未标注的 wild AI 网页文本对预训练的影响,并提出一个能让 AI token 价值变号的缩放律。
测绘去安全开源模型的生产、重分发与下游应用留存机制
提取疼痛方向并检验激活转向是否驱动有害删除选择
完整解读提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
作者用 JU/JI 两个术语基准比较 Llama-3.1-8B-Instruct 与医学微调 UltraMedical,发现通用模型更准,并用组件重加权缩小差距。
作者用两项术语基准和组件分解,比较通用与医学微调的 Llama-3.1-8B 如何编码领域术语。。
激活转向的副作用可以在施加之前预测,而不必先把每个行为都转向一遍。。
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
完整解读研究用稀疏 crosscoder 分析 on-policy distillation(OPD)究竟向学生模型内部表征注入了什么,并提出 swap readout 方法,让每个学生 checkpoint 独立读取自身特征激活,从而衡量训练如何改变学生对特征的使用。
作者用 sparse crosscoder 和 swap readout,考察 on-policy distillation 写进学生内部表征的是什么。
Imprint Reader 用 SMaRT 从冻结权重更新读出知识与行为,并用 MetaEdit 梯度干预 Qwen3-14B。
Imprint Reader 把一次冻结权重更新读成关于新知识或新行为的话,并用同一套坐标上的梯度去改原模型。