可解释性arXiv 2609.30326
Qwen3.5-0.8B 关停响应的受控梯度激活引导:一种最小步数策略
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
- arXiv
- 2609.30326
- 发表
- 层
- 模型层
- 场景
- 模型与 API
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 influence score,量化提示注入检测器各注意力头的有效贡献
这项工作在推理时给提示注入检测分类器的注意力头一个影响分数,用来看分类决策从哪些头来。缺口是电路分析往往要重插桩,只看输出又不知道内部组件的贡献。作者希望同时看到决策在哪一层形成、哪些头在推,以及正确与错误是否对应不同机制。
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。