可解释性arXiv 2608.21766
研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关
用探针与激活导向分析语言模型的评测意识表征及言语化
- arXiv
- 2608.21766
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Nemotron3-49B、Qwen3-8B、Qwen3-32B 等 14 个
- 风险欺骗与谋划
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。