可解释性arXiv 2609.04721
研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
- arXiv
- 2609.04721
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
用 SAE 追踪稠密检索查询扩展的潜变量并用激活转向验证
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
提出 KPI,用入度定位跨层关键路径并做 SAE 转向以解决知识冲突
KPI 针对知识冲突 RAG 中的 SAE 转向:相关性批量改特征会带入冗余,少量因果上关键的特征即可完成转向。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆