可解释性arXiv 2610.01864
从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
- arXiv
- 2610.01864
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- MuQ、MusicFM
- 组件音频
摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道
作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。
提出 DiDAE,对冻结视觉基础模型做无梯度解耦反事实解释
DiDAE 用冻结视觉基础模型和一个解耦字典,生成按分量编辑的视觉反事实,再拿去修正依赖伪相关的分类器,或给字典原子按“是否真能翻转该分类器”排序。
提出 Capsule Lens,用胶囊近似并追踪表示空间的概念几何
Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。
检验个体身份训练的视觉表示是否线性编码生物概念
这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。
提出 ResLRP,抑制视觉 Transformer 残差抵消引起的归因不稳定
Berend 等人针对 ViT 上 LRP 热图嘈杂、不忠实的问题,把原因放在残差加法而不是注意力规则:前向抵消留下很小的 zout,标准 LRP 用它作分母,放大成不稳定的正负相关性。
提出 VisER,用内部视觉证据检测 LVLM 物体幻觉
VisER 是面向 LVLM 开放式图像描述的免训练物体级幻觉检测分数,用来处理内部支持的来源混淆。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆