跳到正文
原文
arXiv:可解释性· arXiv:2609.39625· Xinyue Xu, Jiahao Zhang, Lijie Hu, Peter Hase, Hao Wang·· 1 天前

D-Scope:用稀疏自编码器分解与操控扩散 Transformer

D-Scope: Decomposing and Steering Diffusion Transformers with Sparse Autoencoders

AI 导读

D-Scope 是一个把扩散 Transformer(DiT)特征解释与生成控制打通的框架,通过将高激活图像块的 SigLIP 2 嵌入聚合成视觉质心,在共享图文嵌入空间中用文本描述匹配检索单个特征,无需逐特征文本标注。研究刻画了两个模型家族、五个层的 150 个 SAE,并发布含 100 个目标概念、每个概念十种上下文的基准。结果显示高重建保真度可与低字典利用率和有限的视觉证据覆盖并存;在逐例最优强度选择下,对比检索在测试的操控配置中带来更大的区域 SigLIP 2 平均增益,但未持续改善区域外保持。

阅读原文arxiv.org