跳到正文
原文
arXiv:可解释性· arXiv:2610.04020· Jakub St\k{e}pie\'n, Marcin Mazur, Jacek Tabor, Przemys{\l}aw Spurek·本站收录 · 原文发表 日期未标

ClasSAE:通过可微特征-类别亲和度实现类别对齐的稀疏自编码器

ClasSAE: Class-Aligned Sparse Autoencoders via Differentiable Feature-Class Affinity

AI 导读

ClasSAE 提出一种在训练中自动为特征分配类别、并引导编码器学习类别可分表示的方法,用可微 top-k 算子作用于可训练的特征-类别亲和度矩阵,使编码器与亲和度矩阵协同适应,无需事后探测。在 ImageNet 上使用 CLIP ViT-L/14 嵌入时,学到的亲和度矩阵与在留出数据上独立估计的事后特征-类别矩阵高度一致,模型还能仅凭编码器和亲和度矩阵直接进行类别预测,并在 Targeted Probe Perturbation 评测中取得更好的分离效果。

阅读原文arxiv.org