跳到正文
原文
arXiv:可解释性· arXiv:2609.32355· Jonathan Drechsel·· 6 天前

语言模型定向特征学习:检测用激活值,干预用梯度

Gradients for Interventions and Activations for Detection: Targeted Feature Learning in Language Models

AI 导读

论文研究定向特征学习,即为预先指定的概念构造单个特征,而非像 SAE 那样事后识别特征与概念的关系。作者在三种模型信号(激活值、激活梯度、参数梯度)与两种估计器(对比均值、学习式一维编码器-解码器)之间做受控比较,得到六种定向方法,其中 CAA 和 GRADIEND 是已有实例,另外四种为新方法。研究在 15 项任务和三个语言模型上将这些方法与预训练 SAE 对比,同时评估检测与因果干预。结果显示,对比式激活值方法检测表现最强,基于梯度的方法干预表现最强,定向特征质量取决于模型信号与估计器的组合,检测与干预反映互补的性质。

阅读原文arxiv.org