研究:探针可解码性不等于因果性,SAE 分解可区分行为驱动特征
Decodability is Not Causality: Dissociating Probe Readouts from Behavioral Drivers via SAE Decomposition
AI 导读
论文指出线性探针能从语言模型激活中解码真实性等安全相关概念,但探针准确率只反映可解码性,不代表探针权重对应的特征真正因果驱动模型行为。作者提出一种特征级诊断方法,将已部署的 True/False 探针分解为 SAE 特征,分别按探针对齐度和模型行为的梯度敏感度排序,并在一致性门控下消融共享、仅探针和随机特征集。