跳到正文
原文
arXiv:可解释性· arXiv:2609.07037· Takeru Hiramatsu·· 25 天前

Steering Vector Dissection:将激活引导向量拆解为独立语义特征

Disentangling Steering Vectors

AI 导读

论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。

阅读原文arxiv.org