跳到正文
原文
arXiv:可解释性· arXiv:2609.14151· Prajjwal Bhattarai·· 19 天前

语言模型激活空间中的可操控性特征

Signatures of Steerability in Activation Space of Language Models

AI 导读

研究证明,简单的分离度指标与语言模型的下游可操控性在不同设置下均强相关,即便控制层数和数据集效应后依然成立。基于合成叠加实验,分离度指标与经验特征方向和真实特征方向之间的一致性也高度相关。结果表明,这类可分离性统计量可作为判断 steering vector 何时有效的实用诊断工具。

阅读原文arxiv.org