arXiv:可解释性· arXiv:2609.14151· Prajjwal Bhattarai·2026-09-13 05:06· 19 天前语言模型激活空间中的可操控性特征Signatures of Steerability in Activation Space of Language ModelsAI 导读研究证明,简单的分离度指标与语言模型的下游可操控性在不同设置下均强相关,即便控制层数和数据集效应后依然成立。基于合成叠加实验,分离度指标与经验特征方向和真实特征方向之间的一致性也高度相关。结果表明,这类可分离性统计量可作为判断 steering vector 何时有效的实用诊断工具。阅读原文arxiv.org#可解释性#对齐#arXiv