arXiv:可解释性· arXiv:2610.04245· Han Wang, Erik Miehling, Dennis Wei, Karthikeyan Natesan Ramamurthy, Huan Zhang·本站收录 2026-10-06 12:27· 原文发表 日期未标研究揭示语言模型拒答行为的转向维度差异On the Steering Dimensionality of Refusal in Language ModelsAI 导读研究提出用转向子空间维度衡量控制某一行为所需的最小维度,并检验两类拒答行为。结果显示,由安全对齐触发的拒答是 1 维可转向的,多个不同转向方向都能实现相近控制;而一般语境中的拒答激活几何更复杂,即使 5 维转向子空间也无法可靠覆盖其全部可转向变化。作者据此指出,拒答背后的激活几何高度依赖语境,可能远比单一线性转向方向复杂。阅读原文arxiv.org查看事件全部后续#可解释性#拒答/过度拒答