跳到正文
原文
arXiv:可解释性· arXiv:2609.35599· Luke Leckie·· 3 天前

大语言模型激活值中的语义搜索特征:J-lens 揭示 LLM 的探索与利用机制

Signatures of semantic search in the activations of large language models

AI 导读

研究用 Jacobian lens(J-lens)等机制可解释性技术发现,大语言模型在语义流畅性任务中切换概念类别时,内部激活呈现类似人类"语义觅食"的探索与利用特征。切换与低下一 token 激活相关,当 J-space 中当前类别项目耗尽时切换概率上升,中层对抽象类别标签的激活会在切换前升高;通过类别切换引导向量可因果影响切换行为。研究还识别出切换期间及切换前激活的通用残差流方向,沿这些方向引导可提高或降低切换率。

阅读原文arxiv.org