跳到正文
原文
arXiv:可解释性· arXiv:2610.07469· Pratyay Dutta, Kowshik Thopalli, Vivek Narayanaswamy·本站收录 · 原文发表 日期未标

COMPASS:在语言模型中定位推理发生的注意力头

COMPASS: Finding Where Reasoning Lives in Language Models

AI 导读

研究者提出 COMPASS,一种推理时激活引导方法,用于找出语言模型中承载推理的注意力头。该方法不依赖预定义的推理刻画,而是以模型自身直接作答的正确性作为信号,得到一条可诱发推理的潜在方向;该方向在多数注意力头的激活中可解码,但只有少数头能被有效干预。COMPASS 通过 logit 空间的归因分数识别这些头,并沿正确性方向引导其激活,只需每个头的激活统计量。在三个模型家族和多个数学基准上,COMPASS 优于所比较的激活引导基线,GSM8K 准确率平均提升 16 个百分点,并以少生成 20-70% token 的方式接近 CoT 准确率;干预无需重新拟合即可迁移到未见基准,消融实验显示正确性方向与承载它的少数头都不可或缺。

阅读原文arxiv.org