跳到正文
原文
arXiv:可解释性· arXiv:2610.04017· Sankaran Vaidyanathan, Rafal Urbaniak, Emily Bunnapradist, Michelangelo Naim, Daniel Waxman·本站收录 · 原文发表 日期未标

WISE 与 JuntaLearner:面向语言模型的交互感知电路发现方法

Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models

AI 导读

研究者提出 witness-integrated set effect(WISE)因果估计量,在 witness 机制上对原因集合与 witness 集合取期望,避免组合枚举,从而在计算上可行。基于该方法,他们提出基于梯度的电路发现方法 JuntaLearner,按组件在不同规模组件与 witness 集合中的因果影响对组件排序。作者同时引入必要性、任务特异性指标以及电路识别分数(CRS),用于在电路规模上汇总各指标并突出小电路取得的效果。在规模递增的多个任务与模型上,JuntaLearner 在所有指标上的平均 CRS 均高于归因基线;其成本不随候选组件数量增长,因此可扩展到大型模型,同时考虑集合级交互并避免一阶近似。

阅读原文arxiv.org