跳到正文
原文
arXiv:可解释性· arXiv:2610.09087· Tobias Braun, Nils Loose, Alexander Herzog, Virginia Ceccatelli, Marcus Rohrbach, Thomas Eisenbarth, Lorenzo Cavallaro·本站收录 · 原文发表 日期未标

U-Space:揭示语言模型不确定性何时与为何产生

U-Space: Uncovering When and Why Uncertainty Arises in Language Models

AI 导读

研究者提出 U-Space,一个低维子空间,用来让语言模型在推理过程中变化的不确定性变得可测量且可解释。该方法先找出表示怀疑与确定的语义锚点,把它们的 unembedding 方向映射回残差空间,再将二者的对比组合成正交基;U-Lens 把每个 token 状态投影到这些基向量上,得到可直接查看的 token 级不确定性图,也可聚合成标量不确定性分数。该方法不需要正确性标签、重复生成或额外训练,在推理类基准上其置信度分数在标准评测与长度受控评测下均优于已有基线,并且比监督式估计器迁移更可靠。代码已发布于 https://github.com/s2labres/U-Space。

阅读原文arxiv.org