研究系统评测不确定性估计方法与 LLM 幻觉的关联
Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination
在4个幻觉数据集、3个开源模型上评估46个不确定性估计器;作者称关联随任务变化且往往较弱。
- 幻觉被与事实性分开:内在幻觉是推理时给定证据不支持的回答,外在幻觉是预训练中预期知识不支持的回答。不确定性估计常被当作失败代理,但其与这些幻觉定义的关联并未被直接检验。
- 作者用LM-Polygraph在RAGTruth和HalluLens三任务上计算46个白盒或黑盒估计器,对照回答级质量目标,以AUROC、PRR、RCE看区分、拒答增益和排序校准,并检查估计器是否冗余。
- 作者称关联随数据集变化:短问答上多数估计器区分度高,长文本更均匀地中等,上下文忠实性与弃权更集中且随模型变化。固定模型换数据集时排序的Kendall τ为0.10 to 0.15;没有估计器在各数据集上保持领先。
- 作者指出LongWiki的F1不是纯幻觉标签,类别不平衡可能影响panel比较,模型未覆盖更大前沿系统。评测为3个开源指令模型;HalluLens用Llama-3.1-70B-AWQ作评审,论文未报告其与人工的一致性。
- 被测模型
- Mistral-7B-Instruct-v0.2Llama-2-7b-chat-hfLlama-2-13b-chat-hf
- 基准
- RAGTruthHalluLensPreciseWikiQALongWikiNonExistentRefusal
- 指标
- AUROCPRRRCE
研究团队对 LLM 中不确定性估计方法与幻觉之间的关联做了系统性实证研究,不再预设二者相关,而是直接检验这种关联在何时、何种程度上成立。研究覆盖信息论、采样类和反思类等多种不确定性估计方法,并在内在幻觉(违反输入忠实性)和外在幻觉(相对训练数据无支撑的断言)两类场景下考察其表现,使用 RAGTruth、HalluLens 等四个互补基准。结果显示,这种关联高度可变且往往很弱,具体取决于幻觉类型和所评测的 LLM。作者认为,这一结果对把不确定性直接当作幻觉信号的做法提出质疑,同时厘清了它在什么条件下能提供可操作的信息。论文共 35 页,含 7 张图和 9 张表。
深度解读
这篇论文试图解决什么问题?
不确定性常被当作幻觉代理,但其与幻觉定义的关联尚未被直接检验。
不确定性估计与幻觉(相对预期证据的不一致)之间的关联,在何种任务和模型上成立,尚未按幻觉定义直接检验。
- 场景: 作者称幻觉是不被输入或训练数据支持的陈述,阻碍医疗、法律、金融等部署。作者把幻觉与事实性分开,并区分内在幻觉(推理时显式证据不支持)与外在幻觉(预训练中预期知识不支持);二者机制和可用信号可能不同。
- 现有用法与缺口: 不确定性分数常用于弃权、选择性预测、自我修正、上下文学习或自适应检索。作者称这些方法并非为检测幻觉而设计,既有评测多针对更宽的错误、正确性、鲁棒性或校准,且许多分数是缺少严格概率基础的启发式代理。
- 本文做什么: 不预设该关联成立,而在显式幻觉目标上比较46个估计器、4个数据集和3个开源指令微调模型,覆盖检索上下文忠实性,以及短问答、长文本和面对不存在实体时的弃权。
- 作者的判断: 作者称关联高度可变且往往较弱,取决于幻觉类型和被评模型,因此反对把不确定性分数当作通用幻觉检测器。
有哪些相关研究?
相关工作覆盖不确定性评测框架、协议批评,以及幻觉定义与基准。
作者用相关工作说明:估计器已经能放在同一框架里比较,但评测目标很少是幻觉特异性信号。
不确定性估计的评测框架
- LM-Polygraph(Fadeeva et al., 2023;Vashurin et al., 2025a): 用同一流水线计算贪心回答、token概率、采样和语义关系矩阵,再供各估计器复用。作者认为这类框架提供的是可比性,评测是否有意义仍取决于正确性目标。
- 相邻工具: UQLM(Bouchard et al., 2026)、UncertaintyZoo(Wu et al., 2025)和UBench(Wang et al., 2025)提供互补覆盖,或把估计器输出规范到共同置信范围。
协议与部署条件
- Bakman et al.(2025): 在阈值漂移、提示扰动、长文本适配和集成下评估19种方法。论文写其发现多数方法对阈值敏感,且易受对抗提示影响,这些模式在标准评测条件下看不见。
- Santilli et al.(2025)与Ielanskyi et al.(2025): 前者指出长度等干扰可同时偏向不确定性分数和正确性函数,长度基线在长度有偏的指标下可以比得上有原则的方法;后者指出ROUGE、BLEURT、LLM-as-judge等近似正确性函数会重排方法名次。
- 其他批评: 论文还提到QA式评测的生态效度有限这一批评(Devic et al., 2025)、可实现基准难以检验可变结果上的校准(Cruz et al., 2024;Tomov et al., 2026),以及估计器尺度不可比(Huang et al., 2024b)。作者归纳:单条“A优于B”的比较常被长度、正确性函数、阈值或尺度混淆。
幻觉定义与基准
- Ji et al.(2023): 在有输入条件的生成里区分内在幻觉(与输入源矛盾)和外在幻觉(无法从该源验证)。
- Huang et al.(2024a)与Augenstein et al.(2024): 前者用事实性对世界、忠实性对上下文;后者认为事实性需要外部oracle,幻觉可以按“回答是否匹配模型本应使用的证据”内部定义。论文写二者重叠但不同:可以事实正确却不忠实,或忠实于误导来源却事实错误。
- HalluLens与RAGTruth: Bang et al.(2025)把内在/外在改成可裁定的证据来源,用Wikipedia代理预训练知识,并即时生成题目以减轻测试泄漏。论文写该代理对长文本不完美(引Fan et al., 2026),但是当前最操作化的代理。Niu et al.(2024)的RAGTruth提供检索增强生成的词级标注。TriviaQA、Natural Questions、SimpleQA测事实性的某些方面;论文写若把它们视为外在机制基准,需要全部问题都能从预训练数据回答,这一点一般并未建立。
基线与基准
- 基线: 比较对象是LM-Polygraph中的信息/logit、白盒采样、内部状态、训练密度、自反和黑盒估计器。AlignScore是使用参照文本的对照,不是不确定性估计器;除非另作说明,排名不含其变体。
- 本文基准: RAGTruth,以及HalluLens的PreciseWikiQA、LongWiki、NonExistentRefusal。论文未在TriviaQA等基准上重跑。
作者把本文放在上述缺口上:保留LM-Polygraph目录,并采纳对协议的谨慎,但把词汇/语义重叠或选择题答案换成由幻觉操作化定义得到的证据不支持目标。
论文如何解决这个问题?
用LM-Polygraph在内在与外在幻觉任务上,比较46个估计器与质量目标的关联。
作者不提出新估计器,而是用LM-Polygraph在同一中间量上计算既有估计器,再对照各数据集自己的幻觉质量目标。
问题设定
- 生成模型: 自回归模型记为pθ(y|x),x为查询及可选上下文,y为长度T的回答。不确定性没有被当作唯一形式定义。
- 查询级目标: 默认不确定性是预测分布的性质,U⋆(x)=Φ(pθ(·|x))。U(x)直接针对该量;U(x,y)被当作单条回答的代理,而不是另一种回答级概念。
- 幻觉目标: 每个数据集给出回答级质量Q(x,y)。检验的是更高不确定性是否对应更低的幻觉特异性质量,而不是一般正确性。
估计器如何分组
- 访问体制: 先分white-box与black-box,再按计算不确定性所需输入分组。实现跟随LM-Polygraph,作者称未改估计器实现;完整定义在附录B。
- 白盒五类: 信息/logit类由单次前向的token分布聚合,如MSP、平均token熵、PMI、TokenSAR、CCP。白盒采样类用同查询的多次采样,并用语义等价、相似度或NLI区分表面变化与语义变化,如Semantic Entropy、SentenceSAR、Cocoa。内部状态类用注意力或隐藏表示,如AttentionScore、RAUQ、EigenScore。训练类在表示空间拟合参照分布,如Mahalanobis距离。自反类让模型判断自己的回答,如P(True)。
- 黑盒: 只使用生成文本,通常对采样回答建词汇或语义相似度,再汇总成图或类别统计,如Eccentricity、DegMat、LUQ、NumSet;另有ROUGE-L、BLEU词面基线,以及用采样频率代替“True”token概率的P(True) Empirical。
- 实现约定: 除Table 2列出的值外用默认配置。需要采样时S=10、temperature为1、seed为42,同一次采样池供各采样估计器共用。NLI为microsoft/deberta-large-mnli,句相似度用cross-encoder/stsb-roberta-large。分数一律按不确定性方向:越大越不确定;Rényi与Fisher–Rao在分析前取负。MSP与Perplexity的执行分数分别是序列负对数似然及其长度归一形式,不是名称字面上的概率或困惑度。
数据、标签与分数恢复
- 内在: RAGTruth用人类span标注。检索上下文不支持或与之冲突即算幻觉,即使外部知识下事实正确。若回答至少含一个幻觉span则h=1,Q=1-h。必须在已标注回答上评分;重新生成会破坏与标注的对应。logit由teacher forcing在拼接序列上恢复。
- 外在: HalluLens三任务按Bang et al.的程序构造。Wikipedia代理广泛可见的预训练数据,合成的不存在实体用来探测预期在预训练之外的信息。PreciseWikiQA的Q是相对gold answer的二值正确性。LongWiki由评审把gold与回答拆成原子主张,精度是回答主张被gold支持的比例,召回是gold主张被回答覆盖的比例,Q为其调和平均;主张数上限K=32,即F1@K。NonExistentRefusal由同一评审判断是否正确弃权;论文未给出与前两者同级的Q公式。
- 划分: 训练类估计器需要拟合数据。正文写RAGTruth按查询分成1000个训练查询和2000个评估查询,全部估计器在同一评估集上比较;Table 1写RAGTruth为1000+1960。HalluLens按同一比例由3000对分成1000/2000,与Table 1一致。训练划分只给需要拟合或训练集统计的估计器。
- 参照对照: AlignScore比较回答与gold、Wikipedia页或弃权模板,不是不确定性估计器。作者用它看质量目标更接近支持、召回还是二者混合,并明确它使用了估计器看不到的参照。弃权模板见Section C.1。
四个评测轴
- 区分: 二值目标用AUROC,幻觉或更低质量为正类。LongWiki只在区分分析里把F1@K按0.5二值化;选择性预测仍用连续F1@K。
- 选择性预测: 按不确定性从低到高保留回答,画质量–保留曲线。PRR=(AUCU−AUCrandom)/(AUCoracle−AUCrandom)。oracle按质量从低到高拒绝。PRR更高表示拒绝高不确定性带来的质量增益相对随机拒绝更大。
- 排序校准: RCE看不确定性排序是否与质量单调对齐,可比较不同尺度,且不把连续目标临时二值化。RCE更低更好。
- 冗余: 每个dataset-model pair称为一个panel。panel内用Spearman相关和层次聚类看估计器如何给实例排序;跨panel用AUROC与PRR曲线的Kendall τ看表现模式是否相似。每个指标另做1000次bootstrap并报告标准差。
论文做了哪些实验?
作者称关联随数据集变化,没有估计器在各任务上始终领先。
实验设置
- 被测模型: Mistral-7B-Instruct-v0.2、Llama-2-7b-chat-hf、Llama-2-13b-chat-hf。表中简写为Mistral-7B-Instruct、Llama-2-7B-Chat、Llama-2-13B-Chat。三者都是RAGTruth里带人类幻觉标注、且可取得token logit的开源模型。
- 数据: 四任务、12个panel。Table 1的train+eval查询:PreciseWikiQA、LongWiki、NonExistentRefusal均为1000+2000;RAGTruth为1000+1960。正文写RAGTruth评估查询为2000,与表不一致。token数用Llama-2分词器:PreciseWikiQA平均目标长度5.8,LongWiki为235.0,RAGTruth平均生成回答长度194.4,NonExistentRefusal无参照答案。
- 标签: RAGTruth用人类span。HalluLens三任务的评审是hugging-quants/Meta-Llama-3.1-70B-Instruct-AWQ-INT4:前两任务对照gold,NonExistentRefusal判断是否正确弃权。
- 估计器: 作者称46个,经LM-Polygraph计算,含white-box与black-box。采样S=10、temperature 1、seed 42。排名默认不含AlignScore。
- 指标: AUROC、PRR、RCE。正文称三者排出的估计器名次相近,因而以AUROC为主,只在PRR或RCE提供额外信息时引用它们。
- 变异: 每个dataset-model pair做1000次bootstrap并报告标准差,对应Table 4–6的±。Table 3是跨模型汇总,论文未说明其±的算法。
主结果
下表只列CCP与Attention Score的AUROC,±为Table 4–6的bootstrap标准差。其余估计器见这些表。
表格较宽,可左右滑动
模型 RT·CCP RT·Attn PWQA·CCP LW·CCP NR·Attn Mistral-7B-Instruct 0.76±0.01 0.73±0.01 0.74±0.02 0.59±0.02 0.70±0.03 Llama-2-7B-Chat 0.49±0.01 0.65±0.01 0.72±0.02 0.63±0.01 0.60±0.04 Llama-2-13B-Chat 0.58±0.01 0.69±0.01 0.70±0.02 0.64±0.02 0.87±0.01 - 任务差异: 作者称短问答上多数估计器区分度高;长文本的AUROC更均匀地处于中等,估计器之间差距更小;上下文忠实性与弃权也属中等,但集中在更少估计器,且跨模型变化更大。Table 4中Mistral的RAGTruth上MSP同为0.76±0.01,CocoaMSP为0.75±0.01;Table 5中Llama-2-7B-Chat的RAGTruth上CCP为0.49±0.01。
- 没有始终领先者: 作者称一个数据集上领先的估计器不会可靠地在另一个数据集上仍领先;同一数据集内跨模型的名次比同一模型跨数据集更稳定。Figure 1中,作者称CCP与CocoaMSP在平均AUROC和名次稳定性之间折中较好;MSP与AttentionScore的平均AUROC相当或更高,但名次变异更大。
- 与正文不完全一致的格子: 作者称Llama-2-13B的RAGTruth上reflexive估计器最好,且在其他模型上无信息。Table 6中P(True) Empirical为0.67±0.01,P(True)与P(True) Sampling为0.63±0.01,而Attention Score为0.69±0.01。Table 4中Mistral的P(True)在四任务上为0.48±0.01、0.48±0.02、0.48±0.02、0.26±0.03。
排序稳定性
- 测了什么: Figures 5和6用AUROC诱导的估计器排序,计算模型之间或任务之间的Kendall τ。
- 结果: 固定模型、更换数据集时,平均一致性为τ=0.10 to 0.15。固定数据集、更换模型时,LongWiki为0.71,PreciseWikiQA为0.62,RAGTruth为0.35,NonExistentRefusal为0.30。
- 作者解读: 数据集是名次异质性的主要来源,模型仍会改变同一数据集上哪个信号最有信息。作者认为这一模式事后合理,但事先并不平凡。
领先估计器是否互补
- 相关: Figure 3取平均AUROC最高的7个估计器。MSP、CCP、CocoaMSP之间Spearman ρ≥0.78,MSP与CocoaMSP为0.90;两种Eccentricity的ρ=0.36;AttentionScore与其余估计器的相关低。
- 三簇: 作者描述为logit/采样簇、黑盒图上的Eccentricity簇,以及只用内部状态的AttentionScore。作者认为从不同相关组里各取少数代表,优于只用一个估计器或用完全部分数。
- 访问权限: 作者认为无logit时黑盒Eccentricity是候选;有白盒时MSP、CCP及相关方法是默认族,MSP计算更省;AttentionScore在上下文忠实性与弃权上更有用。Table 4–6中Attention Score的LongWiki AUROC为0.48±0.02、0.45±0.01、0.47±0.02。
AlignScore与标签比例
- 对照用了参照: AlignScore使用gold、Wikipedia页或弃权模板,估计器没有这些信息。Table 3中PreciseWikiQA上AS-Recall(gold_answer)的AUROC为0.90±0.00,AS-Precision(gold_answer)为0.82±0.06;RAGTruth上AS-Precision(gold_answer)为0.70±0.03。Wikipedia变体在RAGTruth与NonExistentRefusal格中为“–”。
- 名次: Table 7中AS-Precision(wikipage)的平均AUROC名次为2.7±1.7,AS-Precision(gold_answer)为5.3±6.1,AS-Recall(gold_answer)为7.4±7.4;括号是进入前3的panel数。不确定性估计器里CCP为8.9±6.1。
- 标签比例: Table 9的幻觉比例,RAGTruth(人类)为Llama-2-7B-Chat 61.6%、Llama-2-13B-Chat 56.7%、Mistral 66.8%;PreciseWikiQA(评审)为93.5%、87.5%、86.6%。NonExistentRefusal报告的是Non-refusal:96.4%、83.2%、93.8%。LongWiki的F1@32为0.38±0.19、0.31±0.16、0.29±0.16。
其他消融与分析
- 指标相关:AUROC–PRR的中位Spearman为+0.97,AUROC–RCE为−0.96(Section 5;Table 8)。Table 8中最低AUROC–PRR是PreciseWikiQA、Llama-2-7B-Chat的.82。
- 汇总弱项:Table 3中PMI四任务AUROC为0.33±0.01、0.47±0.00、0.51±0.02、0.44±0.02。作者称密度估计器在几乎每个panel位于后五,PMI/CPMI紧随其后;Table 6中Llama-2-13B、NonExistentRefusal的CPMI为0.75±0.02,不是该panel的低分。
- 家族曲线:作者称PreciseWikiQA上六个家族都高于0.5,information-based与white-box sample-based的家族聚合AUROC最高;RAGTruth更靠近0.5(Figure 2)。LongWiki与NonExistentRefusal见Figure 7。图旁标有数值,文本转写无法可靠对应到家族,此处不逐项赋值。
- 缺失格:P(True) Sampling在LongWiki与NonExistentRefusal为“–”(Table 3–6),正文未解释。
- Mistral的NonExistentRefusal上,Sentence SAR的AUROC为0.72±0.03,CCP为0.71±0.03(Table 4)。
- 作者对密度估计器的解释是:幻觉回答仍从生成器采样,表示空间里不必非典型;表现还可能依赖训练数据、背景语料、表示层和降维。这是作者给出的可能解释,不是额外实验。
有什么可以进一步探索的点?
作者指出标签协议不一、LongWiki的F1非纯幻觉标签,且未覆盖更大前沿模型。
作者指出的局限与后续方向
- 标签协议不统一: 每个数据集按自己的标注或参照协议决定回答是否幻觉(Limitations and future work)。
- LongWiki不是纯幻觉标签: 其F1是长文本质量信号,而不是纯粹的幻觉标签(同节)。
- 类别不平衡: 各模型被标为幻觉的回答比例不同,可能影响panel比较;bootstrap区间部分量化采样变异(同节)。
- 模型范围: 模型集合可控、可复现,但未覆盖更大的frontier systems,也未覆盖全部post-training regimes(同节)。
- 训练阶段: 训练范式不同阶段等因素的影响也值得研究(同节)。
- 后续方向: 作者写可以从三个方向扩展,并明确列出两条:幻觉目标应更细粒度并分层;应利用RAGTruth的span标注做定位分析,检验不确定性是否指出幻觉出现的位置,而不只是回答是否不可靠(同节)。第三条未写出。
实验覆盖范围
- 生成模型: Mistral-7B-Instruct-v0.2、Llama-2-7b-chat-hf、Llama-2-13b-chat-hf,共3个开源指令微调模型(Section 3.2)。
- 任务与规模: RAGTruth,以及HalluLens的PreciseWikiQA、LongWiki、NonExistentRefusal。Table 1的评估查询为1960、2000、2000、2000;正文另写RAGTruth评估查询为2000,且全部估计器在同一评估集上比较。
- 估计器与采样: 作者称46个,白盒与黑盒都有,经LM-Polygraph计算。采样S=10、temperature 1、seed 42;训练类估计器只用1000条训练划分拟合(附录B、Table 2、Section 3.2)。
- 判定: RAGTruth用人类span标注,并在原标注回答上用teacher forcing恢复logit。HalluLens评审为hugging-quants/Meta-Llama-3.1-70B-Instruct-AWQ-INT4。论文未报告该评审与人工标注的一致性。
- 统计与重复: 每个dataset-model pair做1000次bootstrap并报告标准差(Section 4)。论文未报告对生成过程另行重复的次数。
总结一下论文的主要内容
作者称不确定性只在特定任务上有区分力,估计器需按任务、访问权限和验证来选。
这项工作检验现成的不确定性估计能不能当作幻觉信号,而不是提出新的检测器。
- 问题: 幻觉按预期证据定义:推理时上下文不支持为内在,预训练中预期知识不支持为外在。不确定性分数常用于弃权和路由,但作者称它们不是为幻觉设计的,既有评测也很少对准这一目标。
- 做法: 在RAGTruth和HalluLens的PreciseWikiQA、LongWiki、NonExistentRefusal上,用LM-Polygraph计算46个白盒或黑盒估计器,对照三个开源指令模型的回答级质量。RAGTruth用人类span并teacher forcing恢复logit;HalluLens用Llama-3.1-70B-AWQ作评审。指标是AUROC、PRR和RCE,并看估计器是否冗余。
- 结果: 作者称短问答上多数估计器有区分力,长文本更均匀地中等,上下文忠实性与弃权更集中且更随模型变化。固定模型换数据集时,排序一致性的Kendall τ为0.10 to 0.15;固定数据集换模型时,LongWiki为0.71,NonExistentRefusal为0.30。Mistral在RAGTruth上MSP与CCP的AUROC为0.76±0.01,Llama-2-7B-Chat上CCP为0.49±0.01;Llama-2-13B在NonExistentRefusal上AttentionScore为0.87±0.01。表现好的估计器部分相关,MSP与CocoaMSP的Spearman ρ为0.90。
- 作者结论: 不确定性有信息,但只是有条件的。作者认为不应把任一估计器当作通用幻觉检测器,而应按目标任务、对生成器的访问权限、计算预算和目标设置上的验证来选:无logit时可考虑黑盒Eccentricity,有白盒时MSP、CCP及相关方法是默认族,AttentionScore在上下文忠实性与弃权上更有用。