研究提出 Fact-Ablated Evaluation,揭示 LLM 事实核查更依赖参数知识
Evaluating and Improving Evidence-Grounded Fact-Checking in LLMs via Multi-Round Evidence Ablation
作者提出 FAE 与 REAL:在 FEVER 上,Llama-3.1-8B 的 REAL 将 Strict 从 76.27 提到 94.28,IS 从 43.79 提到 99.06(Table 1)。
- 作者认为,LLM 作为事实核查器时,即使标签准确,也可能依靠参数知识而非所给证据;标准指标只评一次标签,测不出证据与判决的因果依赖。
- FAE 迭代删除模型自己引用的证据并重新判定,用 IS、ER、IO 量化依赖。REAL 在完整证据与删除金标证据后的 NEI 上做对比监督,并用多模型补充证据注释。
- Table 1 中,在 FEVER 上 REAL(Llama-3.1-8B)的 Strict 为 94.28、IS 为 99.06,高于所列现成模型。Table 2 中去掉证据消融后 IS 降到 10.80。域外 SciFact、Climate-FEVER 上 REAL 的 Acc/Strict 最高,Check-COVID 上 Acc 为 88.90。
- 作者在 Limitations 中称:只用文本证据、只训练于 FEVER、假设证据已检索、消融按固定轮数。实验覆盖四个数据集、R=4,并排除了 NEI 声明。
- 模型
- GPT-4o-miniGemini-2.5-flash-liteQwen-2.5-32B-InstructLlama-3.1-8B-InstructQwen-2.5-7B-InstructREAL (Llama-3.1-8B-Instruct)REAL (Qwen-2.5-7B-Instruct)
- 基准
- FEVERSciFactClimate-FEVERCheck-COVID
- 指标
- Label AccuracyStrict AccuracyPrecisionRecallF1Immediate Sensitivity (IS)End-State Retention (ER)Ideal Offset (IO)
研究者提出 Fact-Ablated Evaluation(FAE)评测框架,通过迭代消融被引证据来检验 LLM 是否会相应修改判断,结果显示现成 LLM 作为事实核查系统时更依赖参数知识而非所给证据。为缩小预测准确率与证据依赖之间的差距,作者提出 REAL(Rigorous Evidence Ablation Learning)训练框架,用反事实证据监督让作为核查器的 LLM 学会依赖证据。在四个不同领域的事实核查数据集上,用 REAL 训练的模型在证据依赖能力上优于标准微调模型。研究指出,强事实核查表现可以与弱证据依赖并存,REAL 能让判断更紧密地跟随支持证据是否可用。该工作已被 CIKM'26 接收。
深度解读
这篇论文试图解决什么问题?
LLM 事实核查即使标签准确,也可能不依赖所给证据;作者用 FAE 测、用 REAL 训。
LLM 作为事实核查器时,判决是否真的取决于所给证据,而不是参数知识;若不依赖证据,如何训出这种依赖。
- 场景:自动事实核查要判定声明真伪,并从文档或知识图谱检索、呈现证据。作者称这在公共卫生、法律等高风险场景里用于解释决策,并支持人类决策流程。
- 现有不足:RAG 中 LLM 可同时用检索证据与记忆知识;参数知识可过时或含训练误差。标准指标只评一次标签准确性,不检查证据与预测的因果依赖。Figure 1 中,LLaMa3-8B-Instruct 在 FEVER 上即使真实证据被删,仍维持 SUPPORT,并改引其他句子或不给证据。
- 核心观察:作者假设 Ha:训练中获得的参数知识会干扰严格依据证据的核验。对 SUPPORT/REFUTE,依据证据的核验器应在支持证据被删后立即改为 NOT_ENOUGH_INFO。
- 提出的方法:Fact Ablated Evaluation(FAE)通过迭代删除模型自己引用的证据,用 Immediate Sensitivity(IS)、End-State Retention(ER)、Ideal Offset(IO)量化决策是否随证据改变。REAL(Rigorous Evidence Ablation Learning)用完整证据与消融证据的对比监督,训练模型在证据不再可用时改判 NOT_ENOUGH_INFO。
有哪些相关研究?
相关工作分为不相关上下文下的拒答、引用一致性评测,以及生成式接地对齐。
相关工作在 Related Work 中按三类组织,作者称它们都想减少对参数知识的依赖,但主要做在问答等生成任务上。
记忆与 RAG 接地
- 记忆:作者称 LLM 记住训练数据已是已确立的现象,并引用 Carlini 等 [5]、Nasr 等 [16]、Kandpal 等 [33]、Zhang 等 [69]。
- RAG 与拒答:采用 RAG 使接地与拒答机制成为研究对象 [18]。第一类工作研究检索文档不相关或不完整时模型如何处理 [31, 42, 56, 72],强调“知道自己不知道”并拒答,以减少幻觉。
评测框架
- 检索与生成误差:新指标与基准用于诊断检索和生成错误 [49, 53],测量答案与引用的语义一致性。
- 事实核查原则的简化:部分框架 [24, 54]用事实核查原则,但仍把 REFUTE 与 NOT_ENOUGH_INFO 合并成 NON-SUPPORT。
- 静态删除金标证据:Akhtar 等 [2] 删除金标证据以验证评测指标。作者称这种静态做法不能诊断模型是否真的用了该证据做决定。
方法改进
- 接地与对齐:多种适配与对齐策略用来加强接地 [25, 28, 73]。Song 等 [53] 训练模型在证据不足时拒答;Huang 等 [28] 训练模型把声明接到细粒度文本证据,而不是粗粒度文档标识。
- 标准微调:既有工作常在声明–证据对上做标准监督微调 [8, 34, 46, 52, 74],只暴露证据完整的条件。
基线与基准
- 基线方法:现成 LLM(GPT-4o-mini、Gemini-2.5-Flash-lite、Qwen-2.5-32B/7B-Instruct、Llama-3.1-8B-Instruct)以及标准 SFT;REAL 的主干是 Llama-3.1-8B-Instruct,消融里还用 Qwen-2.5-7B-Instruct。基准/数据集:域内 FEVER,域外 SciFact、Climate-FEVER、Check-COVID。
作者把本文定位为:事实核查要求细粒度标签,并要求判决对证据有显式因果依赖;FAE 动态删除的是模型自己预测的证据,而不是静态删除金标证据。
论文如何解决这个问题?
FAE 迭代删掉模型引用的证据并计 IS、ER、IO;REAL 用完整与消融两种监督训练拒答。
FAE 迭代删除核验器自己引用的证据并重新判定,用三个指标描述决策是否随证据消失而改变。REAL 在证据完整与证据被删两种条件上同时监督,并用多模型补充可能漏标的证据。
问题设定
给定句子集 S 与声明 c,事实核查系统 FC 输出真伪标签 l 与支持证据 E ⊆ S:FC(c, S) → (l, E)。标签集 L = {SUPPORT, REFUTE, NOT_ENOUGH_INFO/NEI}。系统最大化标签与证据子集的联合概率。
标准评测分两块:声明级的 Label Accuracy,以及标签正确且至少命中一句金标证据才算对的 Label-Evidence Joint(Strict)Accuracy;证据选择用预测集与金标集的 Precision、Recall、F1。
FAE 的消融过程
- 第 0 轮:FC 在完整证据上得到 (l(0), E(0)),然后 S1 = S \ E(0)。
- 迭代:每轮 r 删掉该轮预测证据 E(r),用剩余句子再判定。固定轮数 R 后停止。实验取 R = 4,作者称此时准确率已进入平台;再删会让模型幻觉不存在的证据编号(Figure 1 的第三种失败)。
- 理想轨迹:初始为 SUPPORT 或 REFUTE 后,理想核验器应在支持证据被删后改为 NOT_ENOUGH_INFO。Figure 2 上半对照了实际仍维持 Refute 与理想改为 Not Enough Information。
FAE 指标
先把每轮准确率用第 0 轮归一化:gr = ar / a0。a_r 是第 r 轮准确率。
- IS = 1 − g1:第一次消融后准确率是否立即下降。作者称高 IS 表示初始判决直接依赖所引证据;低 IS 表示判决未变,可能是证据选错或对所引证据依赖有限。
- ER = 1 − g_R:最后一轮是否仍保留非 NEI 判决。作者称低 ER 表示证据完全消融后仍持续非 NEI,常与伪证据或缺失证据相关,并认为决策更像由参数知识驱动。
- IO:IO = 1 − (1/R) ∑r=1R ar。作者称它惩罚中间轮仍保持高准确率的核验器,奖励消融后快速且持续的下降;计算用 a_r 而不是 g_r,且不依赖 a0。
神经元对照
作者定义两种范式:evidence-based 只用所给证据;knowledge-based 去掉证据列表,促使模型完全依靠参数知识。按先前工作 [55],在校准集上记录神经元激活,按幅度排序,取累计占总信号 90% 的神经元为高相关神经元,两种范式分别取。Figure 4 标注重叠 73.3%,两侧各 13.3% 与 13.4%。
REAL 训练
每条训练样本是三元组 (c, S, l),E ⊆ S 为支持金标标签 l* 的金标证据。每条构造两种条件:
- Positive:完整上下文 S,目标输出 (l, E)。
- Negative:消融上下文 S_abl = S \ E*,目标输出 (NEI, ∅)。
目标为两项负对数似然之和:完整证据下对 (l*, E*) 的似然,加上消融证据下对 (NEI, ∅) 的似然。第一项监督证据完整时的标准核验,第二项惩罚证据被删后仍保持原判决。
Evidence Enhancement:金标注释按充分性而非穷尽性设计 [3, 15],消融后可能仍留有未标注的有效证据。作者用 GPT-4o-mini、Gemini-2.5-Flash-Lite、Qwen-2.5-32B-Instruct 各自标出支持句,保留多数模型支持的句子以扩充证据集,再用于构造消融上下文。
微调用 LoRA:rank 16、α = 32、dropout 0.05,加在 attention projection。AdamW,学习率 1×10^−4,全局 batch 32,最大序列长度 4096,只监督 assistant 输出(标签加证据句编号),训两个 epoch,固定随机种子。只在 FEVER 训练集上训练。
论文做了哪些实验?
四个数据集上,REAL 的 FAE 分数高于现成模型;去掉证据消融后 IS 大幅下降。
实验设置
- 被测模型:GPT-4o-mini、Gemini-2.5-flash-lite、Qwen-2.5-32B-Instruct、Llama-3.1-8B-Instruct;REAL 主干为 Llama-3.1-8B-Instruct。Table 3 另用 Qwen-2.5-7B-Instruct 及其 +REAL。证据增强用 GPT-4o-mini、Gemini-2.5-Flash-Lite、Qwen-2.5-32B-Instruct。
- 数据集:FEVER(185,445 条人写声明,对照 Wikipedia,句级注释);SciFact(1,409 条科学声明,对照论文摘要);Climate-FEVER(气候声明,对照 Wikipedia);Check-COVID(COVID-19 声明,对照科学与医学来源)。后三者的训练集规模论文未写。
- 划分:只在 FEVER 训练集上训练。域内测 FEVER 测试集;域外用 SciFact、Climate-FEVER、Check-COVID 的全部可用划分且不再训练。SciFact 排除测试集,因为共享任务中该集不可见 [65]。NEI 声明被排除,作者称其需要外部检索,会引入检索器质量与标签噪声。
- 基线:上述现成模型(无任务微调);Standard SFT(只用声明与金标证据对);w/o Evidence Ablation;w/o Evidence Enhancement。
- 指标:初始预测的 Prec、Rec、F1、Label Acc、Strict;FAE 的 IS、ER、IO,R = 4。论文未写重复次数与人工一致性。
- 问题:RQ1 域内准确性与接地;RQ2 域外迁移;RQ3 组件与架构消融;RQ4 表示空间动态。
主结果
Table 1 报告初始事实核查指标与 FAE 指标。下表只列 Label Acc、Strict 与三个 FAE 指标。
表格较宽,可左右滑动
模型(FEVER,Table 1) Acc Strict IS ER IO GPT-4o-mini 87.24 81.97 54.91 78.21 71.27 Gemini-2.5-flash-lite 80.78 78.46 75.15 98.33 90.72 Qwen-2.5-32B-Instruct 83.19 78.81 66.95 95.45 84.98 Llama-3.1-8B-Instruct 83.08 76.27 43.79 67.85 62.83 REAL 95.66 94.28 99.06 99.99 99.69 - 作者称:相对 Llama-3.1-8B-Instruct,REAL 把 FEVER 上的 label accuracy 从 83.08 提到 95.66,strict accuracy 从 76.27 提到 94.28;相对 GPT-4o-mini,strict 从 81.97 到 94.28,IS 从 54.91 到 99.06;相对 Gemini-2.5-Flash-Lite,IO 从 90.72 到 99.69。证据选择上 REAL 的 recall 85.89、F1 78.12 为表中最高,precision 为 71.64,低于 Qwen-2.5-32B-Instruct 的 79.51 与 Gemini 的 75.69。
- 域外:SciFact 上 REAL 的 Acc/Strict 为 89.39/84.86,IS/ER/IO 为 92.19/100/97.54;Climate-FEVER 为 74.86/68.69 与 95.58/100/98.82。Check-COVID 上 REAL 的 Acc 为 88.90,高于 GPT-4o-mini 的 88.60,但 Strict 为 83.65,低于 GPT-4o-mini 的 87.02;F1 为 61.97,低于 GPT-4o-mini 的 62.82。作者仍称 REAL 是表中唯一在全部数据集上同时保持较强核验准确性与较强证据依赖的框架。
- 曲线:Figure 5 的坐标轴为 Ablation Round(0–4)与 Accuracy(0–1.0),四个数据集各一幅,图例为 REAL、LLaMA-8B-Instruct、GPT-4o-mini、Gemini-2.5-flash-lite、Qwen-32B。作者称 REAL 在 FEVER 上第一轮后准确率快速下降,接近 Figure 3 的理想轨迹;基线停在非零平台。域外上作者称 REAL 约在两轮后接近零,域不匹配使它不是完全理想的立即下降。图中曲线端点数值未在正文逐点标出。Figure 3 纵轴为 Accuracy(0.0–1.0),横轴为 Ablation Round,图例为 Ideal verifier 与 Actual LLM verifier,对象为 Llama-3.1-8B-Instruct 在 FEVER 上、标注为 SUPPORT/REFUTE 的声明。
组件消融(Table 2)
测了 Standard SFT、去掉 Evidence Ablation(§5.1)、去掉 Evidence Enhancement(§5.2)与完整 REAL。
- 证据消融:FEVER 上 Standard SFT 的 IS/ER/IO 为 10.75/11.02/14.36,w/o Evidence Ablation 为 10.80/11.04/14.67,REAL 为 99.06/99.99/99.69。四个数据集上去掉该组件后 FAE 分数都处于个位数到二十几。作者称该组件是证据接地行为的主要来源,初始事实核查表现可以仍然较高。
- 反例:FEVER 上 Standard SFT 的 Acc 96.18、F1 79.99 高于 REAL 的 95.66 与 78.12;w/o Ablation 的 Strict 94.52 高于 REAL 的 94.28。SciFact 上 w/o Ablation 的 Acc/Strict 为 91.07/86.16,高于 REAL 的 89.39/84.86;Climate-FEVER 上 SFT 与 w/o Ablation 的 Acc 为 84.45 与 84.79,高于 REAL 的 74.86。Check-COVID 上 w/o Ablation 的 Acc 91.08 高于 REAL 的 88.90。去掉 Evidence Enhancement 后,FEVER 的 IS 仍为 98.82,接近 REAL 的 99.06;SciFact 上该变体 IS 92.79 高于 REAL 的 92.19,但 Rec 从 72.97 降到 42.06。作者称增强主要帮助证据召回,对 FAE 的边际改变较小。
- Table 2 与 Table 1 的不一致:Check-COVID 上 REAL 的 Prec/F1 在 Table 1 为 54.10/61.97,在 Table 2 为 58.95/65.03;Acc、Strict、Rec 与 FAE 三项两表相同。论文未解释这一差异。
换干与表示分析
- Qwen 干:Table 3 中,FEVER 上 Qwen-2.5-7B-Instruct 的 Acc/Strict/IS 为 81.94/77.18/59.95,+REAL 为 95.23/93.43/99.04。SciFact 上 +REAL 的 Acc/Strict 为 89.52/81.76,IS/ER/IO 为 86.71/99.86/95.73。Climate-FEVER 上 +REAL 的 Acc 78.83 高于基座 63.29,但 Rec 51.85 低于基座 53.45。Check-COVID 上 +REAL 的 Acc/Strict 为 90.49/83.05。作者称该框架不依赖单一架构。
- 表示空间:§7.4 在 FEVER 上提取最后一个 token 的隐藏状态,做 PCA,只看前两个主成分。Figure 6 上半为 Standard SFT,下半为 REAL,横轴为 Ablation Round 0 到 4,图例为 SUPPORT、REFUTE、NOT ENOUGH INFO。作者称 SFT 中 SUPPORT 与 REFUTE 在各轮仍与 NOT ENOUGH INFO 分开;REAL 从 round 1 起三类几得更近,到后期轮几在一起。论文未给出各类距离的数值。
- 神经元:Figure 4 标注两种范式重叠 73.3%,各有 13.3% 与 13.4% 的独有神经元。作者称这支持 Ha:核验器保留与参数知识相关的神经元信号,可能与所给证据竞争。校准集规模与模型名称论文未写。
其他消融与分析
- Table 2,SciFact:w/o Enhancement 的 Rec 42.06、Strict 67.40,REAL 为 72.97、84.86。
- Table 2,Climate-FEVER:SFT 的 IS 3.92,REAL 的 IS 95.58;SFT 的 Acc 84.45 高于 REAL 的 74.86。
- Table 2,Check-COVID:w/o Ablation 的 Strict 85.53,REAL 为 83.65;两者 IS 为 13.10 与 92.64。
- Table 3,Climate-FEVER:+REAL 的 F1 60.13 低于基座 60.71,IS 从 55.40 到 94.97。
- Table 1,Climate-FEVER:Gemini-2.5-flash-lite 的 Acc 为 48.62,为该表中最低的初始 Acc。
- 论文未报告统计显著性检验。
有什么可以进一步探索的点?
作者写明的局限是只用文本证据、只在 FEVER 上训练,以及证据已检索这一假设。
作者指出的局限与后续方向
- 证据形态:Limitations 称工作主要考虑文本证据;多模态、结构化或交互证据会引入额外接地挑战,留作未来工作。
- 训练域:Limitations 称模型只在 FEVER 上训练;虽然在域外数据上观察到迁移,在更多核验域上训练可能进一步改善泛化。
- 检索假设:Limitations 称工作假设相关证据已被检索;把该框架接到端到端检索仍是开放问题。
- 消融轮数:Limitations 称消融按固定轮数进行;自适应或学习到的停止准则可能更好地反映证据依赖。
- 可复现:Reproducibility 称代码已发布,训练用固定种子;闭源模型可能随接口更新而变,因此完全复现不能保证。
实验覆盖范围
- 被测的现成模型为 GPT-4o-mini、Gemini-2.5-flash-lite、Qwen-2.5-32B-Instruct、Llama-3.1-8B-Instruct;REAL 训在 Llama-3.1-8B-Instruct 与 Qwen-2.5-7B-Instruct 上(§6.1、Table 1、Table 3)。
- 评测数据集为 FEVER、SciFact、Climate-FEVER、Check-COVID;训练只用 FEVER 训练集;SciFact 不用测试集;NEI 声明被排除(§6.3)。
- FAE 取 R = 4;指标为 Label Accuracy、Strict Accuracy、Precision、Recall、F1、IS、ER、IO(§6.4)。论文未报告每个条件的样本量、重复次数与人工一致性。
- 消融比较了 Standard SFT、w/o Evidence Ablation、w/o Evidence Enhancement(Table 2);表示分析为 FEVER 上最后一个 token 隐藏状态的 PCA(§7.4、Figure 6)。
- 神经元分析比较 evidence-based 与 knowledge-based 两种范式,取累计 90% 信号的神经元(§4.2、Figure 4);校准集规模论文未写。
总结一下论文的主要内容
FAE 用多轮证据消融测接地,REAL 用对比监督让判决随证据可用性改变。
FAE 与 REAL 分别用来测量并训练 LLM 事实核查器对所给证据的依赖,而不只看一次性的标签准确率。
- 问题:作者认为,现成 LLM 在证据被删后仍可维持 SUPPORT 或 REFUTE,标准指标看不出这种对参数知识的依赖。
- FAE:每轮删掉模型当轮引用的句子再判定,R = 4。IS 看第一次消融后是否立即下降,ER 看最终轮是否仍保留非 NEI,IO 累计各轮相对理想轨迹的偏离。
- REAL:同一声明在完整证据上监督原标签与金标证据,在删掉金标证据后监督 NEI 与空证据。三个 LLM 多数表决用来补可能漏标的句子。主干为 Llama-3.1-8B-Instruct,只在 FEVER 训练集上训两个 epoch。
- 结果:FEVER 上 REAL 的 Acc/Strict/IS 为 95.66/94.28/99.06,Llama-3.1-8B-Instruct 为 83.08/76.27/43.79(Table 1)。去掉证据消融后 FEVER 的 IS 为 10.80(Table 2)。SciFact 与 Climate-FEVER 上 REAL 的 Acc 与 Strict 为表中最高;Check-COVID 上 REAL 的 Strict 83.65 低于 GPT-4o-mini 的 87.02。Climate-FEVER 上 Standard SFT 的 Acc 84.45 高于 REAL 的 74.86,但 IS 只有 3.92。
- 作者的结论:较高的事实核查准确率可以与较弱的证据依赖同时存在;REAL 使真伪判断更贴近支持证据是否仍在。作者计划把该框架扩到更多核验域、端到端检索和自适应停止。