跳到正文
原文
论文追踪· arXiv:2602.11167· Nathan Mao, Varun Kaushik, Shreya Shivkumar, Parham Sharafoleslami, Kevin Zhu, Sunishchal Dev·本站收录 · 原文发表

通过内部状态分析与聚类可视化并评测 LLM 事实幻觉倾向

Visualizing and Benchmarking LLM Factual Hallucination Tendencies via Internal State Analysis and Clustering

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

FalseCite测虚构引用;GPT-4.0-mini随机引用幻觉率63.62%,无引用23.97%(表2)。

问题
虚构引用会不会让模型更把虚假陈述说圆。作者认为医疗、法律等场景里幻觉关系应用是否可信;TruthfulQA与HaluEval主要看回答对错,较少单独测引用。
方法
FalseCite把FEVER、SciQ假陈述配上模板生成的虚构引用,分随机配对与语义配对(stella嵌入,取最高余弦相似度)。GPT-4.1标注幻觉。随机引用条件下用Spearman选层,再做PCA与k-means。
实验与结果
三个模型在虚构引用下的幻觉率都高于无引用,随机引用高于语义引用。Table 2中GPT-4.0-mini无引用23.97%,随机63.62%(Δ +39.65),语义61.00%。作者称隐藏状态呈horn形,聚类没有明显分开幻觉。
局限与可以继续做的
作者在Limitations把GPT-4.1专家标注列为主要关切,并写明更希望人工或RAG,但缺少时间与RAG访问。实验包括三模型与三种引用条件;论文未报告送评条数、重复次数、所选k,以及激活捕获用的是哪两个模型。
实验设置GPT-4o-mini、Falcon-7B 等 · FalseCite、FEVER 等 · hallucination rate、Δ 等
被测模型
GPT-4o-miniFalcon-7BMistral-7B
基准
FalseCiteFEVERSciQHALUEVAL
指标
hallucination rateΔUnsure rate
AI 导读研究者提出 FalseCite 数据集,用误导性或伪造引用诱发大语言模型的幻觉回答,并据此对 GPT-4o-mini、Falcon-7B 和 Mistral 7-B 进行评测,发现带欺骗性引用的虚假主张会明显加剧幻觉活动,GPT-4o-mini 尤为突出。基于这些回答,作者对幻觉模型的隐藏状态向量进行可视化与聚类,观察到无论是否幻觉,隐藏状态向量都倾向于呈现独特的角状(horn-like)形态。该工作发表于 IJCNLP-AACL SRW 2025,作者称 FalseCite 可作为未来评测与缓解 LLM 幻觉的基础。

研究者提出 FalseCite 数据集,用误导性或伪造引用诱发大语言模型的幻觉回答,并据此对 GPT-4o-mini、Falcon-7B 和 Mistral 7-B 进行评测,发现带欺骗性引用的虚假主张会明显加剧幻觉活动,GPT-4o-mini 尤为突出。基于这些回答,作者对幻觉模型的隐藏状态向量进行可视化与聚类,观察到无论是否幻觉,隐藏状态向量都倾向于呈现独特的角状(horn-like)形态。该工作发表于 IJCNLP-AACL SRW 2025,作者称 FalseCite 可作为未来评测与缓解 LLM 幻觉的基础。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    问题是虚构引用会不会放大对虚假陈述的幻觉,以及内部状态能否分开幻觉。

    虚假陈述加上虚构引用后,模型会不会更把假话说圆;隐藏状态能否分开幻觉与非幻觉。

    • 场景:作者认为幻觉是生成看似合理、但事实错误、与前文矛盾或无关的内容。在医疗或法律等敏感领域,作者引述这会动摇应用的可靠性(引言,Rawte et al., 2023)。
    • 现有不足:作者称 TruthfulQA 与 HaluEval 主要在回答层面看对错,对虚构或误导性引用如何放大幻觉、让模型更有把握地支持虚假主张,仍缺少专门资源。
    • 作者说法:配上虚构引用后,模型更可能再写支持性但虚构的内容。作者分出引用驱动(引用不可信仍反复依赖)与内容驱动(先写错,再用生成的推理去支撑)。引言称效应在较小模型上尤其明显;摘要称在 GPT-4o-mini 上尤其明显。两处不一致,数字见第 4 问。
    • 提出:FalseCite。摘要称含 82k 条公开来源的虚假主张,分无引用、随机引用、语义引用。隐藏状态聚类是补充;作者称可视化不是主要重点。

    论文没有 white-box、black-box 等说法。输入是语义相同的虚假陈述,可带或不带伪造引用。被测模型为 GPT-4o-mini、Falcon-7B、Mistral-7B。是否幻觉由无联网的 GPT-4.1 标注,因此不能核验出处是否真实。

  2. 有哪些相关研究?

    论文讨论TruthfulQA、HaluEval与Huang等人综述,对照是同一陈述的无引用条件。

    引言和 Related Works 讨论的相关工作不多,没有与其他检测方法比分数。

    事实性与幻觉基准

    • TruthfulQA(Lin et al., 2022):用专门设计、意在引出幻觉的问题,评测问答里的事实准确性。论文转述:模型常以看似合理的语言掩盖不准确,且难以把语言流畅和主张真伪分开。
    • HaluEval(Li et al., 2023):评测开放生成中不能只靠事实知识核验的幻觉倾向。引言把它与 TruthfulQA 并列,称二者都偏回答层正确性,引用的作用仍少被单独考察。

    幻觉综述与定义

    • Huang et al. (2025):综述幻觉,汇总多种测试的定量结果,并给出幻觉类别,其中包括本文关注的事实性幻觉。论文转述该综述的一条模式:较小模型比更大模型更少幻觉。论文没有批评这篇综述。
    • 引言用 Xu et al. (2025) 与 Huang et al. (2025) 界定幻觉,用 Rawte et al. (2023) 说明医疗、法律应用的关切。这两处是定义和动机,没有方法对比。

    语料来源

    • FEVER(Thorne et al., 2018):短声明,标成真或假;非科学,偏流行文化、政治、历史。
    • SciQ(Welbl et al., 2017):科学考试式问答,用来改写成科学类虚假陈述。论文称二者合在一起,是为了不把评测限制在单一文风或学科。

    基线与基准

    • 对照是同一虚假陈述的无引用版本。随机配对被作者称为 baseline,用来排除效应只来自精心对齐的引用–主张对。语义配对表示引用与主题一致。专家模型在 HALUEVAL 上测过准确率。论文没有把别的幻觉检测方法的分数当作对照。

    作者的定位:现有资源主要停在回答是否事实正确;FalseCite 用同一假陈述的有无虚构引用,覆盖一般知识与科学内容。聚类被作者称为补充,不是主要重点。

  3. 论文如何解决这个问题?

    FalseCite用随机与语义虚构引用配对假陈述,再按注意力相关选层并聚类。

    FalseCite 把同一条虚假陈述做成无引用、随机虚构引用、语义匹配虚构引用三种输入,看引用是否改变幻觉率;再用注意力统计与幻觉标签的相关选出层,对隐藏状态做 PCA 与 k-means。

    虚假陈述从哪来

    • FEVER:只用标为 false 的声明,约 47k 条;非科学,偏流行文化、政治、历史。
    • SciQ:每题对应三个错误答案,写成陈述句,结构是 “the answer to {question} is {incorrect answer}”,得到 35k 条科学类虚假陈述。
    • 摘要把二者合称为 82k 条虚假主张。论文写 around 47k,因此不宜把 82k 理解成两个整数的精确和。

    虚构引用怎么配

    • 用来源名称和预先写好的引用模板做 mix-and-match。模板是带 source 占位符的短语框架。正文举了两类框架;来源和模板的完整列表在附录 B,这里不逐条列出。
    • 随机配对:主张与引用随机组合。作者称为 baseline,使观察到的效应不依赖于精心对齐。
    • 语义配对:用 NovaSearch/stella_en_1.5B_v5 为主张和引用做嵌入。论文写 iteratively paired,每条主张配余弦相似度最高的引用;未写是否互斥分配。作者称这更接近引用与主题一致、因而更有说服力的情形。
    • 作者想区分三种可能:幻觉只因“出现了引用”;语义对齐后进一步升高;或语义对齐反而降低。Table 1 只给三种列的结构示例。

    谁来判定幻觉

    • 因资源不足,用 GPT-4.1 作专家模型,标注响应是否幻觉。作者报告它在 HALUEVAL 上的准确率为 75.2%,并据此认为它识别幻觉响应相当准确。
    • 该 API 无联网,不能确认被引来源是否真发表过相应材料。作者称这是 core issue,并指示:无法确认出处时,按主张本身而不是按引用判断。
    • Figure 1:引用看起来可信时,专家模型把 Mistral-7B 的虚假引用响应标成非幻觉。Figure 2:引用完全不可信时,仍标为幻觉。
    • 附录 A 另有 Unsure:专家模型无法核验测试模型响应的事实准确性。

    激活捕获

    • 目标:每条幻觉响应抽 5 个向量,对应生成中最重要的层;另从一组非幻觉响应抽出每一层作对照。
    • 选用 Random Citation。作者写两个测试模型在随机引用的虚假主张上幻觉更多。论文未点名这两个模型。
    • 专家模型做 token 级标注:1 为幻觉 token,0 为事实性内容(Figure 3)。
    • 生成后得到 hidden states 与 attention 两个元组。Figure 4 取当前生成 token 对输入序列的注意力,跨该层所有 head 聚成一个 attention vector。
    • 每个 attention vector 压成 mean、max、entropy(Table 3 是 mean 的示例)。对每条响应,分别用幻觉标签对这三列做 Spearman 相关,得到层排序,再对三种统计的名次取平均,留下前五层。
    • 存表(Table 4):response index、层号、幻觉标签,以及 4544 维的 aggregated hidden state vector。幻觉响应对应 5 个层向量,非幻觉响应对应 32 个层向量。论文未写隐藏状态跨 token 如何聚成这 4544 维。

    聚类

    • PCA 降到 100 维,再 k-means。
    • 选 k:看簇内幻觉率离 0% 或 100% 有多近。作者举例,20% 的簇得 20 分,95% 的簇得 5 分;选使所有簇平均分最小的 k。论文未报告最终 k,也未报告各簇幻觉率。
  4. 论文做了哪些实验?

    三模型在随机引用下幻觉率最高;表2中GPT-4.0-mini从23.97%到63.62%。

    实验设置

    • 被测模型:GPT-4o-mini、Falcon-7B、Mistral-7B。作者称前者相对更大,后两者更小,且都擅长推理(Almazrouei et al., 2023;Jiang et al., 2023)。Table 2 表头写作 GPT-4.0-mini,附录 A 标题又写作 GPT-40-mini。下面引用表中数字时沿用表头写法。
    • 数据与条件:FalseCite 的无引用、随机引用、语义引用。FEVER 约 47k,SciQ 35k,摘要称 82k。论文未报告实际送入三个模型的条数。
    • 标注与指标:GPT-4.1;HALUEVAL 准确率 75.2%;无联网。指标是 Hallucinated 百分比,以及相对无引用的绝对增量 Δ。附录 A 另报 No 与 Unsure。论文未报告重复次数,也未报告与人工标注的一致性。
    • 内部状态:Random Citation;Spearman 选前五层;PCA 到 100 维后 k-means。论文未报告激活子集大小和所选 k。

    主结果

    据 Table 2(Unsure 未计入):

    表格较宽,可左右滑动

    模型(表头)无引用随机引用(Δ)语义引用(Δ)
    Falcon-7B62.45%77.91%(+15.46)70.83%(+8.38)
    Mistral-7B34.56%53.28%(+18.72)45.82%(+11.26)
    GPT-4.0-mini23.97%63.62%(+39.65)61.00%(+37.03)
    • 作者称虚假引用在所有模型上都会放大幻觉;随机引用增幅最大,语义引用增幅较小,但仍高于无引用。作者把相对无引用的变化称为清晰且幅度大的上升。
    • 作者称 Falcon-7B 与 Mistral-7B 的随机–语义差距大于 GPT-4o-mini,并认为更可信的引用更能骗过能判断引用是否可能为真的更稳健模型。作者还称 GPT-4o-mini 基线最低,两类引用下的增幅最大。
    • 引言写该效应在较小模型上尤其明显。Table 2 的 Δ 最大的是 GPT-4.0-mini(+39.65、+37.03),不是两个 7B 模型。基线幻觉率则是 Falcon-7B 最高、GPT-4.0-mini 最低。

    附录 A 的 No 与 Unsure

    Table 5 在 Hallucinated 之外给出 No 与 Unsure。Unsure 指专家模型无法核验测试响应的事实准确性。下表顺序均为无引用 / 随机 / 语义。

    模型NoUnsure
    Falcon-7B34.03% / 16.44% / 21.44%3.52% / 5.65% / 7.73%
    Mistral-7B59.36% / 32.83% / 41.25%6.08% / 13.89% / 12.93%
    GPT-4.0-mini76.03% / 36.38% / 39.00%0.00% / 0.00% / 0.00%
    • Table 2 表注写 Unsure cases (14%) omitted。附录 A 的 Unsure 按模型和条件分开,并不是每个格子都是 14%。GPT-4.0-mini 三种条件的 Unsure 都是 0.00%。
    • 有引用时,Falcon-7B 与 Mistral-7B 的 No 都低于无引用;语义条件下的 No 高于随机条件。作者未单独解释 Unsure 为何随模型变化。Figure 1 说明:引用看起来可信时,专家模型会把响应标成非幻觉。论文未报告这类标注的比例。

    激活捕获与聚类

    • 随机引用条件下,用 Spearman 相关在 mean、max、entropy 上给层排序,取平均名次的前五层;非幻觉响应保留 32 层。向量维度 4544(Table 4)。论文未报告参与捕获的响应条数,也未点名 “two test models”。
    • 作者称 Figure 5 中隐藏状态向量呈 horn 形,并说这是隐藏状态随各层注意力演化的形状;摘要称无论幻觉与否都如此。作者称聚类本身没有明显模式;图上靠上的两个簇幻觉率略高,但未给出这两个簇的百分比。图注只说左图是簇、右图按层上色,文本未给出颜色与层号的对应,也未给出坐标轴名称。
    • 引言把该分析指向 Figure 2。正文 Figure 2 的图注是 GPT-4.1 将 Mistral-7B 的不可信虚假引用标为幻觉。聚类图是 Figure 5。

    定性例子

    • 附录 C 用四组例子说明不同触发方式,这里不复述具体主张或输出。Table 6(Falcon-7B):无引用与两种引用都幻觉。Table 7(GPT-4o-mini):只有带引用的响应幻觉。Table 8(Falcon-7B):只有语义引用的响应幻觉。Table 9(GPT-4o-mini):随机引用下模型编造归因;表注称对科学术语的纠正本身可以成立。
    • 这些是示例。论文未报告各类模式的比例。

    其他消融与分析

    • 方法节把“语义对齐反而降低幻觉”列为待检验可能。Table 2 中语义引用仍高于无引用,低于随机引用;作者未把这写成降到基线以下。
    • 选 k 的 20 分、5 分只是方法举例,不是簇的实测幻觉率。论文未报告 k、送评条数、重复次数。
    • GPT-4.1 在 HALUEVAL 上的 75.2% 是标注器准确率,不是三个被测模型的幻觉率。
  5. 有什么可以进一步探索的点?

    作者把GPT-4.1专家标注列为主要关切,更希望用人工或RAG。

    作者指出的局限与后续方向

    • 专家标注(第 6 节 Limitations):作者写 GPT-4.1 流程是主要关切。更希望人工标注或 RAG,但缺少时间,也没有 RAG 访问,因而使用 GPT-4.1。作者称该选择省时,标注仍然相当成功。
    • 论文没有 Conclusion 或 Future Work 节。摘要称 FalseCite 有潜力成为未来评测和缓解幻觉的基础;这不是 Limitations 里列出的后续实验。

    实验覆盖范围

    • 生成侧被测模型为 GPT-4o-mini、Falcon-7B、Mistral-7B 三个;表头另写作 GPT-4.0-mini、GPT-40-mini(Table 2、附录 A)。
    • 条件为无引用、随机引用、语义引用。语料为 FEVER 假声明(约 47k)与 SciQ 假陈述(35k);摘要称 82k。
    • 标注者为 GPT-4.1,并报告其在 HALUEVAL 上的准确率 75.2%(第 4 节)。附录 A 给出 Yes、No、Unsure。
    • 激活捕获使用 Random Citation;幻觉响应每条 5 个层向量,非幻觉响应每条 32 个;隐藏状态 4544 维;PCA 到 100 维后 k-means(第 5 节,Table 3、Table 4、Figure 5)。
    • 论文未报告送入模型的条数、重复次数、所选 k、激活捕获的模型名称与响应数量,以及专家标注和人工标注的一致性。
  6. 总结一下论文的主要内容

    作者报告虚构引用提高幻觉率且随机更高;隐藏状态呈horn形但未分开幻觉。

    FalseCite 用来测虚构引用会不会提高模型在虚假陈述上的幻觉率,并顺带看隐藏状态聚类能否分开幻觉。

    • 问题:回答层基准较少单独考察引用。作者要的是同一假陈述在无引用、随机虚构引用、语义匹配虚构引用下的差异。
    • 数据:FEVER 的 false 声明(约 47k)与 SciQ 改写的科学假陈述(35k);摘要称 82k。引用由来源名和模板拼出。语义配对用 NovaSearch/stella_en_1.5B_v5 的余弦相似度。
    • 判定与模型:GPT-4o-mini、Falcon-7B、Mistral-7B 生成,GPT-4.1 标注。该标注模型无联网,在 HALUEVAL 上的准确率为 75.2%。表头把前者写成 GPT-4.0-mini。
    • 主数字(Table 2):无引用幻觉率 Falcon-7B 62.45%、Mistral-7B 34.56%、GPT-4.0-mini 23.97%。随机引用为 77.91%、53.28%、63.62%,Δ 为 +15.46、+18.72、+39.65。语义引用的 Δ 为 +8.38、+11.26、+37.03,都低于随机、高于无引用。GPT-4.0-mini 的 Unsure 为 0.00%(附录 A)。
    • 内部状态:作者称向量呈 horn 形,与是否幻觉无关;k-means 没有明显分开幻觉。附录 C 只给定性例子,没有各类比例。引言指向的 Figure 2 与正文图注不一致,聚类图是 Figure 5。
    • 作者结论:虚假引用会放大幻觉,随机引用强于语义引用;更可信的引用对更能分辨引用真伪的模型更有效。作者把专家标注视为主要关切,并称 FalseCite 可作为后续评测与缓解的基础。引言“较小模型上尤其明显”与 Table 2 的最大 Δ 不在同一模型上。
阅读原文arxiv.org