跳到正文
原文
论文追踪· arXiv:2606.21155· Patty Liu, Dominik Stammbach, Peter Henderson·本站收录 · 原文发表

研究评测法律引用幻觉检测:GPT-5 在 agentic 框架下召回率 84.4%

Who Checks the Citations? Benchmarking Legal Hallucination Detection

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者在LePhantomCite测试集上评测,GPT-5智能体recall为84.4%、F1为55.0%。

问题
律师、法官与自行诉讼人用AI起草诉状,含伪造引用的文书已逾1,000件并逐年增加。作者称模型更新和制裁并未使问题自行消退,核验负担仍会增加,且此前没有基准评测AI能否核验法律引用。
方法
作者从真实文书归纳五类引用幻觉,构建LePhantomCite(1,300条):1,000条摘录注入一种错误,300条来自Dahl等人并经人工核对。BOED智能体可查法律库与网页,每条最多30步,并设非智能体对照。
实验与结果
八个ChatGPT、92条提示上,GPT-5.1的幻觉引用率为6.57%(高于2024年8月GPT-4o,pp=0.001)。测试集上GPT-5智能体recall为84.4%、F1为55.0%;Claude Code的F1为68.8%。
局限与可以继续做的
作者称半合成基准未必泛化到真实诉状的幻觉分布,宜视为核验难度的受控下界,且只在短摘录上评测。检测实验为Table 2的6个系统、测试集390条;论文未报告重复次数,也未说明主结果是否在真值更新后计算。
实验设置gpt-5-2025-08-07、Opus 4.8 等 · LePhantomCite、92 legal drafting prompts · Recall、Precision 等
被测模型
gpt-5-2025-08-07Opus 4.8Gemini 2.5 FlashQwen3.6-27BGPT-OSS 120BQwen3-8Bgpt-5.1-2025-11-13gpt-4o-2024-08-06gpt-4o-2024-05-13gpt-4o-2024-11-20chatgpt-4o-latestgpt-3.5-turbo-1106gpt-3.5-turbo-0125
基准
LePhantomCite92 legal drafting prompts
指标
RecallPrecisionF1citation hallucination rate
AI 导读研究团队提出基于真实法庭文件的法律引用幻觉分类体系,并构建了包含 1300 条注入错误的法律文书摘录数据集,用于评测 AI 系统能否自动检测伪造引用。他们发现超过 1000 份提交文件含有伪造引用,且数量逐年增长。在 agentic 与非 agentic 设置下对五个模型及 Claude Code 的基准测试显示,最新模型表现更好,GPT-5 在 agentic 框架下达到 84.4% 召回率和 55.0% F1 分数,但所有模型都难以处理细微错误类别。agentic 验证仍然资源密集,GPT-5 平均每条摘录需 15.3 步;信息访问受限也削弱了最佳 agent 的效果,这给缺乏商业法律数据库订阅的用户带来不利。

研究团队提出基于真实法庭文件的法律引用幻觉分类体系,并构建了包含 1300 条注入错误的法律文书摘录数据集,用于评测 AI 系统能否自动检测伪造引用。他们发现超过 1000 份提交文件含有伪造引用,且数量逐年增长。在 agentic 与非 agentic 设置下对五个模型及 Claude Code 的基准测试显示,最新模型表现更好,GPT-5 在 agentic 框架下达到 84.4% 召回率和 55.0% F1 分数,但所有模型都难以处理细微错误类别。agentic 验证仍然资源密集,GPT-5 平均每条摘录需 15.3 步;信息访问受限也削弱了最佳 agent 的效果,这给缺乏商业法律数据库订阅的用户带来不利。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    作者称引用幻觉率不再持续下降,并以LePhantomCite评测自动核验。

    如何自动核验法律文书里的引用幻觉,并为此提供可审计的基准。

    • 发生场景:作者称律师、法官和自行诉讼人(pro se)越来越多地用大语言模型起草诉状、动议等文书。伪造引用等于指向编造的法律。作者称含幻觉引用的法院文书已逾1,000件且逐年增加;法院称之为对对抗制的滥用,法官反复称由此带来的负担浪费司法资源。
    • 既有预期:作者称一种流行看法是,模型改进和高调制裁会使问题暂时化。作者称其发现和近期情况挑战了这一看法:真实文书中的幻觉引用仍在增加,且8个ChatGPT代际在同一92条起草提示上的幻觉引用率并非持续下降。2024年中GPT-4o为1.23%,早先GPT-3.5约25%;GPT-5.1为6.57%。§2称后者高于2024年8月的GPT-4o(bootstrap,pp=0.001);引言写p=0.001。论文未给出该8月版本的具体比率。
    • 负担的另一维:即便单条幻觉率下降,新模型每份文书引用更多,且更多指向较少被引用的案件。Figure 2中,GPT-3.5所引案件的被引用次数中位数逾500,GPT-4o最低为105。作者援引Chang(2026),称起草成本下降会推高文书总量,核验负担仍会增加。
    • 缺口与提出的工作:作者称既有研究多评测法律解释、摘要或问答是否正确,没有基准评测AI能否核验法律引用。本文给出源自真实文书的五类分类、1,300条摘录的LePhantomCite,以及智能体与非智能体核验评测。
  2. 有哪些相关研究?

    作者称既有法律幻觉研究多评生成文本是否正确,而非文书内引用核验。

    既有法律幻觉评测主要看生成文本是否正确;作者把任务改到文书内的判例引用。

    法律任务中的幻觉评测

    • 摘要与解释:Deroy等人(2023)、Feijo与Moreira(2021)做封闭域法律摘要;Savelka等人(2023)评测法律概念解释。论文对此作描述,没有逐篇对照本文。
    • 开放域问答:Dahl等人(2024)、Fan等人(2026)、Hu等人(2025)评测开放域法律问答中的幻觉。作者把它们与上述基准放在同一组,称重点是生成法律文本是否正确。

    法律幻觉分类

    • 三类分类工作:Dahl等人(2024)提出一般法律幻觉分类;Magesh等人(2025)将其扩展到检索增强生成;Hou等人(2024)刻画人工法律分析与机器生成分析之间的gaps,其中包括幻觉。
    • 作者的对照:作者称这些分类仍以生成文本的正确性为中心。本文针对嵌在文书中的判例引用,作者称这是法院里最常见的幻觉。

    格式正确与事后检测

    • Bluebook:Dahl(2025)评测模型能否生成格式正确的Bluebook引用。作者称这是最接近的工作,但是封闭域的格式任务;本文问的是引用信息是否正确。
    • 事后检测:Chakraborty等人(2025)综述事后幻觉检测与修正。一类需要接触原生成过程,如多次采样(Manakul等人,2023;Mündler等人,2024;Yehuda等人,2024)或专门提示(Yu等人,2024);另一类独立于生成器,包括外部判别器(Chen等人,2023b)和查询外部来源以核验或修正摘要(Chen等人,2023a)。作者称本文属于后一类。

    基线与数据

    • 基线:Table 2的非智能体设置,是同一提示去掉信念更新和动作选择;Claude Code加Opus 4.8用其自有harness作对照。评测数据是LePhantomCite测试集。趋势实验另用92条法律起草提示,以CourtListener和Westlaw核对引用。

    作者称此前没有基准评测AI系统核验法律引用的能力,并把本工作称为朝自动核验迈出的一步。

  3. 论文如何解决这个问题?

    LePhantomCite注入五类引用幻觉,并用BOED智能体对照非智能体核验。

    LePhantomCite在上诉状摘录中注入五类引用幻觉,再用可检索法律库的BOED智能体做核验。

    分类与任务

    任务是从摘录中检索幻觉片段。分类来自法院讨论过的失败模式。真实引用可以同时含多类,但构建时每条引用只注入一类。

    • 不存在的引用:改reporter卷号、缩写或页码,使之不指向任何真实案件。
    • 案名不匹配:reporter与案名分别指向两个真实案件;替换案名或reporter。
    • 错误pincite:案件正确,但所标页不支持被引语句或命题。pincite指来源中的具体页或段。
    • 逐字误引:引号内文字并不出现在该案中。作者用语义相近的同义词替换一到两个词,并称句意保持不变,从而与内容误述分开。
    • 内容误述:案件存在,但不支持被引命题。除改写要旨外,作者加入Dahl等人(2024)的Large Legal Fiction例子。

    数据构建

    1. 经CourtListener收集2012年1月至2021年12月、13个美国联邦上诉法院的上诉状。限制在2022年前,以降低源文书本身含AI生成内容的可能;选上诉法院是为了基线引用质量。正文称摘录来自245份文书。附录写下载323份PDF、抽出27,949条不同引用,并去掉超过200条引用的文书,余279份。
    2. olmOCR把PDF转为文本,微调过的RoBERTa做句子切分,Llama-3.3-70B-Instruct组成语义段落,得到5,648段,再抽1,000段。排除目录和无判例引用的段落。
    3. Qwen3-32B抽取案名、引语和要旨,且必须是原文的精确子串。附录A5.1给出抽取与改写提示词。
    4. 500段(50%)含注入幻觉。作者称该比例用于平衡评测,并不反映生成文书中的真实幻觉率。附录A1.2另写:切段前向80%的文书注入,因为含幻觉的文书仍会留下许多无幻觉段落。不存在引用和案名不匹配在整份文书内全局替换,以免模型靠别处的正确出现发现错误。
    5. 另加300条Dahl等人(2024)的central holding,并改成与摘录一致的输入。原标签来自两次模型输出是否一致,不是真值。作者对照Westlaw复核全部300条,得到42条确认为非幻觉。合并后1,300条、4,499个引用实例,其中1,107个含幻觉。Figure A4:不存在158、案名不匹配189、错误pincite 177、逐字误引167、内容误述416。

    内容误述另有一位资深作者复核40条,同意95%,其余为边界情况(附录A1.2)。

    智能体

    核验系统基于贝叶斯最优实验设计(BOED),作者称与Zheng等人(2026)及Choudhury等人(2026)、Lidayan等人(2026)、Murphy(2026)的框架相近。信念状态是语言记录,每步更新,跟踪抽取出的引用、引语、要旨,以及每项为correct、hallucinated或pending。作者称引用核验是顺序且依赖信息的,因此用信息导向搜索。作者另试过Reflexion(Shinn等人,2023),称动作序列变长后它难以记住当前判断,BOED的信念状态用来处理这一点。

    智能体有八个动作(Table A4):CourtListener引用查找、站内检索、网页检索、获取意见、本地意见检索、阅读文档、笔记和思考。每条摘录最多30步。作者称Figure A4(a)中每段引用少于18条、中位数为2,因此认为30步足够。非智能体使用同一提示,但去掉信念更新和动作选择。附录A5给出完整智能体提示词。

    另评Claude Code,模型为Opus 4.8,effort为默认的high,max_turns=30,经MCP使用WebSearch、WebFetch和CourtListener,提示与非智能体基线相同。

    判定

    预测片段与真值片段只要互为子串即算匹配,略长或略短的跨度仍可算对。真阳性是至少命中一条真值的预测数。Precision为真阳性除以预测数,Recall为真阳性除以真值数,F1为二者的调和平均。模型输出片段时不标注类型,因此作者称按类型算precision并不准确,Table A6只报告recall。

    附录A1.4:作者检查GPT-5在不存在引用、案名不匹配、逐字误引上的假阳性后,把原诉状中的明确笔误写入真值(Table A1),并设可选跨度(Table A2):命中算真阳性,未预测不算假阴性。论文未说明Table 2是否在这次更新之后计算。

  4. 论文做了哪些实验?

    测试集上GPT-5智能体recall为84.4%、F1为55.0%;Opus 4.8的F1为68.8%。

    检测主结果在390条测试摘录上比较智能体与非智能体;引用幻觉率趋势是另一组实验。

    实验设置

    • 趋势实验:Figure 2列出的8个模型,均为当时浏览器免费档ChatGPT的默认模型:gpt-3.5-turbo-1106、gpt-3.5-turbo-0125、gpt-4o-2024-05-13、gpt-4o-2024-08-06、gpt-4o-2024-11-20、chatgpt-4o-latest、gpt-5-2025-08-07、gpt-5.1-2025-11-13。同一92条起草提示,共产生逾8,000条引用,用CourtListener和Westlaw核对。幻觉指不对应真实案件,或案名与Westlaw中该reporter所指案名不一致。作者称这只覆盖最明显的幻觉,是总体发生率的保守下界。
    • 检测模型:Gemini 2.5 Flash、GPT-5(gpt-5-2025-08-07)、GPT-OSS 120B、Qwen3-8B、Qwen3.6-27B,以及Claude Code配Opus 4.8。Table A5把对应本地配置写成Qwen3.5-27B(FP8)。论文未说明这两个名称是否同一模型。
    • 数据与划分:LePhantomCite共1,300条,70–30划分,评测只在测试集390条上运行。全文4,499个引用实例,1,107个含幻觉。论文未说明训练集用途。
    • 运行设置:BOED的max_steps=30。非智能体用同一提示,无信念更新和动作选择。Claude Code的max_turns=30,effort为high。Table A5中温度为0.8;GPT-5的max tokens为10,000,其余为8,192。
    • 指标与评审:宽松子串匹配下的Precision、Recall、F1。没有LLM裁判。论文未报告重复次数,也未说明Table 2中±的含义。

    主结果

    单位为%,±照录Table 2。Claude Code用自有harness,非智能体栏论文为「-」。

    模型智能体 P / R / F1非智能体 P / R / F1
    GPT-540.8±4.3 / 84.4±4.2 / 55.0±4.236.9±4.5 / 58.2±5.2 / 45.2±4.2
    Claude Code(Opus 4.8)76.1±5.6 / 62.8±5.6 / 68.8±4.6未报告
    Gemini 2.5 Flash16.9±2.4 / 66.9±5.1 / 27.0±3.325.3±4.2 / 43.5±5.9 / 32.0±4.4
    Qwen3.6-27B28.9±4.1 / 65.0±5.1 / 40.0±4.445.9±7.8 / 31.5±5.4 / 37.4±5.7
    GPT-OSS 120B21.1±3.2 / 55.1±5.8 / 30.5±4.014.9±3.0 / 30.7±5.5 / 20.0±3.7
    Qwen3-8B12.0±2.2 / 41.1±6.0 / 18.6±3.114.6±2.8 / 35.1±5.4 / 20.7±3.5
    • 作者解读:作者称BOED的recall高于非智能体,并称GPT-5在该框架下整体最好。表中F1与precision并非一律更高:Gemini 2.5 Flash、Qwen3-8B的非智能体F1更高,Qwen3.6-27B的非智能体precision更高。
    • 26.2%与Claude Code:作者称智能体检索使GPT-5的recall提高26.2%。Claude Code的precision与F1为表中最高,recall低于GPT-5、Gemini 2.5 Flash和Qwen3.6-27B。作者称其平均每条15.4次工具调用。
    • 步数:GPT-5平均15.3步。作者称这是第二高;Table A7中GPT-OSS 120B为16.8,Qwen3-8B为7.5。作者称GPT-5把38.9%的动作用于查看已取回意见;Table A7中SEARCH_LOCAL_OPINION为37.3%,READ_DOCUMENT为1.6%。

    分类型recall

    • GPT-5:Table A6中,不存在引用与案名不匹配均为100.0±0.0,与Gemini 2.5 Flash并列;错误pincite为52.8±16.1,逐字误引为95.2±6.1,内容误述为83.2±6.4。引言把后三个数字一起列为GPT-5难以处理的类别。
    • 作者概括与表:作者称除Qwen3-8B外,各模型对不存在引用和案名不匹配的检出大多超过80%。Qwen3-8B这两类为58.1±18.5和49.1±15.2。作者称没有模型能稳定检出错误pincite;Claude Code该格为3.6±14.0。全部智能体取回的意见中,19.9%无可用文本或缺少页码。
    • 结论与表注:结论称内容误述仍是最难检测的类型。Table A6表注称各模型在内容误述和错误pincite上表现最差。表中各模型recall最低的一列是错误pincite,不是内容误述。

    生成端幻觉率

    • 设置与定义:8个免费档默认模型、92条提示、逾8,000条引用。作者称该定义是总体发生率的保守下界,不计入“真实案件但不支持所述命题”这类更细的误述。
    • 比率:2024年中GPT-4o最低,为1.23%;早先GPT-3.5约25%。GPT-5.1为6.57%。§2称其高于2024年8月GPT-4o(bootstrap,pp=0.001);引言称高于2024年中表现最好的GPT-4o版本(p=0.001)。论文未给出该对照版本的具体比率。
    • 引用构成:Figure 2左图是所引案件本身被引用次数的中位数:GPT-3.5逾500,GPT-4o为105。作者称新模型每份文书引用更多;正文没有给出每份文书引用数。右图轴上有0、8、16、24,柱高无法从文本读出。

    错误分析

    • 库中缺失:测试集有132条未被改动、CourtListener查无结果的正确引用。Table A8:Gemini 2.5 Flash标出87条(65.9%),GPT-5标出33条(25.0%),Claude Code标出14条(10.9%)。作者称较弱模型把库中缺失当成幻觉证据。§4.3称GPT-5未立即标出的引用中,40条经其他来源核验,33条仍pending或证据不足。附录A3.3另写132条中有88条未立即判断,论文未解释与33条之差。
    • 步数与可靠性:GPT-5假阴性中36.7%因达到30步上限;29.5%的测试回合触及上限。可靠性失败占假阴性30.6%:输出不符合格式、提前返回、未识别某引用的全部内容。该段末有作者留注“[Update this]”。
    • 冗余与笔误:Table A9中,GPT-5回合的重复引用查找为39.7%,重复意见搜索为26.4%,命中后再搜为8.2%。Claude Code的调用中7.4%为完全重复,其CourtListener工具调用21.5%无效。智能体还标出原诉状中逾10处人工笔误(Table A1)。

    其他消融与分析

    • 平均步数(Table A7):GPT-OSS 120B 16.8,GPT-5 15.3,Gemini 2.5 Flash 9.7,Qwen3.6-27B 9.3,Qwen3-8B 7.5。
    • 动作占比(Table A7):GPT-5的OPEN_WEB_SEARCH为8.3%;Qwen3-8B的引用查找为48.2%,SEARCH_LOCAL_OPINION为14.9%。
    • 含任一类冗余调用的回合(Table A9):GPT-OSS 120B 62.1%,GPT-5 52.3%,Qwen3-8B 36.2%,Qwen3.6-27B 23.8%,Gemini 2.5 Flash 14.1%。
    • CourtListener缺失引用的假阳性率(Table A8,132条):GPT-OSS 120B 40.9%,Qwen3-8B 46.2%,Qwen3.6-27B 62.1%。
    • 附录A1.3:27,949条不同引用中2,854条不在CourtListener,这些引用未被注入幻觉。附录A3.3称数据集中约10%的真实引用是Westlaw或Lexis标识,CourtListener无法解析。
  5. 有什么可以进一步探索的点?

    作者称半合成基准未必泛化到真实文书,且评测在短摘录上进行。

    作者在§5.3把后续工作放在自然出现的幻觉样本,以及长文书上的可靠性与算力使用。

    作者指出的局限与后续方向

    • 半合成分布:结果未必完全泛化到真实诉状中的幻觉分布;作者鼓励用自然出现的例子补充数据集(§5.3)。
    • 难度下界:作者称该基准应主要当作核验难度的受控下界(§5.3)。
    • 短摘录:评测对象是短摘录,而收集到的最长诉状有193页、逾30,000词、逾1,000条引用。作者称算力使用和可靠性问题在引用密集的诉状里都会加重(§5.3)。
    • 长上下文:作者称可靠性问题和长上下文失败仍然存在,需要更多研究(§5.3)。
    • 后续重点:作者称后续检测工作应着重缓解上述两类问题,并引用Rabanser等人(2026)(§5.3)。
    • 数据访问:作者在§5.1称,要提高自动核验表现,需要更广的公开法律数据,或建立在商业平台之上的核验系统。

    实验覆盖范围

    • 趋势实验:8个ChatGPT浏览器免费档默认模型、同一92条提示、逾8,000条引用;幻觉只计不对应真实案件,或案名与Westlaw中该reporter所指案名不一致(§2)。
    • 检测实验:Table 2的6个系统,只在70–30划分后的测试集390条上运行,步数或回合上限为30。论文未说明训练集用途(§4.1)。
    • 分类型与错误分析:五类幻觉的recall见Table A6。假阳性与假阴性分析针对GPT-5加BOED,且限于不存在引用、案名不匹配和逐字误引(§4.3)。
    • 未写明的统计信息:论文未报告检测实验的重复次数,未说明Table 2中±的含义,也未说明主结果是否在附录A1.4更新真值之后计算。
    • 判定方式:Precision、Recall、F1来自子串匹配,不是LLM裁判。内容误述注入另有40条二次复核,同意率为95%(附录A1.2)。论文未报告检测输出与人工判定的一致性。
  6. 总结一下论文的主要内容

    引用幻觉未随代际持续下降;智能体提高recall,但细类错误与数据访问仍制约核验。

    法律引用核验被做成基准:伪造引用的法院文书在增加,生成端的幻觉率也没有随模型代际持续下降。

    • 要核验什么:作者称含幻觉引用的文书已逾1,000件。在8个免费档ChatGPT、同一92条提示上,2024年中GPT-4o的幻觉引用率为1.23%,GPT-5.1为6.57%;§2称后者高于2024年8月GPT-4o(bootstrap,pp=0.001)。新模型每份文书引用更多,所引案件也更不集中于常见判例。
    • 怎么评:五类错误为不存在引用、案名不匹配、错误pincite、逐字误引和内容误述。LePhantomCite含1,300条摘录、4,499个引用实例,其中1,107个含幻觉。BOED智能体用语言信念串联法律库与网页检索,每条最多30步,并与去掉该循环的非智能体对照。
    • 主要数字:测试集390条上,GPT-5智能体的recall为84.4%、F1为55.0%,非智能体为58.2%与45.2%。Claude Code(Opus 4.8)的F1为68.8%、recall为62.8%。GPT-5对不存在引用和案名不匹配的recall均为100.0%,错误pincite为52.8%。
    • 作者的结论:作者称负责任部署要求把引用核验当作一等任务,并称最好模型的F1为68.8%,内容误述最难检出。Table A6里recall最低的是错误pincite。作者同时称公开库缺页码、覆盖不全,会限制智能体,也会限制没有商业数据库的诉讼人。半合成基准被作者视为核验难度的受控下界。
阅读原文arxiv.org