跳到正文
原文
论文追踪· arXiv:2606.18021· Lalit Yadav, Akshaj Gurugubelli·本站收录 · 原文发表

LegalHalluLens:面向法律 AI 的分类幻觉审计与校准多智能体辩论

LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

LegalHalluLens 审计 CUAD 法律抽取:类内 HalTP 差距 38.0–40.6 pp,假阳性降 45%。

问题
法律抽取若只报聚合幻觉率,看不出错误集中在哪类条款,也不看出偏向遗漏还是编造,合规部署缺少可行动信号。
方法
LegalHalluLens 在 CUAD 上把条款分成数值、时间、义务/权利和事实,报告分层 HalTP,并用 RDI 比较遗漏与编造。再按该诊断设置 Skeptic 质疑和增删门的不对称。
实验与结果
四模型 HalTP 类内差距 38.0–40.6 pp,聚合 HalTP 50.9%–56.5%。gpt-5.2 与 qwen3-32b 全量 RDI 为 +0.161 与 −0.202。120 合同子集上假阳性从 524 降到 287,内容矛盾从 642 到 641。
局限与可以继续做的
作者称数值限于 510 份英文美国商业合同,跨法域与文书类型的泛化未验证;实验假设全文上下文。实验 2 仅一次运行、一个骨干和 120 份合同。评审为 gemini-2.5-flash,无人工核验标签。
实验设置gemini-3-flash、gpt-5.2 等 · CUAD v1.0 · HalTP、HalGen 等
被测模型
gemini-3-flashgpt-5.2qwen3-32bllama-3.3-70bgemma-4-26B-A4B
基准
CUAD v1.0
指标
HalTPHalGenFARFRRAccJEqRDIScore
AI 导读研究者提出 LegalHalluLens,一个面向法律 AI 的幻觉审计框架,包含基于 CUAD 的四类法律主张分类幻觉画像(数值、时间、义务/权利、事实)、将遗漏与虚构偏差压缩为单一可比较标量的风险方向指数(RDI),以及按幻觉幅度与方向校准的分类辩论流程。在 510 份合同、249252 条条款级实例上,团队测得同一模型在义务/数值类与时间类主张之间存在约 38-40 个百分点的差距,这一差距被聚合指标掩盖;两个总体幻觉率同为 52% 的系统可能具有相反的 RDI。该辩论流程将虚构检测减少 45%,各类别增益与诊断结果对应,并以 4B 激活参数的更小骨干模型匹配商业 API。作者称分类画像与 RDI 能揭示聚合指标掩盖的失效模式,并可作为多智能体辩论流程的校准输入,其中针对已测失效模式的 Skeptic 质疑与非对称门控优于通用调优的辩论。

研究者提出 LegalHalluLens,一个面向法律 AI 的幻觉审计框架,包含基于 CUAD 的四类法律主张分类幻觉画像(数值、时间、义务/权利、事实)、将遗漏与虚构偏差压缩为单一可比较标量的风险方向指数(RDI),以及按幻觉幅度与方向校准的分类辩论流程。在 510 份合同、249252 条条款级实例上,团队测得同一模型在义务/数值类与时间类主张之间存在约 38-40 个百分点的差距,这一差距被聚合指标掩盖;两个总体幻觉率同为 52% 的系统可能具有相反的 RDI。该辩论流程将虚构检测减少 45%,各类别增益与诊断结果对应,并以 4B 激活参数的更小骨干模型匹配商业 API。作者称分类画像与 RDI 能揭示聚合指标掩盖的失效模式,并可作为多智能体辩论流程的校准输入,其中针对已测失效模式的 Skeptic 质疑与非对称门控优于通用调优的辩论。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    聚合率看不出法律抽取错误集中的条款类型和遗漏或编造方向。

    聚合幻觉率看不出法律条款抽取的错误集中在哪一类、偏向遗漏还是编造。

    • 场景:作者称法律 AI 已进入合同审阅、合规监测、监管报告和尽职调查,从业者依据输出做有后果的决定,选模型本身也有法律暴露。编造的责任上限和被丢掉的义务限定,承担成本的人不同。
    • 现有做法:作者称当前标准是报告聚合幻觉率,摘要写约 52%。跨类型平均会掩盖法律后果最大的条款上的失败率。作者称 Dahl 等、Hou 等、Magesh 等未处理合同抽取,也未把方向收成可部署比较的标量。
    • 三个问题:类型失败排序是否跨架构稳定;遗漏与编造能否收成单一指标,并分开聚合率相同的系统;按幅度和方向校准的辩论,收益是否集中在高失败类别,小开源模型能否在综合分上匹配商业 API。
    • 提出的框架:LegalHalluLens。组件是四类幻觉画像、Risk Direction Index(RDI),以及由该诊断校准的多智能体辩论。语料是 CUAD v1.0,全文可核对,不用外部知识。
  2. 有哪些相关研究?

    作者称先前工作未处理合同抽取,也未把方向收成可比较标量。

    作者把空档放在合同抽取和可比较的方向标量,而不是再做一个泛泛的幻觉基准。

    法律幻觉与法律基准

    • 类型学:Dahl et al.(2024)在联邦司法任务上给法律幻觉分类,率在 58% 到 88%,并认为并非所有模式对法律从业者同等要紧。Hou et al.(2024)为机器生成的法律分析建缺口分类。Magesh et al.(2025)报告商业法律 AI 中的 RAG 并未消除幻觉。作者称这三项都未处理合同抽取,也未把方向性收成可部署比较的标量。
    • 任务基准:LegalBench(Guha et al., 2023)、BLT(Blair-Stanek et al., 2024)、ContractEval(Liu et al., 2025)测任务准确率,没有按声明类型分层幻觉。CUAD(Hendrycks et al., 2021)提供分类用专家标注,本文改作幻觉 oracle。
    • 其他诊断:Enguehard et al.(2025)、Demir and Canbaz(2025)、Purushothama et al.(2025)。作者称这些工作与本文正交。

    通用幻觉基准与辩论

    • 事实精度:FActScore(Min et al., 2023)、HaluBench(Ravi et al., 2024)、HalluLens(Bang et al., 2025)、PHANTOM(Ji et al., 2025)测事实精度,无声明类型分层。
    • 辩论机制:Du et al.(2024)、Fang et al.(2025)、Li et al.(2025)、Hu et al.(2025)把多智能体辩论当作事实性机制;Snell et al.(2024)、Wu et al.(2024)提供推理时缩放的动机。Huang et al.(2024)被用来对照后文的内容纠错上限。
    • 泛泛调节:作者指出 Du et al.(2024)与 Hu et al.(2025)一类工作对全部错误类型调节 Skeptic 提示、门控阈值和聚合规则,并认为这不适合高风险野外部署。

    基线与数据集

    • 对照:实验 1 没有另设方法基线,在 CUAD v1.0 上比较四个抽取模型。实验 2 以同一 120 合同子集上的 gemma-base,以及 gpt-5.2、qwen3-32b、llama-3.3-70b、gemini-3-flash 的抽取为对照。综合分是 FAR、FRR、Acc、HalGen、JEq 的平均名次,越低越好。

    作者把四类分类法和 RDI 定位为填合同抽取与方向标量的空档;辩论组件按实验 1 的逐类、逐方向失败来设。作者称据其所知,这是组件由实测失败模式校准、而非泛泛选定的多智能体抽取流水线。

  3. 论文如何解决这个问题?

    用四类 HalTP、有符号 RDI,以及按该诊断校准的六角色辩论。

    LegalHalluLens 用类型画像和 RDI 做审计,再用二者校准六角色辩论。前两者是评测程序,第三者是缓解。

    问题设定与指标

    • 实例:文档 D、条款类型 ci、抽取模型 M。每个 (D, ci) 给出条款或判 not present。相对 CUAD:TP 为正确检出,FP 为原文没有却判有,FN 为有却判无,TN 为正确判无。
    • 检测:FAR = FP/(FP+TN),FRR = FN/(FN+TP),Acc = (TP+TN)/N。
    • 内容:外部评审把 TP 标为 supported 或 contradicted。HalTP = contradicted/TP,用于实验 1。HalGen = (contradicted+FP)/(TP+FP),把虚构算进错误,用于实验 2。JEq = supported/(TP+FN)。
    • 类内差距:Gap(M)=maxci HalTP(M,ci)−minci HalTP(M,ci)。作者用它表示聚合 HalTP 会平均掉部署后果不同的类型。

    四类幻觉画像

    • 划分:按主要验证难点,不按文书类型。作者认为因此可迁到任何能对照原文核对的法律抽取。41 类到四类的映射在附录 D。
    • 四类:数值 n=5(阈值、单位);时间 n=6(字面日期或期限);义务/权利 n=27(情态、例外、范围);事实 n=3(当事人、管辖法等短身份主张)。
    • 证据权重:作者称事实类和数值类 n 小,只作支持证据;中心对比是义务(n=27)对时间(n=6)。

    Risk Direction Index

    • 标签:mismatch type 来自固定清单:none、numeric、temporal、obligation、scope、missing condition、extra condition、other。有方向的是后两类:漏掉原文限定,或断言原文没有的限定。
    • 定义:RDI(M)=(pextra(M)−pmissing(M))/100。p 是带该标签的矛盾发现所占百分比。正值偏编造,负值偏遗漏。不另做标注。
    • 作者定位:方向概念在 Dahl et al.(2024)和 Hou et al.(2024)已有定性讨论;本文收成一个有符号标量。作者称它是方向信号,不是风险幅度的基数度量,因为 scope 错误占矛盾的 62%–71%。

    类型化辩论

    • 角色:在基线抽取上跑状态机,最多两轮。Skeptic 按测得的失败模式发类型化质疑;Supporter 只用合同原文辩护;结构错误时 Re-extractor 重抽,且只在第 1 轮触发一次;轮次用尽仍不一致则 Arbiter 保守保留基线,除非反证强;Verifier 独立查合同并检查定义契合;Judge 做有约束力的内容决定,并受增删门约束。
    • 路由:双方同意则进 Verifier;仍有轮次且不同意则继续;死锁则先 Arbiter。Figure 3 分辩论、独立核验、带门的 Judge 三阶段。
    • 门:Addition Gate(无到有)要 Verifier 确认且辩论一致。Deletion Gate(有到无)在 Verifier 确认存在时被挡住。作者称不对称编码的是实验 1 里高错误类型上 FAR 高于 FRR 的画像。
    • 质疑从哪来:数值问取值是原文还是常见先验;义务问情态与例外是否保留;时间问是明示还是推断;事实问信息来自文书还是外部知识。附录 C 给出完整问题集。骨干是未进入实验 1 的 gemma-4-26B-A4B;作者称它在匹配子集上基线综合分最差,改进归于干预而不是更强起点。

    判定与评审分离

    • 外部评审:gemini-2.5-flash,temperature=0。五条标准:数值精确、时间精确、情态匹配、极性匹配、例外保留。附录 A 是完整提示词。它产出文中全部 HalTP、HalGen 和 RDI。
    • 流水线内 Judge:与实验 2 抽取骨干同为 gemma-4-26B-A4B,只裁定增删门,不对照 ground truth,不进入报告指标。
  4. 论文做了哪些实验?

    四模型 HalTP 类内差距 38.0–40.6 pp;辩论把假阳性减少 45%。

    四模型的 HalTP 类内差距为 38.0–40.6 pp,聚合率看不出这一差距。

    实验设置

    • 被测模型:实验 1 为 gemini-3-flash、gpt-5.2(商业 API)、qwen3-32b(32.8B)、llama-3.3-70b(70B)。实验 2 骨干为 gemma-4-26B-A4B(MoE,4B active parameters),不进入实验 1。
    • 数据:CUAD v1.0,510 份商业合同,41 个专家标注条款类型,映射为数值 5、时间 6、义务/权利 27、事实 3。作者称后两类 n 小的结果只作支持证据。
    • 实验 1:全文上下文,temperature=0,相同结构化 JSON 提示(附录 B),每模型三次运行。名义 510×41×3=62,730 条/模型;实际 62,580、62,689、61,536、62,447,合计 249,252。缺行 0.2%–1.9%,作者称与合同相关而非随机。
    • 实验 2:120 合同匹配子集,run id=1,名义 4,920。对照为 gemma-base 与四个实验 1 模型在该子集的抽取。qwen3-32b 为 4,817 行,Table 4 注称涉及其比较时要带此说明。论文未写 120 份如何抽出。
    • 指标:FAR、FRR、Acc、HalTP、HalGen、JEq、RDI。Score 为五指标平均名次,越低越好。
    • 评审:外部评审 gemini-2.5-flash,temperature=0,与流水线内 Judge 分开。论文未报告重复评审,也未报告与人工的一致性。

    主结果

    据 Table 2。HalTP 为检出条款中被判 contradicted 的比例。510 份合同、三次运行。

    表格较宽,可左右滑动

    模型数值义务/权利事实时间类内差距(pp)
    gemini-3-flash67.5%67.3%36.0%29.5%38.0
    gpt-5.270.3%64.8%44.3%29.7%40.6
    qwen3-32b66.8%69.1%39.3%29.0%40.1
    llama-3.3-70b74.3%73.6%46.9%35.1%39.2
    • 排序:作者称 {数值, 义务} 高于事实、事实不低于时间,四模型无例外,聚合报告看不到这一差距。Table 1 聚合 HalTP 为 50.9%–56.5%,作者称落在 6 pp 区间内,不足以支持部署决定。
    • 作者的解释:义务条款要同时保留情态、触发条件、例外和范围,时间类多是单个字面值;附录 B.1 已对数值类写排除说明,数值类仍与义务同处高失败档。作者称预训练先验压过显式提示。
    • 没有单一领先者:作者称选择取决于部署里哪类条款最要紧。llama-3.3-70b 在 Table 1 的 FAR 为 7.7%、Acc 为 89.0%,但 §6.2 写其数值类 FRR 为 52.8%、数值类 JEq 为 12.1%。Table 1 的 HalGen 会重排模型:最低 gpt-5.2 为 62.4%,最高 gemini-3-flash 为 65.5%。

    错误方向与 RDI

    • 测了什么:在矛盾 TP 上比较 missing condition 与 extra condition。Figure 2 标注:qwen3-32b 缺失 23.7%、额外 3.5%;gpt-5.2 缺失 4.9%、额外 21.0%;gemini-3-flash 为 13.8% 与 11.4%;llama-3.3-70b 为 20.3% 与 1.3%。qwen3-32b 与 gpt-5.2 的 HalTP 为 52.1% 与 51.8%(Table 1)。
    • 标量:Table 3(95% bootstrap,2,000 次重采样):gpt-5.2 +0.161 [+0.151, +0.170],gemini-3-flash −0.024 [−0.035, −0.015],llama-3.3-70b −0.190 [−0.198, −0.180],qwen3-32b −0.202 [−0.212, −0.193]。作者称前两者与末行的区间不重叠,方向分离不是运行噪声。
    • 作者的读法:RDI 只覆盖有明确方向的那部分错误。合规里漏掉义务会带来责任时,作者认为 gpt-5.2 的正 RDI 是更安全的画像;误报消耗审阅容量时排序相反。作者称没有普遍正确的模型。

    校准辩论

    • 假阳性与内容:120 合同、run id=1,gemma-4-26B-A4B 基线对比类型化辩论。假阳性从 524 降到 287(−45%),内容矛盾从 642 到 641(−0.2%)。作者称机制是过滤虚构,而不是修好已检出条款的内容,并称这与 Huang et al.(2024)一致:基线与 Skeptic 共享参数先验。
    • 逐类:作者称增益顺序在跑缓解前已指定。义务 ∆FAR=−8.2、∆HalGen=−6.3;事实 ∆FAR=−5.8;数值 ∆FAR=−3.6;时间 ∆FAR=−2.4,时间 HalGen +0.6 pp(Figure 4 及 §7.2)。义务 RDI 从 −0.078 到 −0.014(Figure 5)。作者称这是针对遗漏偏差预先设定的结果,不是附带效应。
    • 综合分与反例:Table 4 中 gemma-debate 为 2.4,gpt-5.2 为 2.6,gemma-base 为 5.2。作者称 4/5 加权方案下排名第 1;recall-heavy 下 gpt-5.2 第 1、gemma-debate 第 2(附录 E.3)。Table 4 里 gemini-3-flash 的 JEq 为 46.8、FRR 为 4.5,llama-3.3-70b 的 FAR 为 7.6,好于 gemma-debate 的 43.3、14.4、8.4。作者称 4B active 骨干在综合分上匹配商业 API;论文未报告查询次数或耗时。

    其他消融与分析

    • 运行方差(附录 E.1):HalTP 最大 SD 0.6 pp;逐类 HalTP SD ≤ 2.4 pp;1-SD 下类内差距仍 ≥ 36 pp。
    • 义务类 RDI(附录 E.2):gpt-5.2 +0.220 [+0.207, +0.234],gemini-3-flash +0.018 [+0.004, +0.031],llama-3.3-70b −0.198 [−0.210, −0.186],qwen3-32b −0.181 [−0.194, −0.168]。
    • 加权(附录 E.3):等权、FP-heavy、Halluc-only、Detection-only 下 gemma-debate 第 1;recall-heavy 下第 2。gemma-base 为第 5 或第 6。
    • 缺行(附录 E.4):qwen3-32b 三轮 20417、20771、20348(名义每轮 20,910)。5 份合同三轮都不全,58 份任一运行不全,持续比例 8.6%。
    • 义务子类型(附录 E.5):四模型平均 HalTP 42.7%–88.6%,桶内 SD 12.4 pp;最低 Termination for Convenience 42.7%,最高 Post-Termination Services 88.6%。作者称最低子类型仍高于时间类 29.0%–35.1%。
    • 辩论开销(附录 E.6):平均轮数 1.12,87.9% 在第 1 轮结束;检出改变 12.8%;Skeptic–Supporter 一致 99.94%;stability 90.6%。翻转率:事实 4.2%、时间 9.9%、数值 13.8%、义务 14.2%。各类型平均轮数 1.10–1.20。
  5. 有什么可以进一步探索的点?

    作者称结果限于 CUAD 英文美国合同,跨法域泛化与人工核验仍待做。

    作者把语料范围、全文上下文、实验 2 规模和评审标签写为局限。

    作者指出的局限与后续方向

    • 语料:数值结果适用于 CUAD 的 510 份英文美国商业合同;四架构上排序一致,但跨法域、跨文书类型的泛化仍待验证(Limitations)。
    • 上下文:实验都假设全文在上下文内;超出窗口时,检索增强会带来与本文所测正交的额外失败模式(Limitations)。
    • 实验 2:一次运行、一个骨干 gemma-4-26B-A4B、120 合同子集;综合排名只对该比较构成证据(Limitations)。
    • 消融:最小提示和泛泛辩论消融被列为直接延伸(Limitations)。
    • 评审:全部 HalTP、HalGen、RDI 经单一评审 gemini-2.5-flash。作者称没有人工核验标签,小的 RDI 差异不宜过度解读;接近零的逐类 RDI 要额外谨慎。用专家标注核验分层样本是直接延伸;作者称这会收紧 RDI 的基数解释,但不改变方向排序(Limitations)。
    • 迁移:失败排序能否转到其他文书类型,作者称本文没有解决;应做任务特定审计,而不是把 CUAD 得出的阈值用到新场景(§8)。

    实验覆盖范围

    • 实验 1:gemini-3-flash、gpt-5.2、qwen3-32b、llama-3.3-70b,CUAD v1.0,510 合同,41 类,temperature=0,每模型三次运行,合计 249,252 条(§5)。
    • 实验 2:gemma-4-26B-A4B,120 合同,run id=1,名义 4,920 次;对照含 gemma-base 与实验 1 四模型在同一子集的抽取(§5.2、Table 4)。论文未说明这 120 份的抽样规则。
    • 评审分工:外部评审为 gemini-2.5-flash,temperature=0;流水线内 Judge 与抽取骨干相同,不对照 ground truth 计分(§5.3)。
    • 类别与输入:数值 5、时间 6、义务/权利 27、事实 3(§5.1、附录 D)。实验在全文上下文下进行。
    • 论文未报告:评审与人工标注的一致性;辩论的查询次数或墙钟耗时。附录 E.6 报告轮数、翻转率和一致率。
  6. 总结一下论文的主要内容

    作者称类型画像与 RDI 能区分聚合率相近的系统,辩论主要减少虚构检出。

    LegalHalluLens 是一套法律条款抽取的审计框架,外加一个按审计结果校准的辩论缓解。

    • 问题:作者认为只报聚合幻觉率,合规人员不知道错误集中在哪类条款,也不知道模型是在漏掉原文义务还是在编造原文没有的限定。摘要把这一聚合率写成约 52%。
    • 做法:在 CUAD v1.0 上把 41 类条款收成数值、时间、义务/权利、事实,用 HalTP 看检出条款的内容错误,用 RDI 把 missing condition 与 extra condition 收成有符号标量。缓解是最多两轮的六角色辩论:Skeptic 质疑按高失败类型来写,增删门按高错误类型上 FAR 高于 FRR 来设。外部打分与流水线内 Judge 分开。
    • 画像:四个模型、三次运行、249,252 条实例。类内 HalTP 差距 38.0–40.6 pp(Table 2),聚合 HalTP 为 50.9%–56.5%(Table 1)。四模型都是数值与义务高于事实,事实不低于时间。
    • 方向:HalTP 为 51.8% 与 52.1% 的 gpt-5.2 和 qwen3-32b,RDI 为 +0.161 与 −0.202,bootstrap 区间不重叠(Table 3)。作者认为合规与法务运营应按这一不对称来选模型,而不是按聚合率。
    • 缓解:120 合同子集上,gemma-4-26B-A4B 经辩论后假阳性从 524 降到 287,内容矛盾从 642 到 641。综合分从 5.2 到 2.4,在 4/5 加权下排第 1;Table 4 的 JEq、FRR、FAR 仍有分项不是最好。义务 RDI 从 −0.078 到 −0.014。
    • 作者的结论:可信部署要问失败的条款类型和错误方向,而不是聚合准确率。Impact Statement 称最好配置仍有 58.6% 的已检出条款内容与原文矛盾,类型化评测应告知而不是替代人工审阅。Table 4 中 gemma-debate 的 HalGen 同为 58.6%;论文未说明这两处是否同一指标。
阅读原文arxiv.org