LegalHalluLens:面向法律 AI 的分类幻觉审计与校准多智能体辩论
LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI
LegalHalluLens 审计 CUAD 法律抽取:类内 HalTP 差距 38.0–40.6 pp,假阳性降 45%。
- 法律抽取若只报聚合幻觉率,看不出错误集中在哪类条款,也不看出偏向遗漏还是编造,合规部署缺少可行动信号。
- LegalHalluLens 在 CUAD 上把条款分成数值、时间、义务/权利和事实,报告分层 HalTP,并用 RDI 比较遗漏与编造。再按该诊断设置 Skeptic 质疑和增删门的不对称。
- 四模型 HalTP 类内差距 38.0–40.6 pp,聚合 HalTP 50.9%–56.5%。gpt-5.2 与 qwen3-32b 全量 RDI 为 +0.161 与 −0.202。120 合同子集上假阳性从 524 降到 287,内容矛盾从 642 到 641。
- 作者称数值限于 510 份英文美国商业合同,跨法域与文书类型的泛化未验证;实验假设全文上下文。实验 2 仅一次运行、一个骨干和 120 份合同。评审为 gemini-2.5-flash,无人工核验标签。
- 被测模型
- gemini-3-flashgpt-5.2qwen3-32bllama-3.3-70bgemma-4-26B-A4B
- 基准
- CUAD v1.0
- 指标
- HalTPHalGenFARFRRAccJEqRDIScore
研究者提出 LegalHalluLens,一个面向法律 AI 的幻觉审计框架,包含基于 CUAD 的四类法律主张分类幻觉画像(数值、时间、义务/权利、事实)、将遗漏与虚构偏差压缩为单一可比较标量的风险方向指数(RDI),以及按幻觉幅度与方向校准的分类辩论流程。在 510 份合同、249252 条条款级实例上,团队测得同一模型在义务/数值类与时间类主张之间存在约 38-40 个百分点的差距,这一差距被聚合指标掩盖;两个总体幻觉率同为 52% 的系统可能具有相反的 RDI。该辩论流程将虚构检测减少 45%,各类别增益与诊断结果对应,并以 4B 激活参数的更小骨干模型匹配商业 API。作者称分类画像与 RDI 能揭示聚合指标掩盖的失效模式,并可作为多智能体辩论流程的校准输入,其中针对已测失效模式的 Skeptic 质疑与非对称门控优于通用调优的辩论。
深度解读
这篇论文试图解决什么问题?
聚合率看不出法律抽取错误集中的条款类型和遗漏或编造方向。
聚合幻觉率看不出法律条款抽取的错误集中在哪一类、偏向遗漏还是编造。
- 场景:作者称法律 AI 已进入合同审阅、合规监测、监管报告和尽职调查,从业者依据输出做有后果的决定,选模型本身也有法律暴露。编造的责任上限和被丢掉的义务限定,承担成本的人不同。
- 现有做法:作者称当前标准是报告聚合幻觉率,摘要写约 52%。跨类型平均会掩盖法律后果最大的条款上的失败率。作者称 Dahl 等、Hou 等、Magesh 等未处理合同抽取,也未把方向收成可部署比较的标量。
- 三个问题:类型失败排序是否跨架构稳定;遗漏与编造能否收成单一指标,并分开聚合率相同的系统;按幅度和方向校准的辩论,收益是否集中在高失败类别,小开源模型能否在综合分上匹配商业 API。
- 提出的框架:LegalHalluLens。组件是四类幻觉画像、Risk Direction Index(RDI),以及由该诊断校准的多智能体辩论。语料是 CUAD v1.0,全文可核对,不用外部知识。
有哪些相关研究?
作者称先前工作未处理合同抽取,也未把方向收成可比较标量。
作者把空档放在合同抽取和可比较的方向标量,而不是再做一个泛泛的幻觉基准。
法律幻觉与法律基准
- 类型学:Dahl et al.(2024)在联邦司法任务上给法律幻觉分类,率在 58% 到 88%,并认为并非所有模式对法律从业者同等要紧。Hou et al.(2024)为机器生成的法律分析建缺口分类。Magesh et al.(2025)报告商业法律 AI 中的 RAG 并未消除幻觉。作者称这三项都未处理合同抽取,也未把方向性收成可部署比较的标量。
- 任务基准:LegalBench(Guha et al., 2023)、BLT(Blair-Stanek et al., 2024)、ContractEval(Liu et al., 2025)测任务准确率,没有按声明类型分层幻觉。CUAD(Hendrycks et al., 2021)提供分类用专家标注,本文改作幻觉 oracle。
- 其他诊断:Enguehard et al.(2025)、Demir and Canbaz(2025)、Purushothama et al.(2025)。作者称这些工作与本文正交。
通用幻觉基准与辩论
- 事实精度:FActScore(Min et al., 2023)、HaluBench(Ravi et al., 2024)、HalluLens(Bang et al., 2025)、PHANTOM(Ji et al., 2025)测事实精度,无声明类型分层。
- 辩论机制:Du et al.(2024)、Fang et al.(2025)、Li et al.(2025)、Hu et al.(2025)把多智能体辩论当作事实性机制;Snell et al.(2024)、Wu et al.(2024)提供推理时缩放的动机。Huang et al.(2024)被用来对照后文的内容纠错上限。
- 泛泛调节:作者指出 Du et al.(2024)与 Hu et al.(2025)一类工作对全部错误类型调节 Skeptic 提示、门控阈值和聚合规则,并认为这不适合高风险野外部署。
基线与数据集
- 对照:实验 1 没有另设方法基线,在 CUAD v1.0 上比较四个抽取模型。实验 2 以同一 120 合同子集上的 gemma-base,以及 gpt-5.2、qwen3-32b、llama-3.3-70b、gemini-3-flash 的抽取为对照。综合分是 FAR、FRR、Acc、HalGen、JEq 的平均名次,越低越好。
作者把四类分类法和 RDI 定位为填合同抽取与方向标量的空档;辩论组件按实验 1 的逐类、逐方向失败来设。作者称据其所知,这是组件由实测失败模式校准、而非泛泛选定的多智能体抽取流水线。
论文如何解决这个问题?
用四类 HalTP、有符号 RDI,以及按该诊断校准的六角色辩论。
LegalHalluLens 用类型画像和 RDI 做审计,再用二者校准六角色辩论。前两者是评测程序,第三者是缓解。
问题设定与指标
- 实例:文档 D、条款类型 ci、抽取模型 M。每个 (D, ci) 给出条款或判 not present。相对 CUAD:TP 为正确检出,FP 为原文没有却判有,FN 为有却判无,TN 为正确判无。
- 检测:FAR = FP/(FP+TN),FRR = FN/(FN+TP),Acc = (TP+TN)/N。
- 内容:外部评审把 TP 标为 supported 或 contradicted。HalTP = contradicted/TP,用于实验 1。HalGen = (contradicted+FP)/(TP+FP),把虚构算进错误,用于实验 2。JEq = supported/(TP+FN)。
- 类内差距:Gap(M)=maxci HalTP(M,ci)−minci HalTP(M,ci)。作者用它表示聚合 HalTP 会平均掉部署后果不同的类型。
四类幻觉画像
- 划分:按主要验证难点,不按文书类型。作者认为因此可迁到任何能对照原文核对的法律抽取。41 类到四类的映射在附录 D。
- 四类:数值 n=5(阈值、单位);时间 n=6(字面日期或期限);义务/权利 n=27(情态、例外、范围);事实 n=3(当事人、管辖法等短身份主张)。
- 证据权重:作者称事实类和数值类 n 小,只作支持证据;中心对比是义务(n=27)对时间(n=6)。
Risk Direction Index
- 标签:mismatch type 来自固定清单:none、numeric、temporal、obligation、scope、missing condition、extra condition、other。有方向的是后两类:漏掉原文限定,或断言原文没有的限定。
- 定义:RDI(M)=(pextra(M)−pmissing(M))/100。p 是带该标签的矛盾发现所占百分比。正值偏编造,负值偏遗漏。不另做标注。
- 作者定位:方向概念在 Dahl et al.(2024)和 Hou et al.(2024)已有定性讨论;本文收成一个有符号标量。作者称它是方向信号,不是风险幅度的基数度量,因为 scope 错误占矛盾的 62%–71%。
类型化辩论
- 角色:在基线抽取上跑状态机,最多两轮。Skeptic 按测得的失败模式发类型化质疑;Supporter 只用合同原文辩护;结构错误时 Re-extractor 重抽,且只在第 1 轮触发一次;轮次用尽仍不一致则 Arbiter 保守保留基线,除非反证强;Verifier 独立查合同并检查定义契合;Judge 做有约束力的内容决定,并受增删门约束。
- 路由:双方同意则进 Verifier;仍有轮次且不同意则继续;死锁则先 Arbiter。Figure 3 分辩论、独立核验、带门的 Judge 三阶段。
- 门:Addition Gate(无到有)要 Verifier 确认且辩论一致。Deletion Gate(有到无)在 Verifier 确认存在时被挡住。作者称不对称编码的是实验 1 里高错误类型上 FAR 高于 FRR 的画像。
- 质疑从哪来:数值问取值是原文还是常见先验;义务问情态与例外是否保留;时间问是明示还是推断;事实问信息来自文书还是外部知识。附录 C 给出完整问题集。骨干是未进入实验 1 的 gemma-4-26B-A4B;作者称它在匹配子集上基线综合分最差,改进归于干预而不是更强起点。
判定与评审分离
- 外部评审:gemini-2.5-flash,temperature=0。五条标准:数值精确、时间精确、情态匹配、极性匹配、例外保留。附录 A 是完整提示词。它产出文中全部 HalTP、HalGen 和 RDI。
- 流水线内 Judge:与实验 2 抽取骨干同为 gemma-4-26B-A4B,只裁定增删门,不对照 ground truth,不进入报告指标。
论文做了哪些实验?
四模型 HalTP 类内差距 38.0–40.6 pp;辩论把假阳性减少 45%。
四模型的 HalTP 类内差距为 38.0–40.6 pp,聚合率看不出这一差距。
实验设置
- 被测模型:实验 1 为 gemini-3-flash、gpt-5.2(商业 API)、qwen3-32b(32.8B)、llama-3.3-70b(70B)。实验 2 骨干为 gemma-4-26B-A4B(MoE,4B active parameters),不进入实验 1。
- 数据:CUAD v1.0,510 份商业合同,41 个专家标注条款类型,映射为数值 5、时间 6、义务/权利 27、事实 3。作者称后两类 n 小的结果只作支持证据。
- 实验 1:全文上下文,temperature=0,相同结构化 JSON 提示(附录 B),每模型三次运行。名义 510×41×3=62,730 条/模型;实际 62,580、62,689、61,536、62,447,合计 249,252。缺行 0.2%–1.9%,作者称与合同相关而非随机。
- 实验 2:120 合同匹配子集,run id=1,名义 4,920。对照为 gemma-base 与四个实验 1 模型在该子集的抽取。qwen3-32b 为 4,817 行,Table 4 注称涉及其比较时要带此说明。论文未写 120 份如何抽出。
- 指标:FAR、FRR、Acc、HalTP、HalGen、JEq、RDI。Score 为五指标平均名次,越低越好。
- 评审:外部评审 gemini-2.5-flash,temperature=0,与流水线内 Judge 分开。论文未报告重复评审,也未报告与人工的一致性。
主结果
据 Table 2。HalTP 为检出条款中被判 contradicted 的比例。510 份合同、三次运行。
表格较宽,可左右滑动
模型 数值 义务/权利 事实 时间 类内差距(pp) gemini-3-flash 67.5% 67.3% 36.0% 29.5% 38.0 gpt-5.2 70.3% 64.8% 44.3% 29.7% 40.6 qwen3-32b 66.8% 69.1% 39.3% 29.0% 40.1 llama-3.3-70b 74.3% 73.6% 46.9% 35.1% 39.2 - 排序:作者称 {数值, 义务} 高于事实、事实不低于时间,四模型无例外,聚合报告看不到这一差距。Table 1 聚合 HalTP 为 50.9%–56.5%,作者称落在 6 pp 区间内,不足以支持部署决定。
- 作者的解释:义务条款要同时保留情态、触发条件、例外和范围,时间类多是单个字面值;附录 B.1 已对数值类写排除说明,数值类仍与义务同处高失败档。作者称预训练先验压过显式提示。
- 没有单一领先者:作者称选择取决于部署里哪类条款最要紧。llama-3.3-70b 在 Table 1 的 FAR 为 7.7%、Acc 为 89.0%,但 §6.2 写其数值类 FRR 为 52.8%、数值类 JEq 为 12.1%。Table 1 的 HalGen 会重排模型:最低 gpt-5.2 为 62.4%,最高 gemini-3-flash 为 65.5%。
错误方向与 RDI
- 测了什么:在矛盾 TP 上比较 missing condition 与 extra condition。Figure 2 标注:qwen3-32b 缺失 23.7%、额外 3.5%;gpt-5.2 缺失 4.9%、额外 21.0%;gemini-3-flash 为 13.8% 与 11.4%;llama-3.3-70b 为 20.3% 与 1.3%。qwen3-32b 与 gpt-5.2 的 HalTP 为 52.1% 与 51.8%(Table 1)。
- 标量:Table 3(95% bootstrap,2,000 次重采样):gpt-5.2 +0.161 [+0.151, +0.170],gemini-3-flash −0.024 [−0.035, −0.015],llama-3.3-70b −0.190 [−0.198, −0.180],qwen3-32b −0.202 [−0.212, −0.193]。作者称前两者与末行的区间不重叠,方向分离不是运行噪声。
- 作者的读法:RDI 只覆盖有明确方向的那部分错误。合规里漏掉义务会带来责任时,作者认为 gpt-5.2 的正 RDI 是更安全的画像;误报消耗审阅容量时排序相反。作者称没有普遍正确的模型。
校准辩论
- 假阳性与内容:120 合同、run id=1,gemma-4-26B-A4B 基线对比类型化辩论。假阳性从 524 降到 287(−45%),内容矛盾从 642 到 641(−0.2%)。作者称机制是过滤虚构,而不是修好已检出条款的内容,并称这与 Huang et al.(2024)一致:基线与 Skeptic 共享参数先验。
- 逐类:作者称增益顺序在跑缓解前已指定。义务 ∆FAR=−8.2、∆HalGen=−6.3;事实 ∆FAR=−5.8;数值 ∆FAR=−3.6;时间 ∆FAR=−2.4,时间 HalGen +0.6 pp(Figure 4 及 §7.2)。义务 RDI 从 −0.078 到 −0.014(Figure 5)。作者称这是针对遗漏偏差预先设定的结果,不是附带效应。
- 综合分与反例:Table 4 中 gemma-debate 为 2.4,gpt-5.2 为 2.6,gemma-base 为 5.2。作者称 4/5 加权方案下排名第 1;recall-heavy 下 gpt-5.2 第 1、gemma-debate 第 2(附录 E.3)。Table 4 里 gemini-3-flash 的 JEq 为 46.8、FRR 为 4.5,llama-3.3-70b 的 FAR 为 7.6,好于 gemma-debate 的 43.3、14.4、8.4。作者称 4B active 骨干在综合分上匹配商业 API;论文未报告查询次数或耗时。
其他消融与分析
- 运行方差(附录 E.1):HalTP 最大 SD 0.6 pp;逐类 HalTP SD ≤ 2.4 pp;1-SD 下类内差距仍 ≥ 36 pp。
- 义务类 RDI(附录 E.2):gpt-5.2 +0.220 [+0.207, +0.234],gemini-3-flash +0.018 [+0.004, +0.031],llama-3.3-70b −0.198 [−0.210, −0.186],qwen3-32b −0.181 [−0.194, −0.168]。
- 加权(附录 E.3):等权、FP-heavy、Halluc-only、Detection-only 下 gemma-debate 第 1;recall-heavy 下第 2。gemma-base 为第 5 或第 6。
- 缺行(附录 E.4):qwen3-32b 三轮 20417、20771、20348(名义每轮 20,910)。5 份合同三轮都不全,58 份任一运行不全,持续比例 8.6%。
- 义务子类型(附录 E.5):四模型平均 HalTP 42.7%–88.6%,桶内 SD 12.4 pp;最低 Termination for Convenience 42.7%,最高 Post-Termination Services 88.6%。作者称最低子类型仍高于时间类 29.0%–35.1%。
- 辩论开销(附录 E.6):平均轮数 1.12,87.9% 在第 1 轮结束;检出改变 12.8%;Skeptic–Supporter 一致 99.94%;stability 90.6%。翻转率:事实 4.2%、时间 9.9%、数值 13.8%、义务 14.2%。各类型平均轮数 1.10–1.20。
有什么可以进一步探索的点?
作者称结果限于 CUAD 英文美国合同,跨法域泛化与人工核验仍待做。
作者把语料范围、全文上下文、实验 2 规模和评审标签写为局限。
作者指出的局限与后续方向
- 语料:数值结果适用于 CUAD 的 510 份英文美国商业合同;四架构上排序一致,但跨法域、跨文书类型的泛化仍待验证(Limitations)。
- 上下文:实验都假设全文在上下文内;超出窗口时,检索增强会带来与本文所测正交的额外失败模式(Limitations)。
- 实验 2:一次运行、一个骨干 gemma-4-26B-A4B、120 合同子集;综合排名只对该比较构成证据(Limitations)。
- 消融:最小提示和泛泛辩论消融被列为直接延伸(Limitations)。
- 评审:全部 HalTP、HalGen、RDI 经单一评审 gemini-2.5-flash。作者称没有人工核验标签,小的 RDI 差异不宜过度解读;接近零的逐类 RDI 要额外谨慎。用专家标注核验分层样本是直接延伸;作者称这会收紧 RDI 的基数解释,但不改变方向排序(Limitations)。
- 迁移:失败排序能否转到其他文书类型,作者称本文没有解决;应做任务特定审计,而不是把 CUAD 得出的阈值用到新场景(§8)。
实验覆盖范围
- 实验 1:gemini-3-flash、gpt-5.2、qwen3-32b、llama-3.3-70b,CUAD v1.0,510 合同,41 类,temperature=0,每模型三次运行,合计 249,252 条(§5)。
- 实验 2:gemma-4-26B-A4B,120 合同,run id=1,名义 4,920 次;对照含 gemma-base 与实验 1 四模型在同一子集的抽取(§5.2、Table 4)。论文未说明这 120 份的抽样规则。
- 评审分工:外部评审为 gemini-2.5-flash,temperature=0;流水线内 Judge 与抽取骨干相同,不对照 ground truth 计分(§5.3)。
- 类别与输入:数值 5、时间 6、义务/权利 27、事实 3(§5.1、附录 D)。实验在全文上下文下进行。
- 论文未报告:评审与人工标注的一致性;辩论的查询次数或墙钟耗时。附录 E.6 报告轮数、翻转率和一致率。
总结一下论文的主要内容
作者称类型画像与 RDI 能区分聚合率相近的系统,辩论主要减少虚构检出。
LegalHalluLens 是一套法律条款抽取的审计框架,外加一个按审计结果校准的辩论缓解。
- 问题:作者认为只报聚合幻觉率,合规人员不知道错误集中在哪类条款,也不知道模型是在漏掉原文义务还是在编造原文没有的限定。摘要把这一聚合率写成约 52%。
- 做法:在 CUAD v1.0 上把 41 类条款收成数值、时间、义务/权利、事实,用 HalTP 看检出条款的内容错误,用 RDI 把 missing condition 与 extra condition 收成有符号标量。缓解是最多两轮的六角色辩论:Skeptic 质疑按高失败类型来写,增删门按高错误类型上 FAR 高于 FRR 来设。外部打分与流水线内 Judge 分开。
- 画像:四个模型、三次运行、249,252 条实例。类内 HalTP 差距 38.0–40.6 pp(Table 2),聚合 HalTP 为 50.9%–56.5%(Table 1)。四模型都是数值与义务高于事实,事实不低于时间。
- 方向:HalTP 为 51.8% 与 52.1% 的 gpt-5.2 和 qwen3-32b,RDI 为 +0.161 与 −0.202,bootstrap 区间不重叠(Table 3)。作者认为合规与法务运营应按这一不对称来选模型,而不是按聚合率。
- 缓解:120 合同子集上,gemma-4-26B-A4B 经辩论后假阳性从 524 降到 287,内容矛盾从 642 到 641。综合分从 5.2 到 2.4,在 4/5 加权下排第 1;Table 4 的 JEq、FRR、FAR 仍有分项不是最好。义务 RDI 从 −0.078 到 −0.014。
- 作者的结论:可信部署要问失败的条款类型和错误方向,而不是聚合准确率。Impact Statement 称最好配置仍有 58.6% 的已检出条款内容与原文矛盾,类型化评测应告知而不是替代人工审阅。Table 4 中 gemma-debate 的 HalGen 同为 58.6%;论文未说明这两处是否同一指标。