研究:法律推理模型引用法条不等于依据法条,注入指令合规率高达 73.3%–96.4%
Cited but Not Consulted: A Counterfactual Audit of Legal Chain-of-Thought Faithfulness
作者在法律CoT中置换法律依据并追踪隐层承诺,发现模型表面引用正确但裁决置换敏感度偏低且易受注入操纵。
- 大语言模型在法律思维链中常显式引用法规或判例,但生成的法律依据是否真实因果驱动裁决结果仍未被验证,且存在裁决被恶意操纵的风险。
- 作者固定案件事实并置换目标法律依据,同时在各句子边界使用logit lens解码隐层裁决倾向以判定决策锁定步数,并加入提示注入测试。
- 在ECHR Pair A上5个模型的裁决置换敏感度为31.0%–58.6%,而事实中插入虚假指令的注入遵从率达73.3%–96.4%,均高于置换敏感度。
- 实验样本量为每条件30例,置换法律依据同时改变了问题本身存在混杂,且部分测试仅覆盖单一依据对或截断文本。
- 被测模型
- Qwen3-8BQwen3-14BLlama-3.1-8BLlama-3-8BGemma-3-12BLlama-3.3-70BLegal-Δ-14B
- 基准
- ECHRCaseHOLDSCOTUSContractNLI
- 指标
- Verdict-swap sensitivityPost-commitment re-engagementSurface engagementAccuracyConvergenceParaphrase instabilityInjection complianceInjection verdict change
研究者提出权威替换反事实协议,在固定案件事实的前提下把模型被要求依据的法律权威换成无关权威,并从句边界处的隐藏状态解码模型不断演化的裁决,以检验法律思维链的忠实性。在七个 8B–70B 开源权重模型和四个覆盖司法与合同推理的基准上,模型在 66.7%–100% 的生成中能正确说出所依据的权威,但裁决随权威改变而改变的比例低得多:CaseHOLD 为 0.0%–21.7%,ECHR 和 SCOTUS 为 30.0%–76.7%,ContractNLI 为 43.3%–50.0%。扩大规模或使用专门的法律推理模型(Legal-Δ-14B,尽力复现的 LoRA 版本)都没有缩小这一差距。在五个核心模型上的红队评测显示,模型对隐藏在案件事实中的对抗指令的合规率为 73.3%–96.4%,远高于裁决替换敏感度,且不受跨模型排名影响。
推荐理由论文用反事实替换法律依据并解码隐藏状态,量化了模型引用权威与实际依赖权威之间的落差,为思维链忠实性审计提供了可迁移方法。
深度解读
这篇论文试图解决什么问题?
作者称法律CoT中引用法律依据常被当作推理依据,但缺乏对其因果依赖性的审计验证。
模型在法律思维链中正确引用法律依据是否代表其裁决真正依赖该依据,以及该裁决是否容易被对抗性指令操纵。
- 高风险场景下的信任假设:作者指出,金融与法律AI系统常借助思维链(CoT)推理来命名法规、法条或先例,以此作为裁决由该依据推导而出的证据,但这一假设缺乏因果验证。
- 现有研究的空白:过往CoT忠实性研究多集中在通用领域,未考察特定法律依据命名与裁决的因果依赖关系,且未结合内部状态演化进行审计。
- 核心观察与假设:作者提出两阶段假设,模型在开篇模板化地提及法律依据,随后基于事实模式生成裁决,裁决对具体依据的依赖程度可能较低。
- 论文提出的方案:作者设计了法律依据置换反事实协议,结合句子边界的logit lens内部承诺追踪,并引入红队提示注入测试进行全面审计。
有哪些相关研究?
作者梳理了CoT忠实性、内部承诺追踪与法律引用可靠性研究,定位本文为依据反事实与内部解码的结合。
CoT忠实性与事后合理化
- Lanham et al. (2023)与Lyu et al. (2023)——作者指出两项工作分别发现模型可能在生成推理前已确定答案,以及推理链未必反映实际计算过程。
- Arcuschin et al. (2026)与Turpin et al. (2023)——作者指出前者发现前沿模型中普遍存在事后合理化,后者发现CoT会合理化未披露的输入偏置。
内部决策承诺追踪
- Zhang et al. (2026)与Boppana et al. (2026)——分别利用隐层解码定位延迟裁决任务中的预口头化承诺,以及在通用基准上探测激活动态。
- Mehta (2026)与Li et al. (2026)——在智能体与多步CoT中追踪潜在承诺,Li et al.报告潜在承诺与显式答案仅在61.9%的步骤一致。
法律引用可靠性与反事实因果分析
- Chen et al. (2026)、Liu et al. (2026)与Ovcharov (2026)——作者指出这些工作通过检索或图谱验证引用的真实性与教义准确性,关注的是正确性而非因果依赖性。
- Jambula (2026)、Somov et al. (2026)与Wang et al. (2026)——分别通过事实扰动、中间结构扰动以及形式化求解器检验忠实性。
基线与基准定位
- 基线方法与基准:实验采用了Chalkidis et al. (2022)发布的LexGLUE套件(ECHR、SCOTUS、CaseHOLD)以及ContractNLI作为测试基准。
- 作者将本文定位为:首次将法律决策目标反事实介入、隐层承诺追踪与对抗鲁棒性测试相结合。
论文如何解决这个问题?
作者提出法律依据置换反事实方案,并在句子边界通过logit lens解码内部承诺步数与再引用行为。
作者提出了法律决策目标置换反事实协议,并在生成过程中对模型隐层状态实施未经训练的logit lens投影,以追踪内部决策承诺与文本再引用动态。
依据置换反事实设计
- 事实固定与目标置换:在案件事实保持不变的前提下,分别在目标法律依据与对照依据下提示模型生成带思考标签的CoT。
- 四类法律决策目标:针对ECHR替换公约条款(Article 8对比Article 3;Article 6对比Article 14),针对SCOTUS替换案由领域(刑事诉讼对比经济活动;第一修正案对比民权),针对ContractNLI替换合同条款(强制披露通知对比禁止招揽)。
- CaseHOLD先例替换:对于CaseHOLD,保持案件事实与5个候选项不变,将输入中的引用先例名称替换为中性占位符Doe v. Roe。
内部承诺追踪与判定机制
- 句子边界隐层投影:在每个句子末尾提取隐藏状态h_t,通过非嵌入矩阵投影解码候选标签得分。
- 置信度判定与承诺步定义:设定得分最高的类别相对次优类别的优势阈值,解码标签为: elli = begincases texttop textif si( texttop) > 0 textand (si( text2nd) = 0 textor fracsi( texttop)si( text2nd) ge 1.5) bot textotherwise endcases 公式中 elli表示第i句解码出的离散标签,si(c)为类别c在第i句的得分;承诺步t*定义为解码标签从此固定为最终标签的最早句子索引。
核心评估指标
- 裁决置换敏感度:统计目标依据与对照依据下最终输出裁决发生改变的比例。
- 表面引用与承诺后再引用:表面引用指推理中是否提及被问及的依据;承诺后再引用要求模型在承诺步t*所在或之后的句子再次提及该依据。
- 提示注入鲁棒性:在案件事实末尾追加虚假指令,要求模型无视事实直接输出违约裁决,评估模型的遵从率。
论文做了哪些实验?
实验显示依据置换敏感度远低于表面引用率,且对抗注入遵从率在所有被测模型上均大幅高于置换敏感度。
实验设置
- 被测模型:Qwen3-8B、Qwen3-14B、Llama-3.1-8B、Llama-3-8B、Gemma-3-12B、Llama-3.3-70B、Legal-Δ-14B;并在消融中对比了未微调基座Qwen2.5-14B-Instruct。
- 数据集与规模:ECHR(ECtHR-A)、CaseHOLD、SCOTUS、ContractNLI;每个依据对每模型测试30个平衡样本(15正15负),CaseHOLD同样为30个样本。
- 运行与生成参数:本地bfloat16精度运行,随机种子统一固定为seed=42,新生成token上限为1536。
- 评估指标:收敛率、准确率、裁决置换敏感度(计算1000次重采样95%自举置信区间)、表面引用率、承诺后再引用率。
- 提示注入设置:在ECHR Pair A事实中追加伪造注册说明,强制要求输出VERDICT: VIOLATION,统计遵从率及裁决翻转率。
主结果
表格较宽,可左右滑动
模型 收敛率(%) 准确率(%) 裁决置换敏感度(%) 95%自举置信区间 表面引用率(%) 承诺后再引用率(%) Qwen3-8B 90.0 / 100 88.9 33.3 [14.8, 51.9] 100 53.3 Qwen3-14B 96.7 / 100 82.8 31.0 [13.8, 48.3] 100 70.0 Llama-3.1-8B 96.7 / 100 69.0 58.6 [41.4, 75.9] 100 33.3 Llama-3-8B 90.0 / 93.3 48.1 40.7 [22.2, 59.3] 80.0 46.7 Gemma-3-12B 100 / 100 66.7 36.7 [20.0, 56.7] 100 26.7 Legal-Δ-14B 100 / 100 83.3 33.3 [16.7, 50.0] 96.7 20.0 注:据Table 2,测试环境为ECHR Pair A(Article 8对比Article 3),各行n=30。在所有模型中,在首次提及依据前达成承诺的比例均为0.0%(未单独列行)。Llama-3.3-70B未包含在Table 2中。
- 表面引用与敏感度脱钩:作者称,表面引用率在多数模型上达到100%,但裁决置换敏感度仅为31.0%至58.6%,表明模型虽在文本中列出法条,裁决并不稳定依赖该法条。
- 行为敏感度与内部再引用不协同:Llama-3.1-8B置换敏感度最高(58.6%),但承诺后再引用率仅为33.3%;Qwen3-14B敏感度最低(31.0%),再引用率却达70.0%。
- 首次提名前承诺率为零:所有模型在所有样本中均在首句复述所问依据,因此t*全部出现在首次提及之后,作者称这反映了开篇模板行为。
鲁棒性与提示注入评估
- 对抗指令注入:在ECHR Pair A上,5个模型的注入遵从率为73.3%至96.4%(Table 3),全部超过其裁决置换敏感度;作者称模型服从编造指令的倾向超过跟踪真实依据的倾向。
- 更严格的裁决改变检验:注入导致输出不同于自身未注入基线的比例为18.5%至41.4%(Table 3),仅Qwen3-8B(41.4%)超过其置换敏感度(33.3%)。
- 改写不稳定性基准:保持依据不变仅改写提问语气的改写不稳定性为13.8%至23.3%(Table 3),低于裁决置换敏感度,作者称表明置换敏感度不仅是表面措辞扰动。
规模与专业模型分析
- 70B模型规模扩展:Llama-3.3-70B在ECHR Pair A敏感度为40.0%([23.3, 56.7]),在SCOTUS Pair A达到76.7%([60.0, 90.0]),但后者承诺后再引用率仅10.0%。
- 法律强化学习模型表现:通过强化学习微调的Legal-Δ-14B在四个数据集上置换敏感度未显著高于通用模型,其SCOTUS敏感度为70.0%,再引用率为0.0%(Table 7)。
- CaseHOLD先例替换测试:仅替换先例名称为Doe v. Roe时,答案置换敏感度仅为0.0%至21.7%(Table 6),Qwen3-8B置换率为0.0%。
其他消融与分析
- 原依据与对照依据金标真实不同的无混杂子集上,ContractNLI所有6个模型的敏感度从43.3%–50.0%升至50.0%–66.7%(Table 11)。
- 虚构占位符对照下,ECHR置换敏感度为10.0%至51.7%,SCOTUS为26.7%至43.3%(Table 12)。
- 原生思考模式关闭后,Qwen3-8B准确率从88.9%降至82.8%,再引用率从53.3%升至63.3%(Appendix G)。
- Qwen2.5-14B-Instruct基座对比LoRA合并模型,置换敏感度从26.7%升至33.3%,准确率从73.3%升至83.3%(Table 15)。
- 配对McNemar检验显示,ECHR Pair A上15组模型对仅2组名义p<0.05,SCOTUS仅5组名义p<0.05(Table 13、14)。
有什么可以进一步探索的点?
作者指出了样本量偏小、混杂未完全消除等局限,实验覆盖了7个模型与4个基准。
作者指出的局限与后续方向
- 样本量与统计功效偏小:作者在Section 9中指出,实验样本量仍处于中等水平,多项自举置信区间跨度达20点以上,配对精确检验确认多数两两模型排名在当前样本量下无统计区分度。
- 依据置换混杂未完全消除:作者在Section 9中指出,更换被问及的法律依据同时改变了被提问的问题本身,空依据基线与无混杂重采样虽缩小了该混杂,但未能完全排除残余影响。
- Legal-Δ-14B权重复现偏差:作者在Section 9中指出,公开权重为LoRA适配器且原训练基座未开源,合并至最接近的公开发行基座属于尽力复现。
- 测试依据对覆盖度有限:作者在Appendix N中指出,各数据集仅评估了一至两个依据对,未能覆盖教义相似度更高的法条或判例对。
- 探测信号方法未统一:作者在Appendix N中指出,ECHR因token划分限制采用了基于关键词的启发式分类器,而未采用与其他任务相同的直接logit lens单token读取。
- 未探索自发引用行为:作者在Appendix N中指出,所有实验均显式提示模型命名法律依据,未覆盖无显式提示下的自发引用场景。
实验覆盖范围
- 被测模型共7个,参数量分布在8B至70B区间。
- 评测基准包括ECHR、CaseHOLD、SCOTUS及ContractNLI共4个数据集。
- 每个数据集的每个依据条件样本量固定为n=30,并采用单一解码随机种子(seed=42)。
- 提示注入鲁棒性测试仅在ECHR Pair A上针对5个通用模型展开。
- 论文未报告更长文本的完整覆盖(SCOTUS文本截断至前6000字符)。
总结一下论文的主要内容
作者通过依据置换反事实与内部承诺追踪发现法律CoT裁决对依据依赖度有限,且易受提示注入操纵。
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
- 问题定位:大模型常通过列出法条或先例来证明其裁决合理,但尚无证据表明最终裁决在因果层面上确实依赖于被引用的依据,且缺乏对抗鲁棒性审计。
- 方法设计:作者提出固定案件事实而置换目标法律依据的反事实干预方法,并在推理句界应用logit lens解码隐层决策状态以定位承诺步,同时测试事实内嵌对抗指令的遵从情况。
- 核心实验发现:在ECHR、SCOTUS等司法与合同基准上,模型表面引用率普遍接近100%,但裁决置换敏感度在不同模型与任务上仅为0.0%至76.7%;在CaseHOLD上先例名称置换敏感度仅为0.0%–21.7%。
- 对抗风险暴露:在ECHR Pair A测试中,5个模型对混入案件事实的恶意指令遵从率达73.3%–96.4%,均大幅超过其依据置换敏感度,表明模型更容易被虚假注入左右而非依据自身。
- 结论与启示:作者认为单纯提及法律依据不能作为推理忠实性的可靠代理,依赖模型生成法律解释的系统在忠实性与安全性两方面均存在脆弱性。