跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.12313· Saisab Sadhu, Aadit Sengupta, Vinay kumar Sankarapu, Pratinav Seth·本站收录 · 原文发表

研究测试五个大模型合规系统对监管规则扰动的敏感度

Verdict Without the Rule: Diagnosing and Auditing Regulatory Rule Sensitivity in LLM Compliance Systems

论文速读

分析与理论

据论文 PDF 整理(AI 生成),以原文为准

五模型删换否定规则后裁决少变;定制规则下Llama-Guard-3-8B准确率51.1%。

问题
合规系统被默认会依据所给监管规则作裁决,但准确率评测不检查规则是否被用到。作者认为,规则删掉后仍然成立的裁决,不能靠基准高分成为合规判定。
方法
固定案例,对规则做删除、换域或否定强制义务。OCS看裁决是否翻转,ICS-delta看合规预测方向的投影变化占自身基线幅度的比例。再试规则锚定提示与激活导向能否拉回低敏感性案例的准确率。
实验与结果
OmniCompliance-100K的20域上,五模型OCS-agg为0.013–0.094,通用模型准确率90.3%–91.9%,护栏模型51.1%。规则必要案例上换规则OCS为0.73–1.00。两种干预未稳定提高低OCS准确率。
局限与可以继续做的
作者指出标准提示把规则截到300字符,低OCS可能来自信息不可用而非未使用。LOW/HIGH划分从Llama-3.3-70B-Instruct迁移,一致性未检验。ICS-delta只沿一个锚层方向;泛化只测一个模型。
实验设置Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct 等 · OmniCompliance-100K、LegalBench 等 · OCS-agg、OCS-del 等
被测模型
Llama-3.3-70B-InstructLlama-3.1-8B-InstructQwen2.5-7B-InstructMistral-7B-Instruct-v0.3Llama-Guard-3-8B
基准
OmniCompliance-100KLegalBenchContractNLI
指标
OCS-aggOCS-delOCS-swapOCS-negICS-deltabaseline accuracy
AI 导读研究者在五个模型和20个监管及平台政策领域上测试合规判定是否真正依赖所给规则,做法是固定案例、删除或替换或否定适用规则,再观察判定是否改变以及模型内部合规表征是否偏移。结果显示两者变化都不大,模型判定往往对规则的实质性扰动保持不变;其中护栏模型在其原生分类体系的自定义规则改编下规则敏感度和准确率最低,仅略高于随机(51%),而通用模型为90-92%。作者指出这更多反映案例本身容易,而非模型普遍忽视规则:在删除规则会改变原本正确预测的案例上,模型会紧密跟随规则。更好的提示词或直接干预模型内部表征都未能弥合这一差距,因此仅凭准确率无法证明合规判定建立在所给规则之上。

研究者在五个模型和20个监管及平台政策领域上测试合规判定是否真正依赖所给规则,做法是固定案例、删除或替换或否定适用规则,再观察判定是否改变以及模型内部合规表征是否偏移。结果显示两者变化都不大,模型判定往往对规则的实质性扰动保持不变;其中护栏模型在其原生分类体系的自定义规则改编下规则敏感度和准确率最低,仅略高于随机(51%),而通用模型为90-92%。作者指出这更多反映案例本身容易,而非模型普遍忽视规则:在删除规则会改变原本正确预测的案例上,模型会紧密跟随规则。更好的提示词或直接干预模型内部表征都未能弥合这一差距,因此仅凭准确率无法证明合规判定建立在所给规则之上。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    合规裁决被假定取决于所给规则,但删换否定后裁决与探针方向都少动。

    合规系统给出的裁决,是否真的取决于当时提供的监管规则。

    • 生产中的默认:作者称基于大语言模型的合规系统已在生产中作出有法律后果的判定,前提是它们会处理所给规则。标准评测只对照标注基准看准确率,不检查规则是否进入了裁决。
    • 准确率分不开两种正确:作者称,规则被整段删掉后仍然成立的裁决,不会因为基准分高就更站得住。若不查阅规则也能得到正确标签,它与必须依赖规则的正确裁决在准确率上看起来一样。
    • 两个独立方向:行为上固定文档,删除规则、换成另一领域规则,或否定强制性义务,看裁决变不变。表征上问同一扰动是否移动残差流里的合规预测方向。作者称,只看裁决无法区分“内部仍表征规则、输出前被压掉”和“所探方向根本不反映规则”。
    • 本文做的四件事:无参考、黑盒、可落到样本的 OCS;看合规预测方向是否编码所条件规则的 ICS-delta;用 OCS 找出敏感性最低的案例,再测提示词与表征干预能否恢复准确率;以及用五种文本特征描述领域差异。
    • 四个问题:RQ1 裁决是否随删除、换域或义务否定而变;RQ2 合规预测残差流方向是否移动;RQ3 规则锚定提示词与激活导向能否在最低敏感性案例上恢复准确率;RQ4 规则的哪些文本属性让领域更敏感或不敏感。
  2. 有哪些相关研究?

    相关工作多评准确率或信号是否存在,较少直接检验裁决是否用了所给规则。

    合规与法律系统

    • FinGuard、ComplianceNLP、GraphCompliance、LegiLM、Xu 等(2026)、RegOps-Bench 与 CLAUSE:覆盖多种监管场景,按分类、生成或检索准确率评测,不评裁决是否锚定所给规则。
    • Purushothama 等(2025):法律解释随提示变体而不稳定,论文写其未诊断原因。作者称 OCS 与 ICS-delta 为这种不稳定提供行为与表征检验。
    • RuleSafe-VL(Lu 等,2026):在视觉语言审核中讨论最终标签准确率很少说明模型是否用了底层规则结构。作者称这与本文关切相关。

    安全分类器与推理时策略

    • Inan 等(2023)、Han 等(2024)、Zhao 等(2025)、Mazeika 等(2024):专用安全与策略分类器多为额外前向,评测几乎只看准确率。
    • DynaGuard(Hoover 等,2026)与 CourtGuard(Suleymanov 等,2026):转向动态、推理时的策略条件化。作者称这是对 OCS 所诊断问题的另一种架构回答。

    忠实性、启发式与激活监测

    • Jacovi 与 Goldberg(2020)、Lanham 等(2023):追问陈述理由是否反映背后计算。作者称 OCS 更窄、纯行为,不需要解释,可用于只出标签的护栏模型;ICS-delta 把同一反事实逻辑用到内部表征。
    • McCoy 等(2019)诊断 NLI 的虚假启发式;Chalkidis 等(2022)的法律理解基准形式化法律推理,但不测规则锚定。作者称把前一种逻辑用于合规。
    • Rachmil 等(2025)、Rozenfeld 等(2026)、Mehta(2026)、McKenzie 等(2025)、Sadhu 等(2026a):从激活或 logits 看违规或冲突信号是否存在,不问该信号是否编码所给的具体规则。

    最直接相关的工作

    • LPG(Li 等,2026):去掉被违反的策略条款,检查裁决是否转为安全。
    • Sadhu 等(2026b):本文 ICS 探针的基础;检验删除、打乱或替换规则是否改变护栏模型与激活探针的聚合分类器 AUROC。作者称 ICS-delta 测的是同种扰动下逐样本表征位移幅度,并与 OCS 的独立行为反事实联合看,而不是孤立看聚合准确率变化。
    • 比较参照与数据:独立性参照写为 ≈ 0.5;第 5 节改为各模型经验裁决边际下的零假设。数据为 OmniCompliance-100K 的 20 域子集,泛化用 LegalBench 与 ContractNLI。

    作者把本文定位为系统性多领域审计:行为敏感性与激活层敏感性配对,并用规则必要性对照,分开单一裁决反事实分不开的两种准确率机制。

  3. 论文如何解决这个问题?

    用OCS看裁决是否随规则扰动翻转,用ICS-delta看合规预测方向是否移动。

    作者用两个互补仪器检验规则依赖:OCS 问裁决是否随规则扰动改变,ICS-delta 问内部合规预测表征是否在同样扰动下移动。两者只改规则字段,文档固定。

    扰动与 OCS

    • 系统 M 输入文档 d 与规则 R,输出 V∈{0,1}(不合规/合规)。条件为删除、换域、否定。不调用外部 API。
    • OCS-del:规则改为空字符串。OCS-swap:换成均匀抽到的另一监管领域中最常见规则文本。OCS-neg:只否定 must/shall,may/can/should 不动;没有强制性情态的样本不计入,不当作未改变。各域情态覆盖率 0.0–60.7%(Table 4);三个域为 0.0%,整域排除。
    • 条件 τ 下,OCSτ(M,s)=1 当且仅当裁决改变,否则为 0,表示该扰动下输出是否翻转。由它平均得到的量都在 [0,1]。逐样本分数对适用条件平均。
    • LOW-OCS:每个适用条件都不变。HIGH-OCS:三种里至少两种改变。划分在 Llama-3.3-70B-Instruct 上定义,再原样用于其他模型。随机、与规则无关的翻转且边际无偏时,期望 OCS 约为 0.5。

    OCS 不衡量什么

    • 作者称 OCS 是反事实规则依赖的诊断代理,不是正确性度量。低 OCS 只表示裁决在这些操作下大体不变,不确立推理错误,也不表示改变后的裁决在法律上应当改变。
    • 第 5.4 节的规则必要性是操作性定义:基线(真实规则在场)正确,删除后错误。作者称这不是独立标注的“法律任务本身需要该规则”。

    ICS-delta

    • ICS(Sadhu 等,2026b)是免训练探针:每个模型、每个领域在锚层取合规与不合规激活簇的归一化均值差方向;锚层按与拟合划分不相交的验证划分上 AUROC 的 argmax 选取。对新样本,ICS 是最后 token 残差流激活在该固定方向上的投影。
    • ICS-deltaτ(M,s)=|ICS(M,d,R)−ICS(M,d,Rτ)|,即只改规则时,扰动前后该投影之差的绝对值。ICS 无固定上界,故报告为该模型自身平均基线 |ICS| 的比例。
    • 四个通用模型(文中称 Tier-1)拟合该方向。Llama-Guard-3-8B 只做行为 OCS:作者称其架构与任务格式与另外四个相差太大,共享方向含义不同。WildGuard 被排除,因其固定子类体系不接收规则条件输入。

    干预、文本特征与裁决抽取

    • 规则锚定提示词:先引用最相关条款,再给裁决。激活导向:在锚层残差流加上 α 乘该方向;正 α 朝向合规簇,负 α 朝向不合规簇。α 取 −1、−0.5、0.5、1,0 为未导向基线。只在两个 Llama 指令模型上做。
    • 五个特征从各域每条规则文本提取,不只一条最常见规则:例外条款密度、交叉引用数、强制性情态比、平均依存树深度、Flesch-Kincaid 年级。对五模型的域均值 OCS-agg 做 Spearman,并做标准化 OLS;五个检验用 Benjamini-Hochberg 校正。
    • 通用模型的标准提示词把规则截到前 300 字符,要求只答 Compliant 或 Non-compliant(附录 C)。解析时先查不合规字符串;两者都没有则记 null,从该条件排除,不猜。Llama-Guard-3-8B 绕过打包 chat template,在其微调分隔骨架里用一条自定义合规类别替换固定 14 类,safe 读为合规、unsafe 读为不合规(附录 A)。论文未写该骨架是否同样截到 300 字符。
  4. 论文做了哪些实验?

    五模型OCS-agg为0.013–0.094;通用模型准确率90.3%–91.9%,护栏模型51.1%。

    实验设置

    • 模型:本地运行,无闭源或 API。Llama-3.1-8B-Instruct(bf16)、Llama-3.3-70B-Instruct(int8;需要单一代表时的主模型)、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、Llama-Guard-3-8B。WildGuard 未运行。Table 1 表头为简称,全名见 Section 4.3。
    • 主数据:OmniCompliance-100K,标签来自监管执法文本(COMPLIES/VIOLATES),非模型自标注。固定 20 域,覆盖数据保护、AI 安全、金融、网络安全、教育、平台政策与基本权利(Table 4)。每域每模型 200 例,支持时 100/100;edu_discrimination_us_edu_dept 全库 146 例、全部使用。分层且 seed 42,五模型见同一批案例。
    • 生成量:每模型 12,897 次(案例,条件)生成,合计 64,485;各模型可解析裁决率高于 99.5%(Section 4.2)。无 LLM 评审,按字符串解析。
    • 统计:Spearman、BH 校正、域内置换(零假设 10,000 次,规则必要性 20,000 次)、McNemar 精确检验。ICS-delta 只在四个 Tier-1 模型上报告;导向只覆盖两个 Llama 模型。
    • 泛化:LegalBench 887 例(sara_entailment 272、privacy_policy_entailment 615);ContractNLI 分层 400 例(蕴含与矛盾各 200,去掉 neutral),Table 2 的 n=387 为可解析基线裁决。仅 Llama-3.3-70B-Instruct,不做 ICS-delta、干预或回归。

    主结果

    据 Table 1(OCS,20 域汇总,每域 200 例,seed 42)与 Table 5(准确率)。通用模型用截到 300 字符的标准提示词。

    表格较宽,可左右滑动

    模型OCS-delOCS-swapOCS-negOCS-agg基线准确率
    Qwen2.5-7B0.0520.1180.1350.09490.3%
    Llama-3.1-8B0.0640.0790.0600.07091.9%
    Llama-3.3-70B0.0610.0950.0840.08190.9%
    Llama-Guard-3-8B0.0140.0150.0090.01351.1%
    Mistral-7B-v0.30.0760.1030.0650.08990.3%
    • 作者称五模型 OCS-agg 都低于 ≈ 0.5 的独立性参照;100 个(模型,领域)格子的均值为 0.069。跨模型跨域汇总,OCS-del 为 0.053,低于 OCS-neg 的 0.070 与 OCS-swap 的 0.082:规则被整段删除时裁决最不容易变。
    • 作者称删除准确率是“只看案例内容”的最近代理,四个通用模型都在基线 4 个点以内;Qwen2.5-7B 与 Mistral-7B-v0.3 略高于基线(Table 5:90.7%、91.6%)。交换与否定后,作者写准确率进一步到 79.5%–89.7%;Table 5 中护栏模型对应格为 50.1% 与 50.9%,不在该区间。
    • 作者称 Figure 2 几乎每格都冷。文中给出的最高格是 Mistral-7B-v0.3 × cybersecurity_mitre_attack,OCS-agg 0.265,其他模型在该域未复现。跨模型最高域均值是 sb35,0.138。摘要写护栏模型 51%、通用模型 90–92%;Table 5 为 51.1% 与 90.3%–91.9%。

    零假设与规则必要性

    • 零假设:按各模型经验边际,翻转率参照为 p(1−q)+q(1−p)。四个通用模型的零假设为 0.48–0.50,观察 OCS-agg 在 10,000 次置换中均更低(p < 0.0001,Table 8)。Llama-Guard-3-8B 的 p=0.985、q=0.996,零假设为 0.019,观察值 0.013 仍更低(p < 0.0001)。作者称它几乎不论条件都答合规,规则不敏感超过其响应偏差所能解释的程度。
    • 子集定义:基线正确且删除后错误。规模从 Qwen2.5-7B-Instruct 的 94 到 Llama-3.3-70B-Instruct 的 187,护栏模型 49;四个通用模型同时落入该定义的抽样案例只有 6 个。
    • 子集上的换规则:作者称每个模型的 OCS-swap 升至 0.73–1.00,对照汇总的 0.08–0.12。十项检验、Bonferroni 阈值 0.005 下,只有 Llama-3.1-8B-Instruct 高于自身零假设(n=132,观察 0.780,零假设 0.669,p↑ < 0.0001)。Mistral 的 p↑=0.006。Llama-3.3-70B-Instruct 的 swap 为 0.733 对零假设 0.723(p↑=0.329)。护栏模型子集观察值与零假设同为 1.000(Table 9)。其 OCS-neg 的名义 p↓=0.036 未过 0.005,作者不把它当作支持的下降。

    跨数据集泛化

    • Table 2(仅 Llama-3.3-70B-Instruct):OmniCompliance-100K 的 OCS-agg 0.081、基线准确率 0.909、n=3,946;LegalBench 0.255、0.497、n=887;ContractNLI 0.318、0.786、n=387。作者称后两者相对主数据为 3.1 倍与 3.9 倍,但仍低于 0.5。
    • 作者解读:这不利于把低规则敏感性当成固定、与数据集无关的程度。LegalBench 基线准确率 49.7%,作者认为升高的 OCS 可能部分来自任务难度,而不是规则锚定。ContractNLI 写为 78.6%,高于随机,作者认为其更高 OCS 更干净,并可能与“假设作规则、合同摘录作文档”这一更紧的格式有关。
    • 两个外部集的不可解析率,作者并列写为 1.4% 与 3.3%,高于主数据近乎为零的比率;论文未在该句逐项标明对应哪一数据集。作者认为应在接近部署分布的数据上计算 OCS,而不是携带单一数字。

    干预

    • 规则锚定提示词(Table 11;分区来自 Llama-3.3-70B-Instruct,McNemar):十格里只有 Qwen2.5-7B 的 LOW-OCS 达到论文所用阈值,∆=−0.028(p < 0.0001),准确率下降。Llama-3.3-70B 的 ∆low=+0.007(p=0.073),Mistral 的 ∆low=−0.010(p=0.077)。作者称没有模型得到支持的提升,且有一个模型在本欲帮助的案例上变差。
    • 激活导向(Table 3,百分数):Llama-3.1-8B 的 LOW 未导向基线 92.8% 为该分区最高;α=−1 与 +1 均为 92.3%。Llama-3.3-70B 的 LOW 基线 92.1%,α=−1 为 91.7%(p=0.0044);HIGH 基线 79.2%,α=−1 为 73.3%(p=0.0290)。正 α 没有一格稳定超过基线。
    • 作者称这些逐设置比较未对表中 16 次比较做校正,视为探索性。与提示词结果合看,两种干预都没有在 LOW-OCS 案例上产生可推广的准确率恢复。

    其他消融与分析

    • ICS-delta 占自身 mean |ICS|:Llama-3.1-8B 12.8%,Llama-3.3-70B 21.0%,Mistral-7B-v0.3 22.9%,Qwen2.5-7B 16.7%(Section 3.2.2;Table 6)。各模型都是 OCS-neg 的投影变化最小。
    • OCS-agg 与 ICS-delta-agg 的域排序 Spearman:ρ 为 0.114、0.084、−0.032、0.338,p 为 0.631、0.724、0.895、0.145,均未达常规阈值(Table 7,n=20 域)。
    • 与域均值 OCS-agg:ECD ρ=0.041(pBH=0.86),CRC ρ=0.241(pBH=0.38),MMR ρ=0.405,FKGL ρ=0.448;仅 MDD ρ=0.570、pBH=0.044。联合 OLS:R²=0.484,adjusted R²=0.285,F=2.44,p=0.091,n=19(Table 10)。Figure 6 作者称联合模型内没有系数单独 p<0.05,MDD 最接近。MDD 相关为正:树更深对应更高 OCS。
    • OCS-agg 与基线准确率:ρ=0.190,p=0.058,n=100(Appendix F)。作者将其视为边际关系。
    • Figure 1 的一个案例:换规则或否定义务会翻转该模型裁决,合规预测激活位移不超过基线幅度的 7.9%。图注未写模型名,并称余弦/角度记号是概念简化。
    • 护栏模型在自定义规则适配下同时规则敏感性最低、准确率最低。作者认为这与任务格式不匹配一致,而不是关于合规专用训练的一般主张;通用模型则是高准确率、低规则敏感性。
  5. 有什么可以进一步探索的点?

    作者指出规则截断至300字符,且划分迁移假设未经检验。

    作者指出的局限与后续方向

    • 截断:标准提示词把规则截到 300 字符。作者称结果刻画的是该提示格式下的敏感性,不一定是对完整监管文本的敏感性;操作条款落在窗口外时,低 OCS 可能反映规则信息不可用,而不是没用已有信息(Limitations)。
    • 提示未分离:规则锚定提示词同时加入完整规则并改变推理指令,两种提示未对规则完整性做对照(Limitations)。
    • 后续测量:作者称删除下准确率下降相对较小(Table 5),与 OmniCompliance-100K 的构建方式一致,场景侧存在标签信号。未来工作应直接测量仅场景预测,并单独控制规则截断(Limitations)。
    • OCS 的对象:OCS 测扰动下裁决是否改变,不测改变是否法律上正确;只扰动规则字段,案例文本扰动是未处理的互补失效模式(Limitations)。
    • 划分与探针:LOW/HIGH-OCS 在 Llama-3.3-70B-Instruct 上定义后迁移,跨架构一致性假设未检验;若某模型的低敏感案例差很多,干预会测在错误子集上且无法察觉。ICS-delta 只沿一个锚层的一个合规预测方向,规则内容可能在别处,低 ICS-delta 不能排除这一点(Limitations)。
    • 功效与结论边界:规则必要子集较小,其中 OCS-neg 功效不足;泛化检查只用一个模型。三个零强制性情态域不适用 OCS-neg。结论称,这些结果并不证明该模式永久存在或不能被未测试方法修复,也不确立这些模型从不编码或使用监管规则(Limitations;Conclusion)。

    实验覆盖范围

    • 行为审计为五个本地开源模型、OmniCompliance-100K 的 20 个域;抽样与域规模见 Section 4.2 与 Table 4,种子为 42。论文未报告该主审计在其他种子上的重复。
    • ICS 方向与 ICS-delta 覆盖四个 Tier-1 通用模型;Llama-Guard-3-8B 只报告 OCS(Section 4.3)。
    • 激活导向的 α 扫描覆盖 Llama-3.3-70B-Instruct 与 Llama-3.1-8B-Instruct 的 LOW/HIGH 分区(Section 7.2,Table 3)。
    • 跨数据集检查覆盖 LegalBench 与 ContractNLI,且仅 Llama-3.3-70B-Instruct;该节写明未做 ICS-delta、干预或回归(Section 6)。
    • OCS-neg 按逐样本强制性情态决定是否适用;Table 4 中 cybersecurity_mitre_attack、edu_academic_integrity、edu_online_learning 的覆盖率为 0.0%,整域排除。裁决由字符串解析,论文未报告与人工判定的一致性。
  6. 总结一下论文的主要内容

    五模型上许多正确裁决对删换否定规则大体不变;作者称准确率不能充当规则锚定证据。

    用行为反事实和激活探针,审计合规裁决是否依赖所给规则。

    作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。只报准确率做不到这一点。

    做法是固定案例、只改规则:删除、换成其他领域最常见规则,或否定 must/shall。OCS 记录裁决是否翻转,并可落到样本。ICS-delta 记录最后 token 残差流上、预先拟合的合规预测方向移动了多少,再除以各模型自身的平均 |ICS|。低敏感案例再试规则锚定提示词和激活导向。

    • Table 1 在 OmniCompliance-100K 的 20 域上,OCS-agg 从定制规则适配的 Llama-Guard-3-8B 的 0.013,到 Qwen2.5-7B 的 0.094。Table 5 基线准确率:四个通用模型 90.3%–91.9%,护栏模型 51.1%。作者称删除后的准确率与基线相差不超过 4 个点。
    • 在“有规则时正确、删规则后错误”的子集上,作者报告 OCS-swap 为 0.73–1.00。十项检验里,只有 Llama-3.1-8B-Instruct 在 Bonferroni 阈值 0.005 下高于自身零假设(观察 0.780,n=132)。
    • 四个 Tier-1 模型的 ICS-delta 为自身 mean |ICS| 的 12.8%–22.9%。作者认为这表示所测方向对规则敏感有限,但不表示残差流其他位置没有规则信息。两套指标的域排序相关未达常规阈值。
    • 仅 Llama-3.3-70B-Instruct:LegalBench 与 ContractNLI 的 OCS-agg 为 0.255 与 0.318,作者称约为该模型在主数据上 0.081 的 3.1 倍与 3.9 倍,仍低于 0.5。
    • Qwen2.5-7B 在 LOW-OCS 分区上,规则锚定提示词的准确率变化为 −0.028(p < 0.0001)。激活导向没有设置稳定超过未导向基线。

    作者的结论是:高基准准确率可以与对所给规则的大幅不变性同时出现,所以准确率本身不足以作为规则锚定合规推理的证据;把现成安全分类器改去查监管规则时尤其要小心。OCS 不需要金标签,作者认为可作部署前检查,但低分只促使审视,不能判定法律上对不对。领域级敏感性与依存树深度的 Spearman ρ 为 0.570(pBH=0.044),强于例外条款和交叉引用;联合回归本身 p=0.091,作者称该回归是提示性的,而不是决定性的。

阅读原文arxiv.org