跳到正文
原文
arXiv· arXiv:2610.01641· Poushali Sengupta, Sabita Maharjan, Frank Eliassen, Shashi Raj Pandey, Yan Zhang·本站收录 · 原文发表

MCIR:面向特征依赖的可解释性方法与可靠性保证

MCIR: A Feature Dependence-Aware Explainability Method with Reliability Guarantees

论文速读

分析/可解释性

据论文 PDF 整理(AI 生成),以原文为准

Sengupta 等人提出 MCIR-M,用邻域条件互信息的归一化比值度量特征的独特预测信息;合成近重复下优势最清晰,真实数据上与 SHAP、SAGE 等比较好坏不一。

问题
强特征依赖下,SHAP、LIME、HSIC、MI/CMI、SAGE 等可能把共享预测信息分给冗余特征,排序不稳且计算变贵。CIR 与 BlockCIR 不直接度量单个特征相对邻域的独特条件信息。
方法
MCIR-M 为每个特征筛选小的强依赖邻域 XΦ(i),用条件互信息 Ui 相对扩大块互信息 Ji 做归一化,得到 Ci = 2Ui / (Ui + Ji)。分数在 [0, 1],精确条件冗余时为 0。另用缩减解释样本做轻量估计,并用排序、头集与忠实性诊断对照全量解释。
实验与结果
作者报告:受控合成冗余与 UCI HAR 上 MCIR 呈现依赖感知排序,最清晰优势出现在注入近重复预测变量时;与独立/条件 SHAP、SAGE、HSIC、基于 MI 的分数及 CIR 族基线在真实数据各准则上比较好坏不一。减少解释样本在所评配置中降低计算负担,全量与轻量的一致性另行用排序、头集和忠实性诊断评估。
局限与可以继续做的
有界性只提供共同数值范围,并不意味着跨数据集或任务校准相同。估计器切换与 Auto-Φ 是数据驱动启发式,不是 oracle 最优。轻量保真是操作诊断,没有自动保持保证。表示层接近不能单独控制归因排序差异。
实验设置fixed predictive model M、UCI HAR classifier 等 · controlled synthetic redundancy experiments、UCI HAR 等 · MCIR score Ci、Kendall rank discrepancy drank 等
模型
fixed predictive model MUCI HAR classifierHouseEnergy-Sim predictorCIFAR-10 representation modelNorwegian load forecasting model
基准
controlled synthetic redundancy experimentsUCI HARHouseEnergy-SimCIFAR-10 representationsNorwegian load forecasting
指标
MCIR score CiKendall rank discrepancy dranktop-K disagreement dJ@Kdeletion/insertion faithfulnessruntimerepresentation discrepancy drepr
AI 导读全文 287 字

针对强相关或冗余特征导致 SHAP、LIME、HSIC、MI/CMI、SAGE 等方法在多共线性下排名不稳的问题,研究者提出全局特征重要性方法 MCIR-M,其核心指标互相关影响比(MCIR)将每个特征条件于强依赖邻居并计算归一化比值,取值落在 [0,1],精确条件冗余时为 0。该方法还引入轻量估计流程,仅用部分数据即可近似完整数据的解释结果。在合成冗余实验与 UCI HAR 基准上,MCIR 展现出依赖感知的排序行为,优势最明显的是注入近重复预测变量的场景;但与独立及条件 SHAP、SAGE、HSIC、MI 类评分以及 CIR 系基线的对比在不同评价标准下有优有劣。

深度解读

6 个问题,约 7,200 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    强依赖下现有归因会把共享信息分给冗余特征,MCIR 度量相对邻域的独特预测信息。

    强特征依赖下,全局归因难以区分一个特征相对其相关邻域所贡献的独特预测信息。

    • 场景与重要性:作者称现代模型部署在高风险、数据丰富的环境中,特征交互更复杂。存在多重共线性或近重复预测变量时,共享预测信息如何分配会让归因敏感,可能产生不稳定排序并增加计算成本。
    • 现有方法的不足:作者称 SHAP、LIME、HSIC、MI/CMI 与 SAGE 可能把重要性分给冗余特征,从而掩盖哪些变量含有独特预测信息。CIR 与 BlockCIR 处理依赖的相关方面,但不直接度量单个特征贡献的独特条件信息。无条件置换重要性和基于不纯度的重要性在相关预测变量下可能有偏或难以解释。CMI 能做条件隔离,但其有限样本估计对样本量与条件维数敏感。
    • 核心观察:作者把归因对象定为输入特征与固定预测模型输出表示 Z 之间的统计依赖,而不是对真实目标 Y⋆ 的因果依赖。独特信息始终相对所选邻域 XΦ(i) 定义:精确条件冗余(Q ⊥ Xi | XΦ(i))时,总体分数应为 0。有界性只提供共同数值范围,并不意味着跨任务校准相同。
    • 本文提出的方法:作者提出 Mutual Correlation Impact Ratio Method(MCIR-M),一种依赖感知的全局特征重要性流程。其中 Mutual Correlation Impact Ratio(MCIR) 把每个特征条件于一小集强依赖邻居,并计算条件信息相对块级信息的归一化比值。另给出用部分数据估计 MCIR、再用排序与忠实性诊断对照全量解释的轻量流程。贡献被表述为冗余感知的归因构造及其总体、有限样本与轻量计算分析,而不是新的通用 CMI 估计器。
  2. 有哪些相关研究?

    相关工作按联盟归因、信息度量、预测风险与 CIR 族分组,MCIR 强调相对特征专属邻域的独特条件信息。

    作者在第 2 节按归因目标与依赖处理方式分组,并在 Table 1 对比各方法族。作者强调这些泛函目标不同,不必产生相同排序。

    扰动、联盟与局部代理

    • SHAP / SAGE / LIME:Lundberg & Lee (2017) 的干预 SHAP、Aas et al. (2021) 的条件 SHAP、Covert et al. (2020) 的 SAGE,以及 Ribeiro et al. (2016) 的 LIME,通过联盟价值函数或局部代理分配贡献。作者称标准 KernelSHAP 常用特征独立近似,条件变体则估计条件分布以保留依赖;相关预测变量在不同合法 Shapley 表述下可以分到不同份额,这反映估计量不同,而不是 Shapley 值普遍失效。
    • 置换与不纯度重要性:Breiman (2001)、Strobl et al. (2008) 讨论无条件置换重要性与基于不纯度的重要性;作者称它们在相关预测变量下可能有偏或难以解释。
    • ROAR 与删除测试:Hooker et al. (2019)、Samek et al. (2017) 检查移除或替换所选特征后预测性能是否变化。作者称其结果依赖扰动、替换、再训练与评测协议,应与归因泛函本身区分。

    信息论、核依赖与交互

    • MI、HSIC 与 CMI:Cover & Thomas (2006)、Kraskov et al. (2004)、Gretton et al. (2005; 2007) 与 Gao et al. (2018)。边际 MI 与 HSIC 量化无条件依赖,CMI 量化条件后剩余依赖。作者称这些量没有统一的单位区间尺度,非参数 CMI 在较大条件维数下需要估计器特定的正则与样本量条件。
    • Archipelago:Tsang et al. (2020) 建模并归因高阶特征交互。作者称该目标不同于 MCIR:后者把独特条件信息相对所选依赖邻域做归一化。

    预测风险、方差分配与因果/鲁棒性

    • LOCO 与算法无关变量重要性:Lei et al. (2018)、Williamson et al. (2021) 用去掉一个协变量后的预测性能变化度量重要性。作者称较小的 LOCO 值不必意味着没有预测关联,其目标是预测风险变化而不是独特条件信息。
    • Shapley effects 与树模型条件 Shapley:Owen & Prieur (2017) 在可能相关的输入之间分配被解释方差;Amoukou et al. (2022) 改进树模型上条件 Shapley 值的估计。作者称它们分配共享解释方差,而不是隔离相对所选邻域的独特信息。
    • 因果归因与事后解释鲁棒性:Janzing et al. (2020) 的因果特征归因需要观测联合律之外的因果假设或结构信息。Ghorbani et al. (2019)、Slack et al. (2020) 在其所考察设置中显示,事后解释可在保持预测的小扰动或故意操纵模型时改变。作者据此主张明确写出归因目标、依赖处理、估计器与扰动协议。

    CIR 族与本文基线

    • CIR / PCIR / BlockCIR / ExCIR:Sengupta et al. (2025a;b)。作者称 Correlation Impact Ratio 给出有界的特征–输出共动度量;实验表中的逐特征实现称为 PCIR,同族还有组级 BlockCIR 与多类输出的类条件 ExCIR(文中亦写 CC-CIR)。作者称它们捕捉共享结构与交叉协方差几何,但不显式估计特征相对 XΦ(i) 的独特条件信息。Figure 1 把 PCIR 画成不显式条件于依赖邻域的全局关联。
    • 基线与对照:实验对照包括 SHAP(独立与条件)、SAGE、HSIC、基于 MI 的分数、CIR 族基线,以及第 6.1.3 节在受控依赖结构下与 LOCO、区域加权的 R-LOCO 风格流程(Amoukou & Brunel, 2026)和相关输入 Shapley-effects 插件估计器的比较。评测数据包括受控合成冗余、UCI HAR、HouseEnergy-Sim、CIFAR-10 表示与挪威负荷预测。

    作者把 MCIR-M 定位为:对特征专属的筛选依赖邻域做条件,从而得到一种冗余感知的归因泛函及其分析,而不是主张不同归因目标应给出相同排序。

  3. 论文如何解决这个问题?

    MCIR 把特征相对其筛选邻域的条件互信息,用扩大块互信息归一化到 [0, 1]。

    整体思路是:对固定预测模型 M 的输出表示做全局解释。MCIR 是分数,MCIR-M 是完整流程:为每个特征选一小邻域,估计独特条件信息并归一化;轻量版本在缩减解释样本上计算同一泛函。

    问题设定与解释对象

    • 解释对象:X = (X1, …, Xk),固定可测预测器 M : X → Rd 给出 Z = M(X)。MCIR 解释特征与 Z 的统计依赖,作者明确不把它当作因果变量重要性。
    • 邻域:对特征 i,Φ(i) ⊆ {1, …, k}{i},XΦ(i) 为对应块。Ui = I(Q; Xi | XΦ(i)) 是条件后剩余信息,Ji = I(Q; XΦ(i)∪{i}) 是扩大块的联合互信息。Q 在全量环境为 Z,在轻量环境为 Z′。
    • 两种环境:全量经验环境用 N 条解释样本;轻量环境用 n < N 的子集,并可选表示映射 G : Rd → Rd′(d′ ≤ d)。只做子采样时 G 为恒等、d′ = d。作者把观测数 N、n 与表示维数 d、d′ 分开。
    • 表示相似度不蕴含归因一致:当 d′ < d 时用 Cai & Lim (2022) 的增广 Wasserstein 距离比较边际输出律。作者给出反例:两个独立同分布 Bernoulli 变量互换作为输出时,边际输出律可相同而特征排序不同。排序差异 drank、头集差异 dJ@K 与表示差异分开报告。

    MCIR 分数

    • 定义:在 Ui + Ji > 0 时,Ci = 2Ui / (Ui + Ji);两者都为 0 时令 Ci = 0。由链式法则 Ji = I(Q; XΦ(i)) + Ui ≥ Ui,故 Ci ∈ [0, 1]。写成 Hi = I(Q; XΦ(i)) 时,Ci = 2Ui / (2Ui + Hi)。
    • 含义:分子是相对邻域的独特预测信息,分母用扩大块信息做参照。接近 0 表示条件于邻域后独特信息很少;接近 1 表示扩大块的预测信息几乎全由 Xi 贡献(Hi = 0 且 Ui > 0)。作者称该“独特”是统计预测信息,不表示因果效应,也不能在没有外部顺序或不对称邻域规则时区分两个精确重复里哪一个是“原始”特征。
    • 与 CMI、PID 的差别:作者称混合变量 CMI 只是同一总体 CMI 泛函在连续、离散与混合类型上的称呼,不是新的信息度量。MCIR 不声称给出完整的部分信息分解,也不单独识别协同分量。

    总体性质

    Table 2 归纳性质及其适用范围。

    • 有界与端点:Ci = 0 当且仅当 Ui = 0,当且仅当 Q ⊥ Xi | XΦ(i) 几乎必然。若 Xi 关于 σ(XΦ(i)) 可测(含精确重复及其可测变换),则 Ci = 0。Ci = 1 当且仅当 Ui > 0 且邻域单独不携带关于 Q 的预测信息。
    • 再参数化不变:Proposition 1:对 Q、Xi、XΦ(i) 做双可测双射后,总体 MCIR 不变。作者把它与高斯–copula 估计器的秩单调不变分开,后者是估计器性质。
    • 弱依赖退化:Proposition 2:若条件于邻域对 Xi 的信息只产生渐近可忽略的影响,则 MCIR 变成归一化的边际信息分数。作者称这不蕴含与 PCIR 或其他方法的排序等价。
    • 有限样本:Table 2 写明,经验分数一致性继承所选 MI/CMI 估计器,不假定统一收敛速率。排序稳定性需要估计器误差、分母分离与总体间隔条件(Theorem 1)。近似重复不做总体 KL 连续性论证,而用估计误差与排序敏感性诊断。

    估计、邻域与轻量计算

    • 估计器选择:Auto-Φ 与 bootstrap 估计器切换被作者称为面向不同数据类型与依赖结构的实用启发式,不是 oracle 最优;其代价与限制被要求显式报告。MCIR-M 不消除 CMI 估计的既有困难,而是用筛选后的局部邻域限制条件维数,并写出估计器特定条件。
    • 轻量流程:在缩减解释样本上计算同一归因泛函。充分性用表示、排序、top-K 与行为(删除/插入)诊断分开评估,作者称没有自动保持保证。附录 J 把这四项作为联合诊断:其中一项不能当作另一项成立的前提。
    • 成功/对照含义:删除与插入曲线被作者视为排序与评测协议的观测结果,用来检查归因行为,而不是用来证明曲线或排序必然一致。PCIR 只作为不显式条件于邻域的历史全局基线,不用于建立 MCIR 的测度论或信息论性质。
  4. 论文做了哪些实验?

    合成近重复上依赖感知排序最清晰;真实数据上与 SHAP、SAGE、HSIC、MI 与 CIR 族的比较好坏不一。

    实验设置

    • 任务范围:第 5 节与第 6.1 节在合成与真实数据上评测。作者列出的评测包括受控冗余、UCI HAR、HouseEnergy-Sim、CIFAR-10 表示,以及挪威负荷预测。
    • 对照方法:SHAP(独立与条件)、SAGE、HSIC、基于 MI 的分数、CIR 族基线(含实验表中的 PCIR,以及 BlockCIR、类条件 ExCIR/CC-CIR)。第 6.1.3 节另在同一受控依赖结构下比较 LOCO、区域加权 R-LOCO 风格流程,以及相关输入的 Shapley-effects 有限样本插件估计。作者称比较的是预测风险变化、区域损失变化、解释方差分配与独特条件信息这几种不同目标。
    • 指标:排序、组级、删除、估计器敏感性与运行时间;轻量实验另报全量与轻量之间的表示差异、Kendall 排序差异 drank、头集差异 dJ@K,以及删除/插入曲线差异。MCIR 解释的是模型输出表示,不是真实标签上的因果重要性。
    • 诊断定义:drank = (1 − τ)/2,τ 为带并列校正的 Kendall 系数,取值在 [0, 1],0 为完全一致。dJ@K 用 top-K 特征集合的 Jaccard 补,同样在 [0, 1],比较的是特征身份是否相同。
    • 评审与重复:论文在所附正文中没有把上述实验写成由某个 LLM 打分,也没有在本解读所依据的正文里给出统一的重复次数或每个条件的样本量;这些若只出现在未附上的附录表中,此处不转写具体数字。
    • 被测对象:被解释的是各数据集上固定的预测模型 M 及其输出表示 Z。正文未在一处把全部模型的名称与版本列成清单。

    主结果

    所附正文与摘要没有给出可逐格回查的主结果数值表;Table 1、Table 2 是方法性质对照,不是实验分数。因此下表只记录作者在摘要与贡献列表中的定性结论,不填论文未写出的数字。

    设置作者报告的结论出处
    注入近重复的受控冗余依赖感知排序的最清晰优势出现在这一设置摘要;贡献 3
    UCI HAR 及真实数据各准则与 SHAP(独立与条件)、SAGE、HSIC、MI 分数、CIR 族的比较好坏不一摘要
    缩减解释样本在所评配置中降低计算负担;与全量的一致性另行评估摘要;贡献 3
    • 作者解读:最清晰的收益出现在受控冗余实验;真实数据上的比较随准则而变化,作者没有把 MCIR 写成在所有模型或所有准则上都更好。
    • 轻量解释:作者把运行时间与全量–轻量一致性分成不同诊断,不用其中一个代替另一个。
    • 不同归因目标:第 6.1.3 节的 LOCO、R-LOCO 风格与 Shapley effects 对照,被作者用来检查不同估计量,而不是要求它们与 MCIR 排序相同。

    轻量环境与保真诊断

    • 测了什么:全量解释样本数 N 对缩减样本数 n,以及可选的输出表示降维 d′ < d。诊断包括表示层 Wasserstein 或增广 Wasserstein 距离、完整排序、top-K 头集,以及删除/插入行为。
    • 作者给出的结构性结果:附录 J 的反例表明,边际输出律相同(表示差异为 0)时,特征归因排序仍可不同。因此不存在不附加联合律假设就能把 drank 控在表示距离常数倍以内的一般界;本文不施加这类假设。
    • 作者的解读:四项诊断联合报告。删除/插入曲线差异是协议的观测结果,不能当作排名已经一致的前提。

    估计与理论所支撑的经验检查

    • 测了什么:估计器敏感性,以及有限样本下近似冗余是否仍表现为低分与稳定排序。作者把精确冗余的得分为 0 放在总体层(式 27),把近似重复放到估计误差与排序敏感性上。
    • 理论条件:Table 2 中的有限样本排序稳定需要分量误差、分母分离与间隔;经验分数一致性依赖所选 MI/CMI 估计器是否一致,且不假定统一收敛速率。
    • 作者的解读:Auto-Φ 与估计器切换是启发式。总体有界性不提供跨数据集的统一校准。

    其他消融与分析

    • 邻域筛选:用局部强依赖邻域限制条件维数;具体邻域大小与阈值若只在未附附录中给出,此处不写数字。
    • PCIR 对照:PCIR 不条件于 XΦ(i),定义、预处理与实现放在附录 B;它不用于证明 MCIR 的信息论性质。
    • 弱依赖:Proposition 2 给出总体退化形式,作者不把它说成与 PCIR 排序等价。
    • 不变性:总体分数在双可测再参数化下不变(Proposition 1);高斯–copula 的秩不变是另一条估计器性质。
    • 端点:精确重复若落入该特征的条件邻域,总体 MCIR 塌到 0;两个精确重复中哪一个保留正分数取决于各自邻域怎么定。
    • 表示降维:d′ < d 时投影可不保互信息;作者要求把信息损失和归因差异分开分析,而不是默认轻量降维保持 MCIR。
  5. 有什么可以进一步探索的点?

    作者把估计器启发式、跨任务校准和轻量保真的无自动保证写成方法边界。

    作者指出的局限与后续方向

    所附正文没有单独的 Limitations 小节全文。下面只列作者在方法陈述、Table 1–2 与附录 J 里明确写成边界或未保证的内容。

    • 跨任务校准:有界性提供共同数值范围,但本身不意味着不同数据分布或任务上校准相同(第 4.2 节;Table 2)。
    • 估计器选择不是最优程序:Auto-Φ 与 bootstrap 估计器切换是数据驱动启发式,不是 oracle 最优;作者要求显式报告其代价与限制(引言;贡献 2)。
    • CMI 估计困难仍在:MCIR-M 不消除对样本量、正则条件与条件维数的既有敏感,只是用筛选邻域限制条件维数(引言;第 2 节对 Gao et al. (2018) 的讨论)。
    • 轻量没有自动保持保证:全量与轻量的保真通过操作诊断刻画,没有自动保持保证(Table 1 末行)。表示接近不控制 MCIR 分数或排序差异(附录 J.1)。
    • 排序稳定是条件性的:有限样本排序界需要分量误差、分母分离与总体间隔(Table 2;Theorem 1)。一致性继承所选估计器,没有统一收敛速率(Table 2)。
    • 不能单靠依赖区分重复特征:没有外部顺序或不对称邻域规则时,统计依赖本身不能决定两个精确重复中哪一个是“原始”特征(第 4.2 节)。

    实验覆盖范围

    • 数据与任务:评测覆盖受控冗余、UCI HAR、HouseEnergy-Sim、CIFAR-10 表示与挪威负荷预测(贡献 3;第 5–6.1 节的组织说明)。
    • 对照族:包括 SHAP(独立与条件)、SAGE、HSIC、MI 分数、CIR 族,以及 LOCO、R-LOCO 风格流程和相关输入 Shapley-effects 插件估计(摘要;第 2 节;第 6.1.3 节)。
    • 诊断种类:排序、组级、删除、估计器敏感性、运行时间,以及轻量设置下的表示、完整排序、头集与行为诊断被分开报告(摘要;第 3 节;附录 J)。
    • 理论与估计的分工:总体性质(有界、端点、精确冗余塌缩、再参数化不变、弱依赖退化)与估计器条件分开陈述(第 4 节;Table 2)。
    • 论文未报告的统一数字:所附正文没有给出可回查的主表 ASR/分数矩阵、每个条件的样本量、重复次数,或轻量对照的具体 Kendall 数值;这些不能从方法定义推断。
  6. 总结一下论文的主要内容

    MCIR 用邻域条件信息的归一化比值做全局归因,精确冗余时为 0,真实数据比较好坏不一。

    MCIR-M 是面向强特征依赖的全局解释流程:它度量每个特征在一小集相关邻居之外还剩下多少预测信息,再把该量归一化成 [0, 1] 上的分数。

    • 问题:多重共线或近重复预测变量下,SHAP、LIME、HSIC、MI/CMI、SAGE 等可能把共享信息分给冗余特征。CIR 与 BlockCIR 不直接估计单个特征相对其邻域的独特条件信息。CMI 能隔离增量信息,但高条件维数下的有限样本估计困难。
    • 分数:对模型输出表示 Q,Ui 为 I(Q; Xi | XΦ(i)),Ji 为扩大块互信息。Ci = 2Ui / (Ui + Ji)(分母为 0 时定义为 0)。精确条件冗余时 Ci = 0;邻域单独无预测信息且 Ui > 0 时 Ci = 1。对象是模型解释,不是对真实标签的因果重要性。
    • 配套分析:总体结果包括有界、端点、可测重复塌缩、双可测再参数化不变,以及弱依赖下退化为归一化边际信息分数。有限样本排序稳定需要误差、分母分离与间隔条件。Auto-Φ 与估计器切换是启发式。轻量版本在更少解释样本上计算同一泛函,并用表示、Kendall 排序、top-K 与删除/插入诊断分别检查是否仍接近全量解释。
    • 实验结论(作者说法):受控合成冗余,尤其是注入近重复时,依赖感知排序的优势最清晰。UCI HAR 及其他真实数据上,与独立/条件 SHAP、SAGE、HSIC、MI 分数和 CIR 族的比较随准则好坏不一。减少解释样本在所评配置中降低计算负担,但全量与轻量是否一致要看单独的诊断,表示层接近不能代替排序一致。
    • 作者的边界:共同的 [0, 1] 区间不是跨任务校准;方法不提供新的通用 CMI 估计器,也不声称与 LOCO、Shapley effects 或 PID 的目标相同。没有额外结构时,精确重复里哪一个保留正分数取决于邻域规则。
阅读原文arxiv.org