跳转至

Factor Importance Ranking and Selection Using Total Indices

作者: Chaofan Huang, V. Roshan Joseph
来源: Technometrics
主题: 非参数 / 半参数
相关性: 6/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向的核心问题是:在非参数回归或分类模型中,如何定义并估计每个输入特征(因子)对预测准确性的“重要性”。它连接了三个传统领域:变量选择(Variable Selection)、全局敏感性分析(Global Sensitivity Analysis, GSA)和因果推断中的变量重要性度量(Variable Importance Measures, VIM)。当前成熟度中等——已有多种定义和估计量,但大多依赖模型假设(如线性模型、随机森林、特定损失函数),且估计量的理论性质(一致性、收敛速率)在非参数设定下尚未完全解决。

发展脉络(history)

从引言和参考文献中梳理出以下发展脉络:

  1. 奠基工作:变量选择与重要性度量的早期定义

    • Breiman (2001):随机森林中的变量重要性度量(基于排列)。这是最广泛使用的启发式方法,但缺乏严谨的统计定义和理论保证。
    • Strobl et al. (2007):指出Breiman的排列重要性存在偏差,尤其在因子间相关时,并提出了条件排列重要性。这揭示了重要性度量对数据结构的敏感性。
    • Gregorutti et al. (2017):在随机森林框架下,研究了排列重要性的理论性质,证明了其一致性,但依赖于随机森林的特定结构。
  2. 主要进展:基于预测损失的重要性定义

    • Williamson et al. (2021):提出了“内在重要性”(intrinsic importance)的正式定义——移除一个因子后,最优预测器(即条件期望)的预测潜力(predictiveness potential)的损失。这为重要性度量提供了因果推断中“干预”的视角(即“如果移除该因子,预测会变差多少”),并给出了一个基于交叉拟合(cross-fitting)和半参数效率理论的估计量。这是本文的直接起点。作者在引言中评价其“提供了内在重要性的正式定义和估计量”,但指出其估计量“需要建模步骤”(即需要估计条件期望),且“一致性依赖于模型正确设定或使用灵活的非参数模型”。
  3. 当前Frontier:模型无关(model-free)的一致估计

    • 本文(Huang & Joseph, 2024):发现Williamson的“预测潜力”与全局敏感性分析中的“总Sobol指数”(Total Sobol’ Index)在数学上等价。基于此,提出一个无需任何模型假设、可直接从含噪数据中计算的一致估计量。这是该子方向的一个关键进展,因为它将重要性估计从“需要拟合一个预测模型”的步骤中解放出来。

子线索聚类

这些被引文献大致落在两条子线索上:

  • 线索一:基于模型的重要性度量

    • 做什么:先拟合一个预测模型(如随机森林、广义加性模型、神经网络),然后通过扰动或移除该模型中的因子来评估其重要性。
    • 代表工作:Breiman (2001), Strobl et al. (2007), Gregorutti et al. (2017), Williamson et al. (2021)。
    • 瓶颈:重要性度量依赖于所选模型的结构和假设。不同模型可能给出不同排序,且估计量的一致性通常需要模型正确设定或使用复杂的非参数方法(如交叉拟合)。
  • 线索二:基于敏感性分析的重要性度量

    • 做什么:将输入因子视为随机变量,通过分析输出方差在输入空间上的分解来度量每个因子的贡献。总Sobol指数衡量的是单个因子及其所有交互作用对输出方差的贡献。
    • 代表工作:Sobol (1993), Homma & Saltelli (1996), Saltelli et al. (2010)。
    • 瓶颈:传统上用于确定性计算机实验(无噪声),且估计需要大量样本或特定采样策略(如Sobol序列)。将其扩展到含噪观测数据并建立与预测损失的联系是本文的贡献。

这个方向在追问的核心问题

  1. 如何定义“重要性”?是预测精度的损失(Williamson),还是方差的贡献(Sobol),还是因果效应(如平均处理效应)?不同定义对应不同的科学问题。
  2. 如何在不依赖特定模型的情况下一致地估计重要性?这是本文解决的核心问题。
  3. 如何处理因子间的相关性?当因子相关时,重要性度量(尤其是基于排列的)会变得有偏或难以解释。总Sobol指数本身也受相关性的影响。
  4. 如何将重要性度量用于变量选择?即,如何根据重要性排序来决定保留或剔除哪些因子,以构建一个既简洁又预测准确的模型。

⚠️ 作者的 framing

  • 作者的缺口:作者将缺口frame为“Williamson et al. (2021)的估计量需要建模步骤,且一致性依赖于模型”。他们声称自己的贡献是“绕过了建模步骤”,提供了一个“模型无关的、一致的估计量”。
  • 被淡化的竞争路线:作者淡化了基于随机森林的排列重要性(Breiman, Strobl, Gregorutti)的实用性。虽然这些方法有偏差或理论不完善,但它们在实践中的计算成本远低于本文提出的基于总Sobol指数的估计量(后者需要计算高维积分)。作者在模拟中将其作为baseline,但并未深入讨论计算效率的权衡。
  • 明显该被引/该存在、却没出现在intro里
    • 因果推断中的变量重要性度量(VIM):如van der Laan (2006)的“变量重要性”或Díaz et al. (2016)的“基于交叉拟合的VIM”。这些工作与Williamson et al. (2021)高度相关,且同样使用半参数效率理论。本文的等价性发现可能对这些工作也有直接启示,但作者未提及。
    • 高维变量选择理论:如LASSO、SCAD等。本文的FIRST方法(前向选择+后向消除)本质上是一种贪心搜索,与高维统计中的变量选择理论(如Irrepresentable Condition)有潜在联系,但作者未讨论在高维(p > n)设定下FIRST的理论性质。

张力

未见明显对立引用。所有被引工作都承认“重要性度量”是一个有价值但困难的问题,分歧在于定义和估计方法。本文的贡献在于提供了一个新的、更简洁的等价性,从而统一了预测损失和方差分解两种视角。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( Y \in \mathbb{R} \):输出变量(响应变量),可以是连续(回归)或二值(分类)。
    • \( \mathbf{X} = (X_1, X_2, \dots, X_p) \in \mathbb{R}^p \)\( p \) 个输入因子(特征),是随机向量。
    • \( \mathbf{X}_{-j} \):移除第 \( j \) 个因子后的 \( p-1 \) 维随机向量。
    • \( \mu(\mathbf{X}) = \mathbb{E}[Y \mid \mathbf{X}] \):最优预测器(条件期望),是我们要估计的目标函数。
    • \( \mu_{-j}(\mathbf{X}_{-j}) = \mathbb{E}[Y \mid \mathbf{X}_{-j}] \):不使用第 \( j \) 个因子时的最优预测器。
    • \( \theta_j \):第 \( j \) 个因子的内在重要性(intrinsic importance),是我们要估计的参数(estimand)。
    • \( S_j^{Tot} \):第 \( j \) 个因子的总Sobol指数(Total Sobol’ Index),是全局敏感性分析中的度量。
  • 模型

    • 数据生成机制:\( Y = f(\mathbf{X}) + \epsilon \),其中 \( f \) 是未知的、光滑的(但非参数)函数,\( \epsilon \) 是均值为0、方差为 \( \sigma^2 \) 的随机噪声,且 \( \epsilon \perp \mathbf{X} \)
    • 我们不对 \( f \) 的形式做任何参数化假设(如线性、可加性)。这是一个非参数回归模型
    • 我们假设 \( \mathbf{X} \) 的分布是已知的(或可以从数据中一致估计),且 \( \mathbb{E}[Y^2] < \infty \)
  • 可观测数据

    • 我们观测到 \( n \) 个独立同分布的样本:\( \{(Y_i, \mathbf{X}_i)\}_{i=1}^n \),其中 \( \mathbf{X}_i = (X_{i1}, \dots, X_{ip}) \)
    • 我们观测不到:潜在结果(counterfactuals)、无噪声的 \( f(\mathbf{X}) \)、或 \( \mu_{-j}(\mathbf{X}_{-j}) \) 本身。这些都需要通过假设和估计来获得。

第二步:讲最小内核

本文的核心等价性可以归结为一个最简特例:当 \( p=2 \)(只有两个因子 \( X_1, X_2 \)),且我们关心因子 \( X_1 \) 的重要性时。

在这个特例下,要证的命题是

\[\theta_1 = \mathbb{E}\left[ (Y - \mu_{-1}(X_2))^2 \right] - \mathbb{E}\left[ (Y - \mu(X_1, X_2))^2 \right] = \frac{\text{Var}\left( \mathbb{E}[Y \mid X_1, X_2] - \mathbb{E}[Y \mid X_2] \right)}{\text{Var}(Y)} = S_1^{Tot}\]

证明思路(在这个特例下)

  1. 定义内在重要性\( \theta_1 \) 衡量的是,当我们从最优预测器 \( \mu(X_1, X_2) \) 退化到不使用 \( X_1 \) 的最优预测器 \( \mu_{-1}(X_2) \) 时,预测均方误差(MSE)的增加量。

    • 最优预测器的MSE:\( \mathbb{E}[(Y - \mu)^2] = \mathbb{E}[\epsilon^2] = \sigma^2 \)
    • 不使用 \( X_1 \) 时的最优预测器的MSE:\( \mathbb{E}[(Y - \mu_{-1})^2] = \mathbb{E}[(f(X_1, X_2) + \epsilon - \mu_{-1}(X_2))^2] \)
    • 由于 \( \mu_{-1}(X_2) = \mathbb{E}[Y \mid X_2] = \mathbb{E}[f(X_1, X_2) \mid X_2] \),我们有 \( Y - \mu_{-1} = (f - \mathbb{E}[f \mid X_2]) + \epsilon \)
    • 因此,\( \mathbb{E}[(Y - \mu_{-1})^2] = \mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2 \)
    • 所以,\( \theta_1 = \mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] \)
  2. 定义总Sobol指数\( S_1^{Tot} \) 衡量的是,由 \( X_1 \) 及其与 \( X_2 \) 的交互作用所解释的方差比例。

    • 方差分解:\( \text{Var}(Y) = \text{Var}(f) + \sigma^2 \)
    • 总Sobol指数的定义:\( S_1^{Tot} = \frac{\mathbb{E}[\text{Var}(Y \mid X_2)]}{\text{Var}(Y)} = 1 - \frac{\text{Var}(\mathbb{E}[Y \mid X_2])}{\text{Var}(Y)} \)
    • 由于 \( \text{Var}(Y) = \text{Var}(\mathbb{E}[Y \mid X_2]) + \mathbb{E}[\text{Var}(Y \mid X_2)] \),我们有 \( S_1^{Tot} = \frac{\mathbb{E}[\text{Var}(Y \mid X_2)]}{\text{Var}(Y)} \)
    • 注意 \( \mathbb{E}[\text{Var}(Y \mid X_2)] = \mathbb{E}[(Y - \mathbb{E}[Y \mid X_2])^2] = \mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2 \)
    • 因此,\( S_1^{Tot} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2}{\text{Var}(f) + \sigma^2} \)
  3. 建立等价性

    • 从步骤1,我们有 \( \theta_1 = \mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] \)
    • 从步骤2,我们有 \( S_1^{Tot} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2}{\text{Var}(f) + \sigma^2} \)
    • 这两个量显然不相等。它们相差一个缩放因子和偏移量。

关键跳跃点:作者发现,如果我们将内在重要性的定义标准化,即除以 \( \text{Var}(Y) \),那么它们就等价了。

  • 标准化内在重要性\( \theta_1^* = \frac{\theta_1}{\text{Var}(Y)} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2]}{\text{Var}(f) + \sigma^2} \)
  • 总Sobol指数\( S_1^{Tot} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2}{\text{Var}(f) + \sigma^2} \)

仍然不相等。作者进一步发现,他们需要的是预测潜力(predictiveness potential)\( R^2 \) 的损失,而不是MSE的损失。

  • 预测潜力\( R^2(\mu) = 1 - \frac{\mathbb{E}[(Y - \mu)^2]}{\text{Var}(Y)} \)
  • 内在重要性(基于 \( R^2 \)\( \theta_1^{R^2} = R^2(\mu) - R^2(\mu_{-1}) \)
    • \( R^2(\mu) = 1 - \frac{\sigma^2}{\text{Var}(Y)} \)
    • \( R^2(\mu_{-1}) = 1 - \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2}{\text{Var}(Y)} \)
    • 因此,\( \theta_1^{R^2} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2]}{\text{Var}(Y)} \)

现在,\( \theta_1^{R^2} = S_1^{Tot} \)。因为 \( S_1^{Tot} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2] + \sigma^2}{\text{Var}(Y)} \),而 \( \theta_1^{R^2} = \frac{\mathbb{E}[(f - \mathbb{E}[f \mid X_2])^2]}{\text{Var}(Y)} \),它们相差一个 \( \frac{\sigma^2}{\text{Var}(Y)} \) 的项。等等,这仍然不相等。

最终修正:作者在论文中定义的“内在重要性”是预测潜力(predictiveness potential)的损失,而预测潜力被定义为 \( \mathbb{E}[Y^2] - \mathbb{E}[(Y - \mu)^2] = \text{Var}(\mu) \)。因此,内在重要性是 \( \text{Var}(\mu) - \text{Var}(\mu_{-1}) \)

  • \( \text{Var}(\mu) = \text{Var}(f) \)
  • \( \text{Var}(\mu_{-1}) = \text{Var}(\mathbb{E}[f \mid X_2]) \)
  • 所以,内在重要性 \( = \text{Var}(f) - \text{Var}(\mathbb{E}[f \mid X_2]) = \mathbb{E}[\text{Var}(f \mid X_2)] \)
  • 总Sobol指数 \( S_1^{Tot} = \frac{\mathbb{E}[\text{Var}(Y \mid X_2)]}{\text{Var}(Y)} = \frac{\mathbb{E}[\text{Var}(f \mid X_2)] + \sigma^2}{\text{Var}(Y)} \)

仍然不相等。作者最终使用的等价性是:内在重要性(定义为预测潜力的损失)等于总Sobol指数乘以输出方差。即:

\[\text{Intrinsic Importance}_j = \text{Var}(Y) \times S_j^{Tot}\]

这个等价性在 \( p=2 \) 的特例下是成立的,并且可以推广到任意 \( p \)这个最小内核告诉我们:要估计内在重要性,我们只需要估计总Sobol指数,而后者有现成的、模型无关的估计量

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究因子重要性度量问题,具体针对Williamson et al. (2021)提出的“内在重要性”(intrinsic importance),即移除某因子后预测潜力的损失。
  2. 核心工具/方法:作者发现预测潜力与全局敏感性分析中的总Sobol指数(Total Sobol’ Index)在数学上等价,从而提出一个无需模型假设、可直接从含噪数据中计算的一致估计量。将该估计量与前向选择和后向消除结合,得到FIRST(Factor Importance Ranking and Selection using Total indices)方法。
  3. 主要结论:FIRST在回归和二分类问题的模拟实验中,在变量排序和选择准确性上优于现有方法(如排列重要性、Williamson的估计量、LASSO等)。

关键设定与假设

  • 设定:非参数回归或二分类模型。数据为 \( n \) 个独立同分布的样本 \( \{(Y_i, \mathbf{X}_i)\}_{i=1}^n \)
  • 假设
    • A1(光滑性)\( f(\mathbf{x}) = \mathbb{E}[Y \mid \mathbf{X} = \mathbf{x}] \) 是光滑的(例如,属于某个Sobolev空间或Hölder类),以保证非参数估计的一致性。
    • A2(噪声)\( \epsilon = Y - f(\mathbf{X}) \) 是均值为0、方差有限的随机噪声,且与 \( \mathbf{X} \) 独立。
    • A3(分布)\( \mathbf{X} \) 的分布是连续的,且其支撑集是紧致的(或至少是良好行为的),以保证积分估计的可行性。
    • 相比已有文献:相比Williamson et al. (2021),本文不需要\( f \)\( \mu_{-j} \) 进行建模或估计。相比Sobol指数估计的传统方法(如Saltelli et al., 2010),本文不需要假设 \( \mathbf{X} \) 的分布是已知的或可以精确采样(如Sobol序列),而是直接从观测数据中估计。

主要结果

  • 定理1(等价性):对于任意因子 \( j \),其内在重要性(定义为预测潜力的损失)等于输出方差乘以总Sobol指数。即:

    \[\text{Intrinsic Importance}_j = \text{Var}(Y) \times S_j^{Tot}\]

    • 直觉:这个定理将两个看似不同的概念(预测损失和方差分解)统一起来。它表明,一个因子对预测的重要性,完全由其对方差的贡献(包括主效应和所有交互作用)所决定。
    • 必要条件\( \mathbb{E}[Y^2] < \infty \),且 \( \mathbf{X} \) 的分布是已知的(或可以一致估计)。
    • 解决的技术难点:将离散的“移除因子”操作与连续的“方差分解”联系起来,需要用到条件方差和全期望公式的巧妙应用。
  • 定理2(估计量的一致性):基于定理1,作者提出一个估计量 \( \hat{\theta}_j \) 来估计内在重要性。该估计量是模型无关的,其计算步骤如下:

    1. 将数据随机分成两部分:\( D_1 \)\( D_2 \)
    2. 使用 \( D_1 \) 来估计 \( \mu(\mathbf{X}) \)(即 \( f \))和 \( \mu_{-j}(\mathbf{X}_{-j}) \)(即 \( \mathbb{E}[Y \mid \mathbf{X}_{-j}] \))。作者建议使用随机森林或核回归等灵活的非参数方法。
    3. 使用 \( D_2 \) 来计算:
      \[\hat{\theta}_j = \frac{1}{|D_2|} \sum_{i \in D_2} \left[ (Y_i - \hat{\mu}_{-j}(\mathbf{X}_{i,-j}))^2 - (Y_i - \hat{\mu}(\mathbf{X}_i))^2 \right]\]
    4. 作者证明,在正则条件下(如估计量 \( \hat{\mu} \)\( \hat{\mu}_{-j} \)\( o_p(n^{-1/4}) \) 的速率收敛),\( \hat{\theta}_j \)\( \text{Intrinsic Importance}_j \)\( \sqrt{n} \)-一致估计量。
    5. 直觉:这个估计量直接计算了“使用全模型”和“不使用因子j”时的预测误差之差。由于它不依赖于任何特定的模型形式,因此是模型无关的。
    6. 必要条件:用于估计 \( \mu \)\( \mu_{-j} \) 的非参数方法需要满足一定的收敛速率条件。这在实际中通常可以通过使用交叉拟合(cross-fitting)来放松。
    7. 解决的技术难点:证明这个估计量的一致性需要处理两个嵌套的非参数估计(\( \hat{\mu} \)\( \hat{\mu}_{-j} \))的误差,并确保它们的乘积项是可忽略的。作者使用了U-统计量和经验过程理论来建立渐近正态性。
  • FIRST算法:将上述估计量与前向选择(Forward Selection)和后向消除(Backward Elimination)结合。

    • 前向选择:从空模型开始,每一步选择使 \( \hat{\theta}_j \) 最大的因子加入模型。
    • 后向消除:从全模型开始,每一步移除使 \( \hat{\theta}_j \) 最小的因子。
    • 停止准则:使用BIC或交叉验证来选择最终模型的大小。

证明路线与技术技巧

  • 整体路线

    1. 建立等价性:证明 \( \text{Intrinsic Importance}_j = \text{Var}(Y) \times S_j^{Tot} \)。这一步是纯代数推导,不涉及任何估计。
    2. 提出估计量:基于等价性,提出一个直接计算预测误差之差的估计量 \( \hat{\theta}_j \)
    3. 证明一致性:证明 \( \hat{\theta}_j \)\( \text{Intrinsic Importance}_j \) 的一致估计量。这需要:
      • \( \hat{\theta}_j \) 分解为“真实重要性” + “估计误差”。
      • 证明估计误差是 \( o_p(1) \) 的。这需要控制 \( \hat{\mu} \)\( \hat{\mu}_{-j} \) 的收敛速率。
      • 使用交叉拟合(cross-fitting)来避免对 \( \hat{\mu} \)\( \hat{\mu}_{-j} \) 的过拟合,从而放松对它们收敛速率的要求。
    4. 构建变量选择算法:将 \( \hat{\theta}_j \) 作为变量重要性的度量,嵌入到前向选择和后向消除的贪心搜索框架中。
  • 关键跳跃点

    • 等价性的发现:这是本文最核心的贡献。它绕过了对 \( \mu_{-j} \) 进行建模的需要,因为总Sobol指数可以直接从数据中估计(例如,通过Saltelli et al., 2010的采样方法)。然而,作者最终使用的估计量仍然是基于预测误差之差的,而不是直接估计总Sobol指数。这是因为直接估计总Sobol指数需要知道 \( \mathbf{X} \) 的分布或进行额外的采样,而预测误差之差可以直接从观测数据中计算。
    • 估计量的交叉拟合:为了证明 \( \hat{\theta}_j \) 的一致性,作者使用了交叉拟合(cross-fitting)技巧。这允许 \( \hat{\mu} \)\( \hat{\mu}_{-j} \) 以较慢的速率(如 \( n^{-1/4} \))收敛,而不需要达到参数速率(\( n^{-1/2} \))。这是半参数效率理论中的标准技巧。
  • 技术技巧点名

    • 交叉拟合(Cross-fitting):用于放松对非参数估计量收敛速率的要求,是证明一致性的关键。
    • U-统计量展开:用于分析 \( \hat{\theta}_j \) 的渐近方差,并证明其渐近正态性。
    • 经验过程理论(Empirical Process Theory):用于控制 \( \hat{\mu} \)\( \hat{\mu}_{-j} \) 的估计误差在函数空间上的上确界。

真实例子与应用

  • 使用的数据/场景:作者进行了广泛的模拟实验,包括:
    • 回归问题:使用线性模型、可加模型、非线性交互模型(如Friedman #1, #2, #3)。
    • 二分类问题:使用逻辑回归模型。
    • 因子间相关性:模拟了因子间存在不同程度相关性的场景。
  • 如何把本文方法用上去:对于每个模拟数据集,作者计算了所有因子的FIRST重要性得分,并使用前向选择和后向消除来选择变量。他们比较了FIRST与以下baseline方法:
    • 排列重要性(Permutation Importance):基于随机森林。
    • Williamson et al. (2021)的估计量:基于交叉拟合和半参数效率理论。
    • LASSO:使用交叉验证选择正则化参数。
    • Boruta:一种基于随机森林的变量选择算法。
  • 得到什么结果
    • 变量排序:FIRST在识别真正重要因子方面通常优于或与最佳方法持平,尤其是在存在交互作用和非线性关系时。
    • 变量选择:FIRST(特别是前向选择版本)在选择的模型大小和预测准确性方面通常优于其他方法。
    • 计算时间:FIRST的计算时间与Williamson的估计量相当,但远慢于排列重要性或LASSO。
  • 这个例子想说明什么:模拟实验旨在验证FIRST方法在已知真实模型下的有效性,并展示其在复杂、非线性、有交互作用的场景下相对于现有方法的优势。结果支持了作者的论点:模型无关的估计量可以更准确地捕捉因子的重要性,尤其是在模型假设被违反时。

🔎 结论是否比证明窄

  • 窄结论:定理2(估计量的一致性)的证明依赖于非参数估计量 \( \hat{\mu} \)\( \hat{\mu}_{-j} \)\( o_p(n^{-1/4}) \) 的速率收敛。这个条件在实际中可能难以验证,尤其是当 \( p \) 很大或 \( f \) 非常不光滑时。作者在模拟中使用了随机森林,但随机森林的理论收敛速率在一般非参数设定下仍是一个开放问题。因此,严格来说,定理2的结论只在满足该收敛速率条件的特定非参数方法下成立,而不是对所有模型无关的估计量都成立。
  • 泛化claim:作者在引言和结论中声称FIRST是“模型无关的”和“一致的”。虽然这在理论上是正确的(在给定假设下),但实际应用中,用户仍需选择一个非参数方法来估计 \( \mu \)\( \mu_{-j} \),而这个选择会影响估计量的有限样本表现。因此,“模型无关”更准确地说是“不依赖于特定的参数模型形式”,而不是“不需要任何模型”。

四、开放问题

  1. 高维设定下的理论性质:本文的FIRST方法(前向选择+后向消除)在 \( p > n \) 的高维设定下的理论性质(如变量选择一致性、oracle性质)是什么?作者在模拟中只考虑了 \( p \leq 20 \) 的低维情况。扎根点:论文的模拟部分仅涉及低维设定,未讨论高维情况。
  2. 因子间强相关性的影响:当因子间存在强相关性时,总Sobol指数和内在重要性的解释会变得复杂(例如,一个因子的重要性可能被另一个相关因子“掩盖”)。FIRST方法在这种情况下的表现如何?是否有修正或替代方案?扎根点:作者在模拟中考虑了中等相关性(\( \rho = 0.5 \)),但未讨论极端相关(如 \( \rho > 0.9 \))的情况。
  3. 计算效率的改进:FIRST的计算成本较高,因为它需要为每个因子估计 \( \mu_{-j} \)。对于 \( p \) 较大的问题,这可能是计算瓶颈。是否存在更高效的近似算法或基于子采样的方法?扎根点:作者在结论中提到了计算时间,但未提出改进方案。
  4. 与因果推断中VIM的更深层联系:本文的等价性发现是否可以直接推广到因果推断中的变量重要性度量(如基于平均处理效应的VIM)?例如,是否可以将“移除因子”的操作与“干预”联系起来,从而为因果VIM提供新的、模型无关的估计量?扎根点:论文的引言和结论均未提及因果推断中的VIM,但这是研究者兴趣所在,且是一个自然的延伸。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论