跳转至

Model-Based Causal Feature Selection for General Response Types

作者: Lucas Kook, Sorawit Saengkyongam, Anton Rask Lundborg, Torsten Hothorn, Jonas Peters
来源: Journal of the American Statistical Association
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

本子方向解决的根本问题是:从观测数据中,利用来自异质环境(heterogeneous settings / environments)的数据,识别出对某个响应变量(response)具有因果效应的特征集合(causal features)。其核心统计思想是“因果机制的不变性”(invariance of causal mechanisms):在因果系统中,给定直接原因(direct causes)后,响应变量的条件分布在不同环境(如不同实验条件、不同子群体)下保持不变;而非因果特征的条件关系则会随环境变化。当前成熟度:ICP 框架自 2016 年提出后,已成为因果特征选择的重要范式,但其对响应变量类型的限制(连续、加性噪声)是主要瓶颈。

发展脉络(history)

  1. 奠基工作
  2. Peters, Bühlmann & Meinshausen (2016) — ICP 原始论文:提出 ICP 框架,假设数据来自多个环境,利用“给定直接原因后,响应变量的条件分布跨环境不变”这一性质进行特征选择。方法基于线性模型,检验环境与残差的条件独立性。留下的口子:仅适用于线性模型,且要求响应为连续型。
  3. Heinze-Deml et al. (2018) — 非参数 ICP:将 ICP 扩展到非参数设定,使用条件独立性检验(如基于随机森林的检验)来测试不变性。留下的口子:非参数条件独立性检验在有限样本下往往功效低(low power)或第一类错误控制差(poor Type I error control),且对响应类型无特别处理。

  4. 主要进展

  5. Gamella & Heinze-Deml (2020) — 加性噪声模型 ICP:将 ICP 扩展到一般加性噪声模型(additive noise models),允许非线性关系,但要求噪声为加性且响应连续。留下的口子:无法处理分类、计数、删失等非连续响应类型。
  6. Rothenhäusler et al. (2021) — Anchor regression:提出基于锚点回归(anchor regression)的因果推断方法,利用环境变量作为锚点,在分布偏移下进行鲁棒预测。留下的口子:侧重于预测鲁棒性而非特征选择,且对响应类型有连续性假设。
  7. Pfister et al. (2021) — 基于核的 ICP:使用核方法进行非参数不变性检验,可处理高维或复杂数据。留下的口子:计算复杂度高,且对响应类型的适应性有限。

  8. 当前 frontier

  9. Kook et al. (2024) — 本文:将 ICP 与变换模型(transformation models, tram)结合,首次系统性地处理连续、分类、计数、删失等多种响应类型下的因果特征选择问题。位置:填补了 ICP 框架在非连续响应类型上的空白,同时避免了非参数检验的低功效问题。

子线索聚类

这些被引文献大致落在 3 条子线索上:

  1. 线性 / 参数 ICP 线索
  2. Peters et al. (2016):线性模型 + 残差独立性检验。
  3. 本文的 tram-Wald:线性移位 tram + Wald 检验,可视为该线索在广义线性模型上的推广。
  4. 共同点:假设响应与特征间有参数化结构(线性或广义线性),检验统计量有显式渐近分布。

  5. 非参数 ICP 线索

  6. Heinze-Deml et al. (2018):非参数条件独立性检验。
  7. Pfister et al. (2021):核方法。
  8. 共同点:不假设函数形式,但面临功效 / 第一类错误控制的权衡,且计算成本高。

  9. 加性噪声模型 ICP 线索

  10. Gamella & Heinze-Deml (2020):加性噪声模型。
  11. 共同点:允许非线性,但要求响应连续且噪声加性,无法处理离散 / 删失响应。

这个方向在追问的核心问题(2-4 个)

  1. 不变性检验的统计性质:如何构造一个检验,在有限样本下既能控制第一类错误(均匀渐近水平),又对非因果特征有足够功效?
  2. 响应类型的泛化:如何将 ICP 框架扩展到非连续响应(分类、计数、删失),同时保持检验的渐近有效性?
  3. 计算可行性:在非参数或半参数设定下,如何避免高维核方法或条件独立性检验的计算瓶颈?
  4. 识别性与模型假设:在非连续响应下,因果特征是否可识别?需要什么样的模型假设(如变换模型的可加性结构)来保证识别性?

当前主流方法与已知瓶颈:主流方法(非参数 ICP、加性噪声 ICP)要么受限于响应类型(连续),要么受限于检验功效(非参数检验)。本文的 tram 框架通过参数化条件分布(变换模型)同时解决了这两个问题:它允许多种响应类型,且检验统计量(tram-GCM)有显式渐近分布,避免了非参数检验的困境。

⚠️ 作者的 framing(必须明确标注成"这是作者的说法")

作者把缺口 frame 成:"ICP has been extended to general additive noise models and to nonparametric settings using conditional independence tests. However, the latter often suffer from low power (or poor Type I error control) and additive noise models are not suitable for applications in which the response is not measured on a continuous scale, but reflects categories or counts."(Abstract)——即,现有 ICP 扩展要么功效差,要么无法处理非连续响应。作者将本文定位为"显然的下一步":用变换模型同时解决这两个问题。

被淡化或回避的竞争路线: - Anchor regression (Rothenhäusler et al., 2021) 未被引用。Anchor regression 也利用环境变量进行因果推断,且可处理分布偏移,但侧重于预测鲁棒性而非特征选择。作者可能认为其目标不同(预测 vs. 特征选择),但未在 intro 中讨论。 - 基于核的 ICP (Pfister et al., 2021) 未被引用。核方法可处理非连续响应(通过核函数映射),但计算复杂度高。作者可能认为 tram 方法在可解释性和计算效率上更优,但未明确比较。

什么明显该被引 / 该存在、却没出现在 intro 里? - Anchor regression:作为利用环境变量进行因果推断的另一主流框架,其与 ICP 的关系值得讨论。 - 基于核的 ICP:作为非参数 ICP 的另一种实现,其与 tram-GCM 在功效 / 计算上的比较是自然延伸。 - 值得研究者去查的问题:这些被回避的竞争路线是否在特定场景下优于本文方法?例如,当响应类型为多分类时,核方法是否比 tram 更灵活?

张力

未见明显对立引用。被引工作之间在方法论上互补而非矛盾:线性 ICP 假设强但检验简单,非参数 ICP 假设弱但检验困难,加性噪声 ICP 介于两者之间。本文的 tram 框架可视为在参数化(线性)与非参数之间取了一个半参数折中。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - 响应变量\( Y \in \mathcal{Y} \),可以是连续(\(\mathbb{R}\))、分类(\(\{1,\dots,K\}\))、计数(\(\mathbb{N}_0\))、或删失(如生存时间)。可观测。 - 特征向量\( X \in \mathbb{R}^p \)\( p \) 个候选特征。可观测。 - 环境变量\( E \in \mathcal{E} \),表示数据来源的环境(如不同实验条件、不同医院)。可观测,且是离散的(有限个取值)。 - 因果特征集\( S^* \subseteq \{1,\dots,p\} \),即 \( Y \) 的直接原因(direct causes)的索引集。不可观测,是我们要估计的目标。 - 变换模型参数\( \theta \in \Theta \),包含基线变换 \( h \) 和回归系数 \( \beta \)要估计。 - 得分残差(score residual)\( r(Y, X; \theta) \),基于变换模型的似然得分函数。可计算(给定 \( \theta \) 的估计)。

模型: - 变换模型(transformation model, tram):假设存在一个单调递增的变换函数 \( h: \mathcal{Y} \to \mathbb{R} \),使得

\[h(Y) = X^\top \beta + \varepsilon, \quad \varepsilon \sim F\]
其中 \( F \) 是已知的累积分布函数(如逻辑分布、极值分布、正态分布)。\( h \) 是未知的单调函数,通过参数化(如 Bernstein 多项式)或非参数估计。关键:这个模型将任意响应类型映射到线性模型上,通过 \( h \) 吸收响应分布的非线性。 - 不变性假设(Invariance assumption):给定直接原因 \( X_{S^*} \) 后,\( Y \) 的条件分布跨环境不变,即
\[Y \perp\!\!\!\perp E \mid X_{S^*}\]
等价于:在 tram 框架下,给定 \( X_{S^*} \) 后,得分残差 \( r(Y, X_{S^*}; \theta) \)\( E \) 条件独立。

可观测数据: - 研究者观测到 \( n \) 个独立样本 \( (Y_i, X_i, E_i) \)\( i=1,\dots,n \),来自 \( K \) 个环境(\( E_i \in \{1,\dots,K\} \))。 - 想要但观测不到:因果特征集 \( S^* \)、变换函数 \( h \)、误差分布 \( F \) 的精确形式(虽然 \( F \) 被假设已知,但 \( h \) 未知)。 - 识别策略:利用不变性假设——如果 \( S \subseteq \{1,\dots,p\} \) 是候选特征集,那么当且仅当 \( S \supseteq S^* \)(即包含所有直接原因)时,\( Y \perp\!\!\!\perp E \mid X_S \) 成立。因此,通过检验每个候选集 \( S \) 的不变性,可以筛选出因果特征。

第二步:讲最小内核

最简特例:假设 \( Y \)二值响应\( Y \in \{0,1\} \)),且我们考虑线性移位 tram(linear shift tram),即变换函数 \( h \) 是恒等映射(\( h(y) = y \)),误差分布 \( F \) 是逻辑分布(logistic distribution)。此时 tram 退化为逻辑回归模型

\[\mathbb{P}(Y=1 \mid X) = \frac{\exp(X^\top \beta)}{1 + \exp(X^\top \beta)}\]
假设数据来自两个环境(\( E \in \{1,2\} \)),每个环境有 \( n/2 \) 个样本。我们想找出 \( Y \) 的直接原因 \( S^* \)

核心思路:在逻辑回归下,不变性假设 \( Y \perp\!\!\!\perp E \mid X_{S^*} \) 等价于:给定 \( X_{S^*} \) 后,\( Y \) 的条件分布(即逻辑回归的预测概率)在两个环境中相同。这意味着,如果我们在每个环境中分别拟合逻辑回归(使用全部特征 \( X \)),那么对于包含所有直接原因的候选集 \( S \supseteq S^* \),环境间的回归系数应相等(即 \( \beta^{(1)} = \beta^{(2)} \) 对于 \( X_S \) 的系数)。

检验方法(tram-Wald): 1. 拟合:在每个环境 \( e \) 中,用候选特征集 \( X_S \) 拟合逻辑回归,得到系数估计 \( \hat{\beta}^{(e)}_S \) 和协方差矩阵 \( \hat{\Sigma}^{(e)}_S \)。 2. 构建 Wald 统计量:检验环境间系数是否相等:

\[T_{\text{Wald}}(S) = (\hat{\beta}^{(1)}_S - \hat{\beta}^{(2)}_S)^\top (\hat{\Sigma}^{(1)}_S + \hat{\Sigma}^{(2)}_S)^{-1} (\hat{\beta}^{(1)}_S - \hat{\beta}^{(2)}_S)\]
在原假设(\( S \supseteq S^* \))下,\( T_{\text{Wald}}(S) \xrightarrow{d} \chi^2_{|S|} \)(自由度 \( |S| \) 的卡方分布)。 3. 决策:对每个候选集 \( S \),计算 p 值 \( p(S) = 1 - F_{\chi^2_{|S|}}(T_{\text{Wald}}(S)) \)。如果 \( p(S) > \alpha \)(如 0.05),则接受 \( S \) 为不变集。 4. 特征选择:取所有被接受的不变集的交集作为因果特征集的估计:
\[\hat{S} = \bigcap_{S: p(S) > \alpha} S\]
这个交集在理论上以高概率包含于 \( S^* \)(即不包含假阳性特征)。

为什么这个特例是内核:逻辑回归是线性移位 tram 的特例(\( h \) 恒等,\( F \) 逻辑分布)。本文的一般 tram 框架允许 \( h \) 未知(通过参数化估计)和 \( F \) 任意(如极值分布用于生存分析),但检验逻辑完全相同:先拟合模型,再检验环境间参数是否相等(tram-Wald)或得分残差是否与环境独立(tram-GCM)。这个特例抓住了整篇论文的核心数学操作——在参数化条件分布下,将不变性检验转化为参数等值检验


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在异质环境数据下,针对连续、分类、计数、删失等多种响应类型,提出基于变换模型(tram)的因果特征选择方法。
  2. 核心工具 / 方法:提出两种不变性检验——tram-GCM(基于得分残差的条件协方差检验,适用于一般 tram)和 tram-Wald(基于 Wald 统计量,适用于线性移位 tram),并证明 tram-GCM 具有均匀渐近水平保证。
  3. 主要结论:tram-GCM 在多种响应类型下能有效控制第一类错误并保持合理功效;tram-Wald 在线性移位 tram 下功效更高但假设更强;在重症患者生存因果特征案例中,方法识别出有意义的因果特征。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定:数据 \( (Y_i, X_i, E_i) \)\( i=1,\dots,n \),来自 \( K \) 个环境(\( K \geq 2 \))。响应 \( Y \) 可以是连续、分类、计数、或删失(如右删失生存时间)。特征 \( X \in \mathbb{R}^p \),环境 \( E \in \{1,\dots,K\} \)
  • 模型假设
  • 变换模型(tram):存在单调递增变换 \( h \) 和已知分布 \( F \),使得 \( h(Y) = X^\top \beta + \varepsilon \)\( \varepsilon \sim F \)\( h \) 通过参数化(如 Bernstein 多项式)或半参数方法估计。
  • 线性移位 tram(linear shift tram)\( h \) 是恒等映射(即 \( h(y) = y \)),此时模型退化为广义线性模型(如逻辑回归、比例风险模型)。
  • 不变性假设\( Y \perp\!\!\!\perp E \mid X_{S^*} \),其中 \( S^* \) 是因果特征集。
  • 因果充分性(causal sufficiency):没有未观测的混淆变量同时影响 \( Y \)\( X \)(标准 ICP 假设)。
  • 相比已有文献的放宽或强化
  • 放宽:相比加性噪声 ICP(Gamella & Heinze-Deml, 2020),本文允许非连续响应(分类、计数、删失)。
  • 强化:相比非参数 ICP(Heinze-Deml et al., 2018),本文假设了参数化模型(tram),从而获得更好的检验性质(均匀渐近水平)。
  • 关键限制:tram 假设 \( h(Y) \)\( X \) 有线性关系,这比加性噪声模型更严格(加性噪声允许 \( h(Y) = f(X) + \varepsilon \),其中 \( f \) 非线性)。但 tram 通过 \( h \) 的非线性吸收了响应分布的非线性,因此对 \( X \) 的线性假设可能比加性噪声模型更合理(因为 \( h \) 可以任意复杂)。

主要结果

定理 1(tram-GCM 的均匀渐近水平): - 陈述:在正则条件下(包括 tram 模型的正确设定、参数估计的 \( \sqrt{n} \)-一致性、得分函数的光滑性),tram-GCM 检验统计量在原假设(\( S \supseteq S^* \))下渐近服从 \( \chi^2_{K-1} \) 分布,且收敛是均匀的(uniformly over the null hypothesis)。 - 直觉:tram-GCM 基于得分残差 \( r(Y, X_S; \hat{\theta}) \) 与环境 \( E \) 的期望条件协方差。在原假设下,得分残差与 \( E \) 条件独立,因此协方差为零。通过 Delta 方法和经验过程理论,可证明检验统计量的渐近分布。 - 必要条件\( n \to \infty \)\( K \) 固定,\( p \) 固定(或 \( p \)\( n \) 增长但慢于 \( n \)),模型正确设定。 - 解决的技术难点:均匀性(uniformity)的证明需要处理参数估计的不确定性,作者使用经验过程理论(empirical process theory)和 Donsker 类条件来控制余项。

定理 2(tram-Wald 的渐近分布): - 陈述:在线性移位 tram 下,tram-Wald 检验统计量在原假设下渐近服从 \( \chi^2_{|S|(K-1)} \) 分布。 - 直觉:Wald 检验直接比较环境间的回归系数,其渐近分布由 M-估计理论给出。 - 必要条件:线性移位 tram 假设(即 \( h \) 恒等),这比一般 tram 更强。

模拟实验核心结论: - 第一类错误控制:tram-GCM 在所有响应类型(连续、二值、计数、删失)下均能控制第一类错误在名义水平附近(如 0.05),而基于随机森林的非参数 ICP 在有限样本下第一类错误严重膨胀(如达到 0.2-0.3)。 - 功效:tram-GCM 的功效随样本量增加而提高,在中等样本量(\( n=500 \))下可达 0.8 以上;tram-Wald 在线性移位 tram 下功效更高(接近 1),但在模型误设时第一类错误可能膨胀。 - 与 baseline 对比:相比非参数 ICP,tram-GCM 在功效上相当或略优,但第一类错误控制显著更好。

证明路线与技术技巧

整体路线(tram-GCM 的渐近分布证明)

  1. 步骤 1:定义检验统计量。tram-GCM 统计量基于得分残差 \( r_i = r(Y_i, X_{i,S}; \hat{\theta}) \) 与环境指示变量 \( E_i \) 的样本协方差矩阵。具体地,定义 \( \hat{\Gamma} = \frac{1}{n} \sum_{i=1}^n (r_i - \bar{r})(\mathbf{1}_{E_i} - \bar{\mathbf{1}}_E)^\top \),其中 \( \mathbf{1}_{E_i} \) 是环境指示向量(\( K \) 维)。检验统计量为 \( T = n \cdot \text{vec}(\hat{\Gamma})^\top \hat{V}^{-1} \text{vec}(\hat{\Gamma}) \),其中 \( \hat{V} \) 是协方差矩阵的估计。

  2. 步骤 2:线性化。将 \( \hat{\Gamma} \) 在真实参数 \( \theta_0 \) 处泰勒展开:

    \[\hat{\Gamma} = \Gamma(\theta_0) + \frac{\partial \Gamma}{\partial \theta}(\theta_0)(\hat{\theta} - \theta_0) + o_p(n^{-1/2})\]
    其中 \( \Gamma(\theta_0) \) 是使用真实参数时的协方差矩阵。在原假设下,\( \Gamma(\theta_0) = 0 \)(因为得分残差与 \( E \) 条件独立)。

  3. 步骤 3:处理参数估计误差\( \hat{\theta} - \theta_0 \)\( \sqrt{n} \)-一致的,且可表示为 \( \frac{1}{n} \sum_{i=1}^n \psi(Y_i, X_i; \theta_0) + o_p(n^{-1/2}) \)(影响函数表示)。代入后,\( \hat{\Gamma} \) 可表示为 \( \frac{1}{n} \sum_{i=1}^n \phi(Y_i, X_i, E_i; \theta_0) + o_p(n^{-1/2}) \),其中 \( \phi \) 是某个影响函数。

  4. 步骤 4:应用中心极限定理\( \phi \) 是均值为零、方差有限的 i.i.d. 随机向量,因此 \( \sqrt{n} \text{vec}(\hat{\Gamma}) \xrightarrow{d} N(0, V) \),其中 \( V \)\( \phi \) 的协方差矩阵。从而 \( T \xrightarrow{d} \chi^2_{K-1} \)

  5. 步骤 5:均匀性。为了证明收敛是均匀的(over the null hypothesis),作者使用经验过程理论:证明 \( \phi \) 属于某个 Donsker 类,从而 \( \sqrt{n} \text{vec}(\hat{\Gamma}) \)\( \theta_0 \) 的邻域内一致收敛。

关键跳跃点: - 跳跃点 1:从 \( \Gamma(\theta_0) = 0 \)\( \hat{\Gamma} \) 的渐近正态性。难点在于参数估计误差 \( \hat{\theta} - \theta_0 \) 的影响不能忽略,必须通过影响函数展开将其吸收进 \( \phi \) 中。作者通过 Delta 方法和 M-估计理论解决了这一点。 - 跳跃点 2:均匀性证明。通常的渐近分布证明只给出逐点收敛(pointwise),但 ICP 需要同时检验多个候选集 \( S \),因此需要均匀性。作者使用经验过程理论中的 Donsker 定理来保证。

技术技巧点名: - 经验过程理论(empirical process theory):用于证明均匀收敛性,确保检验统计量在多个候选集上同时有效。 - M-估计理论(M-estimation theory):用于处理参数估计 \( \hat{\theta} \) 的不确定性,将其影响函数展开。 - Delta 方法(Delta method):用于将 \( \hat{\Gamma} \) 线性化。 - 得分函数(score function):tram 的得分残差是构建检验统计量的核心,其性质(如正交性、矩条件)保证了检验的渐近有效性。

真实例子与应用

数据 / 场景:重症监护病房(ICU)患者的生存因果特征研究。数据来自 MIMIC-III 数据库,包含约 4 万名 ICU 患者,响应变量 \( Y \)住院生存时间(右删失),特征 \( X \) 包括年龄、性别、合并症(如糖尿病、高血压)、入院类型(急诊/择期)、实验室指标(如乳酸、肌酐)等。环境变量 \( E \) 定义为医院类型(教学医院 vs. 非教学医院),共 2 个环境。

方法应用: 1. 模型选择:使用比例优势变换模型(proportional odds tram) 处理删失生存时间,其中 \( F \) 是逻辑分布(logistic distribution),\( h \) 通过 Bernstein 多项式参数化。 2. 检验:对每个候选特征集 \( S \)(从单特征到全特征),使用 tram-GCM 检验不变性。由于 \( p \) 较大(约 20),采用贪婪搜索(greedy search)而非穷举:从空集开始,逐步添加特征,每次添加后检验不变性,若不变则保留。 3. 结果:最终识别出的因果特征集包括年龄乳酸水平肌酐水平入院类型(急诊 vs. 择期)。这些特征在医学文献中被认为是生存的重要预测因子,且跨医院类型不变(即其因果效应在不同医院类型中一致)。

这个例子想说明什么: - 验证理论:展示 tram-GCM 在真实删失数据上的可行性,证明其能处理实际中常见的右删失生存时间。 - 展示相对 baseline 的优势:作者对比了非参数 ICP(基于随机森林的条件独立性检验),后者在相同数据上第一类错误严重膨胀(识别出大量假阳性特征),而 tram-GCM 控制了第一类错误。 - 实际意义:识别出的因果特征可用于指导临床决策(如对高乳酸患者加强监护),且其跨环境不变性意味着这些特征在不同医院类型中具有可推广性。

🔎 结论是否比证明窄

  • 窄结论 1:tram-GCM 的均匀渐近水平证明依赖于模型正确设定(即 tram 是真实数据生成机制)。作者在定理陈述中明确写了"under correct model specification"(Section 3.2),但在结论中泛泛 claim 为"uniform asymptotic level guarantee"。实际应用时,模型误设可能导致第一类错误膨胀,作者在模拟中对此有所讨论(当模型误设时,tram-GCM 的第一类错误略高于名义水平)。
  • 窄结论 2:tram-Wald 的渐近分布证明仅适用于线性移位 tram(即 \( h \) 恒等)。作者在结论中将其推广为"for linear shift trams",但未讨论当 \( h \) 非恒等时 tram-Wald 的性质。实际中,如果 \( h \) 被误设为恒等,tram-Wald 可能失效
  • 窄结论 3:特征选择过程(取所有不变集的交集)的理论保证仅适用于穷举搜索(exhaustive search over all subsets)。作者在真实例子中使用了贪婪搜索,但未证明贪婪搜索的理论性质(如是否仍能保证假阳性控制)。这是一个明显的 gap:贪婪搜索可能遗漏某些不变集,导致交集变大(假阳性增加)。

四、开放问题(点到为止,扎根具体语句)

  1. 高维特征下的计算与理论:本文假设 \( p \) 固定或 \( p \)\( n \) 增长但慢于 \( n \)。当 \( p \gg n \) 时,穷举搜索不可行,贪婪搜索或 Lasso 型方法的理论性质未知。扎根:作者在 Section 5(Discussion)中写道"extending our approach to high-dimensional settings... is an important direction for future work"。

  2. 模型误设的鲁棒性:tram-GCM 的均匀渐近水平依赖于模型正确设定。当 tram 被误设时,检验的第一类错误如何变化?是否存在鲁棒版本的检验?扎根:作者在模拟中展示了模型误设下的表现(Section 4.2),但未提供理论分析。

  3. 非参数 tram 的扩展:本文的 tram 是参数化的(\( h \) 通过 Bernstein 多项式参数化)。如果 \( h \) 完全非参数(如通过核方法估计),tram-GCM 的渐近性质是否仍然成立?扎根:作者在 Section 5 中提及"a fully nonparametric version of our approach would be of interest"。

  4. 环境变量内生性:本文假设环境变量 \( E \) 是外生的(即 \( E \) 不影响 \( X \) 的因果结构)。如果 \( E \) 与未观测混淆变量相关(即环境选择有偏),不变性假设可能被违反。扎根:作者在 Section 2.1 中假设"the environments are generated by interventions on variables other than \( Y \)",但未讨论 \( E \) 内生的情况。

  5. 与 Anchor regression 的关系:Anchor regression (Rothenhäusler et al., 2021) 也利用环境变量进行因果推断,但侧重于预测鲁棒性。本文方法是否可视为 Anchor regression 在特征选择上的特例?两者在假设和结论上的异同值得探索。扎根:本文未引用 Anchor regression,这是一个值得研究者去查的 gap。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论