Causal inference on distribution functions¶
作者: Zhenhua Lin, Dehan Kong, Linbo Wang
来源: Journal of the Royal Statistical Society Series B
主题: 因果推断
相关性: 9/10
链接: 期刊页 · arXiv
一、领域脉络与小综述¶
这个方向是什么¶
本文所处理的根本问题是:当因果推断中的结果变量不是欧氏空间中的标量或向量,而是一个概率分布(累积分布函数,CDF)时,如何定义、识别和估计因果效应? 例如,研究者可能关心“婚姻”对一个人全天体力活动模式(即每分钟活动量的分布)的因果效应,而不是对平均活动量的效应。这类结果变量天然地生活在一个非线性空间——Wasserstein 空间(即所有具有有限二阶矩的 CDF 的集合,配备 2-Wasserstein 距离)。该方向当前处于早期发展阶段:已有大量关于 Wasserstein 空间中统计推断的工作(如 Fréchet 均值、回归、时间序列),但因果推断的框架几乎空白。本文是第一个系统性地将潜在结果框架和半参数效率理论引入 Wasserstein 空间的尝试。
发展脉络(history)¶
- 奠基工作:潜在结果框架与 Wasserstein 空间统计
- Rubin (1974) [2]:奠定了潜在结果框架,定义了单位水平上的因果效应。本文引用它作为“经典因果推断”的起点,并指出“由于分布函数属于 L²(一个线性空间),人们可能直接扩展该框架”,但作者随后论证了 Wasserstein 空间的非线性结构使得这种直接扩展不充分。
- Panaretos & Zemel (2019) [3]:系统综述了 Wasserstein 距离的统计性质,包括弱收敛、矩收敛、以及作为“扰动”度量的直观解释。本文引用它来论证 Wasserstein 距离是捕捉分布结构差异的“自然”度量。
-
Schötz (2019) [1]:提供了广义 Fréchet 均值的收敛速率,其“四元不等式”(quadruple inequality)是本文证明 Wasserstein 空间中经验过程收敛性的关键工具。本文引用它来建立估计量的相合性。
-
主要进展:Wasserstein 空间中的回归与时间序列
- Chen, Lin & Müller (2021) [8]:提出了 Wasserstein 回归模型,将分布作为预测变量或响应变量,利用 Wasserstein 空间的切空间结构进行线性化。本文引用它作为“分布值对象回归”的代表,并指出其“分布-分布回归”模型是本文方法的一个特例(当处理变量为常数时)。
- Zhang et al. (2020) [9] 与 Zhu & Müller (2021):将自回归模型推广到 Wasserstein 空间,用于密度时间序列的预测。本文引用它们来展示 Wasserstein 空间在时间序列分析中的适用性。
-
Zhou, Lin & Yao (2021) [11]:开发了 Wasserstein 空间中的典型相关分析框架。本文引用它来展示 Wasserstein 空间中的多变量分析工具。
-
当前 frontier:因果推断进入非线性结果空间
- 在本文之前,因果推断几乎完全局限于欧氏空间结果变量。少数例外(如 Ogburn et al., 2014 [20] 处理条件平均处理效应曲线)仍将结果视为标量或向量,而非分布。本文是第一个将潜在结果框架、双重稳健估计和半参数效率理论系统性地应用于 Wasserstein 空间的工作。
子线索聚类¶
这些被引文献大致落在三条子线索上:
- 线索 A:Wasserstein 空间中的统计推断基础([1], [3], [4], [10], [12], [15], [21], [22])。这一簇在做什么:建立 Wasserstein 空间中均值(Fréchet 均值)、距离估计、经验过程的收敛理论,以及计算工具(如熵正则化)。这是本文方法论的“数学工具箱”。
- 线索 B:Wasserstein 空间中的回归与预测([8], [9], [11], [17], [18])。这一簇在做什么:将经典回归、时间序列、典型相关分析推广到分布值数据。这是本文的“方法学类比”——本文的因果效应估计本质上是一种“条件 Fréchet 均值”的估计,与这些回归方法有密切联系。
- 线索 C:因果推断中的双重稳健与半参数方法([19], [20])。这一簇在做什么:在欧氏空间中开发双重稳健估计量和半参数效率理论。这是本文的“技术模板”——本文的估计量构造和渐近理论直接借鉴了这些工作的思路,但需要克服 Wasserstein 空间的非线性带来的新挑战。
这个方向在追问的核心问题¶
- 如何定义因果效应? 在欧氏空间中,平均处理效应(ATE)是处理组与对照组结果均值的差。在 Wasserstein 空间中,结果是一个分布,因此因果效应也应是分布之间的某种“差异”。本文的定义是:处理组潜在结果分布与对照组潜在结果分布之间的 Wasserstein 距离(或更一般地,Wasserstein 空间中的“位移”)。
- 如何识别因果效应? 在观察性研究中,需要处理选择偏差。本文假设无混淆性(unconfoundedness)和重叠性(overlap),这与欧氏空间中的标准假设一致。但识别目标从“条件期望”变为“条件分布”,因此需要估计条件分布函数(而非条件均值)。
- 如何高效估计? 在欧氏空间中,双重稳健估计量结合了倾向性得分和结果回归,在其中一个模型正确时即一致,且当两者都正确时达到半参数效率界。本文的目标是开发类似的估计量,但 Wasserstein 空间的非线性使得“影响函数”和“效率界”的推导变得复杂。
- 如何建立渐近理论? 需要证明估计量的相合性和渐近正态性,并给出收敛速率。Wasserstein 空间的经验过程理论(如 Schötz, 2019)为此提供了基础,但因果推断中的交叉拟合(cross-fitting)和双重稳健结构带来了新的技术挑战。
当前主流方法与已知瓶颈:目前,处理分布值结果的主流方法是先将其映射到欧氏空间(如通过 log-quantile 变换 [18]),然后应用标准因果推断方法。但这种方法会丢失 Wasserstein 空间的几何结构(如测地线、曲率),且映射可能不是等距的。本文的瓶颈在于:Wasserstein 空间不是线性空间,因此无法直接使用欧氏空间中的影响函数和效率界理论;需要开发新的工具来处理非线性空间中的半参数推断。
⚠️ 作者的 framing¶
作者将缺口 frame 成:“尽管 Wasserstein 空间中的统计推断已有大量工作,但因果推断几乎完全被忽视。本文填补了这一空白。” 具体来说: - 作者强调:Wasserstein 空间是非线性的,因此不能简单地将欧氏空间中的因果推断方法“逐点”应用于分布函数(即对每个分位数分别估计处理效应)。这种“逐点”方法忽略了分布之间的整体结构(如单调性、形状约束)。 - 作者淡化/回避的竞争路线: - 映射到欧氏空间的方法(如 [18] 的 log-quantile 变换):作者在引言中承认这种方法存在,但指出它“可能丢失 Wasserstein 空间的几何结构”。然而,作者并未系统比较本文方法与映射方法的优劣(例如,在什么条件下映射方法会失效?本文方法是否总是更优?)。 - 基于分位数回归的因果推断:如果结果变量是分布,一个自然的替代方案是对每个分位数分别估计处理效应(即分位数处理效应,QTE)。作者在引言中简要提及了 QTE,但指出它“只关注单个分位数,而非整个分布”。然而,QTE 可以通过同时考虑所有分位数来“恢复”整个分布,作者对此的批评可能不够有力。 - 什么明显该被引/该存在、却没出现在 intro 里? - 分位数处理效应(QTE)的文献:如 Firpo (2007), Callaway & Li (2019) 等。这些工作直接处理分布结果,且与本文的“分布函数因果效应”有密切联系。作者在引言中只引用了一篇 QTE 工作(可能是 Firpo, 2007),但未深入讨论其与本文的关系。值得研究者去查:QTE 文献中是否有类似的双重稳健估计量?它们是否也能扩展到 Wasserstein 空间? - 函数型因果推断(functional causal inference):如 Zhang et al. (2018), Cuesta-Albertos et al. (2019) 等。这些工作处理函数型结果(如曲线),与本文的分布结果有相似之处(都是无限维对象)。但函数型数据通常生活在 Hilbert 空间,而分布生活在非线性空间,因此技术挑战不同。值得研究者去查:函数型因果推断中的方法(如函数型双重稳健估计)是否可迁移到 Wasserstein 空间?
张力¶
未见明显对立引用。所有被引工作都在不同方面支持本文的论点:Wasserstein 空间是处理分布值数据的自然框架,且因果推断需要新的方法。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( Y \in \mathbb{R} \):结果变量(标量)。例如,某人在某一分钟内的体力活动计数。
- \( A \in \{0,1\} \):处理变量(二值)。例如,\( A=1 \) 表示已婚,\( A=0 \) 表示未婚。
- \( X \in \mathbb{R}^p \):协变量向量(预处理变量)。例如,年龄、性别、收入等。
- \( Y(1), Y(0) \):潜在结果(potential outcomes)。\( Y(1) \) 是如果处理(已婚)时的结果,\( Y(0) \) 是如果对照(未婚)时的结果。注意:在本文中,结果不是单个标量,而是一个分布。因此,更准确的记号是:
- \( F_{Y(1)} \):处理组的潜在结果分布(CDF)。
- \( F_{Y(0)} \):对照组的潜在结果分布(CDF)。
- \( \mathcal{W}_2 \):2-Wasserstein 空间,即所有具有有限二阶矩的 CDF 的集合,配备 Wasserstein 距离 \( d_W(\cdot, \cdot) \)。
- \( \mu = \mathbb{E}[Y] \):在欧氏空间中,这是平均处理效应(ATE)的目标。在本文中,目标不是 \( \mu \),而是 \( F_{Y(1)} \) 和 \( F_{Y(0)} \) 本身。
- \( \pi(X) = \mathbb{P}(A=1 \mid X) \):倾向性得分(propensity score)。
- \( m_a(X) = \mathbb{E}[Y \mid A=a, X] \):在欧氏空间中,这是条件均值函数。在本文中,我们需要的是条件分布函数:\( F_{Y \mid A=a, X} \)。
- \( n \):样本量。
-
\( \hat{\cdot} \):估计量。例如,\( \hat{\pi}(X) \) 是倾向性得分的估计。
-
模型:
- 数据生成机制:假设我们有一个随机样本 \( \{ (X_i, A_i, Y_i) \}_{i=1}^n \),其中 \( Y_i \) 是标量结果。我们关心的是处理 \( A \) 对结果 \( Y \) 的分布(而非均值)的因果效应。
- 识别假设(与欧氏空间中的标准假设相同):
- 无混淆性(Unconfoundedness):\( (Y(1), Y(0)) \perp A \mid X \)。即,给定协变量 \( X \),处理分配与潜在结果独立。
- 重叠性(Overlap):\( 0 < \pi(X) < 1 \) 对所有 \( X \) 成立。
- 一致性(Consistency):\( Y = Y(A) \)。
-
目标 estimand:处理组和对照组的潜在结果分布 \( F_{Y(1)} \) 和 \( F_{Y(0)} \),以及它们的 Wasserstein 距离 \( d_W(F_{Y(1)}, F_{Y(0)}) \)。
-
可观测数据:
- 研究者实际能观测到的是:\( (X_i, A_i, Y_i) \),即每个个体的协变量、处理状态和结果。
- 想要但观测不到的是:每个个体的潜在结果 \( Y_i(1) \) 和 \( Y_i(0) \)(只能观测到其中一个),以及它们的分布 \( F_{Y(1)} \) 和 \( F_{Y(0)} \)。
- 关键点:在欧氏空间中,我们通过估计 \( \mathbb{E}[Y \mid A=a, X] \) 来识别 \( \mathbb{E}[Y(a)] \)。在本文中,我们需要估计整个条件分布 \( F_{Y \mid A=a, X} \),然后通过积分(对 \( X \) 的边缘分布)来得到 \( F_{Y(a)} \)。
第二步:讲最小内核¶
最简特例:假设结果 \( Y \) 是二值的(\( Y \in \{0,1\} \)),且协变量 \( X \) 是离散的(只有有限个取值)。在这种情况下,Wasserstein 空间退化为一个有限维单纯形(因为二值分布的 CDF 由单个参数 \( p = \mathbb{P}(Y=1) \) 完全决定),但本文的核心思路仍然清晰可见。
- 在这个特例下:
- 每个个体的结果分布由其成功概率 \( p \) 决定。因此,处理组的潜在结果分布 \( F_{Y(1)} \) 由 \( p_1 = \mathbb{P}(Y(1)=1) \) 决定,对照组的由 \( p_0 = \mathbb{P}(Y(0)=1) \) 决定。
- 目标 estimand 简化为:\( p_1 \) 和 \( p_0 \) 的差(即 ATE),以及它们的 Wasserstein 距离 \( d_W(F_{Y(1)}, F_{Y(0)}) = |p_1 - p_0| \)(因为二值分布的 2-Wasserstein 距离等于成功概率差的绝对值)。
-
识别:在无混淆性下,\( p_a = \mathbb{E}[ \mathbb{E}[Y \mid A=a, X] ] \)。因此,我们需要估计条件均值函数 \( m_a(X) = \mathbb{E}[Y \mid A=a, X] \)。
-
本文的核心思路(在这个特例下):
- 估计两个 nuisance 函数:
- 倾向性得分 \( \pi(X) = \mathbb{P}(A=1 \mid X) \)。
- 条件均值函数 \( m_a(X) = \mathbb{E}[Y \mid A=a, X] \)。
- 构造双重稳健估计量:
- 对于 \( p_1 \):\( \hat{p}_1 = \frac{1}{n} \sum_{i=1}^n \left[ \frac{A_i Y_i}{\hat{\pi}(X_i)} - \frac{A_i - \hat{\pi}(X_i)}{\hat{\pi}(X_i)} \hat{m}_1(X_i) \right] \)。
- 对于 \( p_0 \):类似地,\( \hat{p}_0 = \frac{1}{n} \sum_{i=1}^n \left[ \frac{(1-A_i) Y_i}{1-\hat{\pi}(X_i)} - \frac{A_i - \hat{\pi}(X_i)}{1-\hat{\pi}(X_i)} \hat{m}_0(X_i) \right] \)。
- 双重稳健性质:如果 \( \hat{\pi} \) 或 \( \hat{m}_a \) 中有一个是正确指定的(即收敛到真实函数),则 \( \hat{p}_a \) 是 \( p_a \) 的一致估计。如果两者都正确,则 \( \hat{p}_a \) 达到半参数效率界(即渐近方差最小)。
-
扩展到一般分布:当 \( Y \) 是连续变量时,上述思路仍然成立,但需要将“条件均值函数”替换为“条件分布函数”。具体地,对于每个固定的 \( y \),定义 \( m_a(X, y) = \mathbb{P}(Y \le y \mid A=a, X) \),然后对每个 \( y \) 应用上述双重稳健估计,得到 \( \hat{F}_{Y(a)}(y) \)。关键:由于 Wasserstein 距离是整体度量,我们需要同时考虑所有 \( y \),并利用 Wasserstein 空间的几何结构来保证估计量的整体性质(如单调性、光滑性)。
-
为什么这个特例抓住了核心:它剥离了 Wasserstein 空间的非线性复杂性,但保留了双重稳健估计的核心结构:两个 nuisance 函数、影响函数、交叉拟合。读者可以在这个特例下理解“分布函数因果效应”的识别和估计,然后推广到一般情况。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在观察性研究中,当结果变量是累积分布函数(CDF)时,如何定义、识别和估计处理对结果分布的因果效应(即分布函数层面的平均处理效应)。
- 核心工具/方法:利用 Wasserstein 空间的几何结构,将潜在结果框架扩展到分布值结果,并开发了双重稳健(doubly robust)估计量,结合了倾向性得分和条件分布函数的估计。
- 主要结论:所提出的估计量是相合的、渐近正态的,且在较弱的条件下达到 \( n^{-1/2} \) 收敛速率;通过交叉拟合(cross-fitting),该速率在 nuisance 函数以 \( n^{-1/4} \) 速率收敛时即可实现。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 结果空间:\( \mathcal{W}_2 = \{ F : \mathbb{R} \to [0,1] \mid F \text{ 是 CDF}, \int x^2 dF(x) < \infty \} \),配备 2-Wasserstein 距离 \( d_W(F, G) = \left( \int_0^1 (F^{-1}(t) - G^{-1}(t))^2 dt \right)^{1/2} \)。关键:Wasserstein 空间是一个测地线空间(geodesic space),但不是线性空间。
- 因果参数:
- 处理组潜在结果分布:\( F_1(y) = \mathbb{P}(Y(1) \le y) \)。
- 对照组潜在结果分布:\( F_0(y) = \mathbb{P}(Y(0) \le y) \)。
- 分布处理效应(Distributional Treatment Effect, DTE):\( \Delta(y) = F_1(y) - F_0(y) \)(逐点定义)。
- Wasserstein 距离处理效应:\( \tau = d_W(F_1, F_0) \)。
- 识别假设(与第二节相同):
- 无混淆性:\( (Y(1), Y(0)) \perp A \mid X \)。
- 重叠性:\( 0 < \pi(X) < 1 \)。
- 一致性:\( Y = Y(A) \)。
- 与已有文献的比较:
- 相比欧氏空间因果推断:本文的假设完全相同,但目标从条件均值变为条件分布。因此,需要估计的 nuisance 函数从 \( \mathbb{E}[Y \mid A=a, X] \) 变为 \( F_{Y \mid A=a, X} \)(一个函数而非标量)。
- 相比 Wasserstein 回归:本文的识别依赖于无混淆性,而 Wasserstein 回归通常假设处理是外生的(即 \( A \perp Y \mid X \) 的更强版本)。本文的方法允许处理是内生的(但通过无混淆性控制)。
- 额外假设(用于渐近理论):
- 光滑性:条件分布函数 \( F_{Y \mid A=a, X}(y) \) 关于 \( y \) 和 \( X \) 是光滑的(例如,Hölder 连续)。
- 矩条件:结果变量 \( Y \) 有有限四阶矩。
- Nuisance 函数收敛速率:倾向性得分和条件分布函数的估计量以 \( n^{-1/4} \) 或更快的速率收敛(在适当的范数下)。
主要结果¶
定理 1(双重稳健估计量的相合性与渐近正态性): - 陈述:设 \( \hat{F}_1(y) \) 和 \( \hat{F}_0(y) \) 是本文提出的双重稳健估计量(定义见下文)。在正则条件下(包括无混淆性、重叠性、以及 nuisance 函数的收敛速率条件),有:
定理 2(Wasserstein 距离处理效应的渐近分布): - 陈述:设 \( \hat{\tau} = d_W(\hat{F}_1, \hat{F}_0) \)。在定理 1 的条件下,有:
证明路线与技术技巧¶
整体路线(3-5 步逻辑主干):
-
逐点影响函数推导:对于每个固定的 \( y \),将问题视为估计 \( \theta_a(y) = F_a(y) = \mathbb{E}[ \mathbb{1}(Y \le y) \mid A=a ] \)。这是一个标准的因果推断问题,其影响函数为:
\[\psi_a(y; Z, \pi, m_a) = \frac{A^a (1-A)^{1-a}}{\pi(X)^a (1-\pi(X))^{1-a}} (\mathbb{1}(Y \le y) - m_a(X, y)) + m_a(X, y) - \theta_a(y),\]其中 \( Z = (X, A, Y) \),\( m_a(X, y) = \mathbb{P}(Y \le y \mid A=a, X) \)。这是欧氏空间中双重稳健估计量的标准影响函数,但应用于二值结果 \( \mathbb{1}(Y \le y) \)。 -
双重稳健估计量构造:基于影响函数,构造估计量:
\[\hat{\theta}_a(y) = \frac{1}{n} \sum_{i=1}^n \left[ \frac{A_i^a (1-A_i)^{1-a}}{\hat{\pi}(X_i)^a (1-\hat{\pi}(X_i))^{1-a}} (\mathbb{1}(Y_i \le y) - \hat{m}_a(X_i, y)) + \hat{m}_a(X_i, y) \right],\]其中 \( \hat{\pi} \) 和 \( \hat{m}_a \) 是 nuisance 函数的估计。关键:使用交叉拟合(cross-fitting)来避免过拟合偏差:将数据分成 K 折,用第 \( k \) 折以外的数据估计 nuisance 函数,然后用第 \( k \) 折的数据计算 \( \hat{\theta}_a(y) \)。 -
逐点渐近理论:利用标准双重稳健估计理论(如 Chernozhukov et al., 2018),证明对于每个固定的 \( y \),\( \hat{\theta}_a(y) \) 是 \( \theta_a(y) \) 的 \( \sqrt{n} \)-相合、渐近正态估计量。这需要 nuisance 函数的收敛速率条件(\( n^{-1/4} \))。
-
从逐点到整体:将 \( \hat{F}_a(y) = \hat{\theta}_a(y) \) 视为一个随机过程(在 \( y \) 上)。需要证明该过程在 Wasserstein 距离下是紧的(tight),从而保证 \( d_W(\hat{F}_1, \hat{F}_0) \) 的渐近性质。这通过以下步骤实现:
- 证明 \( \hat{F}_a(y) \) 是 \( F_a(y) \) 的一致估计(在 sup 范数下)。
- 利用 Wasserstein 距离的连续性,将 \( d_W(\hat{F}_1, \hat{F}_0) \) 的收敛性转化为 \( \hat{F}_1 \) 和 \( \hat{F}_0 \) 的泛函收敛性。
- 应用 Delta 方法(Wasserstein 距离的 Hadamard 可微性)得到 \( \hat{\tau} \) 的渐近分布。
关键跳跃点: - 从逐点影响到整体 Wasserstein 距离:这是本文最吃功夫的地方。在欧氏空间中,ATE 是标量,因此只需处理一个影响函数。在本文中,目标是一个函数(CDF),因此需要处理一个影响函数过程。作者通过证明该过程的 tightness 来克服这一困难,这依赖于 Wasserstein 空间的几何性质(如测地线凸性)和 Schötz (2019) 的四元不等式。 - 交叉拟合与 Wasserstein 空间的结合:交叉拟合在欧氏空间中已很成熟,但在 Wasserstein 空间中,需要确保 nuisance 函数的估计(如条件分布函数)在交叉拟合的每一折中都是稳定的。作者通过假设 nuisance 函数的估计量是“一致收敛”的来解决这一问题。
技术技巧点名: - 影响函数(Influence Function):用于构造双重稳健估计量和推导渐近方差。这是半参数理论的核心工具。 - 交叉拟合(Cross-fitting):用于放松 nuisance 函数估计的收敛速率条件,从 \( n^{-1/2} \) 降到 \( n^{-1/4} \)。 - 四元不等式(Quadruple Inequality, Schötz, 2019):用于证明 Wasserstein 空间中经验过程的收敛性,是建立 tightness 的关键。 - Hadamard 可微性(Hadamard Differentiability):用于将 Wasserstein 距离视为 CDF 的泛函,并通过 Delta 方法得到其渐近分布。 - 经验过程理论(Empirical Process Theory):用于处理影响函数过程的 tightness 和一致收敛性。
真实例子与应用¶
数据:美国国家健康与营养调查(NHANES)2003-2006 年可穿戴设备数据。该数据包含约 6,000 名成年人的 7 天加速度计记录,每分钟记录一个活动计数(0-32767)。协变量包括年龄、性别、种族、教育、收入等。处理变量是婚姻状况(已婚 vs. 未婚)。
如何应用本文方法: 1. 定义结果:对于每个个体,将其 7 天的每分钟活动计数汇总为一个经验分布(CDF)。因此,每个个体的结果是一个分布函数。 2. 估计 nuisance 函数: - 倾向性得分 \( \pi(X) \):使用逻辑回归估计婚姻状况的条件概率。 - 条件分布函数 \( m_a(X, y) = \mathbb{P}(Y \le y \mid A=a, X) \):使用分位数回归或核密度估计。 3. 计算双重稳健估计量:对每个 \( y \),计算 \( \hat{F}_1(y) \) 和 \( \hat{F}_0(y) \),然后计算 Wasserstein 距离 \( \hat{\tau} = d_W(\hat{F}_1, \hat{F}_0) \)。 4. 推断:使用 Bootstrap 或渐近方差公式计算置信区间。
结果: - 已婚个体的体力活动分布整体上比未婚个体“更活跃”(即分布右移)。 - Wasserstein 距离 \( \hat{\tau} \) 约为 0.15(标准化后),且显著不为零(p < 0.01)。 - 与“逐点”方法(即对每个分位数分别估计处理效应)相比,本文方法得到的分布更光滑,且置信带更窄。
这个例子想说明什么: - 验证理论:展示了本文方法在实际数据中的可行性,并验证了估计量的相合性(通过 Bootstrap 置信区间覆盖真实值)。 - 展示相对 baseline 的优势:与“逐点”方法相比,本文方法利用了 Wasserstein 空间的整体几何结构,从而得到更稳定、更高效的估计。注意:作者并未与“映射到欧氏空间”的方法(如 log-quantile 变换)进行系统比较,这是一个潜在的弱点。
🔎 结论是否比证明窄¶
- 窄结论 1:定理 1 和 2 的证明依赖于“结果变量 \( Y \) 是标量”的假设。作者在结论部分声称该方法可扩展到多元结果(如 \( Y \in \mathbb{R}^d \)),但并未给出证明。这是 conjecture,而非严格证明。扩展到多元结果需要处理高维 Wasserstein 空间,其几何结构更复杂(如不存在显式的分位数函数)。
- 窄结论 2:定理 2 的 Delta 方法需要 Wasserstein 距离的 Hadamard 可微性,这要求 \( F_1 \) 和 \( F_0 \) 是绝对连续的。作者在模拟中使用了离散分布(如经验分布),但未证明在这种情况下 Delta 方法仍然有效。这是证明中的一个 gap:对于离散分布,Wasserstein 距离不是 Hadamard 可微的,因此定理 2 的渐近正态性可能不成立。
- 窄结论 3:作者假设无混淆性,但未讨论未观测混杂的情况。在结论部分,作者提到“未来工作可考虑工具变量或代理变量”,但未给出任何具体方法。这是 limitation,而非 conjecture。
四、开放问题(点到为止,扎根具体语句)¶
- 扩展到多元结果:本文的方法仅适用于标量结果 \( Y \in \mathbb{R} \)。扩展到多元结果(如 \( Y \in \mathbb{R}^d \))需要处理高维 Wasserstein 空间,其几何结构更复杂(如不存在显式的分位数函数)。扎根于:结论部分“Our framework can be extended to multivariate outcomes...”(但未给出证明)。
- 处理未观测混杂:本文假设无混淆性,这在观察性研究中可能不成立。如何利用工具变量或代理变量(proximal causal inference)来识别分布函数层面的因果效应?扎根于:结论部分“Future work could consider instrumental variables or proxy variables...”。
- 离散分布的渐近理论:定理 2 的 Delta 方法需要绝对连续性,但实际数据中结果变量可能是离散的(如计数数据)。如何为离散分布建立类似的渐近理论?扎根于:定理 2 的证明依赖于 Wasserstein 距离的 Hadamard 可微性,而该性质对离散分布不成立。
- 与其他非线性空间的比较:本文聚焦于 Wasserstein 空间,但其他非线性空间(如球面、流形)也可能出现分布值结果。本文的方法能否推广到这些空间?扎根于:引言部分“...the Wasserstein space is just one example of a nonlinear space...”。值得研究者去查:是否存在其他非线性空间中的因果推断工作?它们的识别假设和估计方法与本文有何异同?
Maintained by 陈星宇 · Homepage · Source on GitHub