Causal Partial Identification via Conditional Optimal Transport¶
讲者: Zijun Gao (University of Southern California)
会场: Frontiers in Causal Inference and High-Dimensional Data Analysis
报告题目: Causal Partial Identification via Optimal Transport
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是因果推断中的部分识别(Partial Identification, PI),具体而言,是利用预处理协变量来收紧那些依赖于潜在结果联合分布的因果估计量的识别区间。核心统计问题是:在无法同时观测到处理组和控制组潜在结果的情况下,如何利用协变量信息,通过条件最优传输(Conditional Optimal Transport, COT) 来刻画并估计最优的PI界。该方向当前处于方法快速发展但统计估计理论尚不完善的阶段:COT的数学框架已建立,但有限样本下的一致估计仍是一个开放挑战,现有方法多依赖松弛或间接估计,缺乏直接且具有理论保证的非参数估计量。
发展脉络(history)¶
-
奠基工作:Rubin (1974) [44] 提出潜在结果模型,奠定了因果推断的框架。Neyman (1923) [45] 和 Aronow et al. (2014) [2] 研究了方差的部分识别,但未涉及协变量。Manski (1997) [37] 和 Fan & Park (2010) [20] 利用 Fréchet-Hoeffding 界处理一维结果的部分识别,但该方法无法直接推广到多维结果或连续协变量。
-
最优传输进入因果推断:Villani (2009) [49] 系统总结了OT理论。OT被引入因果推断,用于刻画无协变量时的PI界(如 [24]),以及用于反事实估计(Charpentier et al. 2023 [15], De Lara et al. 2021 [19], Torous et al. 2024 [48])。这些工作表明OT是连接边际分布与联合分布的自然工具,但忽略了协变量的条件结构。
-
条件最优传输与协变量辅助PI:Balakrishnan et al. (2023) [6] 提出利用COT刻画协变量辅助的PI集,并给出保守推断方法。Ji et al. (2023) [28] 提出模型无关的协变量辅助推断方法,但依赖于估计条件分布(nuisance functions)。Lin et al. (2025) [35] 进一步研究了COT的松弛,将COT近似为OT,但需要惩罚参数趋于无穷。这些工作建立了COT与PI的联系,但均未解决COT值的一致估计问题——COT泛函在弱拓扑下不连续,直接plug-in估计不一致(Example 2)。
-
适应Wasserstein距离与本文位置:Backhoff et al. (2022) [3] 提出了适应经验分布,并证明了其在适应Wasserstein距离下的收敛性。本文首次将适应Wasserstein距离引入COT估计,证明COT泛函在该拓扑下连续,并基于适应经验分布构造了直接、一致、非参数的COT值估计量,给出了有限样本收敛速率。本文回答了 [35] 讨论中提出的问题:如何将适应Wasserstein距离融入COT值估计。
子线索聚类¶
- 线索A:OT在因果推断中的应用([10, 15, 19, 48]):利用OT构造反事实分布或PI界,但通常不考虑协变量或仅处理无条件情形。
- 线索B:COT的统计估计方法([38, 35, 28, 46, 12, 26]):包括松弛法(如 [38, 35])、间接法(如 [28] 需估计条件分布)、启发式法(如 [46, 12, 26])。这些方法要么缺乏一致性保证,要么依赖模型假设。
- 线索C:适应Wasserstein距离与适应过程([3, 40, 34, 5]):为处理条件结构提供了拓扑工具,本文直接借用其适应经验分布构造。
- 线索D:三角传输映射([14, 13, 26]):在二次成本下,最优耦合可表示为三角映射,与COT有密切联系,但本文不直接构造映射,而是估计COT值。
这个方向在追问的核心问题¶
- 如何一致地估计COT值? 由于COT泛函在弱拓扑下不连续,直接plug-in失效。需要找到合适的拓扑和估计策略。
- 如何利用协变量信息有效收紧PI界? 协变量可以缩小识别区间,但需要处理连续协变量带来的条件分布估计困难。
- 估计量的收敛速率是多少? 与协变量维数、结果维数、条件分布光滑性有何关系?
- 如何扩展到多处理水平或更一般的处理分配机制? 当前工作主要针对二元处理。
当前主流方法与瓶颈:主流方法包括基于松弛的OT近似(如 [35])和基于 nuisance 函数估计的间接法(如 [28])。瓶颈在于:松弛法需要惩罚参数趋于无穷且可能引入额外误差;间接法依赖条件分布估计的准确性,且在高维或复杂模型下难以保证一致性。本文的直接法避开了这些瓶颈,但需要离散化协变量空间,面临偏差-方差权衡。
⚠️ 作者的 framing¶
作者将缺口 frame 为:COT泛函在弱拓扑下不连续,导致直接plug-in不一致;而适应Wasserstein距离提供了连续性,从而可以构造基于适应经验分布的一致估计量。作者强调其估计量是“直接的、一致的、非参数的”,与现有方法(松弛、间接、启发式)形成对比。作者淡化了以下竞争路线: - 松弛法(如 [35]):作者指出其需要惩罚参数趋于无穷,且本文的估计量实际上是 [35] 中 \(V_{\text{causal}}(\eta)\) 当 \(\eta \to \infty\) 时的极限(Section 6)。 - 间接法(如 [28]):作者认为其需要估计 nuisance 函数,可能因模型错误而失效。 - Fréchet-Hoeffding 界(如 [2, 6]):作者在附录B.2中将其作为一维特例的对比,但指出其无法处理多维结果(\(d_Y > 1\))。
什么明显该被引/该存在、却没出现在intro里? 作者在Section 6提到了三角传输映射,但未引用近期关于三角映射估计的统计文献(如 Baptista et al. 2020 [15] 已在参考文献中,但intro未强调)。此外,关于COT的近期神经网络方法(如 Wang et al. 2023 [50], Kerrigan et al. 2024 [32])仅在应用部分提及,未在intro中作为竞争方法讨论。这可能是因为这些方法缺乏统计保证,但作为“启发式”方法被归入 [46, 12, 26] 一类。
张力¶
未见明显对立引用。各被引工作基本是互补的:OT用于无条件PI,COT用于条件PI,适应Wasserstein距离提供拓扑工具,三角映射提供结构表示。本文是这些线索的汇合。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \(Y_i(0), Y_i(1) \in \mathcal{Y} \subseteq \mathbb{R}^{d_Y}\):单元 \(i\) 的潜在结果(控制、处理)。 - \(W_i \in \{0,1\}\):处理分配指示。 - \(Z_i \in \mathcal{Z} \subseteq [0,1]^{d_Z}\):预处理协变量(连续)。 - \(h: \mathcal{Y}^2 \to \mathbb{R}\):目标函数(如 \(h(y_0,y_1) = (y_0 - y_1)^2\))。 - \(V^* = \mathbb{E}_\mu[h(Y(0), Y(1))]\):目标因果估计量(不可识别)。 - \(V_c = \min_{\pi \in \Pi_c} \mathbb{E}_\pi[h(Y(0), Y(1))]\):PI下界,其中 \(\Pi_c = \{ \pi \in \mathcal{P}(\mathcal{Y}^2 \times \mathcal{Z}) : \pi_{Y(w),Z} = \mu_{Y(w),Z}, w=0,1 \}\)。 - \(\mu_{Y(w),Z}\):\((Y(w), Z)\) 的联合分布(可识别)。 - \(\mu_Z\):协变量的边际分布。 - \(\mu^z_{Y(w)}\):给定 \(Z=z\) 时 \(Y(w)\) 的条件分布。 - \(W_h(\mu, \nu)\):成本函数为 \(h\) 的OT距离。 - \(W_a(\mu, \nu)\):适应Wasserstein距离(Definition 1)。 - \(\varphi^r_n\):将协变量空间离散化为边长为 \(n^{-r}\) 的小立方体,并映射到中心点的投影(Definition 2)。 - \(\hat{\mu}_{Y(w),Z(w),n_w}\):适应经验分布(Definition 3),即对协变量离散化后的经验分布。 - \(\hat{\pi}_{n_0,n_1}\):离散化边际 \(\hat{\mu}_{Z(0),n_0}\) 和 \(\hat{\mu}_{Z(1),n_1}\) 之间的耦合(如最优耦合)。 - \(\hat{V}_{n_0,n_1}\):适应COT值估计量(Definition 4)。
模型: - 潜在结果模型(Rubin 1974):每个单元有潜在结果 \(Y(0), Y(1)\),但只观测到 \(Y(W)\)。 - 超总体模型:\((Y_i(0), Y_i(1), Z_i) \overset{i.i.d.}{\sim} \mu\)。 - 假设:SUTVA(Assumption 1)、无混淆(Assumption 2)、重叠(Assumption 3)。 - 在Bernoulli设计(Assumption 6)下,处理分配独立于协变量,因此处理组和控制组的样本分别 i.i.d. 来自 \(\mu_{Y(1),Z}\) 和 \(\mu_{Y(0),Z}\)。
可观测数据: - 控制组:\(\{(Y_i(0), Z_i(0))\}_{i=1}^{n_0}\),i.i.d. 来自 \(\mu_{Y(0),Z}\)。 - 处理组:\(\{(Y_j(1), Z_j(1))\}_{j=1}^{n_1}\),i.i.d. 来自 \(\mu_{Y(1),Z}\)。 - 不可观测:每个单元的联合潜在结果 \((Y_i(0), Y_i(1))\),以及条件分布 \(\mu^z_{Y(w)}\)(因为每个 \(z\) 通常只有一个观测)。
第二步:最小内核¶
最简特例:\(d_Z = d_Y = 1\),\(h(y_0, y_1) = |y_0 - y_1|\),且假设 \(Y(0), Y(1), Z\) 相互独立,且 \(\mu_{Y(0),Z} = \mu_{Y(1),Z}\)(即处理无效应)。此时,真实下界 \(V_c = 0\)(因为独立时最优耦合是独立耦合,期望绝对差为0?实际上,独立时 \(W_h(\mu^z_{Y(0)}, \mu^z_{Y(1)}) = \mathbb{E}|Y(0)-Y(1)|\),但若 \(\mu^z_{Y(0)} = \mu^z_{Y(1)}\),则最优耦合是共单调耦合,使得 \(Y(0)=Y(1)\) a.s.,因此 \(V_c=0\)。更准确:若条件分布相同,则存在耦合使 \(Y(0)=Y(1)\),故 \(V_c=0\)。
核心困难:直接plug-in估计量使用经验分布 \(\hat{\mu}_{Y(0),Z} = \frac{1}{n_0}\sum_i \delta_{Y_i(0), Z_i(0)}\) 和 \(\hat{\mu}_{Y(1),Z} = \frac{1}{n_1}\sum_j \delta_{Y_j(1), Z_j(1)}\),然后求解 \(\min_{\pi \in \hat{\Pi}_c} \mathbb{E}_\pi|Y(0)-Y(1)|\)。由于协变量连续,几乎必然没有两个样本共享相同的 \(Z\) 值,因此 \(\hat{\Pi}_c\) 只包含一个耦合:将每个 \(Z_i(0)\) 与自身匹配(若 \(Z_i(0)=Z_j(1)\) 则匹配,但几乎必然不相等)。实际上,在Example 2中,假设 \(Z_i(1)=Z_i(0)\)(如双胞胎研究),则唯一耦合是 \(\frac{1}{n_0}\sum_i \delta_{Y_i(0), Y_i(1), Z_i(0)}\),目标值收敛到 \(\mathbb{E}|Y(0)-Y(1)| > 0 = V_c\)。因此直接plug-in不一致。
本文的关键想法:将协变量空间离散化为有限个单元格(边长为 \(n^{-r}\)),使得每个单元格内包含多个观测。然后构造适应经验分布 \(\hat{\mu}_{Y(w),Z(w),n_w}\),其中协变量被替换为单元格中心。这样,对于每个单元格中心 \(z\),条件分布 \(\hat{\mu}^z_{Y(w)}\) 由该单元格内所有观测的 \(Y\) 的经验分布估计。然后,通过最优耦合匹配处理组和控制组的离散化边际,得到COT值估计量。由于离散化引入了偏差(单元格内协变量变化),但通过选择合适的 \(r\) 平衡偏差和方差,可以证明估计量一致且具有收敛速率。核心数学工具是适应Wasserstein距离:在该拓扑下,COT泛函连续,且适应经验分布收敛到真实分布,从而保证一致性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在因果推断中,利用预处理协变量通过条件最优传输(COT)刻画部分识别(PI)集,并解决COT值的一致估计问题。
- 核心工具/方法:证明COT泛函在适应Wasserstein距离下连续,并基于适应经验分布(对协变量离散化)构造直接、非参数的COT值估计量,避免估计 nuisance 函数。
- 主要结论:在Bernoulli设计和无混淆设计下,提出估计量并证明其一致性(Theorem 3)和有限样本收敛速率(Theorem 4, 6),速率依赖于结果维数 \(d_Y\) 和协变量维数 \(d_Z\),为 \(N^{-1/(d_Z+2 \vee d_Y)}\)(对数因子)。此外,给出对协变量分布偏移的鲁棒性保证(Theorem 5)。
关键设定与假设¶
- Assumption 1-3:SUTVA、无混淆、重叠。这是因果推断的标准假设,确保 \(\mu_{Y(w),Z}\) 可识别。
- Assumption 4:\(\mathcal{Z} \subseteq [0,1]^{d_Z}\),\(\mathcal{Y}\) 紧。紧性保证 Wasserstein 距离的良好性质,且离散化可行。
- Assumption 5:\(h\) 连续。用于连续性证明。
- Assumption 6:Bernoulli设计(处理独立于协变量)。简化设定,但后续推广到无混淆设计(Theorem 6)。
- Assumption 7:\(h\) 是 \(L_h\)-Lipschitz 连续的。用于 Lipschitz 性质推导。
- Assumption 8:条件分布 \(\mu^z_{Y(w)}\) 关于 \(z\) 是 \(L_Z\)-Lipschitz 的(在Wasserstein-1距离下)。这是非参数估计的标准光滑性条件。
- Assumption 9:耦合 \(\hat{\pi}_{n_0,n_1}\) 的期望距离有界为 \(O((n_0 \wedge n_1)^{-r})\)。这通过最优耦合自然满足(Remark 4)。
- Assumption 10-13(协变量依赖处理):包括倾向得分估计的 Lipschitz、有界、平均误差条件。
相比已有文献:本文的假设与 [28] 类似,但本文不要求条件分布估计的特定模型,而是通过离散化直接估计。相比 [35] 的松弛法,本文不需要惩罚参数。
主要结果¶
- Theorem 1(最优PI界):在紧性假设下,PI集 \([V_c, \tilde{V}_c]\) 是精确包含所有与观测边际一致的 \(V^*\) 值的区间,且 \(V_c\) 可识别。
- Theorem 2(COT泛函在 \(W_a\) 下连续):若条件分布连续,则当 \(\nu_{Y(w),Z,n} \to \mu_{Y(w),Z}\) 在 \(W_a\) 下时,COT值收敛。这是估计量一致性的理论基础。
- Theorem 3(一致性):在Bernoulli设计下,若 \(\hat{\pi}_{n_0,n_1}\) 弱收敛到 \((id,id)_\# \mu_Z\),则 \(\hat{V}_{n_0,n_1} \to V_c\) a.s.。
- Theorem 4(有限样本收敛速率):在Lipschitz假设下,取 \(r = 1/(d_Z + 2 \vee d_Y)\),有 \(\mathbb{E}[|\hat{V}_{n_0,n_1} - V_c|] \leq \bar{C} \gamma_{d_Y,d_Z}(n_0 \wedge n_1)\),其中 \(\gamma_{d_Y,d_Z}(N) = N^{-1/(d_Z+2 \vee d_Y)} \log N\)(若 \(d_Y=2\) 则无对数)。速率由离散化偏差和Wasserstein估计误差共同决定。
- Theorem 5(鲁棒性):若处理组和控制组的协变量分布与目标分布 \(\mu_Z\) 有 \(W_1\) 距离 \(\epsilon\),则额外误差为 \(2L_h L_Z \epsilon\)。
- Theorem 6(协变量依赖处理):在无混淆设计下,通过倾向得分加权和交叉拟合,得到相同速率的收敛界。
证明路线与技术技巧¶
整体路线(以Theorem 4为例): 1. 误差分解:将 \(|\hat{V}_{n_0,n_1} - V_c|\) 分解为三项(公式15-16): - (Term A):条件分布估计误差 \(\int W_1(\hat{\mu}^z_{Y(0)}, \mu^z_{Y(0)}) d\hat{\mu}_{Z(0)}(z)\) 及类似项。 - (Term B):协变量匹配误差 \(\int \|z_0 - z_1\|_2 d\hat{\pi}(z_0,z_1)\) 和离散化边际估计误差。 2. 控制Term A:利用离散化,将积分分解为单元格内和单元格间。单元格内误差由Wasserstein经验收敛速率控制(Lemma 9,基于Fournier-Guillin [23]),单元格间误差由Lipschitz假设和离散化步长控制(Lemma 8)。 3. 控制Term B:协变量匹配误差由最优耦合的Wasserstein距离控制,该距离又由离散化边际与真实边际的Wasserstein距离控制(Remark 4)。离散化边际的Wasserstein收敛速率由Lemma 9(i)和Lemma 7给出。 4. 选择最优 \(r\):平衡离散化偏差(\(n^{-r}\))和Wasserstein估计误差(\(n^{-1/(2 \vee d_Z)}\) 或 \(n^{-1/d_Y}\) 经离散化后),得到 \(r = 1/(d_Z + 2 \vee d_Y)\)。
关键跳跃点: - Lemma 10(适应经验分布收敛):证明 \(\hat{\mu}_{Y(w),Z(w),n}\) 在 \(W_a\) 下收敛到 \(\mu_{Y(w),Z}\)。这是Theorem 3一致性的基础,依赖于离散化后每个单元格内条件分布的一致估计。 - Lemma 9:将单元格内条件分布的Wasserstein误差与样本量 \(n^{1 - r d_Z}\) 联系起来(因为每个单元格平均有 \(n^{1 - r d_Z}\) 个观测)。这是速率计算的核心。
技术技巧点名: - 适应Wasserstein距离:用于证明COT泛函连续性(Theorem 2),并作为估计量收敛的拓扑。 - 离散化(cell-center projection):将连续协变量空间划分为边长为 \(n^{-r}\) 的立方体,每个单元格中心代表该单元格内所有点。这是构造适应经验分布的关键。 - 最优耦合匹配离散化边际:通过求解Wasserstein-1最优传输问题,匹配处理组和控制组的离散化协变量分布,得到耦合 \(\hat{\pi}_{n_0,n_1}\)。 - 交叉拟合(cross-fitting):在协变量依赖处理设定中,将倾向得分估计与COT值估计分离,避免过拟合。 - Fournier-Guillin定理:用于控制经验分布Wasserstein距离的收敛速率(Corollary 1)。
真实例子与应用¶
论文包含模拟实验和基于真实数据的半合成实验。
- 模拟数据:使用三种模型(线性位置、二次位置、尺度模型),\(d_Y = d_Z = 1\)。比较了本文方法(adapt)与DualBounds方法(ridge和KNN)。结果显示:在线性模型下,ridge DualBounds最优(因模型匹配),但本文方法接近;在非线性模型下,本文方法优于两者。实验验证了理论速率,并展示了鲁棒性(Figure 4)。
- 真实数据:基于STAR项目(奖学金激励对GPA的影响),使用半合成数据(从真实数据拟合模型生成)。估计相关系数的PI界。本文方法在所有样本量下平均相对误差低于DualBounds(Table 2)。
- 这些例子想说明:本文方法在模型错误设定下仍表现良好(非参数),且无需估计 nuisance 函数,具有实际可用性。
🔎 结论是否比证明窄¶
- Theorem 4的收敛速率依赖于Assumption 8(Lipschitz kernel)和Assumption 7(Lipschitz h)。若这些假设不成立(如条件分布不光滑),速率可能更差或估计量不一致。作者未讨论非Lipschitz情形。
- Theorem 6的证明假设倾向得分估计满足Assumption 13(平均误差 \(O(n^{-r})\)),但未给出具体估计方法(如核回归、随机森林)的验证。作者在模拟中假设倾向得分已知,因此该定理的实用性依赖于实际估计器的表现。
- 论文声称“直接、一致、非参数”,但离散化参数 \(r\) 的选择依赖于维数 \(d_Z, d_Y\),实际中需要数据驱动选择(如Section 5.1的bootstrap肘部法),这引入了额外的调参步骤,并非完全“无参数”。
四、开放问题¶
-
多处理水平的扩展:论文在Section 6提到可扩展到多处理水平,但未给出具体估计量或收敛速率。需要解决多边际COT的估计问题,以及适应Wasserstein距离在多处理下的定义。扎根于Section 6“Multiple treatment levels”段落。
-
三角传输映射的恢复:作者推测离散化方法可用于恢复三角传输映射,但未证明。需要建立从离散化COT估计到三角映射的收敛性,并给出映射估计的误差界。扎根于Section 6“Triangular transport maps”段落:“we conjecture that our discretization approach could be adapted to recover a triangular transport map”。
-
更紧的收敛速率:当前速率 \(N^{-1/(d_Z+2 \vee d_Y)}\) 可能不是最优的。例如,若条件分布具有更高阶光滑性(如 Hölder 类),是否可通过更精细的离散化或核平滑达到 minimax 最优速率?扎根于Theorem 4的速率表达式,以及作者未讨论下界。
-
适应Wasserstein距离的替代拓扑:论文使用适应Wasserstein距离,但该距离的计算和理论较复杂。是否存在更简单的拓扑(如基于核的MMD)也能保证COT泛函连续性?扎根于Theorem 2的证明,以及参考文献[11]关于等价性的讨论。
Maintained by 陈星宇 · Homepage · Source on GitHub