跳转至

Stochastic interventions, sensitivity analysis, and optimal transport

作者: Alexander W. Levis, Edward H. Kennedy, Alec McClean, Sivaraman Balakrishnan, Larry Wasserman
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2411.14285


一、领域脉络与小综述

这个方向是什么

本文研究的核心问题是:在存在未测量混杂(unmeasured confounding)时,如何对随机干预(stochastic intervention) 的因果效应进行敏感性分析(sensitivity analysis)。传统上,随机干预是指根据协变量随机分配治疗,其效应在无混杂假设下可被点识别。但当该假设不成立时,效应只能被部分识别(partial identification),即被界定在一个区间内。本文发现,对于传统的“纯随机”干预(即治疗分配独立于自然治疗值),其效应边界有一个反直觉的性质:当目标治疗分布趋近于观测到的自然治疗分布时,边界不会收缩至零宽度(non-collapsing)。作为替代,作者提出广义策略(generalized policy),即允许治疗规则依赖于协变量、自然治疗值及辅助随机性,并证明这类策略可以解决边界非坍缩问题。该方向当前处于理论框架构建与初步方法开发阶段,核心贡献在于将最优传输(optimal transport)理论引入因果敏感性分析,为设计“最优”干预策略提供了数学工具。

发展脉络(history)

  • 奠基工作:Robins (1989) 和 Manski (1990) 开创了非参数边界方法,在仅假设结果有界时给出最宽泛的因果效应边界。Murphy (2003) 和 Robins (2004) 奠定了动态治疗规则(dynamic treatment regimes)的理论基础,即干预可依赖于协变量。
  • 主要进展:
  • 随机干预与增量倾向评分:Kennedy (2019) 提出增量倾向评分干预(incremental propensity score interventions),通过指数倾斜(exponential tilt)改变观测治疗分布,且不要求 positivity 假设。Díaz and Hejazi (2020) 将其推广至连续治疗,并用于中介分析。这些工作主要关注无混杂假设下的点识别与有效估计。
  • 修改治疗策略(MTPs):Robins et al. (2004) 首次提出治疗规则可依赖于自然治疗值(即 MTPs)。Young et al. (2014) 和 Díaz et al. (2023) 系统研究了 MTPs 的识别与估计,并指出在无混杂下,一个 MTP 可关联到一个“纯随机”策略(通过独立随机抽样)。但 Díaz and Hejazi (2020) 明确指出,反向构造(从纯随机策略到 MTP)仍是开放问题。
  • 敏感性分析:Rosenbaum (2002) 和 Tan (2006) 提出了基于倾向得分比值比的敏感性模型。Bonvini et al. (2022) 将敏感性分析推广至边际结构模型,可处理任意离散或连续治疗。Dorn and Guo (2023) 针对二元治疗给出了基于分位数的锐界(sharp bounds)。
  • 当前 frontier 与本文位置:现有敏感性分析大多针对确定性、静态干预,且多限于二元治疗。本文是首个系统探索非确定性策略(随机干预)的敏感性分析的工作。它通过引入耦合(coupling) 和最优传输,统一了纯随机策略与 MTPs,并解决了边界非坍缩问题。作者将 Díaz and Hejazi (2020) 的开放问题(纯随机策略与 MTPs 的关联)作为直接出发点,并给出了完整解答。

子线索聚类

  1. 随机干预与动态治疗规则:包括 Kennedy (2019)、Díaz and Hejazi (2020)、Schindl et al. (2024)、Rakshit et al. (2024) 等。核心是定义和估计在无混杂假设下,由指数倾斜等机制产生的随机干预的因果效应。
  2. 修改治疗策略(MTPs):包括 Robins et al. (2004)、Young et al. (2014)、Díaz et al. (2023)、Haneuse and Rotnitzky (2013) 等。核心是定义和识别依赖于自然治疗值的干预(如阈值干预、移位干预),并探讨其与纯随机策略的关系。
  3. 非参数敏感性分析:包括 Robins (1989)、Manski (1990)、Rosenbaum (2002)、Tan (2006)、Bonvini et al. (2022)、Dorn and Guo (2023) 等。核心是在各种未测量混杂模型下,构建因果效应的锐界。

核心问题与已知瓶颈

  • 核心问题:
  • 如何界定一个随机干预(而非确定性干预)在未测量混杂下的因果效应?
  • 如何设计干预策略,使其在敏感性分析中具有最窄的效应边界?
  • 如何为连续治疗变量开发有效的敏感性分析方法?
  • 已知瓶颈:
  • 传统纯随机策略的边界在目标分布趋近观测分布时不坍缩,这导致其敏感性分析结果可能过于保守。
  • 现有敏感性分析大多针对二元治疗,对连续治疗的处理有限。
  • 纯随机策略与 MTPs 之间的理论联系不清晰,限制了策略设计的灵活性。

⚠️ 作者的 framing

作者将缺口 frame 为:传统随机干预的边界非坍缩性质是一个“令人惊讶的”缺陷,而广义策略是解决该问题的“显然的下一步”。他们通过引入耦合和最优传输,将问题转化为一个最小化边界宽度的优化问题,并声称其最优策略具有“更简洁的解释”。作者淡化了其他敏感性分析路线(如基于工具变量的方法、基于结果模型的参数化方法),将其归为“不同家族”。值得研究者去查的问题:论文的参考文献中,没有出现与 proximal causal inference(如 Tchetgen Tchetgen et al. 的工作)的直接比较或引用。Proximal 方法也处理未测量混杂,但通过代理变量(proxy)实现点识别,而非部分识别。本文的框架是否可与 proximal 方法结合?这是一个明显的未探索交叉点。

张力

未见明显对立引用。不同敏感性模型(如结果导向 vs. 治疗导向)假设不同,但作者将其视为互补而非矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型与可观测数据

  • 符号:
  • \(O = (X, A, Y)\):观测数据,其中 \(X \in \mathbb{R}^d\) 是协变量,\(A \in \mathcal{A} \subseteq \mathbb{R}\) 是治疗变量,\(Y \in \mathbb{R}\) 是结果。
  • \(P\):观测数据分布。
  • \(Y(a)\):在治疗 \(A=a\) 下的潜在结果(counterfactual)。
  • \(d\):广义策略(generalized policy),是一个可测函数 \(d: \mathcal{X} \times \mathcal{A} \times \mathcal{V} \to \mathcal{A}\),其中 \(V\) 是辅助随机变量(如 \(V \sim \text{Unif}(0,1)\))。
  • \(Y(d)\):在策略 \(d\) 下的潜在结果。
  • \(\Pi(\cdot \mid X)\):观测到的治疗条件分布(CDF)。
  • \(Q(\cdot \mid X)\):目标治疗条件分布。
  • \(\mathcal{D}_Q\):所有能诱导出治疗分布 \(Q\) 的广义策略的集合,即 \(Q\)-策略。
  • \(\nu_a(X, a') = E(Y(a) \mid X, A = a')\):在给定 \(X\) 和观测治疗 \(A=a'\) 的个体中,若将治疗设为 \(a\) 的潜在结果均值。
  • \(\mu_a(X) = E(Y \mid X, A = a)\):观测结果回归函数。
  • \(\tau_Q = E\left( \int \mu_a(X) dQ(a \mid X) \right)\):在无混杂假设下,任何 \(Q\)-策略的边际效应。
  • 模型:
  • 数据生成机制:\((X, A, \{Y(a)\}_{a \in \mathcal{A}}) \sim P^*\),观测到的 \(O = (X, A, Y)\) 是 \(P^*\) 的边际分布,且满足一致性假设(\(Y = Y(A)\))。
  • 核心假设:一致性(Assumption 1)和辅助随机性(Assumption 2,即 \(V\) 独立于 \((X, A, \{Y(a)\})\))。
  • 敏感性模型:对未测量混杂的程度施加约束,例如 \(|\nu_a(X, a') - \mu_a(X)| \leq \Gamma\)(Model 2)。
  • 可观测数据:研究者能观测到 \(n\) 个独立同分布的样本 \(\{ (X_i, A_i, Y_i) \}_{i=1}^n\)。
  • 不可观测量:潜在结果 \(Y(a)\) 对于 \(a \neq A\) 的个体是不可观测的。函数 \(\nu_a(X, a')\) 对于 \(a' \neq a\) 是不可识别的,只能通过敏感性模型进行约束。

第二步:最小内核——二元治疗下的边界非坍缩问题

考虑最简单的设定:二元治疗 \(A \in \{0, 1\}\),且无协变量 \(X\)(或条件于 \(X\) 分析)。此时: - 观测治疗分布由倾向得分 \(\pi = P(A=1)\) 刻画。 - 目标治疗分布由 \(q = P(d=1)\) 刻画。 - 纯随机策略 \(d_q\):独立于 \(A\),以概率 \(q\) 分配治疗 1。 - 最大耦合策略 \(d^*_q\):依赖于 \(A\),其定义为: - 若 \(q = \pi\),则 \(d^*_q = A\)。 - 若 \(q < \pi\),则 \(d^*_q = A \cdot \mathbf{1}(V \leq q/\pi)\)(即,仅当 \(A=1\) 且 \(V \leq q/\pi\) 时才保留治疗,否则改为 0)。 - 若 \(q > \pi\),则 \(d^*_q = A + (1-A) \cdot \mathbf{1}(V > (1-q)/(1-\pi))\)(即,仅当 \(A=0\) 且 \(V > (1-q)/(1-\pi)\) 时才改为治疗 1)。

核心现象:当目标分布趋近观测分布,即 \(q \to \pi\) 时: - 对于纯随机策略 \(d_q\):\(P(A \neq d_q) = \pi(1-q) + (1-\pi)q \to 2\pi(1-\pi) > 0\)(除非 \(\pi=0\) 或 1)。因此,即使 \(q=\pi\),\(d_q\) 仍与 \(A\) 不同,其效应边界宽度不趋于 0。 - 对于最大耦合策略 \(d^*_q\):\(P(A \neq d^*_q) = |q - \pi| \to 0\)。因此,当 \(q=\pi\) 时,\(d^*_\pi = A\),效应被点识别,边界坍缩至一点。

数学本质:论文的核心数学问题是:在给定敏感性模型(如 \(|\nu_a - \mu_a| \leq \Gamma\))下,对于任意 \(Q\)-策略 \(d\),其效应 \(E(Y(d))\) 的边界宽度为 \(2\Gamma \cdot P(A \neq d)\)。因此,最小化边界宽度等价于最小化 \(P(A \neq d)\),即最大化 \(d\) 与自然治疗 \(A\) 的一致性。最大耦合策略正是这一优化问题的解。对于连续治疗,该问题推广为最优传输问题:最小化 \(E(h(|A-d|))\),其中 \(h\) 是凸函数,其解由秩保持耦合(rank-preserving coupling)给出。

三、这篇论文做了什么

三句话

  1. 研究问题:在存在未测量混杂时,传统随机干预的因果效应边界在目标分布趋近观测分布时不会坍缩,本文提出广义策略(generalized policy)作为替代,并研究其最优设计与敏感性分析。
  2. 核心工具:利用耦合方法(coupling method)和最优传输理论(optimal transport),将寻找最优广义策略(即最小化边界宽度)转化为一个 Monge-Kantorovich 问题。
  3. 主要结论:对于多种敏感性模型(结果有界、结果偏差有界、连续结果偏差、倾向得分比值比),刻画了最优广义策略(最大耦合策略或秩保持耦合策略)及其对应的锐界(sharp bounds),并为指数倾斜目标分布开发了灵活、高效、稳健的估计量。

关键设定与假设

  • 广义策略(Definition 1):\(d \in \mathcal{D}_Q\) 是任何满足 \(P(d(X,A,V) \leq a \mid X) = Q(a \mid X)\) 的可测函数。这统一了纯随机策略(\(d_Q\),独立于 \(A\))和 MTPs(依赖于 \(A\))。
  • 一致性假设(Assumption 1):\(Y(d_1) = Y(d_2)\) 若 \(d_1 = d_2\),且 \(Y(A) = Y\)。
  • 辅助随机性假设(Assumption 2):\(V \perp\!\!\!\perp (X, A, \{Y(a)\})\)。这是为了确保 \(d\) 与潜在结果条件独立,便于识别。
  • 绝对连续性假设(Assumption 3):\(Q(\cdot \mid X) \ll \Pi(\cdot \mid X)\)。这替代了传统的 positivity 假设,要求目标分布不赋予观测分布零测集以正质量。
  • 目标分布可识别假设(Assumption 4):\(Q\) 可由观测数据识别(例如,通过指数倾斜定义)。
  • 敏感性模型(Models 1-4):对未测量混杂的程度施加不同形式的约束。例如,Model 2 假设 \(|\nu_a(X, a') - \mu_a(X)| \leq \Gamma\),Model 3 假设 \(|\nu_a(X, a') - \mu_a(X)| \leq \Gamma |a' - a|^p\)。相比已有文献,Model 4(倾向得分比值比模型)被推广至任意离散或连续治疗(原文称“这些边界是新的,可能具有独立意义”)。

主要结果

  • Proposition 1:对于任何 \(d \in \mathcal{D}_Q\),其条件效应可分解为:
    \[E(Y(d) \mid X) = t_Q(X) + E\left( \mathbf{1}(A \neq d) \cdot \{\nu_d(X, A) - \mu_d(X)\} \mid X \right),\]
    其中 \(t_Q(X) = \int \mu_a(X) dQ(a \mid X)\)。该分解将效应偏差与“策略与自然治疗不一致”的事件联系起来,是后续所有边界推导的基础。
  • Theorem 1(最大耦合策略的最优性):在敏感性模型下,若偏差有界 \(|\nu_a(X, a') - \mu_a(X)| \leq \Gamma^\pm(X)\),则最大耦合策略 \(d^*_Q\)(Example 3)最小化 \(P(A \neq d \mid X)\),从而给出最窄边界:
    \[E(Y(d^*_Q) \mid X) \in [t_Q(X) - \Gamma^-(X) \cdot \text{TV}_{\Pi, Q}(X),\; t_Q(X) + \Gamma^+(X) \cdot \text{TV}_{\Pi, Q}(X)],\]
    其中 \(\text{TV}_{\Pi, Q}(X)\) 是总变差距离。该边界是锐界(sharp)。
  • Theorem 2(秩保持耦合策略的最优性):在连续治疗且偏差有界 \(|\nu_a(X, a') - \mu_a(X)| \leq h(|a' - a|)\)(\(h\) 为凸函数)时,秩保持耦合策略 \(d^{\text{mon}}_Q\)(Example 2)最小化 \(E(h(|A-d|) \mid X)\),从而给出最窄边界,其宽度由 \(p\)-Wasserstein 距离 \(W_p(\Pi, Q)\) 决定。
  • Theorem 3(二元治疗的特例):对于二元治疗,最大耦合策略 \(d^*_q\) 在更一般的偏差模型(如 Model 4)下仍是最优的,其边界宽度为 \((\Gamma^-_s + \Gamma^+_s) |q - \pi|\),其中 \(s = \mathbf{1}(q > \pi)\)。这比纯随机策略的边界(宽度为 \(\Gamma^-_0 \pi(1-q) + \Gamma^-_1 (1-\pi)q + \Gamma^+_0 \pi(1-q) + \Gamma^+_1 (1-\pi)q\))更窄。

证明路线与技术技巧

  • 整体路线:
  • 分解效应(Proposition 1):将 \(E(Y(d) \mid X)\) 分解为可识别部分 \(t_Q(X)\) 和由未测量混杂引起的偏差项。
  • 将边界宽度与耦合联系起来:在给定敏感性模型下,偏差项的上界可表示为 \(E(\Gamma(A, d) \mid X)\),其中 \(\Gamma\) 是已知函数。因此,最小化边界宽度等价于最小化 \(E(\Gamma(A, d) \mid X)\)。
  • 转化为最优传输问题:对于不同的 \(\Gamma\) 函数,该优化问题对应不同的最优传输问题。例如,当 \(\Gamma(a, a') = \mathbf{1}(a \neq a')\) 时,问题退化为最小化 \(P(A \neq d)\),其解是最大耦合(Theorem 1)。当 \(\Gamma(a, a') = h(|a - a'|)\) 时,问题退化为最小化 \(E(h(|A-d|))\),其解是秩保持耦合(Theorem 2)。
  • 利用已知最优传输结果:最大耦合和秩保持耦合是经典最优传输问题的解,作者直接引用这些结果(如 Santambrogio, 2015 的 Theorem 2.9)。
  • 构建锐界:将最优耦合代入 Proposition 1,得到锐界。
  • 关键跳跃点:将“最小化边界宽度”问题转化为“最小化 \(P(A \neq d)\)”或“最小化 \(E(h(|A-d|))\)”问题。这一步依赖于 Proposition 1 的分解,以及敏感性模型对偏差项的直接约束。作者巧妙地利用了“偏差项仅在 \(A \neq d\) 时非零”这一事实。
  • 技术技巧点名:
  • 耦合方法:用于构造广义策略,并建立其与目标分布 \(Q\) 的联系。
  • 最优传输理论:用于刻画最优耦合,特别是 Monge-Kantorovich 问题。
  • von Mises 展开:用于推导估计量的渐近性质(Proposition 2, 3)。
  • 非光滑泛函估计:对于涉及指示函数的泛函(如总变差距离、分位数),作者利用边际条件(Margin Condition, Assumption 5, 6)来控制估计偏差,这是处理非路径可微泛函的标准技巧(如 Luedtke and van der Laan, 2016)。
  • 交叉拟合(cross-fitting):用于处理估计量中的 nuisance 函数,实现渐近正态性。

真实例子与应用

本文为纯理论论文,无真实数据例子。但包含一个模拟例子(Section 2.1, Figure 1): - 数据:\(X \sim \text{Unif}(0,1)\),\(A \in \{0,1\}\),\(\pi(X) = X\),\(\mu_a(X) = (2a-1)X\)。 - 方法:考虑增量倾向评分干预 \(q_\delta\),在敏感性模型 \(|\nu_a - \mu_a| \leq \Gamma\) 下,计算纯随机策略 \(d_{q_\delta}\) 和最大耦合策略 \(d^*_{q_\delta}\) 的效应边界。 - 结果:Figure 1 显示,当 \(\delta \to 0\)(即 \(q_\delta \to \pi\))时,\(d_{q_\delta}\) 的边界不坍缩,而 \(d^*_{q_\delta}\) 的边界坍缩至一点。这直观验证了论文的核心理论发现。 - 目的:该例子旨在展示问题(边界非坍缩)和验证理论(最大耦合策略解决该问题),而非展示方法在实际数据上的性能。

🔎 结论是否比证明窄

  • 窄结论:Theorem 1 和 Theorem 2 的最优性结论依赖于敏感性模型对偏差项的具体形式(如 \(|\nu_a - \mu_a| \leq \Gamma\) 或 \(|\nu_a - \mu_a| \leq h(|a'-a|)\))。作者在 Theorem 3 的证明中明确指出,对于 Model 4(倾向得分比值比模型),最优策略的闭式解“尚不清楚”,并“将这个问题留给未来工作”。这表明,论文的结论在更复杂的敏感性模型下可能不成立。
  • 泛化 claim:论文在 Section 5(讨论)中声称,其方法可推广至其他敏感性模型(如污染模型)和纵向设置。但这些推广并未在本文中严格证明,属于 conjecture。
  • 具体语句:在 Section 3.2 末尾,作者写道:“Optimal policies for such bounds can be determined from the solution of a linear optimization problem, however whether this solution has a simple closed form is unclear, and we leave this problem for future work.” 这明确承认了结论的局限性。

四、开放问题

  1. 其他敏感性模型下的最优策略:对于 Model 4(倾向得分比值比模型)等更复杂的模型,最优广义策略的闭式解是什么?是否可以通过线性规划高效求解?(扎根于 Section 3.2 末尾的“leave this problem for future work”)
  2. 纵向设置下的推广:本文的框架能否推广至具有时变治疗的纵向设置?在纵向设置下,广义策略的识别需要更强的假设(如 Young et al., 2014 所述),部分识别结果是否还能保持?(扎根于 Section 5 的“extend these methods to handle longitudinal settings”)
  3. 边界长度与估计效率的权衡:本文的最优策略最小化了理论边界宽度,但未考虑估计这些边界时的统计效率。是否存在一种策略,虽然理论边界稍宽,但估计更稳定,从而在有限样本下给出更窄的置信区间?(扎根于 Section 5 的“trade-off between bound length and efficiency in estimating the bounds themselves”)
  4. 与 Proximal Causal Inference 的结合:本文的敏感性分析框架与 proximal 方法(通过代理变量处理未测量混杂)有何联系?能否将广义策略与代理变量结合,实现更紧的边界或点识别?(这是一个基于作者 framing 的推测性问题,论文未提及,但值得研究者去查近期约 5 篇 proximal CI 的 intro 来确认是否为真 gap。)

Maintained by 陈星宇 · Homepage · Source on GitHub

评论