跳转至

Marginal Causal Effect Estimation with Continuous Instrumental Variables

作者: Mei Dong, Lin Liu, Dingke Tang, Geoffrey Liu, Wei Xu et al.
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2510.14368


一、领域脉络与小综述

这个方向是什么

本文研究的子方向是利用连续工具变量(IV)识别和估计平均处理效应(ATE)。其根本的统计问题是:在存在未测量混杂的情况下,如何利用一个连续(而非二元)的工具变量,在尽可能少的参数假设下,识别并有效估计整个群体的平均因果效应。该方向当前处于一个“方法众多但各有局限”的状态:参数方法依赖强假设,非参数方法面临高维诅咒,而半参数方法在连续IV下对效率理论和实用估计量的研究尚不充分。

发展脉络(history)

  • 奠基工作:二元IV的识别与估计。Angrist et al. (1996) 在单调性假设下识别了局部平均处理效应(LATE),这是IV文献的基石。Wang and Tchetgen Tchetgen (2018) 则在同质性假设(无未测量共同效应修饰)下,为二元IV下的ATE识别和估计提供了完整的半参数效率理论,并提出了有界、三重稳健的估计量。这是本文最直接的前身。
  • 主要进展:同质性假设的推广与连续IV的初步尝试。Cui and Tchetgen Tchetgen (2021) 和 Hartwig et al. (2023) 将“无未测量共同效应修饰”假设从“完全无交互”放宽到“协方差为零”,并指出对于连续IV,ATE可由 E[Cov(Z,Y|X)] / E[Cov(Z,D|X)] 识别。然而,这一识别公式依赖于 Cov(Z,D|X) ≠ 0,且未提供完整的半参数效率理论。Kennedy et al. (2019) 和 Zeng et al. (2025) 发展了局部IV方法,将单调性假设推广到连续IV,但识别的是局部IV曲线而非ATE。
  • 当前Frontier:半参数效率理论与实用估计量。对于连续IV,非参数方法(Newey and Powell, 2003; Darolles et al., 2011)理论上可识别ATE,但需解不适定逆问题,在高维协变量下表现不佳。半参数部分线性IV模型(Okui et al., 2012; Young and Shah, 2024; Scheidegger et al., 2025)通常假设同质处理效应,且对二元结果关注较少。本文的位置:它填补了连续IV下ATE的完整半参数效率理论空白,并提供了一个易于实现、三重稳健、局部有效的估计量,直接推广了Wang and Tchetgen Tchetgen (2018) 的二元IV框架。

子线索聚类

  1. 基于单调性假设的LATE方法:Angrist et al. (1996)(二元IV的LATE),Kennedy et al. (2019) 和 Zeng et al. (2025)(连续IV的局部IV曲线)。这一簇关注的是“依从者”的子群体效应。
  2. 基于同质性/无共同效应修饰假设的ATE方法:Wang and Tchetgen Tchetgen (2018)(二元IV,完整半参数理论),Cui and Tchetgen Tchetgen (2021) 和 Hartwig et al. (2023)(推广假设,提出Wald型估计量),本文(连续IV,完整半参数理论)。这一簇关注的是整个群体的ATE。
  3. 非参数与半参数IV方法:Newey and Powell (2003) 和 Darolles et al. (2011)(非参数IV,不适定逆问题),Okui et al. (2012) 和 Young and Shah (2024)(半参数部分线性IV,同质效应)。这一簇侧重于灵活建模,但面临计算或假设上的挑战。

核心问题与瓶颈

  • 核心问题1:在连续IV下,如何在不依赖强参数模型或同质处理效应假设的前提下,识别ATE?
  • 核心问题2:如何刻画由连续IV导致的过度识别约束下的半参数模型切空间,并推导出有效影响函数(EIF)?
  • 核心问题3:如何基于EIF构建一个实用、稳健且高效的估计量,避免估计复杂的密度导数?

当前主流方法(如非参数IV、部分线性IV)的瓶颈在于:要么需要解不适定逆问题(对高维协变量敏感),要么假设了同质效应(过于严格)。本文通过引入“条件加权平均导数效应”(CWADE)和“条件Riesz表示”(conditional RR),提供了一个统一的识别框架,并首次在连续IV的半参数效率理论中使用了二阶参数子模型来刻画切空间,从而解决了核心问题2。

⚠️ 作者的framing

作者将缺口frame成:“现有连续IV方法要么依赖强参数模型,要么假设同质处理效应,而非参数方法在高维协变量下表现不佳。我们提供了一个统一的、基于条件Riesz表示的识别框架,并首次刻画了其半参数切空间,从而构建了一个局部有效、三重稳健且易于实现的估计量。”

  • 被淡化/回避的竞争路线:作者将非参数IV方法(Newey and Powell, 2003)描述为“在高维协变量下表现不佳”,但并未深入讨论其与本文方法在低维协变量下的比较。作者也回避了与近期基于深度学习的IV方法(如Deep IV, Hartford et al., 2017)的直接对比,后者在处理高维数据时可能更具优势。
  • 值得研究者去查的问题:作者在引言中引用了Chen and Santos (2018) 关于“过度识别”的通用理论,但并未详细说明本文的切空间刻画如何与该通用理论关联。值得去查:Chen and Santos (2018) 的通用框架是否能直接应用于本文的设定?本文的“二阶参数子模型”构造是否是该通用框架的一个特例或必要补充? 此外,作者引用了Chernozhukov et al. (2024) 的“条件影响函数”工作,但本文并未直接使用其框架。值得去查:Chernozhukov et al. (2024) 的条件影响函数框架是否能简化本文的EIF推导?

张力

未见明显对立引用。所有被引工作基本沿着“从二元到连续”、“从参数到半参数”的路径演进,彼此之间是互补而非矛盾的关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • O := (Y, D, Z, X):可观测数据向量。
    • Y:结果变量(本文中可为连续或二元)。
    • D ∈ {0, 1}:二元处理/暴露变量。
    • Z:工具变量(IV),可为分类(K个水平)或连续(Z ⊆ ℝ)。
    • X:基线协变量向量。
    • U:未测量的(可能为向量)混杂因子。
    • Y(d):在 D = d 下的潜在结果。
    • D(z):在 Z = z 下的潜在处理状态。
    • µ_Y(Z, X) := E[Y | Z, X]µ_D(Z, X) := E[D | Z, X]:条件均值函数。
    • µ_Y(X) := E[Y | X]µ_D(X) := E[D | X]:给定X的边缘均值。
    • µ_Z(X) := E[Z | X]:给定X的IV均值。
    • ˙µ_Y(z, x) := ∂µ_Y(z, x) / ∂z˙µ_D(z, x) := ∂µ_D(z, x) / ∂z:条件均值对z的偏导数(仅当Z连续时)。
    • p(z | x):给定X下Z的条件密度/质量函数。
    • F(z | x) := Pr(Z ≤ z | X = x):给定X下Z的累积分布函数。
    • δ(X) := E[Y(1) - Y(0) | X]:条件平均处理效应(CATE)。
    • ∆ := E[δ(X)]:平均处理效应(ATE),是本文的目标参数(estimand)
    • ω(Z, X):一个指定的、平方可积的权重函数。
    • δ^D_ω(X) := E[ω(Z, X) ˙µ_D(Z, X) | X]:条件加权平均导数效应(CWADE)之于D。
    • δ^Y_ω(X) := E[ω(Z, X) ˙µ_Y(Z, X) | X]:CWADE之于Y。
    • γ_ω(Z, X):条件Riesz表示(conditional RR),满足 E[γ_ω(Z, X) µ_D(Z, X) | X] = δ^D_ω(X)
    • E := Y - µ_Y(X) - δ(X){D - µ_D(X)}:中心化残差。
    • σ²(Z, X) := Var[E | Z, X]:残差的条件方差。
  • 模型:数据生成机制由标准IV假设(Assumptions 1-4)和一个额外的“无未测量共同效应修饰”假设(Assumption 5)约束。Assumption 5 是核心识别假设,它要求 Cov{E[D|Z=z, X, U] - E[D|X, U], E[Y(1)-Y(0)|X, U] | X} = 0,即未测量混杂U不能同时修饰IV对D的效应和D对Y的效应。这比“完全无交互”更弱,但仍是不可检验的。

  • 可观测数据:研究者实际能观测到的是 (Y, D, Z, X) 的独立同分布样本。想要但观测不到的是:潜在结果 Y(1), Y(0),潜在处理状态 D(z),以及未测量混杂 U。识别ATE的关键在于,利用IV假设和Assumption 5,将 δ(X) 表达为仅依赖于可观测数据 (Y, D, Z, X) 的某个泛函。

第二步:讲最小内核

本文的核心思路可以浓缩为一个最简特例:假设 X 是空集(即没有协变量),Z 是连续IV,且 ˙µ_D(z) ≠ 0 对所有 z 成立。在这个特例下,Assumption 5 简化为 Cov{E[D|Z=z, U], E[Y(1)-Y(0)|U]} = 0。此时,ATE ∆ = E[Y(1)-Y(0)] 的识别公式(Theorem 1)退化为:

∆ = E[ω(Z) ˙µ_Y(Z)] / E[ω(Z) ˙µ_D(Z)], 对任意权重函数 ω(Z) 使得分母非零。

这个公式的核心思路是:通过一个权重函数 ω(Z)˙µ_Y(Z)˙µ_D(Z) 进行加权平均,它们的比值就等于ATE。关键在于,这个比值不依赖于 ω(Z) 的选择(只要分母非零),这正是Assumption 5 保证的。

为什么这个特例是“最小内核”? 因为整篇论文的一般化(引入协变量X、处理Z为分类、处理˙µ_D(Z,X)=0的情况)都是对这个核心思想的“加壳”: 1. 引入X:将 ˙µ_Y(Z)˙µ_D(Z) 替换为条件版本 ˙µ_Y(Z,X)˙µ_D(Z,X),ATE变为 E[δ(X)],其中 δ(X) = E[ω(Z,X) ˙µ_Y(Z,X) | X] / E[ω(Z,X) ˙µ_D(Z,X) | X]。 2. 处理 ˙µ_D(Z,X)=0 的情况:当 ˙µ_D(z,x) 在某些z处为零时,直接使用比值会出问题。本文的巧妙之处在于,通过条件Riesz表示 γ_ω(Z,X),将 E[ω(Z,X) ˙µ_D(Z,X) | X] 等价地写为 E[γ_ω(Z,X) µ_D(Z,X) | X]。这样,分母就从“导数”变成了“函数本身”,避免了除零问题。这对应Theorem 1中的等式(13)。 3. 处理分类Z:将导数 ˙µ_D 替换为离散差分 µ_D(j,X) - µ_D(k,X),权重函数 ω(Z,X) 变为 ω_{jk}(X),条件Riesz表示也相应变化(Lemma 1)。

因此,整个论文的数学核心就是:在“无共同效应修饰”假设下,通过一个权重函数对IV-处理效应和IV-结果效应进行加权平均,其比值等于ATE,且该比值不依赖于权重选择。 条件Riesz表示是一个强大的工具,它将这个核心思想统一到了连续和分类IV的框架下,并巧妙地规避了导数估计的难题。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在连续工具变量(IV)下,如何识别并有效估计平均处理效应(ATE)。
  2. 核心工具/方法:引入了“条件加权平均导数效应”(CWADE)和“条件Riesz表示”(conditional RR)来统一识别框架;通过构造二阶参数子模型来刻画过度识别约束下的半参数切空间,从而推导出有效影响函数(EIF);基于一个局部有效的IF,构建了一个三重稳健(triply robust)局部有效易于实现的估计量。
  3. 主要结论:在标准IV假设和一个“无未测量共同效应修饰”假设下,ATE可由一个“平均广义Wald估计量”识别。该估计量的EIF被推导出,并基于此构建了一个在三个不同模型设定中任一正确时均一致的估计量,且在完全正确时达到局部半参数有效。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • Assumption 1 (IV Relevance):对于每个 x,存在一个非空开集 I_x 使得 ˙µ_D(z, x) ≠ 0。这比二元IV的 Z ⊥̸⊥ D | X 更强,因为它要求导数非零,而不仅仅是相关。这是为了确保CWADE的分母非零。
  • Assumption 2 (Independence)Z ⊥⊥ U | X。标准IV假设。
  • Assumption 3 (Exclusion Restriction)Z ⊥⊥ Y | (D, X, U)。标准IV假设。
  • Assumption 4 (d-separation)Y(d) ⊥⊥ (Z, D) | (X, U)。由SWIG隐含,确保潜在结果与IV和处理分配独立。
  • Assumption 5 (No unmeasured common effect modifier)∀z ∈ Z, Cov{E[D|Z=z, X, U] - E[D|X, U], E[Y(1)-Y(0)|X, U] | X} = 0。这是核心识别假设,比Wang and Tchetgen Tchetgen (2018) 的 Assumption 5'(完全无交互)更弱,因为它只要求协方差为零,而非完全独立。这是对Hartwig et al. (2023) 假设的推广。
  • Assumption A2 (Regularity for continuous Z)ω(z, x)p(z|x) 连续可微,在边界为零,且 p(z|x)=0 ⇒ ω(z,x)=0。这是为了应用分部积分,推导条件Riesz表示。
  • Condition C1 (Conditional Homoskedasticity)σ²(Z, X) := Var[E | Z, X] 不依赖于 Z。这是一个简化假设,用于获得一个更简单的局部有效IF。
  • Condition C2 (Partial Linearity)µ_D(Z, X) = δ^D(X) Z + µ_D(0, X)。另一个简化假设,用于进一步简化局部有效IF。

相比已有文献:本文的Assumption 5 比Wang and Tchetgen Tchetgen (2018) 的假设更弱,但比Hartwig et al. (2023) 的假设更正式地推广到了连续IV。Conditions C1和C2是本文为了构建实用估计量而引入的,它们定义了半参数模型 M_sp 的一个子模型 M_pl

主要结果

  • Theorem 1 (Identification):在Assumptions 1-5下,CATE δ(X) 可由条件广义Wald估计量 δ_ω(X) = δ^Y_ω(X) / δ^D_ω(X) 识别,且该估计量不依赖于权重 ω 的选择。进一步,通过条件Riesz表示,δ_ω(X) 可写为 E[γ_ω(Z,X) µ_Y(Z,X) | X] / E[γ_ω(Z,X) µ_D(Z,X) | X],统一了连续和分类IV。直觉:这个定理是说,只要没有U同时修饰Z-D和D-Y的效应,那么IV对Y的“局部平均效应”(由CWADE衡量)除以IV对D的“局部平均效应”,就等于D对Y的“局部平均效应”(即CATE)。
  • Theorem 2 (Semiparametric Efficiency)
    • (1) 在非参数模型 M_np 下,给定权重 ω∆_ω 的唯一IF(也是EIF)是 Ψ_ω
    • (2) 在半参数模型 M_sp 下,{Ψ_ω} 构成 的一类IF。
    • (3) M_sp 下的EIF是 Ψ_eff,它属于上述IF类,对应一个最优权重 ω_opt直觉:这个定理刻画了在过度识别约束下,ATE的估计效率边界。Ψ_eff 是所有IF中方差最小的,但依赖于复杂的 nuisance 函数。
  • Theorem 3 (Locally Efficient IF)Ψ_{ω_0} = (Z - µ_Z(X)) / Cov(Z, D | X) * E + δ(X) - ∆ 在子模型 M_pl(满足C1和C2)下的EIF,并且在 M_sp 下仍是一个有效的IF。直觉:这个定理提供了一个“退而求其次”的实用方案。虽然 Ψ_eff 最优但难估计,但 Ψ_{ω_0} 在更严格的子模型下是最优的,且在全模型下仍然有效(只是不一定最优)。它的形式非常简单,只涉及 µ_Z(X)Cov(Z, D | X)δ(X) 等易于建模的量。
  • Theorem 4 (Triply Robust Estimation):基于 Ψ_{ω_0} 构建的估计量 ˆ∆_tr 在并集模型 M_union = {M_1 ∪ M_2 ∪ M_3} ∩ M_sp 下是相合且渐近正态的(CAN),并且在交集模型 M_int = M_1 ∩ M_2 ∩ M_3 ∩ M_pl 下是局部半参数有效的。直觉:这是本文的核心方法论贡献。ˆ∆_tr 提供了三重保险:只要研究者能正确指定三组模型中的任意一组(M_1: 结果回归模型;M_2: IV-处理关系模型;M_3: IV-结果关系模型),估计量就是一致的。如果三组都正确,它还能达到局部有效。

证明路线与技术技巧

  • 整体路线

    1. 识别:从Assumption 5出发,证明 ˙µ_Y(z, x) = δ(x) ˙µ_D(z, x),从而得到CATE的识别公式 δ(x) = δ^Y_ω(x) / δ^D_ω(x)。然后利用条件Riesz表示将分母从导数形式转化为函数形式,避免除零问题。
    2. 切空间刻画:这是技术难点。模型 M_sp 由约束 µ_Y(z, X) - µ_Y(X) = δ(X){µ_D(z, X) - µ_D(X)} 定义。为了找到该模型下 的EIF,需要先刻画模型的切空间 Λ_sp。作者通过构造一个二阶参数子模型(second-order parametric submodel)来证明 Λ_sp 的补空间 Λ_sp^⊥ 的形式。标准的一阶扰动 p_t(o) = p(o)(1 + t s(o)) 无法保证扰动后的分布仍在 M_sp 内,因为约束是二阶的。作者通过在条件密度 p(y|d,z,x) 中引入一个 项(即 h_2),使得扰动后的 δ_t(z,x) 不依赖于 z,从而确保路径在模型内。
    3. EIF推导:在得到 Λ_sp^⊥ 后,将任意一个IF(如 Ψ_ω)投影到 Λ_sp 上,得到EIF Ψ_eff。投影过程涉及求解一个条件期望方程,最终得到 Ψ_eff 的显式形式。
    4. 实用估计量构建:由于 Ψ_eff 依赖复杂的 nuisance 函数(如 σ²(Z,X) 的条件期望),作者转而寻找一个形式更简单的IF Ψ_{ω_0}。通过引入Conditions C1和C2,证明了 Ψ_{ω_0} 在子模型 M_pl 下是EIF,并在全模型下有效。然后,基于 Ψ_{ω_0} 构建三重稳健估计量 ˆ∆_tr,其核心是设计三个不同的估计方程,分别对应 M_1M_2M_3 三个模型,使得只要其中一个正确,整个估计方程就是无偏的。
  • 关键跳跃点

    • 从一阶到二阶参数子模型:这是证明中最具技巧性的部分。作者意识到,为了在 M_sp 内构造一个有效的参数子模型,其得分函数 s(o) 必须满足一个非平凡的约束。通过引入一个二阶扰动项 h_2,作者获得了额外的自由度来满足这个约束,从而证明了 Λ_sp^⊥ 的形式。这个跳跃点解决了“如何在一个由代数约束定义的模型中构造路径”这一核心难题。
    • 从EIF到三重稳健估计量:EIF Ψ_eff 虽然最优,但难以直接用于估计。作者的关键跳跃是识别出一个形式简单的IF Ψ_{ω_0},并证明它在子模型下是局部有效的。然后,通过将 Ψ_{ω_0} 中的 nuisance 函数分解为三个可分别建模的部分(M_1, M_2, M_3),并设计相应的估计方程,实现了三重稳健性。
  • 技术技巧点名

    • 条件Riesz表示(conditional RR):用于将CWADE从导数形式转化为函数形式,统一连续和分类IV,并避免除零问题。
    • 二阶参数子模型(Second-order parametric submodel):用于在过度识别约束下刻画半参数模型的切空间。这是本文在技术上的核心创新点。
    • 影响函数(Influence Function)投影:用于在已知切空间补空间的情况下,从一类IF中找出EIF。
    • 三重稳健估计(Triply Robust Estimation):通过设计多个估计方程,使得估计量在多个模型设定下保持相合。
    • 重参数化(Reparameterization):将 Cov(Z, D | X) 重参数化为 δ_Z(X) µ_D(X)(1-µ_D(X)),以确保各 nuisance 模型之间的变分独立性(variation independence),避免模型冲突。

真实例子与应用

  • 数据:Princess Margaret Cancer Centre 的 NSCLC 患者回顾性队列(n=1282)。暴露 D 为诊断时是否超重(BMI≥25),结果 Y 为两年内是否死亡。
  • 方法应用:使用BMI相关的多基因风险评分(PRS)作为连续IV。通过标准QC和排除吸烟相关SNP来缓解水平多效性。将本文提出的 ˆ∆_1, ˆ∆_{b-2}, ˆ∆_3, ˆ∆_{b-tr} 应用于数据,并与 Crude RD, RD Reg, TSLS, 以及将PRS二值化后的 dicIV: ˆ∆_{b-tr} 进行比较。
  • 结果:传统回归方法(Crude RD, RD Reg)显示超重有保护效应(风险差为负),而所有IV方法(包括TSLS和本文方法)的置信区间都包含零,表明无显著因果效应。ˆ∆_3ˆ∆_{b-tr} 的估计值非常接近,暗示 M_3 模型可能正确。二值化IV导致置信区间大幅变宽。
  • 说明的问题:这个例子展示了本文方法在解决实际因果问题中的价值。它揭示了“肥胖悖论”可能源于未测量混杂,而IV方法(尤其是本文提出的稳健方法)能够纠正这种混杂。同时,它也实证了连续IV相比二值化IV的信息优势,以及本文方法在模型选择上的诊断价值(通过比较不同 ˆ∆ 的估计值)。

🔎 结论是否比证明窄

  • 窄结论:Theorem 4 的局部有效性是在 交集模型 M_int = M_1 ∩ M_2 ∩ M_3 ∩ M_pl 下证明的。这意味着,要达到局部有效,不仅需要三组工作模型都正确,还需要满足Conditions C1和C2(即 M_pl)。如果C1或C2不成立,ˆ∆_tr 仍然是相合的,但不再是有效的。论文在Theorem 4的陈述中明确指出了这一点。
  • 泛泛claim:论文在摘要和引言中声称“开发了一个局部有效、三重稳健、有界且易于实现的估计量”。这个claim在Theorem 4的严格条件下是成立的,但读者可能会忽略“局部有效”依赖于 M_pl 这一条件。论文在Theorem 4的陈述中明确指出了这一点,但在非技术性摘要中未强调此限制。
  • 值得注意:论文在讨论部分(Section 7)提到,其方法可以扩展到识别整个群体的条件反事实分布函数(Theorem S.3)。这个结论是在补充材料中证明的,且依赖于一个更强的Assumption 5'''。这个扩展的实用性(例如,用于估计分位数效应)在正文中未被深入探讨。

四、开放问题

  1. 扩展到异质性处理效应:本文识别和估计的是ATE。能否在连续IV下,利用类似框架识别和估计条件平均处理效应(CATE)或分位数处理效应(QTE)?Theorem S.3 提供了一个方向,但需要更具体的估计方法。扎根点:Section 7 讨论中提到的“extension to time-to-event outcomes is promising”,以及Theorem S.3 对更一般泛函的识别。
  2. 处理无效IV:本文假设IV是有效的(满足排除限制)。在孟德尔随机化中,水平多效性(即IV通过处理以外的路径影响结果)是一个常见问题。如何将本文的框架与处理无效IV的方法(如Guo et al., 2018; Zhang et al., 2024)结合?扎根点:Section 6 真实数据应用的最后一段明确提到“Methods for handling invalid IVs... may be adapted to mitigate this concern.”
  3. 放松条件同方差假设:本文的实用估计量 ˆ∆_tr 的局部有效性依赖于Condition C1(条件同方差)。能否在不依赖C1的情况下,构建一个同样简单且局部有效的估计量?或者,能否开发一个对C1不敏感的稳健估计量?扎根点:Theorem 3 和 Theorem 4 的陈述,以及Remark 5 对C1的讨论。
  4. 与Chernozhukov et al. (2024) 的条件影响函数框架的关联:本文使用了条件Riesz表示,但未使用其“条件影响函数”框架。能否用该框架重新推导本文的EIF,从而简化证明或获得更一般的结论?扎根点:引言中引用了Chernozhukov et al. (2024),但正文未深入使用。这是一个潜在的“未竟之事”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论