跳转至

Doubly Robust Estimators of Quantile Treatment Effects With Semiparametric Cumulative Probability Models

作者: Hao Wu, Chun Li, Bryan E. Shepherd
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.27633


一、领域脉络与小综述

这个方向是什么

本方向关注的是分位数处理效应(QTE)的估计与推断。与传统的平均处理效应(ATE)不同,QTE 刻画的是处理组与对照组潜在结果分布的分位数之差,从而揭示处理对分布尾部(而非仅均值)的影响。这在生物医学研究中尤为重要,因为许多结局(如 HIV 研究中的 CD4 计数和病毒载量)高度偏态,且常受检测下限限制,使得基于均值的分析不稳定甚至不可行。当前子方向的成熟度较高,已有多种估计策略(IPW、OR、AIPW、TMLE),但多数方法对结局分布有较强的参数假设(如正态性),在模型误设下表现脆弱。

发展脉络

  • 奠基工作:Doksum (1974) 和 Lehmann et al. (1975) 最早定义了 QTE 作为处理组与对照组无条件分位数之差。Firpo (2007) 首次提出了 QTE 的有效半参数估计,使用基于倾向得分的 IPW 估计量,但其性能严重依赖倾向得分模型的正确设定。
  • 主要进展:Zhang et al. (2012) 提出了基于结果回归的 QTE 估计量,避免了建模倾向得分,在正确模型下比 IPW 更有效,但要求结局服从正态线性模型(或经 Box-Cox 变换后)。同一工作也提出了 AIPW 估计量,具有双重稳健性,但依然依赖正态性假设。Díaz (2017) 提出了基于 TMLE 的 QTE 估计框架,可使用条件分位数回归作为结果模型,比 AIPW 更灵活,但条件分位数回归只估计特定分位点,而非整个条件分布。
  • 当前 frontier:Liu et al. (2017) 展示了累积概率模型(CPM)——一种基于秩的半参数线性变换模型——可以有效地建模连续结局。CPM 的优势在于:它直接估计一个未知的单调变换函数,而非预设其形式;其估计仅依赖结局的排序,对任何单调变换不变;它建模整个条件分布,而非单一矩或分位数。Tian et al. (2024) 进一步将 CPM 扩展至处理多重检测下限的情形。
  • 本文的位置:本文是首次将 CPM 嵌入双重稳健框架来估计 QTE 的工作。作者声称,现有 AIPW 和 TMLE 方法“heavily relies on the assumption of normality for the outcome distribution”(Zhang et al. 2012)或“estimates specific quantile levels rather than the entire conditional outcome distribution”(Díaz 2017),而 CPM 可以同时解决这两个问题:它不假设正态性,且建模整个条件分布。

子线索聚类

  1. 基于 IPW 的 QTE 估计:Firpo (2007) 为代表,依赖倾向得分正确设定。
  2. 基于结果回归的 QTE 估计:Zhang et al. (2012) 为代表,依赖结局模型正确设定,且通常假设正态性。
  3. 双重稳健的 QTE 估计(AIPW / TMLE):Zhang et al. (2012) 的 AIPW 和 Díaz (2017) 的 TMLE 为代表,具有双重稳健性,但结果模型部分仍依赖参数假设或仅覆盖特定分位点。
  4. 基于 CPM 的分布建模:Liu et al. (2017)、Tian et al. (2024) 为代表,提供了一种灵活的半参数条件分布建模工具,但此前未被用于 QTE 估计。

这个方向在追问的核心问题

  1. 如何在不假设结局分布形式的前提下,稳健地估计 QTE? 现有 AIPW/TMLE 方法的结果模型部分(正态线性模型、条件分位数回归)对偏态或混合型结局不够灵活。
  2. 如何对 QTE 进行双重稳健的方差估计? 近期工作(Shook-Sa et al. 2025)表明,EIF 基方差估计器在任一模型误设时可能不一致,需要更稳健的方差估计方法。
  3. 如何处理受检测下限影响的结局的 QTE 估计? 均值基分析在此类数据上不可行,而 CPM 天然适合处理混合型数据。

⚠️ 作者的 framing

作者将缺口 frame 成:现有 QTE 方法要么依赖正态性假设(Zhang et al. 2012 的 AIPW),要么只估计特定分位点而非整个条件分布(Díaz 2017 的 TMLE 使用条件分位数回归)。作者声称 CPM 可以同时解决这两个问题,因此本文是“显然的下一步”。

  • 被淡化或回避的竞争路线:Díaz (2017) 的 TMLE 框架本身是通用的,理论上可以使用任何条件分布模型(包括 CPM)作为初始估计。作者在文中也提到了“CPM-based TMLE”作为备选,但将其定位为次要方法,主要强调 AIPW-CPM 和直接 EIF 求解两种策略。作者没有深入讨论:如果使用 CPM 作为 TMLE 的初始估计,是否比 AIPW-CPM 有额外的有限样本优势?此外,作者没有与基于非参数核密度估计的 QTE 方法进行比较。
  • 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于高维协变量下 QTE 估计的工作,也没有引用关于工具变量或近端因果推断中 QTE 识别的工作。这些是研究者可以自行去查的方向。

张力

未见明显对立引用。各被引工作之间在“是否依赖正态性假设”上存在差异,但这是渐进式的改进,而非矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • A:处理指示变量,A=1 表示处理组,A=0 表示对照组。
  • Y:可观测的结局变量(连续、有序或混合型)。
  • X:协变量向量。
  • Ya:潜在结局(potential outcome),即若 A=a 时该个体将观测到的结局。Y1Y0 是不可观测的。
  • FYa(y) = Pr(Ya ≤ y):潜在结局 Ya 的边际累积分布函数(CDF)。
  • qa,p = F^{-1}_{Ya}(p):潜在结局 Yap 分位数。
  • Δ(p) = q1,p - q0,p:分位数处理效应(QTE)。
  • π(a|X) = Pr(A=a|X):倾向得分。
  • FY|A=a,X(y) = Pr(Y ≤ y | A=a, X):给定处理和协变量下的条件 CDF。
  • ξ:CPM 模型的参数向量(包括截距函数 α(y) 和回归系数 β)。
  • ψ:倾向得分模型的参数向量。
  • φ_{FYa}(Z)FYa(y) 的有效影响函数(EIF)。
  • φ_{qa,p}(Z)qa,p 的有效影响函数。

  • 模型

  • 数据生成机制:观测数据 Z = (Y, A, X) 来自某个未知分布 P0。我们假设存在潜在结果 Y1, Y0,且满足一致性、无混杂性、正性和无干扰假设。
  • CPM 模型(结果模型)G{F(y|X)} = α(y) - β^T X,其中 G = F^{-1}_ε 是已知的链接函数(如 logit、probit),α(y) 是未知的单调递增截距函数,β 是回归系数。等价于 Y = H(β^T X + ε),其中 H 是未知的单调递增变换,ε ~ F_ε
  • 倾向得分模型π(1|X; ψ) = Pr(A=1|X; ψ),通常用逻辑回归建模。
  • 要估的对象Δ(p) = q1,p - q0,p,即处理组与对照组潜在结果分布的第 p 分位数之差。

  • 可观测数据

  • 我们观测到 n 个独立同分布样本 {Yi, Ai, Xi}_{i=1}^n
  • 可观测:每个个体的处理 Ai、协变量 Xi、以及在该处理下的结局 Yi
  • 不可观测(潜在):每个个体的反事实结局 Y_{1,i}(若 Ai=0)或 Y_{0,i}(若 Ai=1)。我们永远无法同时观测到 Y1Y0
  • 识别关键:在无混杂性假设下,FYa(y) 可以通过 E[Pr(Y ≤ y | A=a, X)]E[I(A=a)I(Y≤y) / Pr(A=a|X)] 识别,从而 qa,pΔ(p) 也可识别。

第二步:讲最小内核

最简特例:假设我们只关心中位数处理效应p=0.5),且只有一个二元协变量 X ∈ {0,1}。我们想估计 Δ(0.5) = q1,0.5 - q0,0.5

在这个特例下,本文的核心思路可以分解为两步:

  1. 估计边际 CDF FYa(y):使用双重稳健的估计量(公式 9):

    F̂^{DR}_{Ya}(y) = (1/n) Σ_i [ I(Ai=a)I(Yi≤y) / π̂(a|Xi) - (I(Ai=a) - π̂(a|Xi)) / π̂(a|Xi) * F̂_{Y|A=a,Xi}(y) ]
    
    其中 π̂(a|Xi) 来自倾向得分模型(如逻辑回归),F̂_{Y|A=a,Xi}(y) 来自 CPM 模型。这个估计量是双重稳健的:只要 π̂F̂_{Y|A,X} 中有一个是正确设定的,F̂^{DR}_{Ya}(y) 就是 FYa(y) 的一致估计。

  2. 从边际 CDF 反演分位数:得到 F̂^{DR}_{Ya}(y) 后,通过加权分位数插值(见补充材料 S2.1)得到 q̂a,0.5,然后 Δ̂(0.5) = q̂1,0.5 - q̂0,0.5

为什么 CPM 在这里是关键? 在第一步中,我们需要估计 F_{Y|A=a,X}(y)。传统方法假设 Y|A,X 服从正态线性模型,这在偏态数据下会引入严重偏差。CPM 通过 G{F(y|X)} = α(y) - β^T X 建模,其中 α(y) 是非参数估计的,因此不需要预设 Y 的分布形式。在这个特例中,即使 Y 高度偏态,CPM 也能灵活地拟合其条件分布。

这个最小内核揭示了论文的核心数学困难:如何在不假设结局分布形式的前提下,构建一个双重稳健的 QTE 估计量?答案是用 CPM 作为条件分布的工作模型,然后将其嵌入标准的 AIPW 框架中。CPM 的非参数截距函数 α(y) 使得模型对结局分布具有鲁棒性,而秩基估计使其对单调变换不变。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在结局分布未知、可能偏态且受检测下限影响时,如何双重稳健地估计分位数处理效应(QTE)和概率处理效应(PTE)。
  2. 核心工具 / 方法:将累积概率模型(CPM)——一种基于秩的半参数线性变换模型——作为条件分布的工作模型,嵌入到基于有效影响函数(EIF)的双重稳健估计框架中,提出了两种 QTE 估计策略:逆 CDF 法(先估计边际 CDF,再反演分位数)和直接法(直接求解分位数的 EIF 估计方程)。
  3. 主要结论:所提估计量具有双重稳健性和渐近正态性;在模拟中,当现有 AIPW/TMLE 方法因正态性假设误设而产生严重偏差时,CPM 基估计量保持无偏,且效率与使用正确变换的 oracle 方法相当;Sandwich 方差估计器和非参数 bootstrap 提供了双重稳健的方差估计,而 EIF 基方差估计器在结果模型误设时失效。

关键设定与假设

  • 因果识别假设(标准,与 Firpo 2007 等一致):
  • 一致性Y = A Y1 + (1-A) Y0
  • 无混杂性{Y0, Y1} ⟂ A | X
  • 正性0 < Pr(A=1|X) < 1
  • 无干扰:个体间处理无交互。
  • CPM 模型假设(结果模型的工作假设):
  • G{F(y|X)} = α(y) - β^T X,其中 G 是已知链接函数(如 logit),α(y) 是未知单调递增函数。
  • 等价于存在未知单调变换 H 使得 H(Y) = β^T X + εε ~ F_εG = F^{-1}_ε
  • 相比已有文献的放宽:不假设 Y 服从正态分布或任何已知参数族;不预设 H 的形式(非参数估计);仅依赖 Y 的排序,对单调变换不变。
  • 倾向得分模型假设π(1|X; ψ) 是参数模型(如逻辑回归),但框架允许更灵活的形式。
  • 正则性条件:用于 CPM 的 NPMLE 一致性和渐近正态性(Li et al. 2023),以及 M-估计的标准正则条件(Stefanski and Boos 2002)。

主要结果

  • 定理 1(隐含)F̂^{DR}_{Ya}(y)(公式 9)是 FYa(y) 的双重稳健估计量:若 π(a|X; ψ)F_{Y|A=a,X}(y; ξ) 正确设定,则 F̂^{DR}_{Ya}(y) → FYa(y)
  • 定理 2(隐含)q̂a,p(来自逆 CDF 法或直接法)是 qa,p√n-一致且渐近正态估计量,方差由 EIF 的方差给出。
  • 定理 3(隐含)Δ̂(p) = q̂1,p - q̂0,pΔ(p)√n-一致且渐近正态估计量。
  • 模拟核心量化结论(以 QTE(0.5)n=1000 为例):
  • 当结果模型正确、倾向得分误设时,AIPW(Zhang et al. 2012)的偏差为 0.525,TMLE 为 0.472,而 AIPW-CPM 的偏差仅为 0.030,与使用正确变换的 oracle 方法(ct-AIPW 偏差 0.026)相当。
  • 当链接函数误设(用 logit 代替 probit)时,CPM 基估计量的偏差和方差几乎不变(AIPW-CPM-mislink 偏差 0.037 vs AIPW-CPM 偏差 0.030)。
  • 方差估计:当结果模型误设、倾向得分正确时,EIF 基方差估计量严重高估方差(SE=0.799 vs 经验 SD=0.597),覆盖率达 99.0%;而 Sandwich-I 和 bootstrap 的 SE 分别为 0.562 和 0.593,覆盖率接近 95%。

证明路线与技术技巧

  • 整体路线
  • 推导 EIF:分别推导 FYa(y)qa,p 的 EIF(公式 8 和 10)。FYa(y) 的 EIF 与 ATE 的 EIF 形式相同(Hahn 1998),qa,p 的 EIF 通过 Delta 方法从 FYa(y) 的 EIF 导出。
  • 构建双重稳健估计量:将 EIF 中的未知 nuisance 函数(πF_{Y|A,X})替换为估计值,求解 EIF 估计方程得到 F̂^{DR}_{Ya}(y)(公式 9)或 q̂a,p(公式 11)。
  • 证明双重稳健性:标准论证——若 π 正确,则 IPW 项一致;若 F_{Y|A,X} 正确,则增广项校正偏差。任一正确时,估计方程在真实参数处期望为零。
  • 渐近正态性:在 M-估计框架下,将 q̂a,p 视为联合估计方程系统(包括倾向得分和 CPM 的得分方程)的解,应用标准 M-估计理论得到 √n-一致性和渐近正态性。
  • 方差估计:提出三种策略——EIF 基(经验方差)、Sandwich(M-估计的 A^{-1} B (A^{-1})^T 公式)、非参数 bootstrap。

  • 关键跳跃点

  • CPM 的 NPMLE 与 QTE 估计的衔接:CPM 的 NPMLE 涉及随样本量增长的参数个数(截距函数 α(y) 在每一个唯一观测值处取值),其渐近理论(Li et al. 2023)比标准参数模型更复杂。作者依赖该理论保证 ξ̂√n-一致性和渐近正态性,但未在本文中重新证明,而是引用 Li et al. (2023)。
  • Sandwich 方差估计中 A11 的计算ϕ1,pq1,p 的导数涉及 I(Y ≤ q1,p) 的导数(Dirac delta),这是不光滑的。作者提出了两种处理方式:(a) Sandwich-S:用光滑函数(logistic)近似指示函数,然后数值求导;(b) Sandwich-I:先对 ϕ1,p 取期望再求导,利用 E[ϕ1,p] = FY1(q1,p) - p 得到 A11 = -fY1(q1,p),避免了不光滑性。Sandwich-I 更稳定,是作者推荐的方法。
  • 密度 fYa(qa,p) 的估计:Sandwich-I 需要估计 fYa(qa,p)。作者使用局部多项式回归对 F̂^{DR}_{Ya}(y) 进行光滑,然后求导,带宽选择采用 Sheather-Jones 方法。

  • 技术技巧点名

  • 有效影响函数(EIF):核心工具,用于构建双重稳健估计量和推导渐近方差。
  • M-估计理论:用于 Sandwich 方差估计,将 QTE 估计量视为联合估计方程系统的解。
  • 非参数最大似然估计(NPMLE):用于估计 CPM 的参数 (α, β)
  • 加权分位数插值:用于从阶梯函数形式的 F̂^{DR}_{Ya}(y) 得到连续的分位数估计(补充材料 S2.1)。
  • Sheather-Jones 带宽选择:用于密度估计中的光滑参数选择。

真实例子与应用

  • 数据:拉丁美洲 HIV 队列(CCASAnet),2014-2019 年启动 ART 的 2,669 名成人。结局为 6 个月 CD4 计数和 HIV RNA 病毒载量。处理为 INSTI 基 vs 非 INSTI 基方案。
  • 方法应用
  • 对 CD4 计数:在 INSTI 和非 INSTI 组内分别拟合 CPM,包含基线 CD4、病毒载量、时间间隔的受限三次样条。倾向得分用逻辑回归,包含年龄和时间间隔的样条。
  • 对病毒载量:77% 的患者低于检测下限(≤40 copies/mL),形成混合分布。CPM 天然处理此类数据。
  • 结果
  • CD4 计数:QTE 在大多数分位点为正,且在 75% 分位点显著(56 cells/µL, 95% CI: 5.1, 97.6),而 ATE 仅为 24.2 cells/µL,表明均值分析低估了上尾效应。PTE 在 600 cells/µL 处显著(-5.5%, 95% CI: -10.9%, -0.1%)。
  • 性别异质性:男性中 INSTI 方案有明确获益(PTE 在 350 cells/µL 处为 -3%),女性中无显著差异(PTE 为 0.6%)。
  • 病毒载量PTE(40) = 0.11(95% CI: 0.04, 0.19),表明 INSTI 方案使病毒抑制率提高 11 个百分点。
  • 这个例子想说明什么:展示 CPM 基方法在真实偏态数据(含检测下限)上的实用性,以及其揭示均值分析无法捕捉的分布尾部效应的能力。

🔎 结论是否比证明窄

  • 结论:作者声称 CPM 基估计量“are doubly robust and asymptotically normal”。这在文中得到了证明(通过 M-估计框架和引用 CPM 的渐近理论)。
  • 窄的地方
  • 双重稳健性仅针对点估计:作者在模拟中明确展示,EIF 基方差估计器在结果模型误设时失效(Table 2),因此方差估计不是双重稳健的。作者在正文中承认了这一点(Section 3.3:“the associated EIF-based variance estimator fails to do so under nuisance model misspecification”)。
  • CPM 的 NPMLE 渐近性依赖有界结局:Li et al. (2023) 的 CPM 渐近理论要求响应变量有界。作者在文中提到了这一条件(Section 2:“Under mild regularity conditions including boundedness of the response variable”),但在真实数据应用中,CD4 计数和病毒载量在理论上无上界。作者未讨论这一假设在实际中是否近似满足。
  • 条件 QTE 仅针对离散 V:Section 3.4 明确要求 V 是离散的且 Pr(V=v) > 0。对于连续效应修饰变量,该方法不直接适用。

四、开放问题

  1. CPM 基双重稳健框架向多值或连续处理的推广:作者在 Discussion 中提及,但未给出具体识别条件或估计方程。扎根于 Section 6:“our study focused on binary treatments, the proposed framework can be naturally generalized to multivalued or continuous exposures through modeling of the generalized propensity score”。

  2. CPM 基双重机器学习(DML)的有限样本性质:作者提到正在开发 CPM 基的机器学习方法(随机森林、Boosting、神经网络),但未给出理论保证。扎根于 Section 6:“Incorporating double machine learning procedures may further improve finite-sample performance and reduce bias due to overfitting”。

  3. EIF 基方差估计器在结果模型误设时失效的理论解释:作者在模拟中观察到这一现象,但承认“the underlying theoretical explanation remains unclear”。扎根于 Section 4.3.3:“the EIF–based variance estimator substantially overestimated the variance... although the underlying theoretical explanation remains unclear”。

  4. CPM 基框架向聚类数据或纵向设定的扩展:作者在 Discussion 中提及,但未给出具体方案。扎根于 Section 6:“extending the CPM-based doubly robust estimation framework to cluster data settings would broaden its applicability”。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论