Shape-Preserving Covariate Adjustment via Empirical Likelihood in Randomized Experiment¶
作者: Zhilan Lou, Jun Shao, Yuhan Qian, Tuo Wang, Yanyao Yi et al.
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2608.19423
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向解决的根本问题是:在随机实验中,如何利用基线协变量信息来提高分布函数(CDF)、生存函数、分位数等泛函的估计效率,同时保证这些估计量本身必须满足其固有的形状约束(如单调性、取值在[0,1]内)。当前成熟度较高,已有大量关于均值或处理效应的协变量调整方法,但针对函数值型(function-valued)估计量的形状保持问题,仍是一个活跃且未完全解决的frontier。
发展脉络(history)¶
奠基工作: - Neyman (1923) / Rubin (1974):奠定了潜在结果框架,为随机实验中的因果推断提供了概念基础。 - Kaplan & Meier (1958):提出了非参数生存函数估计的乘积限(Kaplan-Meier)估计量,是后续所有生存函数调整方法的基准。 - Owen (1988) / Qin & Lawless (1994):建立了经验似然(Empirical Likelihood)框架,为利用辅助信息进行非参数推断提供了工具。
主要进展(协变量调整方法):
- 基于校准或增广(calibration/augmentation)的方法:这类方法将分布函数在某点y的值视为一个均值,然后逐点进行协变量调整。代表工作包括:
- Rao et al. (1990):提出了基于回归的校准估计量b𝐹^A_j(y),但作者指出该估计量“不保证在y上单调”,且“在连续协变量下,每个样本中都是非单调的”。
- Zhang (2015):提出了增广广义估计方程(AGEE)方法用于生存函数估计。作者指出,AGEE曲线“不一定是单调函数”,在模拟中约3%的运行中非单调。
- Wang et al. (2019):证明了ANCOVA在模型误设下的稳健性,但主要针对均值。
- Ye et al. (2023):提出了ANHECOVA方法,为均值估计提供了保证效率增益和通用适用性。
- Bannick et al. (2025):提出了AIPW估计量的通用形式,并给出了在协变量自适应随机化下的理论。
- 基于熵平衡(Entropy Balancing)的方法:
- Zhao & Percival (2017):证明了熵平衡是双重稳健的,并达到了半参数效率界。作者指出,熵平衡权重“对于均值估计,其解的对偶问题与本文渐近等价”,但“尚未扩展到函数值型估计量或协变量自适应随机化”。
当前frontier与本文的位置: - 形状保持问题:上述校准/增广方法在估计分布函数或生存函数时,会破坏单调性。虽然可以通过后处理(如Chernozhukov et al. (2010)的rearrangement算子)恢复,但作者指出“这种修改会改变逐点渐近分布,并需要一套更精细的推断理论”。 - 协变量自适应随机化下的统一推断:Wang et al. (2023)证明了分层置换区组随机化下的Kaplan-Meier估计量比简单随机化更有效,但“没有在估计阶段纳入协变量调整以进一步提高效率”。Ye et al. (2022)为均值估计提供了在最小化法下的渐近理论,但其性质“仍不完全清楚”。 - 本文的位置:本文提出使用经验似然,通过协变量平衡约束构造一个单一的、调整后的经验测度,所有分布泛函估计量都作为该测度的plug-in泛函,自动继承形状约束。这调和了协变量调整与形状保持之间的矛盾,并提供了在简单随机化和所有常见协变量自适应设计下统一的推断框架。
子线索聚类¶
- 均值/处理效应的协变量调整:关注点估计和方差缩减,不涉及函数形状。代表:Wang et al. (2019), Ye et al. (2023), Bannick et al. (2025), Cohen & Fogarty (2023)。
- 分布/生存函数的协变量调整:关注函数值型估计量,但面临形状破坏问题。代表:Rao et al. (1990), Zhang (2015)。
- 形状保持的后处理技术:在估计后强制恢复形状,但改变渐近性质。代表:Chernozhukov et al. (2010)。
- 经验似然与熵平衡:通过权重调整实现协变量平衡,天然具有形状保持潜力。代表:Zhao & Percival (2017),以及本文。
这个方向在追问的核心问题¶
- 如何在不破坏形状约束的前提下,对分布/生存函数进行协变量调整?
- 如何为这些调整后的函数值型估计量建立统一的渐近理论,使其适用于各种随机化方案(包括性质不明的Pocock-Simon最小化法)?
- 能否证明调整后的估计量相对于未调整估计量有保证的效率增益,并给出显式表达式?
- 不同调整方法(校准、增广、经验似然、熵平衡)之间是否存在渐近等价性?
当前主流方法与已知瓶颈:主流方法是逐点校准/增广,瓶颈在于破坏形状约束。后处理虽能恢复形状,但破坏了推断的简洁性。经验似然和熵平衡提供了潜在的解决方案,但此前未被系统地用于函数值型估计量或协变量自适应随机化。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么:作者将缺口frame为“现有模型无关的协变量调整方法(校准/增广)在应用于分布或生存函数时,不尊重
𝐹_𝑗必须是分布函数的全局约束”,导致“估计量可能违反单调性或超出单位区间”。因此,本文提出的经验似然方法成为“显然的下一步”:它通过构造一个单一的、调整后的经验测度,从根本上解决了这个问题。 - 哪些竞争路线被他淡化或回避了:作者淡化了后处理(post-processing) 路线(如Chernozhukov et al. (2010)的rearrangement)。虽然承认它可以恢复单调性,但强调其“改变逐点渐近分布,需要更精细的推断理论”,从而突出了本文方法“从源头保证形状”的优势。作者也回避了直接对生存函数建模的参数/半参数方法,专注于模型无关(model-free)的框架。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:作者没有引用任何关于高维协变量或变量选择在协变量调整中应用的工作。本文的
W被要求是低维的,但现实应用中X可能是高维的,如何从高维X中自动选择或构造低维W是一个自然延伸,但本文未提及。此外,关于经验似然在因果推断中更广泛的应用(如工具变量、中介分析)也未在intro中讨论。
张力¶
未见明显对立引用。所有被引工作基本都承认协变量调整能提高效率,分歧在于如何调整以及如何处理形状约束。本文的工作是在承认校准/增广方法有效性的基础上,解决其形状保持的缺陷。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
𝐽: 处理组数量(𝐽 ≥ 2)。𝑛: 总样本量。𝑖: 个体索引(𝑖 = 1, ..., 𝑛)。𝑗, 𝑘: 处理组索引(𝑗, 𝑘 = 1, ..., 𝐽)。𝑌_𝑖𝑗: 个体𝑖在分配至处理𝑗时的潜在结果(potential outcome)。这是不可观测的,因为每个个体只接受一种处理。𝐴_𝑖: 个体𝑖实际接受的处理分配(𝐴_𝑖 ∈ {1, ..., 𝐽})。𝑌_𝑖: 个体𝑖的观测结果(observed outcome)。由一致性假设:𝑌_𝑖 = 𝑌_{𝑖𝐴_𝑖}。𝑋_𝑖: 个体𝑖的基线协变量向量(baseline covariate vector)。可以是高维的。𝑍_𝑖: 用于随机化分层的离散协变量(discrete covariate for stratification),是𝑋的一个函数或子集,有有限个水平。𝑊_𝑖: 用于估计阶段调整的协变量向量(covariate for adjustment at estimation stage)。是𝑋的函数,要求低维且包含𝑍的所有水平指示变量。𝜋_𝑗: 预设的目标分配比例(pre-specified target assignment proportion),∑_𝑗 𝜋_𝑗 = 1。𝐹_𝑗(𝑦) = 𝑃(𝑌_𝑗 ≤ 𝑦): 处理𝑗下的总体分布函数(population distribution function)。这是目标估计量(estimand)。𝑆_𝑗(𝑡) = 𝑃(𝑌_𝑗 ≥ 𝑡): 处理𝑗下的总体生存函数(population survival function)。另一个目标估计量。𝜇_𝑊 = 𝐸(𝑊): 调整协变量𝑊的总体均值。Σ = Var(𝑊): 调整协变量𝑊的总体协方差矩阵。𝑝_𝑖𝑗: 在给定𝐴_𝑖 = 𝑗的条件下,个体𝑖的概率质量(probability mass)。这是经验似然要优化的对象。b𝑝_𝑖𝑗: 经验似然估计出的最优概率质量。b𝜇_𝑊:𝜇_𝑊的经验似然估计量。b𝜆_𝑗: 拉格朗日乘子(Lagrange multiplier),用于处理组𝑗的协变量平衡约束。e𝐹_𝑗(𝑦): 未调整的经验分布函数(unadjusted empirical distribution function)。b𝐹_𝑗(𝑦): 调整后的最大经验似然估计量(MELE)的分布函数。e𝑆_𝑗(𝑡): 未调整的Kaplan-Meier生存函数估计量。b𝑆_𝑗(𝑡): 调整后的MELE生存函数估计量。C_𝑗(𝑦) = Cov{𝑊, 𝐼(𝑌_𝑗 ≤ 𝑦)}: 协变量𝑊与处理𝑗下结果是否小于等于𝑦的协方差向量。Γ_𝑗(𝑡): 一个与𝑊和生存过程相关的协方差向量(见定理1(ii))。
-
模型:
- 数据生成机制:个体
𝑖的潜在结果(𝑌_𝑖1, ..., 𝑌_𝑖𝐽)和协变量𝑋_𝑖是独立同分布(i.i.d.)的。处理分配𝐴_𝑖由随机化方案决定,该方案可能依赖于𝑍_𝑖(即𝑋的离散化版本),但不依赖于潜在结果。观测结果𝑌_𝑖 = 𝑌_{𝑖𝐴_𝑖}。 - 已知:
𝜋_𝑗是已知的。𝑍的分布是未知的,但其水平是有限的。𝑊的选择由研究者决定,但必须包含𝑍。 - 要估的对象:
𝐹_𝑗(𝑦)、𝑆_𝑗(𝑡),以及它们的泛函(如分位数、均值、RMST差异)。
- 数据生成机制:个体
-
可观测数据:
- 可观测:
(𝐴_𝑖, 𝑌_𝑖, 𝑋_𝑖),其中𝑌_𝑖是观测结果。由此可构造𝑊_𝑖和𝑍_𝑖。对于删失数据,观测到的是min(𝑌_𝑖, 𝐶_𝑖)和事件指示符𝐼(𝑌_𝑖 ≤ 𝐶_𝑖)。 - 不可观测(潜在):
𝑌_𝑖𝑗(对于𝑗 ≠ 𝐴_𝑖)。这是因果推断的核心反事实。
- 可观测:
第二步:讲最小内核¶
本文的最小内核是:在随机实验中,通过经验似然为每个处理组构造一组概率权重,使得加权后的协变量均值等于总体均值,然后用这些权重去加权估计分布函数,从而自动保持单调性并提高效率。
最简特例:考虑一个两处理组(𝐽=2) 的随机实验,采用简单随机化,目标是在无删失情况下估计处理组1的分布函数𝐹_1(𝑦)。假设只有一个一维连续协变量𝑋,我们选择𝑊 = 𝑋(即𝑍为常数,因为简单随机化)。
- 未调整估计量:
e𝐹_1(𝑦) = (1/𝑛_1) ∑_{𝑖:𝐴_𝑖=1} 𝐼(𝑌_𝑖 ≤ 𝑦)。这是单调的,但效率不高。 -
调整后的MELE:
- 构造权重:对于处理组1(
𝐴_𝑖=1),我们求解以下优化问题:max_{𝑝_𝑖} ∑_{𝑖:𝐴_𝑖=1} log(𝑝_𝑖)约束条件:𝑝_𝑖 ≥ 0,∑_{𝑖:𝐴_𝑖=1} 𝑝_𝑖 = 1,∑_{𝑖:𝐴_𝑖=1} 𝑝_𝑖 𝑋_𝑖 = (1/𝑛) ∑_{𝑖=1}^𝑛 𝑋_𝑖。 最后一个约束是协变量平衡约束:要求处理组1的加权协变量均值等于全样本的协变量均值。 - 得到权重:通过拉格朗日乘子法,解为:
b𝑝_𝑖 = 1 / [𝑛_1 + b𝜆 (𝑋_𝑖 - b𝜇_𝑋)],其中b𝜇_𝑋是𝑋的样本均值,b𝜆是拉格朗日乘子。 - 构造调整后的分布函数:
b𝐹_1(𝑦) = ∑_{𝑖:𝐴_𝑖=1} b𝑝_𝑖 𝐼(𝑌_𝑖 ≤ 𝑦)。 由于b𝑝_𝑖 ≥ 0且∑ b𝑝_𝑖 = 1,b𝐹_1(𝑦)自动是一个有效的分布函数(非递减,取值0到1)。
- 构造权重:对于处理组1(
-
为什么能提高效率?:直觉上,如果
𝑋与𝑌相关,那么处理组1中𝑋的样本均值(1/𝑛_1)∑_{𝑖:𝐴_𝑖=1} 𝑋_𝑖可能与总体均值(1/𝑛)∑_{𝑖=1}^𝑛 𝑋_𝑖有随机波动。这种波动会通过𝑋与𝑌的相关性,引入到e𝐹_1(𝑦)的估计误差中。通过强制加权后的𝑋均值等于总体均值,我们消除了这部分由协变量不平衡引起的误差,从而提高了效率。定理1(i)中的方差公式𝑉_𝐹_𝑗(𝑦) = [𝐹_𝑗(𝑦){1-𝐹_𝑗(𝑦)} - (1-𝜋_𝑗)C_𝑗(𝑦)^⊤Σ^{-1}C_𝑗(𝑦)]/𝜋_𝑗明确显示了效率增益(1-𝜋_𝑗)C_𝑗(𝑦)^⊤Σ^{-1}C_𝑗(𝑦)/𝜋_𝑗,它正是𝑋与𝐼(𝑌_𝑗 ≤ 𝑦)的协方差所贡献的部分。
这个特例清晰地展示了核心思路:用一次权重调整解决所有分布泛函的形状保持和效率提升问题。论文的一般情形只是将这个特例推广到多处理组、协变量自适应随机化和删失数据。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在随机实验中,如何对分布函数、生存函数及其泛函(分位数、RMST等)进行协变量调整,同时保证这些估计量自动满足单调性等形状约束。
- 核心工具 / 方法:提出使用经验似然(Empirical Likelihood),通过协变量平衡约束为每个处理组构造一个调整后的经验测度,所有目标估计量都作为该测度的plug-in泛函。
- 主要结论:建立了调整后估计量的渐近正态性,证明了其相对于未调整估计量的保证效率增益,并证明了其渐近分布对随机化方案(简单随机化与所有常见协变量自适应设计)具有不变性。此外,还证明了MELE、增广估计量和熵平衡估计量在函数值型估计量下的渐近等价性。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
- 设定:
- 随机实验,
𝐽 ≥ 2个处理组。 - 潜在结果框架,一致性假设。
- 协变量自适应随机化满足条件(D):这是一个非常温和的条件,要求处理分配在给定
𝑍后与潜在结果和协变量独立,且每个𝑍水平内的处理比例偏差为𝑂_𝑝(𝑛_𝑧^{-1/2})。简单随机化是其特例(𝑍为常数)。 - 对于删失数据,假设(C):删失时间
𝐶与生存时间𝑌在给定处理𝐴下独立,且生存函数连续。
- 随机实验,
- 假设:
𝐸∥𝑊∥^3 < ∞:调整协变量𝑊的三阶矩有限,用于经验似然的线性化。Var(𝑊)有限且非奇异:避免多重共线性。𝑍包含在𝑊中:这是关键假设。作者强调,如果𝑍不被包含在𝑊中,则定理1的渐近不变性不成立,且渐近分布会依赖于具体的随机化方案。这保证了方法的通用适用性。- 与已有文献的对比:相比Wang et al. (2023)(仅考虑分层随机化,无估计阶段调整),本文放宽了对随机化方案的限制(覆盖所有满足(D)的方案),并加入了估计阶段的调整。相比Zhang (2015)(AGEE),本文强化了形状保持的性质,并提供了统一的渐近理论。
主要结果¶
-
定理1(分布与生存函数估计):
- 陈述:对于
b𝐹_𝑗(𝑦)和b𝑆_𝑗(𝑡),√𝑛乘以估计误差依分布收敛到均值为0的正态分布,方差分别为𝑉_𝐹_𝑗(𝑦)和𝑉_𝑆_𝑗(𝑡)。 - 直觉:方差公式由两部分组成:未调整估计量的方差减去一个由协变量
𝑊与结果的相关性决定的非负项。这直接证明了保证效率增益。 - 必要条件:条件(D)和(C),以及
𝑍包含在𝑊中。 - 解决的技术难点:处理协变量自适应随机化引入的依赖结构。作者发展了一套专门的渐近理论,证明在条件(D)下,影响函数的形式与简单随机化下相同,从而实现了不变性。
- 陈述:对于
-
定理2(渐近等价性):
- 陈述:对于任意平方可积函数
𝑔(𝑌_𝑗),MELE、增广估计量和熵平衡估计量具有相同的影响函数,因此是一阶渐近等价的。 - 直觉:三种方法在均值估计上殊途同归,但在函数值型估计量上,只有MELE和熵平衡能保持形状,因为它们的权重不随
𝑦变化。 - 解决的技术难点:证明了熵平衡权重与经验似然权重在
𝑂_𝑝(𝑛^{-1/2})$阶上是等价的,从而将熵平衡纳入统一框架。
- 陈述:对于任意平方可积函数
-
定理3(处理效应估计):
- 陈述:对于分位数差异、秩和均值和RMST差异的MELE,给出了渐近正态分布和显式的方差公式,并证明了保证效率增益。
- 直觉:这些复杂泛函的方差公式可以分解为未调整方差减去一个由协方差项构成的效率增益项。
- 必要条件:对于分位数,需要密度函数
𝑓_𝑙在分位数点处为正。
证明路线与技术技巧¶
-
整体路线:
- 线性化经验似然权重(Lemma 1):证明
b𝜇_𝑊和b𝜆_𝑗可以线性表示为样本均值和{𝐼(𝐴_𝑖=𝑗) - 𝜋_𝑗}(𝑊_𝑖 - 𝜇_𝑊)的线性组合,加上一个𝑜_𝑝(𝑛^{-1/2})$的余项。这是所有后续证明的基石。 - 推导影响函数:将
b𝐹_𝑗(𝑦) - 𝐹_𝑗(𝑦)$分解为e𝐹_𝑗(𝑦) - 𝐹_𝑗(𝑦)$(未调整部分)加上∑(b𝑝_𝑖𝑗 - 1/𝑛_𝑗)𝐼(𝑌_𝑖 ≤ 𝑦)$(调整部分)。利用Lemma 1将调整部分线性化,最终得到影响函数𝜙_𝑖𝑗(𝑦)$。 - 计算渐近方差:在条件(D)下,计算影响函数的方差,得到
𝑉_𝐹_𝑗(𝑦)$。关键步骤是处理𝐼(𝐴_𝑖=𝑗)$与(𝑊_𝑖 - 𝜇_𝑊)$的协方差结构,这依赖于条件(D)的性质。 - 证明渐近正态性:应用Ye et al. (2022)中针对协变量自适应随机化的中心极限定理。
- 生存函数:类似地,利用计数过程理论,将
b𝑆_𝑗(𝑡) - 𝑆_𝑗(𝑡)$线性化为∫项,再结合Lemma 1得到影响函数𝜑_𝑖𝑗(𝑡)$。 - 等价性证明:分别证明MELE、增广估计量和熵平衡估计量都与一个“桥估计量”
e𝜃_𝑗$渐近等价,从而证明三者等价。
- 线性化经验似然权重(Lemma 1):证明
-
关键跳跃点:
- Lemma 1的证明:这是最吃功夫的部分。难点在于
b𝜇_𝑊$和b𝜆_𝑗$是联合通过一个profile经验似然估计的,且处理分配是依赖的。证明需要先建立b𝜆_𝑗$和b𝜇_𝑊$的𝑂_𝑝(𝑛^{-1/2})$收敛速率,然后通过泰勒展开和精细的余项控制,得到线性表示。 - 处理协变量自适应随机化的依赖:在计算方差时,不能直接使用i.i.d.的方差公式。作者利用条件(D)的性质,证明
{𝐼(𝐴_𝑖=𝑗) - 𝜋_𝑗}(𝑊_𝑖 - 𝜇_𝑊)$的渐近方差与简单随机化下相同,从而实现了不变性。
- Lemma 1的证明:这是最吃功夫的部分。难点在于
-
技术技巧点名:
- 经验似然(Empirical Likelihood):核心工具,用于构造满足协变量平衡约束的概率权重。
- 影响函数(Influence Function):用于线性化估计量,推导渐近分布和方差。
- 计数过程与鞅理论(Counting Process & Martingale Theory):用于处理删失数据下的生存函数估计。
- 泰勒展开与余项控制:用于线性化经验似然权重和熵平衡权重。
- 针对协变量自适应随机化的中心极限定理:来自Ye et al. (2022),是证明渐近正态性的关键。
真实例子与应用¶
- 数据:SURPASS-4试验数据,一个比较tirzepatide与insulin glargine的随机开放标签3期试验。分析聚焦于有肾损伤的患者(
n=330),主要终点是心肾复合终点(首次事件时间)。 - 方法应用:将本文提出的MELE方法应用于估计两个处理组的生存曲线
𝑆_𝑗(𝑡)$和限制平均生存时间(RMST)差异Δ_{21}$。调整的协变量𝑊$包括年龄、eGFR、HbA1c组、log(UACR)、地区和SGLT2i使用。 - 结果:
- 生存曲线:MELE估计的生存曲线与Kaplan-Meier曲线非常接近,但标准误(SE)更小。SE²的缩减范围在对照组为0.8%到3.5%,在治疗组为0.7%到4.2%,表明了一致的效率提升。
- RMST差异:MELE估计的RMST差异为5.35周(SE=2.56),而Kaplan-Meier估计为5.84周(SE=2.64)。MELE的SE²缩减了5.7%,置信区间更窄。
- 这个例子想说明什么:验证了理论上的效率增益在实际数据中是可实现的,并且MELE方法能直接应用于复杂的临床试验数据,产生形状保持且更精确的估计。
🔎 结论是否比证明窄¶
- 结论与证明基本匹配。论文的主要结论(渐近正态性、保证效率增益、不变性、等价性)都有严格的证明支撑。
- 一个潜在的不匹配点:论文在引言和定理陈述中强调“所有常见协变量自适应设计”,但证明依赖于条件(D)。作者声称Pocock-Simon最小化法满足条件(D),并引用了Baldi Antognini & Zagoraiou (2015)的证明。然而,Pocock-Simon最小化法的渐近性质非常复杂,其是否在所有情况下都严格满足条件(D)可能仍有讨论空间。论文的证明是建立在条件(D)成立的基础上的,因此其结论的适用范围严格受限于条件(D)的成立范围。这是一个值得研究者去核实的点。
四、开放问题¶
- 高维协变量
W的选择:本文要求W是低维的。当基线协变量X是高维时,如何自动选择或构造一个低维的W$(例如通过Lasso或主成分分析),同时保证经验似然权重存在且渐近理论成立?这扎根于论文中“Whave low dimension”的设定。 - 扩展到观察性研究:本文的方法严格依赖于随机化(条件(D)保证了处理分配与潜在结果独立)。如何将这种形状保持的协变量调整方法扩展到观察性研究,其中需要处理倾向性得分或工具变量?这扎根于论文的标题和引言中“randomized experiments”的限定。
- 非随机缺失(MNAR)下的生存函数估计:本文对删失数据的处理依赖于条件(C)(独立删失)。在更复杂的非随机缺失机制下,如何保持形状约束并进行协变量调整?这扎根于论文对条件(C)的依赖。
- 计算效率与大规模数据:经验似然的求解涉及凸优化,当样本量
n极大或W$维度稍高时,计算可能成为瓶颈。是否存在更高效的算法(如随机梯度下降)来近似求解经验似然权重,同时保持渐近性质?这扎根于论文中经验似然求解的数值方面。
Maintained by 陈星宇 · Homepage · Source on GitHub