Assumption-lean covariate adjustment under covariate adaptive randomization when \(p = o (n)\)¶
讲者: Lin Liu
会场: New Advances in Adaptive Randomization
报告题目: Assumption-Lean Covariate Adjustment in Covariate Adaptive Randomization
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
-
这个方向是什么:本子方向解决的根本问题是:在随机对照试验(RCT)中,如何利用基线协变量(baseline covariates)的信息来更精确地估计平均处理效应(ATE),同时保证估计量对结果模型(outcome model)的误设是稳健的(robust)。当协变量维度p相对于样本量n中等偏高(即p=o(n)且p<n)时,传统的基于线性工作模型的OLS调整估计量会产生不可忽略的偏差,从而破坏推断的有效性。本文的核心贡献是在协变量自适应随机化(CAR)和超总体模型(superpopulation model)下,填补了这一理论空白。
-
发展脉络(history):
- 奠基工作:Freedman (2008a,b) 和 Lin (2013) 探讨了在简单随机化下,回归调整估计量的性质,指出了其可能存在的偏差问题。这些工作奠定了后续研究的理论基础。
- 主要进展(CAR下的推断):Bugni et al. (2018, 2019) 提出了在CAR下进行有效推断的模型辅助方法,并证明了分层差异均值估计量(unadjusted estimator)的√n-一致性和渐近正态性。Ma et al. (2022) 和 Ye et al. (2023) 进一步提出了在固定p下,调整额外协变量的层内OLS估计量,并证明了其效率增益。这些工作将CAR下的推断从无调整推进到了有调整。
- 当前frontier(高维p下的调整):当p很大时,Bloniarz et al. (2016) 和 Guo and Basse (2023) 分别引入了稀疏性和低复杂度假设。在简单随机化和有限总体模型下,Lei and Ding (2021), Chang et al. (2024), Lu et al. (2025), Zhao et al. (2024) 等提出了基于U统计量的偏差校正估计量。Zhao et al. (2024) 明确指出,这些估计量本质上都可以被解释为基于高阶影响函数(HOIF)理论的U统计量。在CAR下,Jiang et al. (2025) 是唯一研究高维协变量调整的工作,但他们发现当p≳√n时,标准OLS估计量只有在结果模型是正确线性时才有效。
- 本文的位置:本文填补了CAR和超总体模型下,当p=o(n)且不施加任何结构假设(如稀疏性)时,如何构建√n-一致且保证效率增益的ATE估计量的空白。它直接回应了美国FDA 2023年指南中关于“当协变量数量相对于样本量较大时”缺乏具体指导的声明。
-
子线索聚类:
- 简单随机化下的调整:Freedman (2008a,b), Lin (2013), Lei and Ding (2021), Chang et al. (2024), Lu et al. (2025), Zhao et al. (2024)。这些工作主要在有限总体模型下,研究简单随机化时,如何通过回归或U统计量进行偏差校正。
- CAR下的推断与调整:Bugni et al. (2018, 2019), Ma et al. (2022), Ye et al. (2023), Gu et al. (2023), Liu et al. (2023), Jiang et al. (2025)。这些工作聚焦于CAR设计,研究在固定p或高维p(但需线性假设)下的推断和效率增益。
- 假设宽松(Assumption-lean)的因果推断:Vansteelandt and Dukes (2022) 推广了“假设宽松”这一术语,强调在不依赖结果模型结构假设的情况下进行推断。本文的工作正是这一思想在CAR下的具体应用。
-
这个方向在追问的核心问题:
- √n-一致性:能否在不对结果模型施加结构假设(如线性、稀疏性)的前提下,构建一个√n-一致且渐近正态的ATE估计量?
- 保证的效率增益:这个估计量的渐近方差是否永远不会超过未调整估计量的方差?
- 稳健推断:能否构建一个一致的方差估计量,以进行有效的假设检验和置信区间构建?
- CAR下的特殊性:CAR引入的处理分配依赖性,如何影响上述问题的答案?超总体模型与有限总体模型在理论分析上有何不同?
-
⚠️ 作者的framing:
- 作者的缺口frame:作者将缺口明确地frame为“在CAR和超总体模型下,当p=o(n)时,缺乏一个假设宽松的、√n-一致且保证效率增益的ATE估计量”。他们引用FDA 2023年指南中的具体语句,强调这是一个紧迫的实践需求。
- 被淡化/回避的竞争路线:作者明确区分了他们的工作与有限总体模型下的工作(如Zhao et al., 2024),指出后者不适用于CAR和超总体模型。他们也淡化了Jiang et al. (2025) 的工作,指出其需要线性假设才能处理p≳√n的情况,而本文的“假设宽松”设定是其核心优势。
- 什么明显该被引/该存在、却没出现在intro里?:作者在Remark 5中提到了Zhao et al. (2024) 的工作,并指出其与HOIF理论的联系。但intro中并未深入讨论HOIF理论(Liu et al., 2017)本身,尽管这是其方法论的灵感来源。对于一位熟悉HOIF的研究者来说,这可能是一个值得探究的张力点:本文的U统计量方法是否可以被视为HOIF框架在CAR下的一个特例?作者在Section 3的脚注中提到了这一点,但未在intro中展开。
-
张力:未见明显对立引用。不同工作主要在设定(简单随机化 vs. CAR,有限总体 vs. 超总体,固定p vs. 高维p)和假设(线性 vs. 假设宽松)上有所区别,而非结论矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
n: 样本量。p: 调整的协变量维度。A_i: 处理分配,A_i = 1为处理组,A_i = 0为对照组。B_i: 分层标签,取值于{1, ..., K},K固定。X_i:p维基线协变量向量(未用于分层)。Y_i(0), Y_i(1): 潜在结果(potential outcomes),是不可观测的。Y_i: 观测到的结果,Y_i = A_i Y_i(1) + (1-A_i) Y_i(0)。τ: 平均处理效应(ATE),τ = E[Y(1) - Y(0)],是要估计的因果参数。τ_[k]: 第k层的ATE。p_[k]: 第k层的总体比例。π_[k]: 第k层中处理组的总体比例。n_[k]: 第k层的样本量。n_[k]1, n_[k]0: 第k层中处理组和对照组的样本量。Σ_[k]: 第k层中X的总体Gram矩阵,Σ_[k] = E_{[k]}[X X^T]。bΣ_[k]: 第k层中X的样本Gram矩阵,bΣ_[k] = n_[k]^{-1} Σ_{i∈[k]} X_i X_i^T。η_[k](a): 第k层中X和Y(a)的总体协方差,η_[k](a) = E_{[k]}[X Y(a)]。β_[k](a): 第k层中Y(a)对X的总体线性回归系数,β_[k](a) = Σ_[k]^{-1} η_[k](a)。
-
模型:
- 数据生成机制:数据
W_i = {Y_i(0), Y_i(1), B_i, X_i}是来自超总体W的独立同分布(i.i.d.)样本。处理分配A_i依赖于分层变量B_i,但给定B_i后,A_i与潜在结果和协变量独立(Assumption 1.1)。这是一个超总体模型,意味着我们假设数据是从一个无限总体中随机抽取的,这不同于将n个个体视为固定总体的有限总体模型。 - 已知/未知:处理分配机制(CAR)是已知的,但结果模型
E[Y(a)|X, B]是完全未知的(假设宽松)。Σ_[k]是未知的,需要从数据中估计。 - 要估计的对象:
τ = E[Y(1) - Y(0)]。
- 数据生成机制:数据
-
可观测数据:
- 可观测:研究者能观测到
(Y_i, B_i, X_i, A_i)的样本。 - 不可观测/潜在:每个个体的潜在结果
Y_i(0)和Y_i(1)中,只有一个能被观测到。这是因果推断的核心挑战。此外,总体参数Σ_[k]和η_[k](a)也是不可观测的,需要估计。
- 可观测:研究者能观测到
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有一个层(K=1),且总体Gram矩阵 Σ 已知。在这个特例下,我们来看为什么OLS估计量有偏,以及如何用U统计量校正。
-
最简设定:
K=1,Σ已知。ATEτ = E[Y(1) - Y(0)]。处理分配是CAR的一个特例——简单随机化(但为了与全文一致,我们仍保留π作为处理组比例)。 -
OLS估计量(有偏的):在单层下,OLS估计量
bτ_OLS简化为:bτ_OLS = (¯Y_1 - ¯Y_0) - [ (1/n_1) Σ_{i: A_i=1} (A_i - π) X_i^T bβ(1) - (1/n_0) Σ_{i: A_i=0} (π - A_i) X_i^T bβ(0) ]其中bβ(a) = bΣ^{-1} (1/n_a) Σ_{i: A_i=a} X_i Y_i。 -
偏差来源:将
bβ(1)代入,调整项中的一部分可以写成:(1/n_1^2) Σ_{i,j: A_i=1, A_j=1} (A_i - π) X_i^T Σ^{-1} X_j Y_j(这里用了已知的Σ代替bΣ来简化)。 这是一个V统计量,其双求和包含i=j的对角项:(1/n_1^2) Σ_{i: A_i=1} (A_i - π) X_i^T Σ^{-1} X_i Y_i。 由于X_i^T Σ^{-1} X_i = O_P(p),这个对角项的期望是O(p/n)。当p相对于n不是很小(如p ≳ √n)时,这个偏差的量级会超过n^{-1/2},导致bτ_OLS不是√n-一致的。 -
U统计量校正(无偏的):核心想法是移除对角项。将V统计量替换为二阶U统计量:
U_n,2(Σ^{-1}; 1) = [1/(n_1(n_1-1))] (1/π^2) Σ_{1≤i≠j≤n} (A_i - π) X_i^T Σ^{-1} A_j X_j Y_j。 这个U统计量只对i≠j的项求和,因此完全消除了由i=j项带来的O(p/n)偏差。在这个特例下,bτ_ora = ¯Y_1 - ¯Y_0 - U_n,2(Σ^{-1}; 1) + U_n,2(Σ^{-1}; 0)是精确无偏的(因为Σ已知且处理分配独立)。 -
推广到一般情形:当
Σ未知时,用样本Gram矩阵bΣ代替。这引入了新的依赖关系,使得U统计量的核依赖于整个样本。本文的核心技术贡献之一(Lemma 7)就是通过精巧的leave-two-out分析和Sherman-Morrison公式,证明用bΣ代替Σ带来的额外误差是o_P(n^{-1/2}),从而保证了可行估计量bτ的√n-一致性。
三、这篇论文做了什么¶
-
三句话:
- 研究了什么问题:在协变量自适应随机化(CAR)和超总体模型下,当协变量维度
p = o(n)时,如何构建一个对结果模型误设稳健的、√n-一致且保证效率增益的平均处理效应(ATE)估计量。 - 核心工具/方法:提出了一个基于二阶U统计量的偏差校正估计量
bτ,它通过移除OLS调整估计量中的对角项来消除由高维协变量引起的偏差。 - 主要结论:证明了
bτ是√n-一致且渐近正态的(Theorem 2),其渐近方差不超过未调整估计量(Theorem 2 & Proposition 2),并构建了一个一致的方差估计量bσ^2用于有效推断(Theorem 3)。
- 研究了什么问题:在协变量自适应随机化(CAR)和超总体模型下,当协变量维度
-
关键设定与假设:
- Assumption 1 (CAR机制):
- 给定分层变量
B,处理分配A与潜在结果(Y(0), Y(1))和协变量X独立。这是CAR的核心识别假设。 - 层内处理组比例
π_n[k]依概率收敛到总体比例π_[k]。这保证了CAR设计的渐近性质。
- 给定分层变量
- Assumption 2 (分布假设):
X的每个分量一致有界。这比次高斯假设更强,但简化了技术证明。- 给定
X,Y(a)的四阶矩一致有界。这是证明渐近正态性的标准矩条件。
- Assumption 3 (Gram矩阵特征值):
Σ_[k]的特征值一致有界于(0, ∞)。这保证了Σ_[k]的可逆性和条件数,是进行矩阵运算的基础。 - 相比已有文献:与Jiang et al. (2025) 相比,本文不要求结果模型是线性的(假设宽松)。与Zhao et al. (2024) 相比,本文的设定是CAR和超总体模型,而非简单随机化和有限总体模型。
- Assumption 1 (CAR机制):
-
主要结果:
- Theorem 1 (Oracle估计量
bτ_ora):假设Σ_[k]已知。当p ≲ n时,bτ_ora是√n-一致且渐近正态的。其渐近方差σ^2由三部分组成:ζ^2_H(层间效应方差)、ζ^2_{I,r(π_[k])}(线性调整后的残差方差)和ζ^2_{II}(U统计量带来的额外项)。关键:ζ^2_{II} ≥ 0,且当p = o(n)时,ζ^2_{II} = o(1),因此σ^2与OLS估计量的渐近方差σ^2_{OLS}相等,从而保证了效率增益(Proposition 2)。 - Theorem 2 (可行估计量
bτ):这是本文的核心理论结果。在Assumptions 1-3下,当p = o(n)时,bτ是√n-一致且渐近正态的,其渐近方差与bτ_ora相同(即σ^2)。技术难点:证明bτ与bτ_ora的差异是o_P(n^{-1/2}),这需要处理bΣ_[k]^{-1}与Σ_[k]^{-1}的差异,并控制由此产生的复杂依赖关系。 - Theorem 3 (方差估计量
bσ^2):构建了一个由U统计量组成的方差估计量bσ^2,并证明当p = o(n)时,bσ^2是σ^2的一致估计。因此,基于bτ和bσ^2的Wald置信区间具有正确的渐近覆盖概率。
- Theorem 1 (Oracle估计量
-
证明路线与技术技巧:
- 整体路线:
- Oracle分析:先假设
Σ_[k]已知,分析bτ_ora。利用耦合技术(Bugni et al., 2018, 2019)将CAR下的依赖数据转化为独立同分布数据,然后对U统计量进行Hoeffding分解,分别证明线性部分和退化U统计量部分的渐近正态性(Lemma 1)。 - 可行估计量分析:证明
√n(bτ - bτ_ora) = o_P(1)。这等价于证明用bΣ_[k]^{-1}代替Σ_[k]^{-1}带来的误差是可忽略的。 - 方差估计量一致性:类似地,证明用
bΣ_[k]^{-1}代替Σ_[k]^{-1}后,方差估计量bσ^2与σ^2的差异是o_P(1)。
- Oracle分析:先假设
- 关键跳跃点:证明
√n(bτ - bτ_ora) = o_P(1)是整个证明中最困难的部分。难点在于bΣ_[k]^{-1}依赖于所有样本,导致U统计量的核不再是数据独立的。作者通过Lemma 7解决了这个问题。 - 技术技巧点名:
- 耦合技术 (Coupling):用于处理CAR下的依赖关系,将问题转化为独立同分布情形(Bugni et al., 2018, 2019)。
- Hoeffding分解:用于分析U统计量的渐近性质,将其分解为线性部分和退化部分。
- Sherman-Morrison公式:用于进行leave-m-out分析。通过反复应用该公式,可以将依赖于全样本的
bΣ_[k]^{-1}与特定观测X_i解耦,从而分析其期望和方差(Lemma 7, Lemma 8)。 - 矩阵浓度不等式 (Matrix Bernstein Inequality):用于控制
bΣ_[k] - Σ_[k]的谱范数(Lemma 4)。 - 泰勒展开与多变量二项式定理:用于处理
r_I(i)等复杂项的期望(Lemma 8)。
- 整体路线:
-
真实例子与应用:
- 模拟研究 (Section 6.1):设计了连续结果(Model 1)和二元结果(Model 2)两种数据生成过程。通过改变
p/n比例,系统比较了bτ_unadj,bτ_OLS,bτ_ora,bτ四个估计量的偏差、标准差、标准差与标准误之比以及95%置信区间的覆盖概率。结果验证了理论:bτ_OLS在p较大时偏差显著增大,而bτ始终保持低偏差、高覆盖概率,且效率优于bτ_unadj。 - 半合成数据分析 (Section 6.2):基于一个真实的抗抑郁药物RCT数据(Keller et al., 2000),通过拟合一个加性模型生成半合成数据。结果再次证实了
bτ的低偏差和效率增益,而bτ_OLS则因偏差和低估的标准误导致置信区间严重不足(覆盖概率89.3% vs. 95%)。
- 模拟研究 (Section 6.1):设计了连续结果(Model 1)和二元结果(Model 2)两种数据生成过程。通过改变
-
🔎 结论是否比证明窄:
- 关于
p=o(n)的必要性:Theorem 2 的 (b) 和 (c) 部分明确要求p=o(n)。作者在Remark 4和Remark 6中明确指出,当p ≍ n时,bτ的渐近方差可能超过bτ_unadj,且bσ^2不再一致。因此,论文的核心结论(保证效率增益)严格限制在p=o(n)的渐近框架下。作者在Section 7中将其列为未来工作。 - 关于“假设宽松”:虽然论文声称是“假设宽松”,但Assumption 2.1要求
X一致有界,这比次高斯假设更强。作者在文中也承认“可以进一步放宽”,但未给出证明。因此,结论的普适性在这一点上略窄于“完全无假设”。
- 关于
四、开放问题¶
-
p ≍ n的比例渐近框架:当p/n → γ ∈ (0,1)时,bτ的渐近方差是什么?它是否仍然不超过bτ_unadj?能否构建一个在该框架下仍然一致的方差估计量?扎根点:Section 7, Remark 4, Remark 6, Remark 9。作者明确指出这是未来工作,并提到可能需要随机矩阵理论。 -
非线性工作模型:本文只考虑了线性工作模型。能否将U统计量的偏差校正思想推广到广义线性模型(如Logistic回归)或其他非线性模型?扎根点:Section 7, “Other future directions”。
-
数据驱动的变量选择:当总协变量数大于
n时,如何将数据自适应的变量选择方法(如LASSO)整合到bτ中,同时保持其统计性质?扎根点:Section 7, “Other future directions” 和 Remark 1。 -
放松
X有界假设:能否将Assumption 2.1从“一致有界”放宽到“次高斯”或更一般的轻尾条件?扎根点:Section 4.1, 作者在Assumption 2后明确提到“可以进一步放宽”,但未给出证明。这是一个明确的技术缺口。
Maintained by 陈星宇 · Homepage · Source on GitHub