Adjusting for Many Covariates in Randomized Clinical Trials with GLMs: Bias Reduction by Jackknife and Practical Guidance¶
作者: Sihui Zhao, Xinbo Wang, Yongyong Ren, Hongyu Zhao, Hui Lu et al.
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2609.13736
一、领域脉络与小综述¶
这个方向是什么¶
本论文所处的子方向是随机临床试验(RCT)中协变量调整的统计推断问题,其根本科学问题是:在随机化保证因果识别的前提下,如何利用基线协变量信息提高处理效应估计的效率,同时保证推断的有效性(即置信区间具有正确的覆盖概率)。该方向的核心张力在于:调整协变量可以降低估计量的渐近方差,但当协变量维数 p 相对于样本量 n 不可忽略时,对高维 nuisance 参数的估计会引入一阶偏差,破坏估计量的 √n-相合性和推断有效性。当前该方向的成熟度处于"低维理论已完备、高维/中维过渡区仍存在开放问题"的阶段——低维情形下(p 固定或 p = o(√n))的渐近理论已由 Lin (2013)、Ye et al. (2023) 等建立;但当 p 与 n 同阶(p ≍ n)时,传统方法(如 gOB、OLS 调整)的偏差不可忽略,而现有解决方案要么限于线性工作模型,要么依赖样本分割,后者损害了 RCT 分析的可复现性。
发展脉络¶
奠基工作(2008–2013):Freedman (2008) 对回归调整提出批评,指出在 Neyman 随机化模型下,OLS 调整可能损害渐近精度且方差估计失效。Lin (2013) 回应了这一批评,证明在完全随机化实验中,包含处理-协变量交互项的 OLS 调整渐近有效且"无害"(asymptotically no less efficient than unadjusted)。这一阶段确立了"随机化本身证明调整的合理性"这一核心思想,但分析限于固定维数 p。
低维到中维的过渡(2016–2023):Wager et al. (2016) 证明,在 p = o(√n) 的稀疏线性模型下,交叉拟合的回归调整可保持有效性。Guo & Basse (2023) 将调整推广到广义线性模型(gOB 估计量),利用 GLM 的预测无偏性构造 AIPW 形式的估计量。Cohen & Fogarty (2024) 进一步引入校准步骤,通过 OLS 投影提升效率。这一阶段的关键进展是认识到"工作模型不必正确",但方法仍受限于 p 的增长速度。
高维/中维的突破(2024–2026):Zhao et al. (2024) 基于高阶影响函数(HOIF)构造 U-统计量型估计量,在 p = o(n) 下实现偏差校正。Lu et al. (2025) 提出去偏回归调整,在完全随机化实验的有限总体框架下处理 p ≍ n。Abadie et al. (2025) 提出 LOORA(leave-one-out 回归调整),利用留一法消除高杠杆点的影响。本论文在此基础上,将偏差校正从线性工作模型推广到 GLM 工作模型,填补了"非线性工作模型 + 高维协变量"的空白。
子线索聚类¶
被引文献大致落在三条子线索上:
-
随机化推断与回归调整的理论基础(Freedman 2008; Lin 2013; Ye et al. 2023):在 Neyman 有限总体框架下建立调整估计量的渐近性质,核心工具是随机化分布与 Hoeffding 投影分解。这一线索确立了"调整不伤害有效性"的基准结果。
-
高维 nuisance 参数的偏差校正(Wager et al. 2016; Zhao et al. 2024; Lu et al. 2025; Abadie et al. 2025):处理 p 与 n 可比时的偏差问题,核心工具包括交叉拟合、U-统计量、留一法、岭回归。这一线索是本文的直接竞争/互补对象。
-
GLM 工作模型下的协变量调整(Guo & Basse 2023; Cohen & Fogarty 2024; Vansteelandt & Van Lancker 2020):将调整从线性推广到非线性工作模型,核心工具是 AIPW 表示与校准步骤。这一线索是本文的直接出发点。
核心问题¶
该方向当前追问的核心问题有三个: 1. 偏差-方差权衡的精确刻画:在 p 与 n 同阶时,如何刻画估计量的偏差阶数?现有结果(如本文 Proposition 1)给出 p = o(n^{2/3}) 下的 √n-相合性,但 p = O(n) 时的精确偏差阶数仍不清楚。 2. 无需样本分割的偏差校正:如何在不牺牲数据效率的前提下实现偏差校正?样本分割虽然理论简洁,但在小样本 RCT 中损害可复现性。 3. 工作模型选择的自适应性:当 GLM 工作模型被错误指定时,如何保证调整估计量的效率不劣于未调整估计量?
⚠️ 作者的 framing¶
作者将缺口 frame 为:"现有 GLM 调整方法(gOB、gOB-cal)在 p 相对 n 较大时产生不可忽略的偏差,而 U-统计量方法(Zhao et al. 2024)虽能处理高维,但限于线性工作模型。本文通过刀切得分方程,将 U-统计量的偏差校正思想推广到 GLM,同时避免样本分割。" 作者淡化的竞争路线包括:(i) 交叉拟合方法(Van Lancker et al. 2026),强调其样本分割的可复现性问题;(ii) 岭回归 LOORA(Abadie et al. 2025),指出其限于线性工作模型。值得注意的是,作者未在 intro 中讨论正则化方法(如 Lasso 调整)或非参数方法(如随机森林调整),这些是潜在的被回避路线。
张力¶
被引文献之间存在一个明显的张力:有限总体 vs. 超总体框架。Lin (2013)、Ye et al. (2023) 在 Neyman 有限总体框架下工作,随机化是唯一推断依据;而 Wager et al. (2016)、Zhao et al. (2024) 采用超总体(采样)框架,需要额外的模型假设。本文采用超总体框架(见 Assumption 1–2),但未讨论两种框架下结论的差异。另一个张力是偏差校正的效率代价:Zhao et al. (2024) 的 U-统计量方法在 p 较小时可能比 gOB-cal 效率更低(见本文 Figure 2 中 p=5 时 JASA 的 SD ratio 略高于 gOB-cal),这与"偏差校正必然付出方差代价"的直觉一致,但作者未给出精确的权衡刻画。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
设定:考虑完全随机化实验(CRE),n 个独立同分布样本,每个样本观测三元组 \(O_i = (X_i, T_i, Y_i)\),其中:
- \(X_i \in \mathbb{R}^p\):基线协变量向量(可高维,p 随 n 增长)
- \(T_i \in \{0, 1\}\):处理分配,\(P(T_i = 1) = \pi_1 \in (0,1)\),且 \(T_i \perp (Y_i(0), Y_i(1)) \mid X_i\)(随机化保证)
- \(Y_i = T_i Y_i(1) + (1-T_i) Y_i(0)\):观测结果,\(Y_i(t)\) 为潜在结果
目标 estimand:平均处理效应(ATE)
工作模型:在每个处理组 t ∈ {0,1} 内,用 GLM 近似条件均值函数:
其中 g(·) 是已知的逆连接函数(如恒等、logit、exp),β_t 是 p 维权数向量。
可观测数据:\(\{(X_i, T_i, Y_i)\}_{i=1}^n\),其中 \(X_i\) 可高维,但假设 p = o(n)(本文主要结果要求 p = o(n^{2/3}))。
关键量: - \(\hat{\beta}_t\):组内 GLM 的 MLE,满足 \(\sum_{i: T_i = t} X_i (Y_i - g(X_i^\top \hat{\beta}_t)) = 0\) - \(\hat{\mu}_t^{(-i)}(X_i) = g(X_i^\top \hat{\beta}_t^{(-i)})\):留一法估计的 OR(不含第 i 个样本) - \(H_{ij}\):帽子矩阵元素,\(H = Z(Z^\top Z)^{-1} Z^\top\),其中 \(Z = (1_n, X)\)
第二步:最小内核¶
核心问题:当 p 与 n 可比时(如 p = 0.1n),基于 GLM 的 AIPW 型估计量
最小内核(一维情形,p = 1):考虑最简单的线性工作模型 \(g(u) = u\),即组内线性回归。此时 \(\hat{\beta}_t = (X^\top X)^{-1} X^\top Y_t\)(组内 OLS),帽子矩阵 \(H = X(X^\top X)^{-1} X^\top\)。AIPW 估计量中的 OR 项为 \(\hat{\mu}_t(X_i) = X_i^\top \hat{\beta}_t = \sum_j H_{ij} Y_j\)。
偏差来源:当 \(i = j\) 时,\(H_{ii} \neq 0\),因此 \(\hat{\mu}_t(X_i)\) 包含 \(Y_i\) 自身,导致 \(\mathbb{E}[\hat{\mu}_t(X_i) \mid X] = \sum_j H_{ij} \mu_t(X_j) \neq \mu_t(X_i)\)。偏差为 \(\sum_j H_{ij} (\mu_t(X_j) - \mu_t(X_i))\),其期望阶数为 \(O(p/n)\)。
JASA 的刀切策略:将 \(\hat{\mu}_t(X_i)\) 替换为 \(\hat{\mu}_t^{(-i)}(X_i) = X_i^\top \hat{\beta}_t^{(-i)}\),其中 \(\hat{\beta}_t^{(-i)}\) 是去掉第 i 个样本后的 OLS 估计。此时 \(\hat{\mu}_t^{(-i)}(X_i)\) 与 \(Y_i\) 独立,偏差消失。关键观察:在 p = 1 时,\(\hat{\mu}_t^{(-i)}(X_i) = X_i^\top (X_{-i}^\top X_{-i})^{-1} X_{-i}^\top Y_{t,-i}\),可以解析地表示为 \(\hat{\mu}_t^{(-i)}(X_i) = \frac{n}{n-1} \hat{\mu}_t(X_i) - \frac{1}{n-1} H_{ii} Y_i\)(见本文 Proposition 4 的证明思路)。
为什么这个例子是"最小内核":它揭示了 JASA 的本质——通过留一法切断估计量与目标样本的依赖,消除自影响偏差。一般 GLM 情形(logistic、Poisson)只是将线性投影替换为非线性迭代加权最小二乘,但刀切的核心思想不变:对每个 i,用不含 i 的数据估计 β_t,再用估计值预测第 i 个样本的 OR。本文的 Proposition 1 证明,在 p = o(n^{2/3}) 下,这种刀切策略使偏差降至 \(o(n^{-1/2})\),同时渐近方差与 gOB 相同。
数学上最难的点:证明刀切估计量 \(\hat{\beta}_t^{(-i)}\) 与 \(\hat{\beta}_t\) 的差异在某种范数下足够小(本文 Lemma 1),以及处理 GLM 非线性带来的技术困难(需要控制 \(\sup_x |g''(x^\top \beta)|\) 等量)。作者承认 p = o(n^{2/3}) 的限制可能不是最优的,但证明需要新的技术。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 RCT 中,当协变量维数 p 与样本量 n 可比时,如何通过 GLM 工作模型进行协变量调整,使得估计量保持 √n-相合且渐近正态,同时避免样本分割。
- 核心工具/方法:提出 JACKknife Score-based Adjustment(JASA),即对每个样本 i,用留一法求解 GLM 的得分方程得到 \(\hat{\beta}_t^{(-i)}\),再构造 AIPW 形式的 ATE 估计量;并给出其校准版本 JASA-cal,通过 OLS 校准进一步提升效率。
- 主要结论:在 p = o(n^{2/3}) 下,JASA 和 JASA-cal 是 √n-相合且渐近正态的,偏差为 \(o(n^{-1/2})\);JASA 包含现有 U-统计量方法(Zhao et al. 2024)作为线性工作模型的特例;模拟和真实数据表明,JASA-cal 能调整比 gOB-cal 更多的协变量而保持偏差可控。
关键设定与假设¶
- 数据生成:超总体框架,\((X_i, T_i, Y_i)\) i.i.d.,\(T_i \sim \text{Bernoulli}(\pi_1)\),\(\pi_1\) 严格有界远离 0 和 1。
- Assumption 1:(i) X 各分量有界;(ii) Y 四阶矩有界;(iii) 组内 Gram 矩阵 \(\Sigma_t = \mathbb{E}[ZZ^\top \mid T=t]\) 的特征值有界(保证可逆性)。
- Assumption 2:(i) 逆连接函数 g(·) 单调、三阶可导,且导数有界;(ii) 真实参数 β_t 有界;(iii) MLE 收敛速率 \(\|\hat{\beta}_t - \beta_t\|_2 = O_P(\sqrt{p \log n / n})\);(iv) 组内 Gram 矩阵的最小特征值有正下界。
- 相比已有工作的变化:相比 Zhao et al. (2024)(线性工作模型),本文允许非线性 GLM;相比 Cohen & Fogarty (2024)(gOB-cal),本文不要求 p = o(√n),而是允许 p = o(n^{2/3});相比 Abadie et al. (2025)(LOORA),本文不限于线性工作模型,且不依赖岭回归的正则化参数选择。
主要结果¶
Proposition 1:在 Assumptions 1–2 下,若 p = o(n^{2/3}),则 JASA 估计量 \(\hat{\tau}_{JASA}\) 满足: - 无偏性:\(\mathbb{E}[\hat{\tau}_{JASA} - \tau] = 0\)(精确无偏,不依赖渐近); - 渐近正态性:\(\sqrt{n}(\hat{\tau}_{JASA} - \tau) \xrightarrow{d} N(0, \sigma^2)\),其中 \(\sigma^2\) 与 gOB 估计量的渐近方差相同; - 方差估计一致性:基于影响函数的方差估计量 \(\hat{\sigma}^2_{JASA}\) 满足 \(\hat{\sigma}^2_{JASA} \xrightarrow{p} \sigma^2\)。
Proposition 2:JASA-cal 同样 √n-相合且渐近正态,其渐近方差不超过 JASA 的渐近方差(校准步骤不增加渐近方差)。
Proposition 3:方差估计量的一致性。
Proposition 4:当 g(·) 为恒等连接(线性工作模型)时,JASA 等价于 Zhao et al. (2024) 的 U-统计量估计量 \(\hat{\tau}_{adj,2}\)。
证明路线: 1. 偏差消除:利用留一法,\(\hat{\beta}_t^{(-i)}\) 与 \(Y_i\) 独立,因此 \(\mathbb{E}[\hat{\mu}_t^{(-i)}(X_i)] = \mathbb{E}[\mu_t(X_i)]\),一阶偏差消失。 2. 渐近等价:证明 \(\sqrt{n}(\hat{\tau}_{JASA} - \hat{\tau}_{gOB}) = o_P(1)\),即 JASA 与 gOB 的渐近方差相同。关键在于控制 \(\hat{\beta}_t^{(-i)} - \hat{\beta}_t\) 的差异(Lemma 1),利用 MLE 的收敛速率和 Gram 矩阵的特征值下界。 3. 技术工具:使用 M/Z-估计理论(van der Vaart & Wellner 2023),特别是处理 nuisance 参数维数发散时的经验过程理论;对于非线性 GLM,需要控制 \(\sup_x |g''(x^\top \beta)|\) 等量,这要求 p = o(n^{2/3})。
技术技巧点名: - 留一法/刀切:核心技巧,切断估计量与目标样本的依赖,消除自影响偏差。 - U-统计量分解:将 JASA 估计量表示为 U-统计量形式,利用 Hoeffding 投影分解得到渐近方差。 - 经验过程理论:处理 p 发散时的均匀收敛性,特别是控制 \(\sup_{\beta} |\frac{1}{n} \sum_i X_i (Y_i - g(X_i^\top \beta))|\) 等量。 - 影响函数:基于影响函数的方差估计,避免显式计算高阶项。
真实例子与应用¶
数据:阿尔茨海默病合作研究(ADCS)的维生素 B 补充剂随机对照试验(NCT00056225),n = 340,处理组 202 人、对照组 138 人。主要结局为 ADAS-cog 评分 18 个月变化率。协变量包括基线 ADAS-cog、年龄、性别、教育程度、同型半胱氨酸、ApoE4 状态等,共 50 个协变量。
应用方式:将结局二值化(ADAS-cog 是否改善)后用 logistic 工作模型,以及计数结局(如不良事件次数)后用 Poisson 工作模型。逐步加入协变量(从 2 个到 50 个),比较 JASA-cal 与 gOB-cal、OLS、未调整估计量的表现。
结果:当协变量数从 2 增加到 50 时,gOB-cal 的估计值漂移明显(偏差增大),而 JASA-cal 的估计值保持稳定;JASA-cal 的标准误比未调整估计量降低约 15-20%。该例子说明 JASA-cal 在"协变量数较多但未到超高维"的 RCT 场景中具有实用价值。
🔎 结论是否比证明窄¶
是,存在明显的不匹配: 1. Proposition 1 的 p 条件:证明要求 p = o(n^{2/3}),但模拟中 p/n 最高达到 0.15(即 p = 60, n = 400),此时 p/n = 0.15 远大于 n^{-1/3} ≈ 0.136,严格来说超出了证明范围。作者在 Remark 5 中承认"我们猜想该条件可以放宽到 p = o(n),但需要新的证明技术"。 2. 校准步骤的理论:Proposition 2 只证明 JASA-cal 的渐近方差不超过 JASA,但未给出 JASA-cal 的渐近方差显式表达式。模拟中 JASA-cal 的 SD ratio 在 p 较小时略高于 1(Figure 2a 中 p=5 时约 1.05),这与"校准不增加方差"的理论不完全一致,作者未解释这一现象。 3. 真实数据中的协变量选择:真实数据中协变量是逐步加入的,但理论框架假设协变量集合固定。作者未讨论协变量选择对推断有效性的影响,这是一个重要的 open problem。 4. 有限样本性质:所有理论结果都是渐近的,但模拟中 n = 400 时 JASA-cal 的覆盖概率在 p = 60 时仍接近 0.95,说明有限样本表现良好,但缺乏理论保证。
四、开放问题¶
-
p 条件的放宽:Proposition 1 要求 p = o(n^{2/3}),但模拟显示 p = O(n) 时 JASA-cal 仍表现良好。能否将理论保证扩展到 p = o(n) 甚至 p ≍ n?作者在 Remark 5 中明确将此列为 open problem,并指出可能需要推广 Lin et al. (2024) 的刀切 M/Z-估计理论到非线性情形。(扎根于 Remark 5:"we conjecture that the restriction on p is not sharp, but it may require the development of new proof strategies")
-
校准步骤的有限样本偏差:模拟中 JASA-cal 在 p 极小时(p = 2, n = 400)出现 SD ratio 略高于 1 的现象(Figure A1),作者归因于校准步骤在低维时的过度拟合,但未给出理论解释。能否刻画校准步骤引入的有限样本偏差?(扎根于 Appendix A 对条件校准的讨论)
-
协变量选择的自适应性:真实数据分析中协变量是逐步加入的,但理论框架假设协变量集合固定。当协变量集合本身是数据驱动选择时,如何保证推断有效性?这与 post-selection inference 文献相关,但 RCT 的随机化结构可能提供额外的便利。(扎根于 Section 6 的逐步加入协变量做法,作者未讨论其理论含义)
-
计算效率:JASA 需要对每个 i 求解一次 GLM,总计算量为 O(n × 单次 GLM 计算量)。当 n 较大时,这一计算负担可能成为瓶颈。能否利用刀切估计量的结构(如影响函数的线性近似)加速计算?(扎根于 Remark 10 对计算时间的讨论)
-
时间-事件结局的扩展:作者在 Remark 11 中提出将框架扩展到 Cox 模型,但未给出具体理论结果。对于生存结局,刀切得分方程的留一法需要处理删失,技术难度更大。(扎根于 Remark 11:"it is possible to extend our framework to time-to-event outcomes")
-
与正则化方法的比较:当 p 接近 n 时,Lasso 或岭回归调整是自然替代方案。JASA 与正则化方法的偏差-方差权衡有何不同?是否存在 JASA 优于正则化方法的明确条件?(本文未与正则化方法进行系统比较,仅在 Appendix E.3 中与岭回归 LOORA 做了有限对比)
给研究者的提示:要确认上述开放问题是否是真 gap,建议去读以下近期文献的 intro:(i) Zhao et al. (2024) 的后续工作(若已发表);(ii) Abadie et al. (2025) 的 LOORA 论文;(iii) 关于 RCT 中高维协变量调整的近期综述(如 Van Lancker et al. 2026)。如果这些文献的 intro 都指向同一个未解决问题(例如 p = o(n) 下的 GLM 调整),那大概率是共识性 gap;如果各文献对同一问题的处理方式互相矛盾,那可能是更值得深挖的机会。
Maintained by 陈星宇 · Homepage · Source on GitHub