Optimal Nuisance Function Tuning for Estimating a Doubly Robust Functional under Proportional Asymptotics¶
讲者: Zixiao Wang (Harvard University)
会场: Some Recent Topics in Causal Inference
报告题目: Optimal Nuisance Function Tuning for Estimating a Doubly Robust Functional under Proportional Asymptotics
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是:在“不一致 regime”(nuisance 函数无法一致估计)下,如何估计一个双稳健泛函(doubly robust functional)并实现 √n 推断。具体而言,当协变量维数 p 与样本量 n 成比例增长(p/n → c ∈ (0,∞))时,任何正则化估计量(如 ridge、Lasso)都无法以 n^{−1/2} 速率一致估计线性回归系数(nuisance 参数)。此时,经典的 Double Machine Learning (DML) 框架(要求 nuisance 估计速率快于 n^{−1/4})不再适用。因此,需要发展新的偏差校正策略,并理解样本分割、估计量形式、调优参数选择之间的交互作用,以最小化目标泛函的渐近方差。该方向当前处于理论探索阶段,主要针对线性模型和特定泛函(如期望条件协方差 ECC)进行精确渐近分析,尚未建立一般性的效率界。
发展脉络(history)¶
-
奠基工作:DML 框架(Chernozhukov et al., 2018, Econometrics Journal)提出了双/去偏机器学习方法,允许使用灵活的非参数/机器学习估计 nuisance 函数,只要它们以足够快的速率收敛(如 n^{−1/4}),就能实现 √n 一致且渐近有效的推断。DML 的核心是样本分割(cross-fitting)和影响函数校正。留下的口子:当 nuisance 函数无法以足够快速率估计时(如高维比例渐近),DML 理论失效。
-
不一致 regime 的提出:Celentano & Wainwright (2023, arXiv:2309.01362) 首次系统研究了“不一致 regime”下的缺失数据模型,提出了新的去偏方法。他们指出,在 p/n → c 时,即使使用正则化估计,nuisance 函数的估计误差也不会消失,因此需要针对性地设计去偏策略。留下的口子:该工作主要针对缺失数据模型,且未深入分析调优参数对目标泛函推断的影响。
-
调优与样本分割的交互:McGrath & Mukherjee (2022, arXiv:2212.14857) 在非参数 Hölder 模型下研究了 nuisance 函数调优和样本分割对双稳健估计量的影响,发现即使使用简单的 plug-in 估计,通过精心调优(如 undersmoothing)也能达到 minimax 最优。留下的口子:该工作假设 nuisance 函数可一致估计(非参数光滑性),不适用于比例渐近的不一致 regime。
-
ECC 泛函的估计:Balakrishnan, Kennedy & Wasserman (2023, arXiv:2305.04116) 研究了结构无关泛函估计的基本极限,其中 ECC 是一个重要特例。Liu, Mukherjee & Robins (2020, Statistical Science) 提出了近乎无假设的覆盖检验,也涉及 ECC。留下的口子:这些工作未在比例渐近下进行精确分析。
-
交叉拟合在比例渐近下的问题:Jiang, Mukherjee, Sen & Sur (2025, Annals of Statistics) 发现,在比例渐近下,交叉拟合的折间估计量并非渐近独立,导致方差膨胀,且当 c>1 时最小可达方差仍是开放问题。留下的口子:该工作主要关注增强 IPW 估计量,未涉及 ECC 或调优参数选择。
-
本文的位置:本文是第一个在比例渐近下系统分析 ECC 估计量的工作,同时考虑三种估计量(积分型、Newey-Robins、双稳健)和两种样本分割策略(两分割、三分割),推导了偏差校正后的 √n 一致性和渐近方差表达式,并揭示了预测最优调优参数与推断最优调优参数之间的差异。
子线索聚类¶
-
双稳健泛函的估计理论:包括 DML 框架(Chernozhukov et al., 2018)、高阶影响函数(Robins et al., 2008)、以及 ECC 的特定估计(Liu et al., 2020; Balakrishnan et al., 2023)。这些工作通常假设 nuisance 函数可一致估计,或至少以足够快速率收敛。
-
不一致 regime 下的去偏方法:Celentano & Wainwright (2023) 针对缺失数据模型;Bellec & Zhang (2023, Annals of Statistics) 针对凸正则化估计量的去偏和区间估计。这些工作使用随机矩阵理论推导偏差校正,但未聚焦于双稳健泛函的调优。
-
调优参数选择与样本分割:McGrath & Mukherjee (2022)、McClean et al. (2024, arXiv:2403.15175) 等研究在非参数设定下如何通过 undersmoothing 或交叉拟合优化推断。本文将其扩展到比例渐近的不一致 regime。
这个方向在追问的核心问题¶
- Q1:在 nuisance 函数无法一致估计时,如何构造 √n 一致的双稳健泛函估计量?
- Q2:样本分割策略(两分割 vs 三分割)如何影响渐近方差?是否存在最优分割?
- Q3:调优参数(如 ridge 的 λ)应如何选择以最小化目标泛函的渐近方差?是否与预测最优不同?
- Q4:在比例渐近下,是否存在半参数效率界?当前已知的估计量能否达到?
当前主流方法与瓶颈:主流方法是使用正则化估计(ridge/Lasso)估计 nuisance 函数,然后通过影响函数或偏差校正构造目标泛函估计量。瓶颈在于:偏差校正依赖于随机矩阵理论中的确定性等价,通常需要假设高斯协变量或特定分布;渐近方差表达式复杂,依赖于未知参数(如 ∥α∥², ∥β∥², αᵀβ),实际使用需要估计这些量;效率界未知,无法判断估计量是否最优。
⚠️ 作者的 framing¶
作者将缺口 frame 为:“在 DML 框架中,通常使用预测最优的 nuisance 函数估计进行下游推断;但在不一致 regime 下,预测最优不一定导致推断最优,因此需要直接最小化目标泛函的渐近方差。” 作者通过 ECC 这个具体例子展示了这一现象,并声称这是“first step towards a comprehensive understanding”。
被淡化或回避的竞争路线: - 方法矩估计:作者在结论中提到 Chen, Liu & Mukherjee (2024, arXiv:2408.06103) 的方法矩方法可以完全绕过 nuisance 函数估计,但未在正文中比较。这暗示可能存在更简单的替代方案。 - Lasso 等其他正则化:作者只考虑 ridge,声称其他正则化留给未来工作。但 Lasso 在稀疏设定下可能提供不同的偏差结构。 - 非高斯协变量:方差计算假设高斯性,作者承认需要 universality 原理来推广。
什么明显该被引/该存在、却没出现在 intro 里?:论文未引用关于“统计-计算权衡”的文献,尽管调优参数选择本质上是一个计算问题(选择 λ 以最小化方差)。此外,关于“低度多项式障碍”或“信息-计算差距”的文献也未出现,这可能是因为本文不涉及计算复杂度下界。但考虑到用户对统计-计算权衡的兴趣,这是一个值得注意的缺失。
张力¶
未见明显对立引用。所有被引工作基本一致认为:在比例渐近下,需要特殊的偏差校正,且调优参数选择至关重要。本文的结论(预测最优 ≠ 推断最优)与 DML 的传统智慧形成对比,但作者将其归因于不一致 regime 的特殊性,而非矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据¶
符号: - \( (A, Y, X) \):随机变量,其中 \( A \in \mathbb{R} \)(处理/暴露),\( Y \in \mathbb{R} \)(结果),\( X \in \mathbb{R}^p \)(协变量)。 - \( \theta_0 = \mathbb{E}[\text{cov}(Y, A \mid X)] = \mathbb{E}[AY] - \mathbb{E}[\mathbb{E}[Y \mid X] \mathbb{E}[A \mid X]] \):目标参数(期望条件协方差,ECC)。 - \( \alpha_0, \beta_0 \in \mathbb{R}^p \):线性回归系数,满足 \( \mathbb{E}[A \mid X] = X^\top \alpha_0 \),\( \mathbb{E}[Y \mid X] = X^\top \beta_0 \)。 - \( \epsilon, \mu \):误差项,服从均值为 0、方差为 1、相关系数为 \( \rho \) 的二元正态分布,且与 \( X \) 独立。 - \( n \):用于构造最终估计量的样本量(在三分割中总样本为 3n,两分割中为 2n)。 - \( p \):协变量维数,满足 \( p/n \to c \in (0, \infty) \)。 - \( \lambda_1, \lambda_2 > 0 \):ridge 回归的调优参数。 - \( \hat{\alpha}(\lambda_1), \hat{\beta}(\lambda_2) \):ridge 估计量,定义见式 (2.2)。 - \( \hat{\Sigma} = X^\top X / n \):样本协方差矩阵。 - \( g^{\text{INT}}_{3\text{sp}}, g^{\text{INT}}_{1,2\text{sp}}, g^{\text{INT}}_{2,2\text{sp}}, g^{\text{NR}}_{3\text{sp}}, g^{\text{DR}}_{3\text{sp}}, g^{\text{DR}}_{2,2\text{sp}} \):由 Marchenko-Pastur 分布定义的确定性函数,用于偏差校正。 - \( u = \lim_{n \to \infty} \|\alpha_0\|^2, v = \lim_{n \to \infty} \|\beta_0\|^2, \varrho = \lim_{n \to \infty} \alpha_0^\top \beta_0 \):极限参数。 - \( F_{\text{MP}} \):Marchenko-Pastur 分布(参数 c)。
模型: - 数据生成过程:\( A = X^\top \alpha_0 + \epsilon, \quad Y = X^\top \beta_0 + \mu \),其中 \( (\epsilon, \mu) \sim N(0, \begin{pmatrix} 1 & \rho \\ \rho & 1 \end{pmatrix}) \) 且与 \( X \) 独立。 - \( X \) 的坐标 i.i.d. 次高斯,均值为 0,方差为 1,次高斯范数一致有界。在方差计算中进一步假设 \( X_{ij} \sim N(0,1) \)。 - 参数 \( \alpha_0, \beta_0 \) 的欧几里得范数一致有界(关于 p)。
可观测数据:研究者观测到 \( n \) 个 i.i.d. 三元组 \( \{(X_i, A_i, Y_i)\}_{i=1}^n \)。潜在量:\( \epsilon_i, \mu_i \) 不可观测;\( \alpha_0, \beta_0, \rho \) 是未知参数。目标 \( \theta_0 \) 是 \( \rho \)(因为 \( \theta_0 = \rho \) 在给定模型下?实际上 \( \theta_0 = \mathbb{E}[AY] - \alpha_0^\top \beta_0 = \rho + \alpha_0^\top \beta_0 - \alpha_0^\top \beta_0 = \rho \),因为 \( \mathbb{E}[AY] = \alpha_0^\top \beta_0 + \rho \))。所以 ECC 等于误差相关系数 \( \rho \)。但作者在模拟中设 \( \rho = 0.5 \),所以目标就是估计 \( \rho \)。
第二步:最小内核¶
最简特例:考虑三分割策略(\( \alpha_0, \beta_0 \) 从两个独立子样本估计),且只关注积分型估计量 \( \hat{\theta}_{\text{INT}} \)。此时,核心困难是估计 \( \alpha_0^\top \beta_0 \)。在比例渐近下,ridge 估计 \( \hat{\alpha}(\lambda_1)^\top \hat{\beta}(\lambda_2) \) 不是 \( \alpha_0^\top \beta_0 \) 的一致估计,而是收敛到 \( \alpha_0^\top \beta_0 \cdot g^{\text{INT}}_{3\text{sp}}(\lambda_1, \lambda_2) \),其中
核心数学困难:证明 \( \hat{\alpha}(\lambda_1)^\top \hat{\beta}(\lambda_2) \) 的偏差确实由 \( g^{\text{INT}}_{3\text{sp}} \) 刻画,且剩余项为 \( O_p(n^{-1/2}) \)。这需要随机矩阵理论中的确定性等价(Theorem 1.1 of Hachem et al., 2013),该定理给出了形如 \( u^\top (\hat{\Sigma} + \lambda I)^{-1} v \) 的二次型与 \( u^\top v \cdot m_{\text{MP}}(-\lambda) \) 之间的误差界。在两分割情形下,由于 \( \hat{\alpha} \) 和 \( \hat{\beta} \) 来自同一子样本,误差项还涉及 \( \epsilon \) 和 \( \mu \) 的相关性,导致额外的偏差项 \( \theta_0 g^{\text{INT}}_{2,2\text{sp}} \),需要更复杂的双重逆校正。
最小内核总结:本文的核心思想是:在比例渐近下,ridge 估计的偏差是确定性的(由 MP 分布刻画),因此可以通过“逆偏差”来校正,从而得到 √n 一致的泛函估计。然后,通过精确计算渐近方差,发现调优参数 \( \lambda \) 的选择会影响方差,且预测最优(最小化 nuisance 的 MSE)与推断最优(最小化目标泛函的方差)不同。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在比例渐近(p/n → c)下,使用 ridge 回归估计 nuisance 函数时,如何选择调优参数 \( \lambda_1, \lambda_2 \) 和样本分割策略(两分割 vs 三分割),以最小化期望条件协方差(ECC)估计量的渐近方差。
- 核心工具/方法:利用随机矩阵理论(Marchenko-Pastur 分布、确定性等价、线性谱统计量的 CLT)推导 ridge 估计的渐近偏差,构造逆偏差校正的 √n 一致估计量;然后在高斯协变量假设下,通过特征向量均匀分布和谱分解技巧,精确计算六种估计量的渐近方差。
- 主要结论:所有偏差校正后的估计量(积分型、Newey-Robins、双稳健)在两种分割策略下均达到 √n 一致;渐近方差表达式显示,预测最优的调优参数(\( \lambda = c / \|\alpha_0\|^2 \) 等)并不最小化 ECC 的方差,因此应直接优化目标泛函的方差;模拟验证了理论结果。
关键设定与假设¶
- 数据生成:\( (Y, A) \) 给定 \( X \) 服从二元正态,均值线性,方差 1,相关系数 \( \rho = \theta_0 \)。误差与 \( X \) 独立。
- 协变量:\( X \) 的坐标 i.i.d. 次高斯,均值为 0,方差 1。在方差计算(Theorem 3.4)中进一步假设 \( X_{ij} \sim N(0,1) \)。
- 参数有界:\( \|\alpha_0\|^2, \|\beta_0\|^2 \) 一致有界(关于 p),且极限 \( u, v, \varrho \) 存在。
- 比例渐近:\( p/n \to c \in (0, \infty) \)。
- 调优参数:\( \lambda_1, \lambda_2 > 0 \) 固定(不随 n 变化)。
- 样本分割:两分割:用一半样本估计两个 nuisance,另一半估计 ECC;三分割:用两个独立子样本分别估计 \( \alpha_0, \beta_0 \),第三个子样本估计 ECC。
与已有文献的对比:相比 DML(要求 nuisance 估计速率快于 n^{−1/4}),本文不假设任何一致性;相比 Celentano & Wainwright (2023) 的缺失数据模型,本文聚焦于 ECC 并考虑多种估计量和分割策略;相比 McGrath & Mukherjee (2022) 的非参数设定,本文在比例渐近下进行精确分析。
主要结果¶
Theorem 3.1-3.3:偏差校正后的积分型、Newey-Robins、双稳健估计量(两分割和三分割版本)均为 √n 一致,即 \( \sqrt{n}(\hat{\theta}^{\text{db}} - \theta_0) = O_p(1) \)。证明依赖于随机矩阵理论中的确定性等价(Hachem et al., 2013)和正态误差的矩计算。
Theorem 3.4:在高斯协变量假设下,六种偏差校正估计量的渐近方差存在,并给出表达式(以 \( u, v, \varrho, c, \lambda_1, \lambda_2 \) 和 MP 分布积分表示)。例如,三分割积分型估计量的渐近方差为:
预测最优 vs 推断最优:Lemma F.2 证明,预测最优的 \( \lambda \) 为 \( \lambda^*_1 = c / u^2, \lambda^*_2 = c / v^2 \)。但 Theorem 3.4 的方差表达式显示,最小化 \( V^{\text{INT}}_{2\text{sp}} \) 等的 \( \lambda \) 一般不等于此值。模拟(Figure 1)直观展示了这一差异:例如,在三分割下,积分型估计量的方差在 \( \lambda \approx 0.5 \) 附近最小,而预测最优 \( \lambda = c / u^2 = 2 / 1 = 2 \)(当 \( c=2, u=1 \)),两者明显不同。
证明路线与技术技巧¶
整体路线(以三分割积分型为例): 1. 偏差分解:将 \( \hat{\theta}^{\text{INT,db}}_{3\text{sp}} - \theta_0 \) 分解为三部分:\( \frac{1}{n}\sum A_iY_i - \mathbb{E}[AY] \)(CLT 给出 \( O_p(n^{-1/2}) \))、偏差校正项 \( B_n / g^{\text{INT}}_{3\text{sp}} - \alpha_0^\top \beta_0 \)(需证明 \( O_p(n^{-1/2}) \))、以及剩余交叉项(如 \( T_3, T_9 \) 等,也需证明 \( O_p(n^{-1/2}) \))。 2. 偏差校正项:利用 Hachem et al. (2013) 的 Theorem 1.1,证明 \( B_n = \alpha_0^\top \beta_0 g^{\text{INT}}_{3\text{sp}} + O_p(n^{-1/2}) \)。该定理给出了形如 \( u^\top (\hat{\Sigma} + \lambda I)^{-1} v \) 的二次型与 \( u^\top v \cdot m_{\text{MP}}(-\lambda) \) 之间的误差界,其中 \( m_{\text{MP}} \) 是 MP 分布的 Stieltjes 变换。 3. 剩余项:\( T_3, T_9 \) 等涉及 \( \epsilon, \mu \) 与 \( X \) 的乘积。利用正态性,条件分布为高斯,方差有界(通过谱范数界),从而证明 \( O_p(n^{-1/2}) \)。
两分割情形:更复杂,因为 \( \hat{\alpha} \) 和 \( \hat{\beta} \) 来自同一子样本,导致偏差项包含 \( \theta_0 g^{\text{INT}}_{2,2\text{sp}} \)。证明需要处理 \( \lambda_1 \neq \lambda_2 \) 和 \( \lambda_1 = \lambda_2 \) 两种情况,使用恒等式 \( R(\lambda_1)R(\lambda_2) = (R(\lambda_1) - R(\lambda_2))/(\lambda_2 - \lambda_1) \) 来分解。
渐近方差计算(Theorem 3.4): - 利用高斯协变量的旋转不变性:特征向量服从 Haar 分布,与特征值独立。 - 计算 \( \text{var}(\hat{\alpha}^\top \hat{\beta}) \) 时,先条件于特征值,利用特征向量均匀分布的性质计算期望和方差(Lemma E.1-E.3)。 - 关键引理:对于 \( u_n, w_n \) 有界,\( \sum_j (u_n^\top \hat{v}_j)(w_n^\top \hat{v}_j) f(\hat{\lambda}_j) \) 的方差渐近为 \( (u^2 v^2 + \varrho^2) \text{var}_{X \sim F_{\text{MP}}}(f(X)) / c \)。 - 两分割情形还需计算条件方差(给定 \( X \))和条件期望的方差,分别对应 Proposition D.1 和 D.2。
技术技巧点名: - 确定性等价(Hachem et al., 2013):用于证明偏差校正项的主项。 - Haar 分布与特征向量均匀性:用于计算二次型的期望和方差。 - 线性谱统计量的 CLT(Bai & Silverstein, 2008):用于证明某些项(如 \( \int x/(x+\lambda) d\hat{\pi}_n \))的方差为 \( O(n^{-2}) \)。 - 谱范数界:\( \|\hat{\Sigma}\|_{\text{op}} \leq 2(1+\sqrt{c})^2 \) w.h.p.,用于控制剩余项。 - 正态矩计算:利用 \( \epsilon, \mu \) 的联合正态性计算条件方差。
真实例子与应用¶
本文为纯理论论文,但包含广泛的模拟实验(Section 4 和 Appendix H)。模拟设置: - 数据:\( X \sim N(0, I_p) \),\( A, Y \) 按线性模型生成,\( \rho = 0.5 \),\( \|\alpha_0\| = \|\beta_0\| = 1 \)。 - 场景:两分割(总样本 1000,子样本 500)和三分割(总样本 1500,子样本 500),\( c = 0.5 \) 和 \( c = 2 \)。 - 方法:对 100 个 \( \lambda \) 值(0.05 到 10),计算三种估计量的偏差和方差(10,000 次 Monte Carlo)。 - 结果:偏差校正后估计量几乎无偏;方差曲线显示预测最优 \( \lambda \)(\( c = 0.5 \) 或 2)与方差最小点不同;两分割下积分型估计量在 \( \lambda \approx 1.48 \) 处方差爆炸(因偏差校正常数分母接近 0)。 - 此外,Appendix H.4 验证了参数 bootstrap 方差估计的准确性。
这个例子想说明:理论推导的渐近方差公式与模拟吻合,且预测最优 ≠ 推断最优的结论在有限样本下成立。
🔎 结论是否比证明窄¶
- 高斯假设:Theorem 3.4 的方差表达式严格依赖于 \( X_{ij} \sim N(0,1) \)。作者在结论中承认“an assumption that remains to be explored through the lens of universality principles”,但并未证明对次高斯分布也成立。因此,方差公式的适用范围比证明窄。
- 线性模型:所有结果假设 nuisance 函数是线性的。作者在 intro 中称“Under linear models for the nuisance functions”,但未讨论非线性情况。结论中声称“a first step towards a comprehensive understanding”,暗示线性是起点。
- ridge 回归:只考虑 ridge。作者说“leave the investigation of other estimators to future work”,因此结论不适用于 Lasso 或其他正则化。
- ECC 泛函:只针对 ECC。作者认为 ECC 是“a foundational stepping stone”,但未证明结果可推广到其他双稳健泛函(如 ATE)。结论中“the template of exploration presented here might serve as a framework”是推测,而非证明。
四、开放问题¶
-
非高斯协变量的 universality:Theorem 3.4 的方差公式假设 \( X_{ij} \sim N(0,1) \)。作者在结论中提及“universality principles”,但未给出任何结果。扎根:Section 5 最后一段:“our analysis assumes the Gaussianity of either the errors or the covariates for variance calculation – an assumption that remains to be explored through the lens of universality principles.”
-
其他正则化方法(Lasso、弹性网等):本文只分析 ridge。对于 Lasso,偏差结构不同(涉及软阈值),且需要稀疏性假设。扎根:Section 1.1:“We focus on the ridge-regularized estimators for the nuisance functions and leave the investigation of other estimators to future work.” 以及 Section 5:“One can also envision appealing to more sophisticated debiasing techniques when generic convex regularization, such as Lasso, is employed.”
-
效率界与最优性:本文给出了六种估计量的方差,但未证明哪个是最优的(即是否存在半参数效率界)。作者提到“the minimum achievable variance when c > 1 remains an open problem”(引用 Jiang et al., 2025)。扎根:Section 2.1 末尾:“the precise characterization of the minimum achievable variance when c = p/n > 1 remains an open problem.” 以及 Section 5:“In this regime, where an efficiency theory is unavailable, the choice of estimator that minimizes asymptotic variance is a priori unclear.”
-
扩展到更一般的双稳健泛函:ECC 是特例。能否将本文的模板(偏差校正 + 方差最小化)推广到 ATE、ATT 或其他泛函?扎根:Section 5:“the availability of a large class of sample-split-sensitive, optimally tuned estimators of double-robust functionals might shed light on eventual efficiency bounds.” 但未给出具体路线。
-
两分割下方差爆炸的机制:模拟显示积分型估计量在 \( \lambda \approx 1.48 \) 处方差发散(因偏差校正常数 \( 1 - g^{\text{INT}}_{2,2\text{sp}}/g^{\text{INT}}_{1,2\text{sp}} \) 接近 0)。作者未深入分析这一现象,也未提出规避方法。扎根:Figure 1 和 Appendix H.1.2 的描述,但无理论解释。
Maintained by 陈星宇 · Homepage · Source on GitHub