Assumption-lean inference for generalised linear model parameters¶
作者: Stijn Vansteelandt, Oliver Dukes
主题: 非参数 / 半参数
相关性: 7/10
链接: https://arxiv.org/abs/2006.08402
一、领域脉络与小综述¶
这个方向是什么:本文属于"模型误设下的推断"(inference under misspecification)这一子方向。其根本问题是:当回归模型(如线性或广义线性模型)被当作"工作模型"而非"真实模型"时,回归系数作为估计量的概率极限是什么?它是否仍然对应一个有意义、可解释的总体量?以及如何对该总体量进行有效的推断(置信区间、假设检验)?这一方向在计量经济学、生物统计和因果推断中都有深厚根源,近年来因机器学习被广泛用于 nuisance 估计而重新受到关注。当前成熟度:经典结果(White 1980 的 sandwich estimator)已确立"方差估计对误设稳健"的范式,但对"参数本身在误设下代表什么"这一问题的系统性回答,直到 Buja et al. (2019a,b,c) 的"Models as Approximations"系列才被明确提出,本文是该纲领在广义线性模型和效应修饰参数上的延伸。
发展脉络: - 奠基工作:White (1980) 提出 sandwich estimator,确立了"即使模型误设,M 估计量仍渐近正态,且可用 sandwich 形式估计其方差"的推断框架。但如 Freedman (2006) 所批评,sandwich 估计量虽然修正了方差,却没有回答"系数本身在非线性下代表什么"——当回归函数非线性时,OLS 系数的概率极限是一个混杂了回归函数形状与协变量分布的复杂泛函,未必是研究者想要的"条件关联"的概括。 - 主要进展:Buja et al. (2019a) 系统提出"投影参数"(projection parameter)框架,将线性回归系数重新定义为"在最小二乘意义下对条件期望函数 E(Y|X) 的最优线性逼近"的系数。这一框架将模型误设从"缺陷"转化为"定义 estimand 的方式":研究者不再声称模型正确,而是明确声明"我要报告的是这个投影系数"。Buja et al. (2019b,c) 进一步讨论了推断的有效性、模型选择后的推断问题,以及与 sandwich estimator 的关系。同期,Lin (2013) 在随机实验的因果推断中给出了"模型无关"(model-agnostic)的回归调整方法,证明 OLS 调整在饱和模型下对处理效应估计的稳健性。Angrist & Krueger (1999)、Angrist & Pischke (2009)、Aronow & Samii (2016)、Graham & Pinto (2018)、Słoczyński (2020) 等则从因果推断角度解释了 OLS 估计量在异质性处理效应下作为加权平均的解读。 - 当前 frontier:将投影参数思想从线性模型推广到广义线性模型(GLM)和更一般的估计方程。这一推广并非平凡:在非线性 link 下,GLM 系数的概率极限不再是简单的投影,而是依赖于 link 函数、协变量分布和 nuisance 函数的复杂泛函。Vansteelandt et al. (2008) 对交互作用参数提出了 multiply robust 估计;Tan (2019) 对部分线性 logistic 模型给出了 doubly robust 推断;Newey & Robins (2018) 和 Whitney et al. (2019) 则从交叉拟合和更高阶影响函数的角度推进了非参数推断理论。 - 本文的位置:本文在 Buja et al. (2019a) 的投影参数纲领下,为 GLM 参数(主效应和效应修饰)提供了非参数的定义、影响函数推导和基于机器学习的推断方法。它填补的关键缺口是:当 GLM 被误设时,不仅系数估计的方差需要修正,系数的目标量本身也需要重新定义——本文给出的定义是"条件协方差加权平均"(对主效应)和"条件协方差加权平均的交互版本"(对效应修饰),并证明了这些定义在模型正确时约化为标准 GLM 参数。
子线索聚类: 1. 投影参数与模型误设的估计理论:Buja et al. (2019a,b,c)、White (1980)、Freedman (2006)、Berk et al. (2013)。这条线索关注"当模型错误时,估计量在估计什么"以及"如何对该目标量做有效推断"。 2. 因果推断中的稳健调整:Lin (2013)、Angrist & Krueger (1999)、Aronow & Samii (2016)、Graham & Pinto (2018)、Słoczyński (2020)。这条线索关注 OLS 调整在随机实验和观察性研究中的因果解释,特别是作为异质性处理效应的加权平均。 3. 半参数效率与 doubly robust 估计:Robins et al. (2008)、Newey & Robins (2018)、Tan (2019)、Vansteelandt et al. (2008)、Chernozhukov et al. (2018)。这条线索关注如何利用影响函数构造对 nuisance 误设稳健的高效估计量,以及交叉拟合在其中的作用。 4. 机器学习与因果推断的接口:Athey et al. (2019)(generalized random forests)、Nie & Wager (2017)(R-learner)、Wager & Athey (2018)。这条线索关注如何用机器学习估计 nuisance 函数并保持目标参数的根号 n 推断。
这个方向在追问的核心问题: - 当回归模型被误设时,研究者报告的系数到底在估计什么?如何给出一个不依赖模型正确性的、可解释的总体定义? - 如何对该目标量进行有效的推断,使得置信区间在模型误设下仍有正确的覆盖概率,且不损失效率? - 当 nuisance 函数用机器学习估计时,如何保证目标参数的推断不受第一阶段的收敛速度影响(即"正交性"或"Neyman orthogonality")? - 对于交互作用/效应修饰参数,如何定义"非参数交互作用"并对其进行推断?
已知瓶颈: - 非线性 link 下投影参数没有闭式解,影响函数推导需要 Gateaux 导数计算,且涉及对 nuisance 函数的 Fréchet 可微性要求。 - 效应修饰参数(如交互项)的非参数定义在条件依赖的暴露变量下变得复杂,需要引入正交投影算子。 - 机器学习估计器的收敛速度通常慢于根号 n,需要交叉拟合和影响函数正交化来消除一阶偏差。
⚠️ 作者的 framing(这是作者的说法):作者在引言中明确将缺口定义为"GLM 参数在模型误设下缺乏非参数定义和有效推断方法"。他们写道:"Statistical inference for the parameters indexing generalised linear models is routinely based on the assumption that the model is correct and a priori specified. This is unsatisfactory because the assumptions encoded in the chosen model rarely represent some a priori known ground truth, making standard inferences prone to bias, but also failing to give a pure reflection of the information that is contained in the data."(第 1 节)他们将自己的贡献定位为"assumption-lean inference":即估计量的定义和推断的有效性不依赖于 GLM 的正确性,而只依赖于非参数光滑性条件。他们淡化了与 Buja et al. (2019a) 的投影参数纲领的继承关系(仅在讨论部分提及),而强调其估计量的"条件协方差加权平均"解释。竞争路线被淡化:作者没有深入讨论"如果研究者确实相信 GLM 正确,本文方法是否会损失效率"这一问题,也没有与贝叶斯模型平均或正则化方法做比较。什么明显该被引却没出现:论文未引用 Buja et al. (2019c) 中关于"模型选择后的推断"的讨论,也未引用 Leeb & Pötscher (2005) 关于模型选择不确定性的不可能性结果——这些与本文"数据自适应模型选择"的动机直接相关。
张力:未见明显对立引用。但存在一个微妙的张力:Buja et al. (2019a) 强调投影参数是"描述性的"(descriptive),不赋予因果解释;而本文在讨论部分(第 7 节)暗示其主效应估计量在因果推断中可作为"条件关联"的稳健度量,这一桥接在因果识别假设(如无未测量混杂)未被明确讨论的情况下略显仓促。此外,Vansteelandt et al. (2008) 的 multiply robust 方法要求至少一个 nuisance 模型正确,而本文的方法只要求所有 nuisance 以足够快的速度收敛(不要求任何模型"正确"),两者对误设的容忍度不同,但作者未明确比较。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据
设观测数据为独立同分布样本 \(O_i = (Y_i, A_i, L_i)\),\(i = 1, \dots, n\),其中: - \(Y\):连续或离散结局(本文主要考虑连续结局,但方法适用于指数族); - \(A\):暴露/处理变量(可为连续或离散); - \(L\):协变量向量(可为高维)。
目标量(estimand):本文关注 GLM 中的系数 \(\beta\),但不在"模型正确"的假设下定义它。相反,作者将 \(\beta\) 定义为某个非参数泛函的解。具体地,考虑广义部分线性模型
可观测数据:研究者能观测到 \((Y_i, A_i, L_i)\),但不知道 \(E(A|L)\)、\(E(Y|A,L)\) 等 nuisance 函数。这些函数需要用数据自适应方法(机器学习)估计。
第二步:最小内核——二元处理、单一协变量的情形
为看清本文的核心思想,考虑最简单的情形:\(A \in \{0,1\}\) 为二元处理,\(L\) 为一维协变量,\(g\) 为 identity link,结局 \(Y\) 连续。
传统做法:拟合线性模型 \(Y = \alpha_0 + \alpha_1 L + \beta A + \varepsilon\),报告 \(\hat{\beta}_{\text{OLS}}\)。若真实模型非线性(例如 \(E(Y|A,L) = \alpha_0 + \alpha_1 L + \beta A + \gamma A L\)),则 \(\hat{\beta}_{\text{OLS}}\) 的概率极限不是 \(\beta\),而是一个混杂了 \(\gamma\) 和 \(L\) 分布的复杂量。更糟的是,如果模型经过变量选择(例如剔除了不显著的交互项),则 \(\hat{\beta}_{\text{OLS}}\) 的分布还依赖于选择过程,标准误估计失效。
本文的做法: 1. 定义 estimand:不声称线性模型正确,而是定义
为什么这个例子是"核心":它展示了本文的三个关键思想: - 用非参数泛函重新定义回归系数,使 estimand 在模型误设下仍有意义; - 利用影响函数实现"正交化",使得 nuisance 估计的误差不进入一阶渐近展开; - 用机器学习估计 nuisance 而不破坏根号 n 推断(通过交叉拟合)。
这个例子的数学本质:估计方程
三、这篇论文做了什么¶
三句话: 1. 研究了什么问题:在 GLM 参数(主效应和效应修饰)的推断中,当模型被误设时,如何定义有意义的非参数 estimand,并对其进行有效的推断。 2. 核心工具/方法:利用非参数模型下的影响函数(influence curve)推导,结合交叉拟合(cross-fitting)和机器学习 nuisance 估计,构造渐近正态的估计量。 3. 主要结论:提出的估计量在非参数模型下渐近正态,方差可由影响函数的样本方差一致估计;在模型正确时约化为标准 GLM 估计量;在模型误设时仍收敛到有明确解释的"条件协方差加权平均"参数。模拟和数据分析表明,该方法在有限样本下具有良好的覆盖概率,且比现有方法更稳健。
关键设定与假设:
- 数据:\(O = (Y, A, L)\),独立同分布。
- 主效应 estimand(公式 5):
\[\beta = \frac{ E\left[ \{ A - E(A|L) \} \{ g\{E(Y|A,L)\} - g\{E(Y|0,L)\} \} \right] }{ E\left[ A \{ A - E(A|L) \} \right] }.\]当 \(g\) 为 identity 时,分子为 \(E[\operatorname{Cov}(A, E(Y|A,L)|L)]\),分母为 \(E[\operatorname{Var}(A|L)]\),即条件协方差加权平均。
- 效应修饰 estimand(公式 8 和 11):对交互作用参数,定义涉及正交投影算子 \(P(\cdot)\),将 \(A_1 A_2\) 投影到与 \(A_1, A_2, L\) 的加性函数正交的空间。公式 (11) 是更一般的定义,不要求条件独立。
- 假设:
- 无未测量混杂(仅在因果解释时需要):\(A \perp Y^a | L\)(潜在结果框架)。
- 重叠假设:\(0 < \pi(L) < 1\) 几乎处处(对二元处理)。
- Nuisance 收敛速率:\(\hat{\pi}(L)\)、\(\hat{\mu}_a(L)\) 等以 \(o_p(n^{-1/4})\) 的速率收敛(均方误差意义下),且满足一定的 Donsker 条件(或通过交叉拟合避免)。
- 矩条件:\(E[\{A - E(A|L)\}^2] > 0\),确保分母非零。
- 光滑性:\(E(Y|A,L)\) 和 \(E(A|L)\) 作为 \(L\) 的函数满足一定的 Hölder 光滑性(用于核估计或机器学习收敛速率验证)。
相比已有文献的放宽/强化: - 放宽:不要求 GLM 正确;不要求暴露变量为二元(可连续);不要求条件独立(对效应修饰 estimand 11)。 - 强化:要求 nuisance 估计的收敛速率快于 \(n^{-1/4}\)(这是半参数效率推断的标准条件,但比参数模型假设更弱);要求交叉拟合(cross-fitting)以避免 Donsker 条件。
主要结果:
-
定理 1(主效应估计量的渐近正态性):在正则条件下,
\[\sqrt{n}(\hat{\beta} - \beta) \xrightarrow{d} N(0, V),\]其中 \(V = E[\varphi(O)^2]\),\(\varphi\) 为影响函数(公式 12):\[\varphi(O) = \frac{ \{ A - E(A|L) \} [ \mu(Y,A,L) - \beta \{ A - E(A|L) \} ] }{ E\left[ \{ A - E(A|L) \}^2 \right] },\]其中 \(\mu(Y,A,L) = g'\{E(Y|A,L)\}\{Y - E(Y|A,L)\} + g\{E(Y|A,L)\} - E[g\{E(Y|A,L)\}|L]\)。 关键性质:该影响函数对 nuisance 参数(\(E(A|L)\)、\(E(Y|A,L)\)、\(E[g\{E(Y|A,L)\}|L]\))是正交的,即其 Gateaux 导数在真实分布处为零。因此,用机器学习估计 nuisance 不会影响 \(\hat{\beta}\) 的一阶渐近性质。 -
定理 2(效应修饰估计量的渐近正态性):对公式 (11) 定义的 estimand,影响函数为
\[\frac{ P(A_1 A_2) }{ E\{P(A_1 A_2)^2\} } \left( g'\{E(Y|A_1,A_2,L)\}\{Y - E(Y|A_1,A_2,L)\} + P[g\{E(Y|A_1,A_2,L)\} - \beta A_1 A_2] \right).\]该影响函数同样具有正交性。估计 \(P(\cdot)\) 需要交替条件期望(ACE)算法。 -
推论(方差估计):\(\hat{V} = n^{-1} \sum_i \hat{\varphi}(O_i)^2\) 是 \(V\) 的一致估计,其中 \(\hat{\varphi}\) 将影响函数中的 nuisance 替换为机器学习估计。由此可构造 Wald 置信区间。
证明路线:
-
整体逻辑:采用 von Mises 展开(即影响函数的一阶展开)。将估计量 \(\hat{\beta}\) 表示为
\[\sqrt{n}(\hat{\beta} - \beta) = \frac{1}{\sqrt{n}} \sum_{i=1}^n \varphi(O_i) + R_1 + R_2,\]其中 \(R_1\) 是经验过程项(由 nuisance 估计的随机误差引起),\(R_2\) 是偏差项(由 nuisance 估计的收敛速度引起)。 -
关键跳跃点:
- 证明 \(R_1 = o_p(1)\):需要控制 nuisance 估计的波动。作者使用交叉拟合(cross-fitting),将 nuisance 估计和参数估计放在不同的样本子集上,从而避免 Donsker 条件。具体地,将样本分成 \(K\) 折,在第 \(k\) 折上用其余 \(K-1\) 折估计 nuisance,然后在该折上计算估计方程。这要求 nuisance 估计的 \(L^2\) 收敛速率快于 \(n^{-1/4}\)。
- 证明 \(R_2 = o_p(1)\):这是最核心的技术难点。\(R_2\) 包含 nuisance 估计误差的乘积项。作者利用影响函数的正交性,将 \(R_2\) 分解为若干项,每一项都是两个 nuisance 误差的乘积(或一个误差与一个高阶项的乘积)。通过 Cauchy-Schwarz 不等式和收敛速率条件,证明这些乘积项为 \(o_p(n^{-1/2})\)。例如,在附录 A 中,作者详细推导了主效应估计量的 \(R_2\) 分解,并指出当 \(g\) 为 identity 时,\(R_2\) 中涉及 \(E(A|L)\) 和 \(E(Y|A,L)\) 的误差项相互抵消。
- 影响函数的推导:附录 A、B、C 分别对主效应、条件独立效应修饰、一般效应修饰 estimand 进行了 Gateaux 导数计算。关键技巧是:将 \(\theta(\beta)\) 视为分布的函数,在参数化子模型 \(f_t\) 下求导,然后利用得分函数的性质化简。对于效应修饰 estimand (11),需要利用投影算子 \(P\) 的性质(\(P\) 是幂等的、自伴的),以及 \(P(A_1 A_2)\) 与 \(A_1, A_2\) 的加性函数的正交性。
技术技巧点名: - 交叉拟合(cross-fitting):用于避免 Donsker 条件,使得机器学习 nuisance 估计可以用于半参数推断。 - von Mises 展开:将估计量的渐近偏差分解为影响函数项和余项。 - Gateaux 导数 / 影响函数:在非参数模型下计算 estimand 的路径导数,得到正交性条件。 - 交替条件期望(ACE)算法:用于估计一般效应修饰 estimand 中的投影算子 \(P(\cdot)\)。 - Neyman 正交性:通过构造正交的得分函数,使得 nuisance 估计误差不进入一阶项。
真实例子与应用:
论文包含两个模拟实验和一个真实数据分析。
- 模拟实验 1(主效应):数据生成机制为 \(Y \sim \text{Bern}(\text{expit}(0.3A + \delta^T L_{[1:5]}))\),\(L \sim N(0, \Sigma)\),\(A \sim \text{Bern}(\text{expit}(\gamma^T L - 0.15 L_1^2))\)。比较了四种方法:MLE(线性 logistic 回归)、E-estimator(半参数有效得分)、DR 估计器(Tchetgen Tchetgen 2013)、以及本文提出的影响函数估计器。结果(表 1)显示:
- 在模型正确时(实验 1),所有方法表现相似。
- 在模型误设时(实验 2-4),MLE 的偏差随样本量增大而增大(收敛到错误的极限),而本文提出的方法偏差最小,覆盖率最接近 95%。
- 特别地,在实验 4(复杂交互)中,DR 估计器的覆盖率仅为 6-16%,而本文方法的覆盖率在 90% 以上。
-
本文方法的经验标准差(Emp SD)与影响函数估计的标准误(Mean SE)非常接近,说明方差估计是有效的。
-
模拟实验 2(效应修饰):数据生成涉及两个暴露 \(A_1, A_2\) 和协变量 \(L\),结局为连续。比较了 OLS(含交互项的线性回归)与本文提出的效应修饰估计器。结果显示,在存在未建模的交互时,OLS 的交互项系数严重有偏,而本文方法正确估计了"条件协方差加权平均"的交互效应。
-
数据分析(First Steps 项目):数据来自华盛顿州 First Steps 项目(低收入孕妇和儿童的健康项目),样本量 \(n = 2500\),结局为婴儿出生体重(连续),暴露为项目参与(二元),协变量包括母亲年龄、种族、吸烟状况等。分析结果:
- 传统线性回归估计的项目效应为 -13.57 克(95% CI: -76.3, 49.2)。
- 本文方法估计的 propensity-score 加权效应为 -3.53 克(95% CI: -71.61, 64.55),幅度更小,置信区间更窄。
- 对母亲年龄的效应修饰分析显示,项目效应随母亲年龄增加而略有增加(交互项估计为 7.18,95% CI: -5.82, 20.19),但置信区间包含零。
- 作者强调,本文方法的估计值应被解释为"重叠加权平均条件效应",而非"线性模型系数",这避免了模型误设带来的误导。
🔎 结论是否比证明窄:
- 明确证明的:主效应估计量(定理 1)和效应修饰估计量(定理 2)在交叉拟合和 nuisance 收敛速率条件下渐近正态,且影响函数正交。
- 被泛化的:作者在讨论部分(第 7 节)声称该方法"可扩展到广义线性模型中的任意参数",但附录中的证明仅针对 identity 和 logit link 的具体情形。对于一般 link 函数(如 log link),影响函数的推导需要额外的条件(如 \(g'\) 的有界性),文中未明确给出。
- 被 conjecture 的:作者在讨论中提到"该方法在异方差下仍然有效",但模拟实验均假设同方差。异方差下的影响函数需要额外的修正项(如 Eicker-Huber-White sandwich),文中未给出理论证明。
- 具体语句:作者在结论部分写道"我们相信所提出的框架可以扩展到更一般的估计方程",这是一个 conjecture 而非定理。此外,对于高维协变量(\(p > n\))的情形,作者仅提到"可以使用正则化方法估计 nuisance",但未给出任何理论保证。
四、开放问题¶
以下开放问题均扎根于本文的具体语句或证明中的薄弱环节,供研究者自行判断价值:
-
一般 link 函数下的影响函数推导:本文的定理 1 和 2 仅对 identity 和 logit link 给出了明确的影响函数。对于 log link、probit link 或其他非线性 link,影响函数的形式会如何变化?附录中的 Gateaux 导数计算能否推广?需要什么额外的正则条件?(扎根于附录 A-C 的具体计算,以及第 5 节"arbitrary link functions"的声称。)
-
高维协变量下的理论保证:作者在实现中使用随机森林估计 nuisance,但未给出高维(\(p \gg n\))下的理论结果。当协变量维度随样本量增长时,交叉拟合 + 机器学习估计的 nuisance 收敛速率条件是否仍然成立?是否存在维数灾难导致的偏差?(扎根于第 5.2 节"machine learning"的讨论,未提及高维理论。)
-
异方差和聚类数据的扩展:本文的影响函数假设独立同分布数据。对于异方差(如分组数据)或聚类抽样,影响函数需要如何修正?sandwich 估计量是否仍然有效?(扎根于第 5 节"variance estimation"的简短讨论,未涉及聚类。)
-
效率最优性:本文提出的估计量是渐近正态的,但它是半参数有效的吗?作者在附录中给出了影响函数,但未证明其达到半参数效率界。对于主效应 estimand,是否存在更高效的估计量?(扎根于第 5 节"influence curve"的推导,未讨论效率界。)
-
因果解释的正式化:作者在讨论中暗示该方法可用于因果推断,但未正式引入潜在结果框架和识别假设。在什么条件下,本文的 estimand 等于因果效应?如果存在未测量混杂,偏差有多大?(扎根于第 7 节"causal inference"的讨论,仅一段话。)
-
交叉拟合的折数选择:作者推荐 10 折交叉拟合,但未给出理论指导。折数 \(K\) 的选择如何影响有限样本下的偏差和方差?是否存在最优 \(K\)?(扎根于第 5.2 节"we recommend 10-fold cross-fitting"的具体建议,未提供理论依据。)
-
效应修饰 estimand 的正交投影计算:公式 (11) 中的投影算子 \(P(\cdot)\) 需要 ACE 算法迭代计算。该算法的收敛性、计算复杂度以及在高维下的表现如何?是否存在闭式解或更稳定的替代方案?(扎根于第 5.2 节"ACE algorithm"的简短描述,未提供收敛性分析。)
提醒:要确认上述某条是否是真 gap,建议去读同一子领域近期约 5 篇论文的引言——例如 Buja et al. (2019a,b,c)、Newey & Robins (2018)、Chernozhukov et al. (2018)、Tan (2019)、Vansteelandt et al. (2008) 的后续引用。如果多篇都指向同一个未解决问题,那就是共识性 gap;如果各篇的解决思路互相矛盾,那可能是更值得深挖的机会。
Maintained by 陈星宇 · Homepage · Source on GitHub