Model selection and inference for estimation of causal parameters¶
作者: Dominik Rothenhäusler
来源: Electronic Journal of Statistics
主题: 因果推断
相关性: 8/10
链接: https://doi.org/10.1214/24-ejs2308
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:在因果推断中,当研究者面对多个合理的估计量(例如,对平均处理效应ATE,可以用逆概率加权IPW、工具变量IV、基于代理结果的方法等),并且是在“窥视”数据后才决定使用哪一个时,如何对最终选定的估计量进行有效的统计推断(构造置信区间、进行假设检验)。这是一个“模型选择后的推断”(post-selection inference)问题,但特殊之处在于因果推断中通常没有像预测误差那样的自然损失函数来指导模型选择,因此标准的信息准则(AIC/BIC)或交叉验证不直接适用。该方向目前处于从“点估计选择”向“选择后有效推断”过渡的阶段,理论结果主要集中在低维设定。
发展脉络(history)¶
作者在引言中构建的脉络如下:
-
奠基工作:模型选择后的推断(Post-Selection Inference, PoSI)。作者引用 Berk et al. (2013) 和 Lee et al. (2016) 作为该领域的基石。Berk等人提出了“PoSI”框架,通过构造一个同时覆盖所有可能选择模型的置信区间(即“同时置信区间”)来保证选择后的推断有效性。Lee等人则针对Lasso等特定选择程序,推导了选择后条件分布,从而构造精确的置信区间。作者定位:这些工作为模型选择后的推断提供了通用框架,但它们的核心假设是存在一个可用的损失函数(如平方误差)来定义“最优模型”,这在因果推断中往往缺失。
-
主要进展:因果推断中的模型选择。作者指出,在因果推断中,模型选择通常依赖于估计量的方差或均方误差(MSE)。例如,Imbens and Rubin (2015) 讨论了基于方差估计来选择匹配或加权方法。作者定位:这些方法本质上是启发式的,缺乏严格的渐近理论保证,尤其是在选择后构造置信区间时,会因“数据窥探”而导致覆盖率的严重偏差。
-
当前Frontier:为因果推断设计有理论保证的模型选择工具。作者将本文定位为这一前沿的贡献。他引用了 van der Laan and Rose (2011) 的“目标最大似然估计(TMLE)”和 Chernozhukov et al. (2018) 的“去偏机器学习(DML)”作为背景。这些方法通过交叉拟合(cross-fitting)和Neyman正交性来获得对模型误设鲁棒的估计量,但它们本身不解决“在多个候选估计量中选择一个”的问题。作者定位:本文填补的缺口是,在缺乏损失函数的情况下,如何设计一个具有严格渐近有效性的模型选择程序,并基于此构造选择后的置信区间。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索一:通用模型选择后的推断(PoSI)。以 Berk et al. (2013) 和 Lee et al. (2016) 为代表。核心思路是控制选择过程带来的“数据窥探”效应,通过构造同时置信区间或条件分布来保证推断的有效性。瓶颈:这些方法通常依赖于一个明确的损失函数和选择规则(如最小化AIC、Lasso路径),且计算成本可能很高。
- 线索二:因果推断中的估计量选择与鲁棒估计。以 Imbens and Rubin (2015)、van der Laan and Rose (2011) 和 Chernozhukov et al. (2018) 为代表。核心思路是开发对模型误设不敏感的估计量(如TMLE、DML),或基于经验准则(如方差)选择估计量。瓶颈:前者不解决选择问题,后者缺乏选择后的推断理论保证。
这个方向在追问的核心问题¶
- 如何在没有损失函数的情况下定义“最优模型”? 在预测中,损失函数(如MSE)是自然的。在因果推断中,目标量(如ATE)是固定的,不同估计量的好坏通常由其方差或MSE衡量,但MSE本身是未知的,需要估计。
- 如何构造选择后有效的置信区间? 标准置信区间假设模型是预先指定的。选择过程会扭曲估计量的分布,导致朴素置信区间的覆盖率远低于名义水平。如何修正这种扭曲?
- 选择程序本身应该是什么? 是选择一个估计量,还是对多个估计量进行加权平均(模型平均)?选择程序应该基于什么准则(如最小化估计方差、最小化估计的MSE)?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者声称,现有模型选择后的推断方法(如PoSI)依赖于一个“损失函数”,而因果推断中“通常没有损失函数可用”(原文:“Since there is usually no loss function available in causal inference, standard model selection techniques do not apply.”)。因此,本文提出了一种不依赖损失函数、而是直接估计“估计量与其目标的平方ℓ2偏差”的模型选择程序。
- 哪些竞争路线被他淡化或回避了:作者淡化了模型平均(model averaging)这条路线。模型平均(如贝叶斯模型平均、基于AIC的加权平均)是处理模型不确定性的另一种主流范式,它不进行“选择”,而是对所有候选模型进行加权。作者在引言中未提及任何模型平均的工作,这暗示他选择了一条不同的技术路径(“选择”而非“平均”)。此外,作者回避了高维设定,全文聚焦于低维(有限维参数)情形。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者未引用任何关于交叉验证(cross-validation) 在因果推断中应用的近期工作。虽然交叉验证通常用于预测,但近年来有工作(如用于选择DML中的机器学习调参参数)将其用于因果推断。此外,关于贝叶斯模型平均在因果推断中的大量文献(如用于处理工具变量选择、倾向得分模型不确定性)也未被提及。这可能是作者有意为之,以突出其“非损失函数”方法的独特性,但也构成了一个值得研究者去查的潜在张力点。
张力¶
未见明显对立引用。作者引用的工作(PoSI、TMLE、DML)在方法论上并不矛盾,它们分别处理了不同方面的问题(选择后推断、鲁棒估计),本文试图将它们连接起来。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
θ:目标因果参数(estimand),例如平均处理效应(ATE)。它是一个标量或低维向量。θ̂_j:第j个候选估计量(j = 1, ..., J)。每个θ̂_j都是基于样本Z_1, ..., Z_n构造的,且是θ的相合估计。n:样本量。J:候选估计量的个数,是有限的。d_j:第j个候选估计量θ̂_j的维数。本文假设所有候选估计量都是有限维的(低维)。Σ_j:θ̂_j的渐近协方差矩阵。τ_j²:θ̂_j的平方 ℓ2 偏差(squared ℓ2-deviation),即E[||θ̂_j - θ||²]。这是本文模型选择程序的核心目标量。θ̃:一个已知的、渐近无偏但可能高方差的参数估计量。它被用作“基准”来估计τ_j²。
- 模型:数据生成机制是未知的,但满足一定的正则性条件,使得每个候选估计量
θ̂_j都是θ的√n-相合且渐近正态的估计量。即√n (θ̂_j - θ) → N(0, Σ_j)。模型是半参数的,因为θ是有限维参数,而数据生成机制的其他部分(如倾向得分、结果回归函数)可以是无限维的。 - 可观测数据:研究者观测到独立同分布的样本
{Z_i}_{i=1}^n。每个Z_i包含处理变量、结果变量、协变量等。研究者可以基于这些数据计算出所有J个候选估计量θ̂_1, ..., θ̂_J,以及基准估计量θ̃。想要但观测不到的是目标参数θ的真实值,以及每个候选估计量的真实偏差||θ̂_j - θ||²。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:假设我们只有一个标量目标参数 θ(例如ATE),并且只有两个候选估计量:θ̂_1 和 θ̂_2(例如,一个是IPW估计量,一个是基于结果回归的估计量)。我们还有一个已知的、渐近无偏但可能非常不稳定的基准估计量 θ̃(例如,一个简单的差分估计量,方差很大但无偏)。
核心问题:我们想从 θ̂_1 和 θ̂_2 中选一个,使得选中的那个估计量的真实平方偏差 E[(θ̂_j - θ)²] 尽可能小。但我们不知道 θ,所以无法直接计算偏差。我们该怎么办?
关键想法:我们可以利用基准估计量 θ̃ 来估计每个候选估计量的平方偏差。具体地,对于候选估计量 θ̂_j,考虑以下量:
D_j = (θ̂_j - θ̃)² - Var(θ̃)
其中 Var(θ̃) 是 θ̃ 的渐近方差(假设已知或可以相合估计)。
为什么这个想法成立?
因为 θ̃ 是渐近无偏的,所以 E[θ̃] ≈ θ。因此:
E[D_j] = E[(θ̂_j - θ̃)²] - Var(θ̃)
≈ E[(θ̂_j - θ + θ - θ̃)²] - Var(θ̃)
= E[(θ̂_j - θ)²] + E[(θ - θ̃)²] + 2E[(θ̂_j - θ)(θ - θ̃)] - Var(θ̃)
由于 θ̃ 无偏,E[(θ - θ̃)²] = Var(θ̃)。如果 θ̂_j 和 θ̃ 是渐近独立的(这是一个关键假设,在交叉拟合或样本分割下可以近似满足),那么交叉项 E[(θ̂_j - θ)(θ - θ̃)] ≈ 0。于是:
E[D_j] ≈ E[(θ̂_j - θ)²] + Var(θ̃) - Var(θ̃) = E[(θ̂_j - θ)²] = τ_j²
所以,D_j 是 τ_j² 的一个渐近无偏估计量!我们只需要计算所有候选估计量的 D_j,然后选择 D_j 最小的那个估计量即可。这个选择程序不依赖于任何损失函数,只依赖于一个已知的、无偏的基准估计量。
这个最小内核揭示了什么?
1. 核心工具:利用一个“辅助”的、无偏但高方差的估计量来估计目标估计量的偏差。
2. 关键假设:候选估计量与基准估计量之间的渐近独立性(或至少协方差可处理)。
3. 核心困难:选择后的 θ̂_j 的分布不再是高斯分布,因为选择规则本身(argmin D_j)是一个不连续的、依赖于数据的函数。这使得构造选择后的置信区间变得非常困难,标准渐近展开失效。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在因果推断中,当研究者有多个候选估计量,并在“窥视”数据后基于最小化估计的平方 ℓ2 偏差来选择最终估计量时,如何构造渐近有效的置信区间。
- 核心工具 / 方法:提出了一种模型选择程序,该程序通过一个已知的渐近无偏(但可能高方差)的基准估计量来估计每个候选估计量的平方 ℓ2 偏差。选择后,作者推导了选择后估计量的渐近分布(非高斯),并基于此构造了渐近有效的置信区间。
- 主要结论:在低维设定下,该模型选择程序是相合的(即渐近地选择出真实偏差最小的估计量),并且基于该程序构造的置信区间具有正确的渐近覆盖率。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
* 设定:θ 是 d 维参数(d 固定且较小)。有 J 个候选估计量 θ̂_1, ..., θ̂_J,每个都是 √n-相合且渐近正态的。存在一个基准估计量 θ̃,满足 √n (θ̃ - θ) → N(0, Ṽ),其中 Ṽ 是已知或可相合估计的。
* 关键假设:
1. 渐近联合正态性:(θ̂_1, ..., θ̂_J, θ̃) 的联合分布是渐近正态的。
2. 候选估计量与基准估计量的渐近独立性:对于每个 j,θ̂_j 与 θ̃ 是渐近独立的。这是通过样本分割(sample splitting)实现的:用一部分数据计算 θ̂_j,用另一部分独立的数据计算 θ̃。这是保证 D_j 是 τ_j² 的无偏估计量的关键。
3. 基准估计量的无偏性:θ̃ 是 θ 的渐近无偏估计量。
4. 候选估计量的相合性:每个 θ̂_j 都是 θ 的相合估计量。
* 相比已有文献的强化或放宽:相比Berk et al. (2013) 的PoSI框架,本文放宽了对损失函数的需求,但强化了对基准估计量的要求(需要其渐近无偏且与候选估计量独立)。相比Lee et al. (2016) 的条件推断,本文不依赖于特定的选择规则(如Lasso),而是提出了一种新的、基于偏差估计的选择规则。
主要结果¶
- 定理1(模型选择的相合性):在正则条件下,本文提出的模型选择程序(选择
D_j最小的估计量)是相合的,即它渐近地选择出真实平方 ℓ2 偏差τ_j²最小的那个候选估计量。直觉:因为D_j是τ_j²的相合估计,所以最小化D_j渐近等价于最小化τ_j²。 - 定理2(选择后估计量的渐近分布):设
θ̂_sel为选择后的估计量。其渐近分布不是高斯分布,而是一个截断正态分布(truncated normal)或更一般的非高斯分布,其形式取决于选择规则和所有候选估计量的联合分布。技术难点:选择规则argmin D_j是一个不连续的函数,导致θ̂_sel的极限分布无法通过Delta方法或标准经验过程理论得到。作者通过分析选择事件(selection event)的渐近概率来刻画这个分布。 - 定理3(渐近有效置信区间):基于定理2中推导的渐近分布,作者构造了选择后估计量的置信区间。该置信区间具有正确的渐近覆盖率(即覆盖概率趋近于名义水平
1-α)。必要条件:需要知道所有候选估计量的渐近协方差矩阵Σ_j以及它们与基准估计量的协方差(在样本分割下为0)。这些量可以通过bootstrap或解析公式估计。
证明路线与技术技巧¶
- 整体路线:
- 第一步:构造偏差估计量。通过样本分割,用独立数据计算
θ̃和θ̂_j,构造D_j = ||θ̂_j - θ̃||² - tr(Ṽ)(向量情形下,tr(Ṽ)是Ṽ的迹,对应标量情形的方差)。证明D_j是τ_j²的渐近无偏估计。 - 第二步:定义选择规则。选择
j* = argmin_j D_j。 - 第三步:刻画选择事件。定义事件
E_j = {j* = j},即选择第j个估计量的事件。这个事件可以表示为关于所有D_k的线性不等式组(例如,D_j ≤ D_k对所有k成立)。 - 第四步:推导选择后分布。利用联合渐近正态性,将选择事件
E_j转化为关于(θ̂_1, ..., θ̂_J, θ̃)的线性约束。然后,推导在给定E_j条件下θ̂_j的条件渐近分布。由于E_j是一个凸集(由线性不等式定义),条件分布是一个截断正态分布。 - 第五步:构造置信区间。基于截断正态分布的分位数,构造
θ的置信区间。由于截断正态分布的参数(均值、方差、截断边界)都可以从数据中相合估计,因此可以构造出渐近有效的置信区间。
- 第一步:构造偏差估计量。通过样本分割,用独立数据计算
- 关键跳跃点:最吃功夫的步骤是第四步。难点在于:选择事件
E_j依赖于所有D_k,而D_k本身是θ̂_k和θ̃的二次函数。这使得E_j在(θ̂_1, ..., θ̂_J, θ̃)的空间中是一个二次约束,而不是线性约束。作者通过一个巧妙的技巧绕过了这个困难:他重新参数化问题,将选择事件转化为关于所有候选估计量与基准估计量之差的线性约束。具体地,定义U_j = θ̂_j - θ̃,则D_j = ||U_j||² - tr(Ṽ)。选择事件{D_j ≤ D_k 对所有 k}等价于{||U_j||² ≤ ||U_k||² 对所有 k}。在给定U_j的条件下,这是一个关于U_k的线性约束(因为||U_k||²是凸函数,但约束||U_j||² ≤ ||U_k||²在U_k中是二次的)。作者进一步利用U_k的条件分布(给定U_j)是高斯分布这一事实,将问题转化为一个二次型概率的计算,最终通过数值积分或模拟来得到条件分位数。 - 技术技巧点名:
- 样本分割(Sample Splitting):用于保证候选估计量与基准估计量的渐近独立性,这是
D_j无偏性的基石。 - 二次型概率(Quadratic Form Probability):用于计算选择后分布,因为选择事件涉及二次不等式。
- 截断正态分布(Truncated Normal Distribution):选择后估计量的渐近分布是截断正态的,其分位数用于构造置信区间。
- Delta方法:用于推导
D_j的渐近分布。
- 样本分割(Sample Splitting):用于保证候选估计量与基准估计量的渐近独立性,这是
真实例子与应用¶
本文为纯模拟实验,无真实数据例子。作者设计了三个低维模拟场景来评估方法性能: 1. 实验数据(Experimental Data):模拟一个随机化实验,ATE是目标量。候选估计量包括:简单均值差、调整协变量的OLS估计量、IPW估计量。基准估计量是简单均值差(无偏但方差大)。 2. 工具变量设定(IV Setting):模拟一个存在未观测混杂的场景,使用一个工具变量。候选估计量包括:两阶段最小二乘(2SLS)、有限信息最大似然(LIML)、以及一个对弱IV更鲁棒的估计量。基准估计量是简化式(reduced form)估计量。 3. 基于可观测选择的观察数据(Observational Data with Selection on Observables):模拟一个基于可观测协变量选择偏差的观察性研究。候选估计量包括:IPW、基于结果回归的估计量、双重稳健估计量(AIPW)。基准估计量是一个简单的、未调整的均值差(有偏但无偏性假设在模拟中被检验)。
结果:模拟结果显示,本文提出的模型选择程序在大多数设定下都能选择出MSE最小的估计量。更重要的是,基于该程序构造的选择后置信区间,其经验覆盖率接近名义水平(如95%),而朴素的(未考虑选择)置信区间则严重不足(覆盖率可能低至50%以下)。这个例子想说明:本文方法在实践中是可行的,并且确实能解决“数据窥探”导致的推断失效问题。
🔎 结论是否比证明窄¶
是的。作者在结论部分(Theorem 3)中声称构造了“渐近有效置信区间”,但该结论严格依赖于以下条件:
* 低维设定:θ 的维数 d 是固定的,且候选估计量的个数 J 也是固定的。证明中使用的渐近展开和截断正态分布理论在高维(d 或 J 随 n 增长)下会失效。作者在讨论中明确提到“扩展到高维设定是一个重要的未来方向”。
* 样本分割:证明依赖于样本分割来保证独立性。这意味着需要牺牲一部分数据来估计基准估计量,可能导致效率损失。作者在模拟中使用了50%-50%的分割,但未讨论最优分割比例。
* 基准估计量的存在性:方法要求存在一个已知的、渐近无偏的基准估计量。在某些因果问题中,这样的估计量可能不存在(例如,在存在未观测混杂且没有有效工具变量的情况下)。作者在讨论中承认了这一点。
因此,论文的结论(“渐近有效置信区间”)在低维、有样本分割、存在无偏基准估计量的条件下是严格证明的,但作者在引言和摘要中的表述(“We derive asymptotically valid confidence intervals for low-dimensional settings”)是准确的,没有过度泛化。
四、开放问题¶
- 扩展到高维设定:本文方法严格限于低维参数。如何将模型选择后的推断扩展到高维因果参数(如高维ATE、或高维工具变量)?这需要处理高维协方差矩阵估计、以及选择事件在高维空间中的几何复杂性。扎根点:作者在讨论中明确提到“Extending our approach to high-dimensional settings is an important direction for future work.”
- 放松对基准估计量的要求:本文要求基准估计量是渐近无偏的。在许多实际因果问题中,找到一个无偏估计量可能非常困难(例如,在存在未观测混杂时)。能否放松为“渐近可忽略偏差”或“有偏但偏差可估计”?扎根点:作者在讨论中承认“The requirement of an unbiased baseline estimator is a limitation.”
- 模型平均 vs. 模型选择:本文专注于“选择”一个估计量。一个自然的替代方案是“模型平均”,即对所有候选估计量进行加权平均。能否将本文的偏差估计框架用于构造最优的模型平均权重?选择后的推断与模型平均后的推断在效率和稳健性上如何比较?扎根点:作者在引言中未讨论模型平均,这构成了一个未被探索的竞争路线。
- 选择程序的最优性:本文提出的选择程序(最小化估计的平方ℓ2偏差)是启发式的。是否存在一个“最优”的选择程序,例如,在某种决策理论框架下(如最小化最大后悔值)?扎根点:作者未讨论选择程序本身的最优性,只证明了其相合性。
Maintained by 陈星宇 · Homepage · Source on GitHub