Misspecified regressions with mixed regressors: robust inference and causal interpretation¶
作者: Mengsi Gao, Peng Ding
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.09536
一、领域脉络与小综述¶
这个方向是什么¶
本方向研究错误设定线性回归模型下的统计推断,核心问题是:当回归函数(条件均值)被错误设定时,最小二乘估计量(OLS)的系数估计和标准误估计是否仍有意义?具体而言,回归元(regressors)的随机性来源(随机 vs. 固定 vs. 混合)如何影响估计量的渐近分布、目标参数的解释以及稳健标准误(Huber–White sandwich estimator)的相合性?该方向在实验数据分析中尤为关键,因为处理变量往往是随机分配的(随机回归元),而协变量通常是预先固定的(固定回归元),现有理论框架无法直接覆盖这种“混合”设定。
发展脉络(history)¶
-
奠基工作:Cox (1961) 和 Huber (1967) 最早研究错误设定模型下的最大似然估计,指出需使用“sandwich”标准误。White (1980b, 1982) 系统建立了错误设定下OLS的渐近理论,证明Huber–White(HW)标准误在随机回归元下是相合的。这些工作奠定了“模型错误设定下推断”的基础。
-
主要进展——固定回归元 vs. 随机回归元的区分:Abadie, Imbens, and Zheng (2014) 指出一个关键区别:在错误设定下,HW标准误在随机回归元下相合,但在固定回归元下是保守的(即渐近偏大)。他们研究了协变量条件估计量(covariate-conditional estimand)的渐近性质,但分析仍基于无条件(i.i.d.)抽样框架。White (1983) 和 Chow (1984) 也讨论了类似问题。
-
当前Frontier——混合回归元与因果解释:Freedman (2008) 和 van de Geer (2019) 批评了错误设定下推断的“第一阶问题”:即使标准误正确,目标参数本身可能无意义。Box and Draper (1987) 的“所有模型都是错的,但有些有用”被广泛引用。在因果推断中,Lin (2013) 证明了完全随机实验下全交互回归调整(fully interacted regression)的基于设计的性质,Negi and Wooldridge (2021) 在随机抽样框架下研究了类似问题。Su and Ding (2021) 提供了聚类随机实验的基于设计的理论。然而,这些工作要么假设所有回归元随机,要么假设所有回归元固定,没有统一处理混合回归元(如随机化处理 + 固定协变量)的设定。
-
本文的位置:本文首次为混合回归元下的错误设定线性回归提供了完整的渐近理论,包括Z-估计的一般框架、OLS特例、完全随机实验和聚类随机实验的因果解释。作者统一了随机和固定回归元的文献,并指出混合设计下HW标准误是保守的(类似于固定回归元情形),同时澄清了不同设计下回归系数的因果解释。
子线索聚类¶
被引文献大致落在以下三条子线索:
-
错误设定模型的推断理论:Cox (1961), Huber (1967), White (1980b, 1982), Buja et al. (2019a,b)。这些工作建立了模型错误设定下M估计和Z估计的渐近理论,核心是sandwich方差估计量。
-
固定回归元 vs. 随机回归元的区分:Abadie et al. (2014), White (1983), Chow (1984)。这些工作揭示了不同回归元设定下稳健标准误的相合性差异(随机→相合,固定→保守)。
-
实验数据的回归调整与因果推断:Freedman (2008), Lin (2013), Negi and Wooldridge (2021), Su and Ding (2021), Abadie et al. (2023)。这些工作从设计角度或随机抽样角度研究实验数据中回归调整的性质,但未统一处理混合回归元。
这个方向在追问的核心问题¶
- 目标参数的解释:当模型错误设定时,OLS系数估计的是什么?它是否有因果含义?
- 标准误的相合性:在不同回归元设定(随机/固定/混合)下,HW标准误是否相合?若不相合,是保守还是反保守?
- 聚类数据的扩展:在聚类数据中,Liang–Zeger (LZ) 聚类稳健标准误的性质如何随回归元设定变化?
- 效率比较:不同回归调整方法(如Fisher加法调整 vs. Lin全交互调整)在混合设计下的效率排序如何?
当前主流方法:对于独立数据,使用HW标准误;对于聚类数据,使用LZ标准误。已知瓶颈:这些标准误在固定或混合设计下可能保守,且目标参数的解释依赖于设计。
⚠️ 作者的framing¶
作者将缺口frame为:“现有统计框架要么假设随机回归元,要么假设固定回归元,但都不覆盖实践中随机化处理与固定协变量的情况”(引言第2段)。因此,本文的“显然的下一步”是发展混合回归元的理论。作者淡化了设计-based(finite-population)框架的竞争路线:例如Lin (2013) 和 Su and Ding (2021) 的基于设计的分析,作者在讨论中承认“conservativeness的来源不同”(Section 7),但未深入比较。值得研究者去查的问题:作者未引用Chetverikov et al. (2023) 关于“当回归元随机分配时的标准误”的工作,尽管该文与混合设计相关(作者在Section 3.3末尾提及但未详细讨论)。此外,关于非线性模型(如分位数回归)的混合设计扩展,作者仅在讨论中提及,未给出具体结果。
张力¶
未见明显对立引用。各工作在不同设定下结论一致:随机设计下HW相合,固定设计下保守。本文的混合设计结果延续了这一模式。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
- \(Y_i\):观测到的结果变量(随机变量)。
- \(Z_i \in \{0,1\}\):二元处理变量(随机回归元)。
- \(X_i\):协变量向量(固定回归元,即预先观测且不随抽样变化)。
- \(Y_i(1), Y_i(0)\):潜在结果(counterfactual),满足 \(Y_i = Z_i Y_i(1) + (1-Z_i)Y_i(0)\)。
- \(\beta\):回归系数(待估参数),在错误设定下是“伪真参数”(pseudo-true parameter)。
- \(\hat{\beta}\):OLS估计量。
- \(\hat{V}_{\text{ehw}}\):Eicker–Huber–White (EHW) 稳健方差估计量。
- \(n\):样本量。
-
\(e = P(Z_i=1)\):处理分配概率(已知或可估计)。
-
模型:
- 线性回归模型:\(Y_i = \alpha + \beta Z_i + \gamma^T X_i + \varepsilon_i\),但不假设该模型正确(即条件均值 \(E(Y_i \mid Z_i, X_i)\) 可能非线性)。
- 数据生成机制:\((Y_i(1), Y_i(0), X_i)\) 是i.i.d.,且 \(Z_i \perp\!\!\!\perp (Y_i(1), Y_i(0), X_i)\)(完全随机化)。
-
目标:估计平均处理效应 \(\tau = E[Y_i(1) - Y_i(0)]\)。
-
可观测数据:研究者观测到 \(\{(Z_i, X_i, Y_i)\}_{i=1}^n\),其中 \(Z_i\) 是随机变量,\(X_i\) 是固定(非随机)的。潜在结果 \(Y_i(1), Y_i(0)\) 不可观测。
第二步:最小内核——完全随机实验中的加法回归调整¶
考虑最简单的混合设计情形:完全随机实验,处理 \(Z_i\) 随机分配(随机回归元),协变量 \(X_i\) 固定(固定回归元)。研究者使用加法回归调整(Fisher, 1935):
并用OLS估计 \(\beta\)。即使真实条件均值 \(E[Y_i \mid Z_i, X_i]\) 不是线性的,该回归仍给出一个“最佳线性近似”。核心问题是:
-
\(\beta\) 估计了什么? 在混合设计下,\(\beta\) 的伪真参数是 \(\beta_m = n^{-1} \sum_{i=1}^n E[Y_i(1) - Y_i(0) \mid X_i]\),即条件平均处理效应的样本均值(称为“混合平均处理效应”)。这与随机设计下的 \(\beta_r = E[Y_i(1) - Y_i(0)]\)(总体ATE)不同。
-
EHW标准误是否相合? 在混合设计下,EHW标准误是保守的(渐近偏大),因为估计方程的条件均值非零(由于模型错误设定)。具体地,渐近偏差为 \(B_m = n^{-1} \sum_{i=1}^n E[\varepsilon_i^m(1) - \varepsilon_i^m(0) \mid X_i]^2 \geq 0\),其中 \(\varepsilon_i^m(z)\) 是残差。
这个最小内核揭示了混合设计的本质:条件于固定协变量,处理变量的随机性仍然存在,但模型错误设定导致估计方程的条件期望非零,从而使得稳健标准误保守。这一结论直接推广了Abadie et al. (2014) 的固定回归元结果。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在允许回归函数错误设定的前提下,统一了随机、固定和混合回归元下Z-估计(包括OLS)的渐近理论,并应用于完全随机实验和聚类随机实验的因果推断。
- 核心工具/方法:基于估计方程(Z-estimation)的框架,分别推导了随机、固定、混合设计下估计量的渐近正态性以及Huber–White(或Liang–Zeger)稳健方差估计量的相合性/保守性。
- 主要结论:混合设计下,稳健标准误是保守的(类似于固定设计);加法回归调整和全交互回归调整的系数分别识别不同的因果参数(总体ATE vs. 混合ATE);全交互调整在混合设计下渐近不劣于加法调整;对于聚类数据,提出了LZ标准误的修正项。
关键设定与假设¶
- 独立数据(Sections 2–4):
- Assumption 1(Z-估计):参数空间紧致,估计方程连续可微,存在2+δ阶矩,导数矩阵非奇异。
- Assumption 2(OLS):\((Y_i, X_i)\) i.i.d.,四阶矩有限,\(E[X_i X_i^T]\) 正定。
- Assumption 3(完全随机实验):潜在结果与处理独立(\(Z_i \perp\!\!\!\perp (Y_i(1), Y_i(0), X_i)\)),处理概率 \(e \in (0,1)\),四阶矩有限。
-
相比已有文献:放宽了线性模型正确设定的假设;混合设计是新的。
-
聚类数据(Section 5):
- Assumption 4:簇间独立,簇内任意相关,边际分布相同。
- Assumption 5:类似Assumption 3,但允许簇内相关,且要求最大簇权重 \(\Omega = o(M^{-2/3})\)(保证CLT)。
- 相比Su and Ding (2021):本文采用随机抽样框架(superpopulation),而非有限总体设计框架。
主要结果¶
- Theorem 2.1–2.3(Z-估计一般理论):随机设计下HW相合;固定和混合设计下HW保守,偏差分别为 \(B^f\) 和 \(B^m\)(见公式(3)(4))。
- Theorem 3.1–3.3(OLS特例):EHW标准误在随机设计下相合,固定和混合设计下保守。
- Theorem 4.1–4.5(完全随机实验):
- 无协变量回归(Theorem 4.1):\(\beta\) 识别ATE,EHW相合。
- Fisher加法调整(Theorem 4.2–4.3):随机设计下EHW相合,混合设计下保守,偏差为 \(B_f^m = n^{-1} \sum_i E[\varepsilon_i^m(1) - \varepsilon_i^m(0) \mid X_i]^2\)。
- Lin全交互调整(Theorem 4.4–4.5):随机设计下EHW反保守(需修正),混合设计下保守。修正后的方差估计量 \(\hat{V}_{\text{ehw},l,\text{adj}}\) 相合。
- Proposition 4.1:混合设计下,Lin调整渐近方差 ≤ Fisher调整方差,等号当且仅当 \(e=1/2\) 或 \(\gamma_1^m = \gamma_0^m\)。
- Theorem 5.1–5.8(聚类数据):类似结论,LZ标准误在混合设计下保守;全交互调整在随机设计下LZ反保守,需修正(\(\hat{V}_{\text{lz},l,\text{adj}}\) 是新的贡献)。
证明路线与技术技巧¶
- 整体路线(以Theorem 2.3混合设计为例):
- 定义条件期望算子 \(E^\circ = E_{(Y,X_1) \mid X_2}\),目标参数 \(\beta_m\) 满足 \(E^\circ[\psi(W; \beta_m)] = 0\)。
- 证明估计量相合性:利用均匀大数定律(Lemma S2.1)和参数唯一性。
- 线性化:Taylor展开 \(\sqrt{n}(\hat{\beta} - \beta_m) = -\tilde{\Gamma}_n^{-1} \sqrt{n} \bar{\psi}_n(\beta_m)\)。
- 证明 \(\tilde{\Gamma}_n = \Gamma_m + o_P(1)\),其中 \(\Gamma_m = E^\circ[\nabla_b \psi(W; \beta_m)]\)。
- 证明 \(\sqrt{n} \bar{\psi}_n(\beta_m)\) 条件渐近正态:中心化(减去条件均值 \(\eta(X_{i2})\)),应用Lindeberg–Feller CLT。
- 推导方差估计量:\(\hat{\Delta} = n^{-1} \sum \psi(W_i; \hat{\beta}) \psi(W_i; \hat{\beta})^T\) 收敛到 \(E^\circ[\psi \psi^T] = \Delta_m + \text{bias}\),其中偏差来自条件均值非零。
-
最终得到 \(n \hat{V}_{\text{hw}} = V_m + B_m + o_P(1)\)。
-
关键跳跃点:
- 混合设计下,估计方程的条件均值 \(E[\psi(W; \beta_m) \mid X_2]\) 一般非零,这导致HW方差估计量中多出一个正定偏差项 \(B_m\)。这是与随机设计的主要区别。
-
对于Lin全交互调整,随机设计下中心化协变量引入额外不确定性,需通过增广估计方程(augmented estimating equations)修正方差估计量(Theorem 4.4, 5.7)。这是技术难点。
-
技术技巧点名:
- 均匀大数定律(Lemma S2.1):用于证明估计量相合性,基于Newey and McFadden (1994)。
- 条件Lindeberg–Feller CLT:用于推导条件渐近正态性(Theorem 2.2, 2.3证明中)。
- 增广估计方程(Newey, 1984):处理Lin调整中协变量中心化带来的额外不确定性(Section 4.3, 5.2.3)。
- 块矩阵求逆:用于推导Fisher和Lin调整下方差估计量的显式形式(Supplementary Material)。
- Chebyshev不等式和矩估计:用于证明聚类数据下LZ方差估计量的相合性(Lemma S5.5)。
真实例子与应用¶
本文包含模拟实验(Section 6),无真实数据例子。
-
完全随机实验模拟(Section 6.1):\(n=1000\),\(X_i \sim N(0,1)\),\(P(Z_i=1)=0.5\),潜在结果生成:\(Y_i(1) = 3 + 2 X_i^2 + \varepsilon_i(1)\),\(Y_i(0) = 2 + 1 X_i^3 + \varepsilon_i(0)\)。模型错误设定(真实条件均值非线性)。比较三种回归:无协变量、Fisher加法、Lin全交互。结果验证了理论:随机设计下EHW覆盖接近95%;混合设计下EHW覆盖偏高(保守),Fisher约98.8%,Lin约98.7%;Lin调整在随机设计下EHW覆盖偏低(91.5%),修正后恢复(94.8%)。
-
聚类随机实验模拟(Section 6.2):\(M=160\)个簇,簇大小随机(均匀分布),\(X_{ij} \sim N(0,1)\),簇内相关结构。结果模式类似:混合设计下LZ标准误保守;随机设计下Lin调整的LZ标准误反保守,修正后恢复。
这些模拟旨在验证理论结论,特别是混合设计下稳健标准误的保守性以及Lin调整的修正必要性。
🔎 结论是否比证明窄¶
- Theorem 4.4 和 5.7 的结论(随机设计下Lin调整的EHW/LZ反保守)依赖于“协变量中心化”这一操作。作者在Remark 4.1中指出,两种构造修正方差的方法(增广估计方程 vs. 直接加修正项)渐近等价但有限样本不同。论文未证明有限样本下的具体差异,仅声称“asymptotically equivalent”。
- 对于聚类数据,Theorem 5.7 的修正方差估计量 \(\hat{V}_{\text{lz},l,\text{adj}}\) 是“novel contribution”,但证明依赖于 \(\Omega = o(M^{-2/3})\) 的假设(Assumption 5(g)),该假设排除了簇大小高度不平衡的情形。论文未讨论该假设违反时的后果。
- 在IV回归的混合设计结果(Theorem S1.3)中,目标参数 \(\beta_{iv}^m\) 是加权平均的CATE,但论文未给出该参数的因果解释的直观讨论,仅给出公式。
四、开放问题¶
-
非线性模型的混合设计扩展:论文的Z-估计框架适用于可微估计方程,但分位数回归等非光滑目标函数需要单独的渐近论证。作者在Section 7提到“quantile regression is nonsmooth, this extension requires separate asymptotic arguments”。扎根点:Section 7最后一段。
-
混合设计下伪真参数的因果解释:对于非线性模型(如logistic回归),混合设计下的伪真参数依赖于哪些回归元被条件化,其解释更困难。作者仅指出“requires further study”。扎根点:Section 7第二段。
-
有限样本下修正方差估计量的行为:Theorem 4.4和5.7的修正方差估计量(增广估计方程 vs. 直接加项)在有限样本下可能不同,论文未比较。扎根点:Remark 4.1和Remark 5.2。
-
聚类数据中簇大小高度不平衡时的理论:Assumption 5(g)要求 \(\Omega = o(M^{-2/3})\),排除了极端不平衡情形。实际应用中簇大小可能差异很大,此时LZ标准误的性质未知。扎根点:Assumption 5(g)及其在证明中的使用(Lemma S5.5)。
Maintained by 陈星宇 · Homepage · Source on GitHub