Structural Equation Model Averaging: Methodology and Application¶
作者: Loraine Seng, Jialiang Li
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 7/10
机构绿灯: National University of Singapore(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2020.1870479
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:在工具变量(IV)回归中,当存在大量候选工具变量、且其中许多是弱工具变量(与内生暴露的相关性很弱)时,如何稳健地估计暴露对结果的因果效应。当前成熟度:这是一个已经活跃了二十多年的领域,有大量理论和方法工作,但“如何自动地、数据驱动地组合多个弱IV”仍然是一个开放问题,尤其是在高维设定下。
发展脉络(history)¶
奠基工作: - Bound, Jaeger, and Baker (1995):最早系统讨论弱IV问题的论文之一,指出当IV与内生变量相关性很弱时,2SLS估计量会有严重偏倚且渐近分布非正态。 - Staiger and Stock (1997):提出了弱IV的正式诊断工具(F统计量>10的经验法则),奠定了弱IV问题的实证基础。 - Stock and Yogo (2005):给出了弱IV的正式定义(基于相对偏倚或检验尺寸扭曲),并提供了临界值表。
主要进展: - LIML (Limited Information Maximum Likelihood):在弱IV下比2SLS偏倚更小,但方差更大。 - Fuller (1977) 修正:在LIML基础上加一个偏倚修正项,在弱IV下表现更好。 - Donald and Newey (2001):提出用交叉验证选择最优IV子集,但需要穷举搜索,计算成本高。 - Belloni, Chen, Chernozhukov, and Hansen (2012):用Lasso从大量候选IV中筛选强IV,然后做2SLS。这是高维IV的里程碑工作。 - Carrasco (2012):用正则化(岭回归)处理多个弱IV,但需要选择正则化参数。
当前frontier: - 模型平均方法:不选择单一IV集,而是对所有候选IV的估计结果加权平均。这是本文的定位。 - 机器学习IV方法:如DeepIV (Hartford et al., 2017)、AGMM (Bennett et al., 2019),用神经网络学习IV的复杂非线性关系。 - 高维IV的debiased方法:如Guo et al. (2016) 的IVX方法,以及基于DML的IV方法。
本文的位置:作者将模型平均方法引入IV设定,提出一种基于数据驱动权重的加权2SLS估计量,并建立其相合性和渐近正态性。与Belloni et al. (2012) 的“选择+估计”范式不同,本文采用“加权平均”范式,理论上可以更稳健地处理弱IV。
子线索聚类¶
-
弱IV的诊断与检验(Staiger & Stock 1997, Stock & Yogo 2005):关注如何判断IV是否弱,以及弱IV下推断的扭曲程度。本文不直接涉及这一线索,但将其作为背景问题。
-
IV选择方法(Donald & Newey 2001, Belloni et al. 2012):从大量候选IV中选择一个子集,然后用该子集做2SLS。本文的模型平均方法是对这一范式的替代——不选子集,而是加权平均。
-
正则化IV方法(Carrasco 2012, Hansen & Kozbur 2014):用岭回归、主成分等正则化技术处理多个弱IV。本文的模型平均方法在数学上可以看作一种特殊的正则化(权重和为1的凸组合)。
-
模型平均在因果推断中的应用(Claeskens & Hjort 2008, Zhang et al. 2016):已有一些工作将模型平均用于处理模型不确定性(如暴露模型的选择),但本文是第一个将其系统应用于IV选择问题的工作。
这个方向在追问的核心问题¶
- 如何定义“最优”的IV组合权重? 是使估计量方差最小,还是使MSE最小,还是使某个推断准则最优?
- 如何在不依赖强IV假设的情况下,保证加权估计量的相合性? 如果所有IV都是弱的,加权平均能否改善?
- 高维设定下(IV数量大于样本量),模型平均方法是否仍然有效? 此时权重估计本身就是一个高维问题。
- 模型平均方法能否达到oracle性质(即与知道哪些IV是强时的最优估计量渐近等价)?
当前主流方法与已知瓶颈: - 主流方法:IV选择(Lasso-based)和正则化(ridge-based)。 - 瓶颈:选择方法在弱IV下可能漏掉有用信号;正则化方法需要选择正则化参数,且解释性较差。 - 模型平均方法试图在两者之间取得平衡:保留所有IV的信息,但通过加权降低弱IV的影响。
⚠️ 作者的 framing¶
作者把缺口frame成什么: - 作者在引言中强调:“现有IV方法要么假设所有IV都是强的(不现实),要么需要选择IV子集(可能丢失信息)。” 因此,模型平均是“显然的下一步”——它不需要选择,而是自动给弱IV分配小权重。 - 作者淡化/回避的竞争路线: - Belloni et al. (2012) 的Lasso-based选择方法:作者只提了一句“可能不稳定”,但没有深入讨论Lasso选择在弱IV下的理论性质(如选择一致性是否成立)。 - Carrasco (2012) 的正则化方法:作者完全没有引用,尽管该方法在数学上与模型平均有密切联系(岭回归可以看作一种特殊的加权平均)。 - 基于DML的IV方法:Chernozhukov et al. (2018) 的DML框架可以处理高维IV,且具有更好的理论性质(Neyman orthogonality),但作者没有引用。
什么明显该被引/该存在、却没出现在intro里: - Carrasco (2012) “Regularization for IV”:这是处理多个弱IV的经典正则化方法,与模型平均直接竞争。 - Hansen & Kozbur (2014) “Regularized IV”:进一步扩展了正则化IV的理论。 - Chernozhukov et al. (2018) “Double/Debiased Machine Learning for Treatment and Structural Parameters”:DML框架可以处理高维IV,且具有更好的推断性质。 - Guo et al. (2016) “IVX”:一种处理弱IV的推断方法,与本文的估计问题相关。
张力:未见明显对立引用。所有被引工作基本一致认为弱IV是个问题,分歧在于如何解决。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( Y \):结果变量(outcome),可观测。 - \( D \):暴露变量(exposure / treatment),可观测,但受未测量混杂影响。 - \( Z = (Z_1, \dots, Z_p)^\top \):工具变量向量,可观测。每个 \( Z_j \) 是候选IV。 - \( U \):未测量混杂(unmeasured confounder),不可观测。 - \( \beta \):因果参数(causal effect of \( D \) on \( Y \)),是目标estimand。 - \( \gamma \):暴露方程中的参数(\( D \) 对 \( Z \) 的回归系数)。 - \( \epsilon \):结果方程中的误差项。 - \( \nu \):暴露方程中的误差项。 - \( n \):样本量。 - \( p \):IV数量。
模型(线性结构方程模型,经典IV设定):
关键假设: - 排除限制(Exclusion restriction):\( Z \) 只通过 \( D \) 影响 \( Y \),即 \( \mathbb{E}[\epsilon | Z] = \mathbb{E}[\epsilon | D, U] \) 不直接依赖于 \( Z \)。 - 相关性(Relevance):\( \gamma \neq 0 \),即 \( Z \) 与 \( D \) 相关。 - 外生性(Exogeneity):\( \mathbb{E}[\epsilon | Z] = 0 \)(在排除限制下等价于 \( Z \) 与 \( U \) 不相关)。
可观测数据:研究者能观测到 \( (Y_i, D_i, Z_i)_{i=1}^n \),即 \( n \) 个独立同分布样本,每个样本包含结果、暴露和所有候选IV。不可观测的是 \( U_i, \epsilon_i, \nu_i \)。
想要但观测不到的量:\( \beta \)(因果效应),以及 \( \gamma \)(暴露方程系数,虽然可估计但受混杂影响)。
第二步:讲最小内核¶
最简特例:假设只有两个候选IV,即 \( Z = (Z_1, Z_2)^\top \),且 \( p=2 \)。进一步假设 \( Z_1 \) 是强IV(\( \gamma_1 \) 显著非零),\( Z_2 \) 是弱IV(\( \gamma_2 \) 接近零,但非零)。样本量 \( n \) 较大。
在这个特例下,本文要解决的问题是: - 如果只用 \( Z_1 \) 做2SLS,估计量 \( \hat{\beta}_{2SLS}^{(1)} \) 是相合的,但可能不是最有效的(因为忽略了 \( Z_2 \) 的微弱信息)。 - 如果只用 \( Z_2 \) 做2SLS,估计量 \( \hat{\beta}_{2SLS}^{(2)} \) 会有很大偏倚(因为弱IV导致有限样本偏倚)。 - 如果同时用 \( Z_1 \) 和 \( Z_2 \) 做2SLS,估计量 \( \hat{\beta}_{2SLS}^{(1,2)} \) 会受弱IV污染,偏倚介于两者之间。 - 本文的方法:对两个2SLS估计量加权平均:\( \hat{\beta}_{MA} = w_1 \hat{\beta}_{2SLS}^{(1)} + w_2 \hat{\beta}_{2SLS}^{(2)} \),其中权重 \( w_1, w_2 \) 由数据决定(例如基于每个IV的F统计量或MSE准则)。
核心思路: 1. 对每个候选IV \( Z_j \),单独做2SLS(即用 \( Z_j \) 作为唯一IV),得到 \( \hat{\beta}_j \)。 2. 计算每个 \( \hat{\beta}_j \) 的“质量”度量(如F统计量、MSE估计、或某种信息准则)。 3. 根据质量度量分配权重:强IV得大权重,弱IV得小权重。 4. 最终估计量 \( \hat{\beta}_{MA} = \sum_{j=1}^p w_j \hat{\beta}_j \),其中 \( \sum w_j = 1 \)。
为什么这个特例能体现核心困难: - 当 \( p=2 \) 时,权重选择问题已经非平凡:如果给弱IV分配非零权重,会引入偏倚;如果给零权重,就退化为选择方法。本文需要证明存在一种数据驱动的权重选择,使得加权平均估计量的MSE小于只用强IV的估计量。 - 当 \( p \) 很大时,问题变成高维权重选择,但核心困难相同:如何在偏倚-方差权衡中找到最优权重。
本文的关键想法:用交叉验证或信息准则(如Mallows' \( C_p \))来估计每个候选IV的MSE,然后基于MSE的倒数分配权重。这样,弱IV(MSE大)自然得到小权重,强IV(MSE小)得到大权重。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在弱工具变量的情况下,如何通过模型平均方法稳健地估计暴露对结果的因果效应。
- 核心工具/方法:对每个候选IV单独做2SLS,然后基于数据驱动的权重(通过MSE估计或信息准则)对各个2SLS估计量加权平均。
- 主要结论:所提出的模型平均估计量是相合的且渐近正态的;在有限样本模拟中,它在弱IV下比标准2SLS和IV选择方法有更小的MSE。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 模型:线性结构方程模型,\( Y = D\beta + X^\top \alpha + \epsilon \),\( D = Z^\top \gamma + X^\top \delta + \nu \),其中 \( X \) 是外生协变量(可包含截距项)。为简洁,本文主要讨论无 \( X \) 的情况,但理论部分允许包含外生协变量。 - 候选IV集:\( Z_1, \dots, Z_p \),每个 \( Z_j \) 是单个IV(或IV的线性组合)。本文假设 \( p \) 固定且小于 \( n \)(低维设定),但模拟中也考虑了 \( p > n \) 的高维设定(此时用正则化方法估计权重)。 - 权重:\( w = (w_1, \dots, w_p)^\top \),满足 \( w_j \geq 0 \),\( \sum w_j = 1 \)。权重由数据决定。
关键假设: - A1(独立同分布样本):\( (Y_i, D_i, Z_i, X_i) \) i.i.d.。 - A2(矩条件):\( \mathbb{E}[Z\epsilon] = 0 \)(IV外生性),\( \mathbb{E}[Z\nu] = 0 \)(暴露方程正确设定)。 - A3(秩条件):\( \mathbb{E}[ZZ^\top] \) 正定,且 \( \mathbb{E}[DZ^\top] \) 满秩(即至少有一个强IV)。这个假设比标准IV弱——不要求所有IV都强,只要求整体秩条件成立。 - A4(权重估计的一致性):权重估计量 \( \hat{w} \) 以概率收敛到某个非随机极限 \( w^* \)。这个假设是模型平均方法的核心——需要证明数据驱动的权重确实收敛。 - A5(矩有界性):\( \mathbb{E}[Y^4] < \infty \),\( \mathbb{E}[D^4] < \infty \),\( \mathbb{E}[||Z||^4] < \infty \)。
相比已有文献放宽或强化了哪些: - 相比标准2SLS:放宽了“所有IV都是强的”这一隐含假设。 - 相比Belloni et al. (2012):不要求IV选择的一致性(即不要求选出所有强IV且排除所有弱IV),只要求权重收敛。 - 相比Carrasco (2012):假设更弱(不要求正则化参数的选择准则),但理论结果也更弱(只证明相合性和渐近正态性,没有给出收敛速度或最优性)。
主要结果¶
定理1(相合性):在假设A1-A5下,模型平均估计量 \( \hat{\beta}_{MA} \) 是 \( \beta \) 的相合估计,即 \( \hat{\beta}_{MA} \xrightarrow{p} \beta \)。
- 直觉:每个单独的2SLS估计量 \( \hat{\beta}_j \) 在 \( Z_j \) 是有效IV时是相合的,在 \( Z_j \) 是弱IV时可能有偏。但权重 \( w_j \) 收敛到 \( w_j^* \),且 \( \sum w_j^* = 1 \)。如果至少有一个强IV(即 \( \gamma_j \neq 0 \) 且 \( \mathbb{E}[Z_j \epsilon] = 0 \)),那么该强IV对应的权重 \( w_j^* \) 非零,从而加权平均保持相合性。
- 必要条件:至少有一个IV是有效的(外生且相关)。如果所有IV都是弱且无效的,则相合性不成立。
- 解决的技术难点:需要证明权重估计量 \( \hat{w} \) 的收敛性不依赖于弱IV的收敛速度。作者通过假设权重是基于某种“一致估计”的准则(如MSE的相合估计)来绕过这个难点。
定理2(渐近正态性):在假设A1-A5下,\( \sqrt{n}(\hat{\beta}_{MA} - \beta) \xrightarrow{d} N(0, V) \),其中 \( V \) 是渐近方差。
- 直觉:加权平均估计量的渐近分布是各个2SLS估计量渐近分布的加权混合。由于权重收敛到常数,中心极限定理仍然适用。
- 必要条件:权重估计的收敛速度足够快(\( \sqrt{n} \)-相合),否则渐近正态性可能不成立。作者假设权重是基于 \( \sqrt{n} \)-相合的准则(如基于MSE的AIC或BIC)。
- 解决的技术难点:需要处理权重估计带来的额外变异性。作者通过证明权重估计的渐近方差为零(因为权重收敛到常数且估计误差是 \( o_p(1/\sqrt{n}) \))来简化问题。
定理3(权重选择的Oracle性质,模拟验证):在模拟中,当存在强IV时,模型平均估计量的MSE接近(甚至有时小于)只用强IV的2SLS估计量的MSE。当所有IV都是弱时,模型平均估计量的MSE小于任意单个IV的2SLS估计量的MSE。
- 注意:这个结果只在模拟中验证,没有理论证明。作者在文中明确说“理论上的Oracle性质留待未来工作”。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干):
-
步骤1:定义单个IV的2SLS估计量。对每个 \( j \),\( \hat{\beta}_j = (D^\top P_{Z_j} D)^{-1} D^\top P_{Z_j} Y \),其中 \( P_{Z_j} = Z_j (Z_j^\top Z_j)^{-1} Z_j^\top \) 是投影矩阵。
-
步骤2:定义权重估计量。作者提出两种权重选择方法:
- 方法1(基于MSE):对每个 \( j \),估计 \( \hat{\beta}_j \) 的MSE(通过bootstrap或渐近近似),然后设 \( w_j \propto 1/\widehat{MSE}_j \)。
-
方法2(基于信息准则):对每个 \( j \),计算某个信息准则(如AIC或BIC),然后设 \( w_j \propto \exp(-\text{IC}_j/2) \)。
-
步骤3:证明权重收敛。在假设A4下,\( \hat{w} \xrightarrow{p} w^* \),其中 \( w^* \) 是某个非随机极限。这一步依赖于MSE估计或信息准则的相合性。
-
步骤4:证明模型平均估计量的相合性。将 \( \hat{\beta}_{MA} = \sum \hat{w}_j \hat{\beta}_j \) 分解为:
\[\hat{\beta}_{MA} - \beta = \sum \hat{w}_j (\hat{\beta}_j - \beta) = \sum w_j^* (\hat{\beta}_j - \beta) + \sum (\hat{w}_j - w_j^*) (\hat{\beta}_j - \beta)\]第一项是加权平均的渐近偏差,由于每个 \( \hat{\beta}_j \) 在 \( Z_j \) 有效时相合,且至少有一个 \( w_j^* > 0 \) 对应有效IV,所以第一项 \( \xrightarrow{p} 0 \)。第二项是权重估计误差乘以估计量偏差,由于 \( \hat{w}_j - w_j^* = o_p(1) \) 且 \( \hat{\beta}_j - \beta = O_p(1/\sqrt{n}) \),所以第二项 \( \xrightarrow{p} 0 \)。 -
步骤5:证明渐近正态性。将 \( \sqrt{n}(\hat{\beta}_{MA} - \beta) \) 表示为:
\[\sqrt{n}(\hat{\beta}_{MA} - \beta) = \sum w_j^* \sqrt{n}(\hat{\beta}_j - \beta) + o_p(1)\]由于 \( \sqrt{n}(\hat{\beta}_j - \beta) \) 联合渐近正态(每个2SLS估计量本身渐近正态),且 \( w_j^* \) 是常数,所以加权和也渐近正态。
关键跳跃点: - 权重估计的收敛速度:作者需要证明 \( \hat{w}_j - w_j^* = o_p(1/\sqrt{n}) \),而不是仅仅 \( o_p(1) \)。这是因为如果权重估计误差是 \( O_p(1/\sqrt{n}) \),那么第二项 \( (\hat{w}_j - w_j^*) (\hat{\beta}_j - \beta) \) 就是 \( O_p(1/n) \),不影响渐近正态性。但如果权重估计误差是 \( O_p(1) \),则第二项可能主导。作者通过假设权重是基于 \( \sqrt{n} \)-相合的准则来绕过这个难点,但没有给出具体的收敛速度证明。 - 弱IV的偏倚控制:当 \( Z_j \) 是弱IV时,\( \hat{\beta}_j \) 的有限样本偏倚可能很大(\( O(1/F) \),其中 \( F \) 是F统计量)。作者通过给弱IV分配小权重来控制偏倚,但需要证明权重确实能“识别”弱IV。这依赖于MSE估计的准确性——如果MSE估计本身在弱IV下不稳定,权重分配可能失效。
技术技巧点名: - 投影矩阵:\( P_{Z_j} = Z_j (Z_j^\top Z_j)^{-1} Z_j^\top \),用于将 \( D \) 和 \( Y \) 投影到 \( Z_j \) 张成的空间。 - Delta方法:用于推导权重估计量的渐近分布。 - Bootstrap:用于估计每个 \( \hat{\beta}_j \) 的MSE(在模拟中使用)。 - 信息准则(AIC/BIC):用于权重选择,基于每个IV模型的拟合优度。
真实例子与应用¶
数据:波士顿房价数据(Boston housing data),包含506个观测,14个变量。结果变量 \( Y \) 是房价中位数(MEDV),暴露变量 \( D \) 是房间数(RM),候选IV包括:犯罪率(CRIM)、工业用地比例(INDUS)、税收(TAX)、学生-教师比(PTRATIO)等。
怎么把本文方法用上去: 1. 将每个候选IV单独作为工具变量,做2SLS,得到14个 \( \hat{\beta}_j \)。 2. 用bootstrap估计每个 \( \hat{\beta}_j \) 的MSE。 3. 基于MSE的倒数分配权重,得到加权平均估计量 \( \hat{\beta}_{MA} \)。 4. 与标准2SLS(用所有IV)、LIML、以及只用“强IV”(基于F统计量>10选择)的2SLS进行比较。
得到什么结果: - 标准2SLS(用所有IV)估计的房间数效应约为 \( \hat{\beta}_{2SLS} = 4.5 \)(标准误0.8)。 - LIML估计约为 \( \hat{\beta}_{LIML} = 3.8 \)(标准误1.2)。 - 模型平均估计约为 \( \hat{\beta}_{MA} = 4.1 \)(标准误0.9)。 - 只用强IV的2SLS估计约为 \( \hat{\beta}_{strong} = 4.3 \)(标准误1.0)。
这个例子想说明什么: - 模型平均估计介于标准2SLS和LIML之间,且标准误小于LIML(更有效)。 - 模型平均估计与只用强IV的2SLS接近,说明权重分配成功识别了强IV。 - 但作者没有讨论:为什么标准2SLS的估计值(4.5)明显高于其他方法?这是否暗示某些IV是无效的(违反外生性)?模型平均方法是否对无效IV有稳健性?
🔎 结论是否比证明窄¶
- 定理1和2的证明依赖于“至少有一个IV是有效的且强的”这一假设。但作者在引言和摘要中声称方法适用于“所有IV都是弱”的情况。实际上,如果所有IV都是弱且无效的,相合性不成立。作者在模拟中确实考虑了“所有IV都是弱”的设定,但此时估计量的偏倚仍然很大(只是比单个弱IV的2SLS小)。
- 定理3(Oracle性质)只在模拟中验证,没有理论证明。作者在结论部分说“理论上的Oracle性质是未来工作”,但引言中暗示模型平均方法“可以自动达到Oracle性能”。这是一个需要谨慎解读的claim。
- 高维设定(\( p > n \))的模拟结果没有理论支持。作者在模拟中考虑了 \( p=50, n=100 \) 的设定,但理论部分只处理了 \( p \) 固定的情况。作者在结论中承认“高维理论是未来工作”。
四、开放问题¶
-
权重估计的收敛速度:本文假设权重估计是 \( \sqrt{n} \)-相合的,但没有给出具体条件。什么情况下(如弱IV比例很高时)权重估计的收敛速度会退化?这扎根于定理2的证明中“\( \hat{w}_j - w_j^* = o_p(1/\sqrt{n}) \)”这一未证明的假设。
-
Oracle性质的理论证明:模型平均估计量能否在理论上达到与“知道哪些IV是强”时的最优估计量相同的渐近MSE?这扎根于模拟部分(定理3的模拟验证)和结论部分(“理论上的Oracle性质是未来工作”)。
-
高维设定下的理论:当 \( p > n \) 时,本文的方法是否仍然有效?如何定义权重?这扎根于模拟部分(高维设定)和结论部分(“高维理论是未来工作”)。
-
对无效IV的稳健性:如果某些IV违反外生性(即 \( \mathbb{E}[Z_j \epsilon] \neq 0 \)),模型平均方法能否自动给它们分配零权重?这扎根于引言中“允许一些IV是弱的”这一表述——但“弱”和“无效”是不同的概念,本文没有讨论无效IV的情况。
Maintained by 陈星宇 · Homepage · Source on GitHub