跳转至

Identification, Estimation and Inference Based on Structural Error Projection

作者: Chaohua Dong, Jiti Gao, Oliver Linton, Bin Peng
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2607.05699


一、领域脉络与小综述

这个方向是什么

本文处理的根本问题是:在回归模型中,当回归元与误差项相关(内生性)时,如何在不依赖外部工具变量(IV)的情况下识别和估计结构参数。传统IV方法需要找到与内生回归元相关、与误差无关的外部变量,这在许多实证场景中难以满足。本文提出的“半参数投影(SP)方法”通过将结构误差对回归元的条件均值函数进行投影展开,构造出“内部工具变量”(CIV),从而替代外部IV。该方向当前成熟度较高,已有多种基于数据生成过程特征(如异方差、非高斯性)的内部IV方法,但本文提供了一种新的、基于条件均值投影的识别来源。

发展脉络(history)

  • 奠基工作:传统IV方法(如2SLS)依赖外部工具变量,其有效性假设(相关性、外生性)在实证中常受质疑。早期综述如 Stock, Wright & Yogo (2002) 和 Stock & Yogo (2005) 系统总结了弱IV问题。
  • 主要进展:为摆脱对外部IV的依赖,学者们发展了基于数据生成过程特征的内部IV方法:
  • 异方差识别:Rigobon (2003) 和 Lewbel (2012) 证明,当结构冲击的方差在不同体制下变化时,可产生额外矩条件识别结构参数。Sentana & Fiorentini (2001) 在条件异方差因子模型中也有类似思路。
  • 非高斯性识别:Lewis (2025) 综述了宏观计量中利用高阶矩(如独立成分分析)进行识别的方法。
  • 控制函数方法:Newey, Powell & Vella (1999)、Newey & Powell (2003)、Blundell & Powell (2004) 等通过引入辅助IV或结构限制处理半参数模型中的内生性。
  • 当前frontier:本文作者指出,上述方法分别依赖异方差、非高斯性或外部IV,而本文提出的SP方法“follows a similar philosophy but relies on a different source of identification”——即通过条件均值的投影分解构造IV,不依赖方差变化或矩条件。
  • 本文的位置:作者将本文定位为一种统一框架,适用于线性、非线性、非参数和半参数模型,且计算简单(闭式IV表达式)。与异方差方法相比,本文的识别条件(m(x) ∈ S)更直接地依赖于对混淆机制的结构性假设。

子线索聚类

  1. 异方差/非高斯性内部IV:Rigobon (2003), Lewbel (2012), Lewis (2025)。这些方法利用二阶矩或高阶矩的变化产生识别。
  2. 控制函数方法:Newey, Powell & Vella (1999), Newey & Powell (2003), Blundell & Powell (2004), Imbens & Newey (2009), Wooldridge (2015)。这些方法通过引入辅助方程或结构限制处理内生性。
  3. 本文的SP方法:通过将结构误差投影到回归元生成的σ-域,分解出条件期望部分,构造内部IV。该方法不依赖外部IV或矩变化,而是依赖对混淆空间S的事先指定或LASSO选择。

这个方向在追问的核心问题

  • 核心问题1:如何在没有外部IV时识别结构参数?现有答案包括异方差、非高斯性、控制函数,本文给出投影分解。
  • 核心问题2:识别条件是否可检验?本文提出Hausman型检验(Theorem 3.2)检测弱内生性。
  • 核心问题3:方法对弱内生性是否稳健?本文第4节专门处理弱内生性,证明SP估计量仍一致(Theorem 4.1)。
  • 已知瓶颈:异方差方法要求方差变化可观测;非高斯性方法要求分布假设;控制函数方法需要外部IV或可分离性。本文的瓶颈在于需要事先指定或选择子空间S,且当m(x)包含线性成分时识别失败(如联合高斯情形,作者明确承认“under joint Gaussianity, the endogeneity will be linear and our identification strategy fails as well”)。

⚠️ 作者的framing

  • 作者把缺口frame成什么:作者将现有内部IV方法(异方差、非高斯性)描述为“exploit variation in second moments”或“non-Gaussianity”,而本文“relies on a different source of identification”——即条件均值的投影分解。作者强调SP方法“offers a closed-form expression for an IV function”且“invariant to the degree of endogeneity”,从而将自己定位为更简单、更统一的替代方案。
  • 哪些竞争路线被淡化或回避:作者在引言中仅用一段话提及异方差和非高斯性方法,未详细比较其与SP方法的相对优劣(例如,异方差方法在哪些场景下可能更优?)。此外,对控制函数方法的讨论也仅限于“address endogeneity by introducing auxiliary instruments or structural restrictions”,未深入比较两者在识别条件上的差异。
  • 什么明显该被引/该存在、却没出现在intro里:论文引用了大量系列估计文献(Andrews, Newey, Chen等),但未提及近期关于“内部IV”的另一种重要方法——基于“近端因果推断”(Proximal Causal Inference)的文献(如Tchetgen Tchetgen et al., 2020; Miao et al., 2018),该方法也通过构造代理变量处理未观测混淆。这可能是因为本文更偏向计量经济学传统,而近端因果推断更偏向生物统计和因果推断。研究者可自行判断是否构成gap。

张力

未见明显对立引用。各方法(异方差、非高斯性、控制函数、SP)在不同假设下成立,彼此不直接矛盾。但作者指出,在联合高斯性下SP方法失效,而异方差方法可能仍有效——这是一个值得注意的边界条件。

二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

  • 符号
  • \(y\):响应变量(标量)。
  • \(x\)\(d\)维回归元向量(可观测),可能存在内生性。
  • \(\beta_0\)\(d\)维结构参数(待估)。
  • \(\varepsilon\):结构误差,满足 \(E[\varepsilon]=0\)\(E[x\varepsilon]\neq 0\)(内生性)。
  • \(m(x) = E[\varepsilon | x]\):结构误差的条件均值(未知函数)。
  • \(e = \varepsilon - m(x)\):投影残差,满足 \(E[e|x]=0\)
  • \(S\)\(L_2\)(平方可积函数空间)的一个真闭子空间,假设 \(m(\cdot) \in S\)
  • \(P_S\):到子空间 \(S\) 的正交投影算子。
  • \(M_S = I - P_S\):到正交补 \(S^\perp\) 的投影算子。
  • \(z = M_S(x) = x - P_S x\):构造的内部工具变量(CIV)。
  • \(\{\psi_j(x), j\geq 1\}\)\(S\) 的一组标准正交基,满足 \(E[\psi_j]=0\)\(E[\psi_j\psi_\ell]=\delta_{j\ell}\)
  • \(\Sigma_x = E[zz^\top] = E[xx^\top] - \sum_{j=1}^\infty E[x\psi_j]E[\psi_j x^\top]\):关键识别矩阵。
  • \(k\):截断参数(用于有限维近似)。
  • \(V_k(x) = (\psi_1(x), \ldots, \psi_k(x))^\top\)\(\gamma = (\gamma_1,\ldots,\gamma_k)^\top\) 为展开系数。
  • \(n\):样本量。

  • 模型: 线性结构模型:\(y = x^\top \beta_0 + \varepsilon\),其中 \(E[\varepsilon]=0\)\(E[x\varepsilon]\neq 0\)。将 \(\varepsilon\) 分解为 \(\varepsilon = m(x) + e\),其中 \(m(x)=E[\varepsilon|x]\)\(E[e|x]=0\)。于是模型等价于:

    \[y = x^\top \beta_0 + m(x) + e.\]
    假设 \(m(\cdot) \in S\),即 \(m\) 属于某个已知(或可估计)的闭子空间。

  • 可观测数据: 研究者可观测到 \(\{(y_i, x_i), i=1,\ldots,n\}\),即 \(y\)\(x\) 的独立同分布样本。不可观测的量包括:结构误差 \(\varepsilon_i\)、条件均值 \(m(x_i)\)、投影残差 \(e_i\)。识别依赖于对 \(S\) 的事先指定或通过LASSO从数据中选择。

第二步:最小内核

最简特例:考虑一维线性模型 \(y = x\beta_0 + \varepsilon\),其中 \(x\) 是标量,且假设 \(m(x) = E[\varepsilon|x]\) 属于一个有限维子空间 \(S\),例如 \(S = \text{span}\{\psi_1(x), \ldots, \psi_k(x)\}\),其中 \(\{\psi_j\}\) 是已知的正交基函数(如三角函数)。此时,\(m(x) = \sum_{j=1}^k \gamma_j \psi_j(x)\),模型变为:

\[y = x\beta_0 + \sum_{j=1}^k \gamma_j \psi_j(x) + e.\]
这是一个线性回归模型,但 \(x\)\(\psi_j(x)\) 可能相关。关键想法:将 \(x\)\(\{\psi_j\}\) 做投影,得到残差 \(z = x - P_S x = x - \sum_{j=1}^k E[x\psi_j] \psi_j(x)\)。由于 \(z\) 与每个 \(\psi_j\) 正交,且 \(m(x) \in S\),故 \(E[z m(x)] = 0\)。同时,\(E[z e] = 0\)(因为 \(E[e|x]=0\))。因此 \(z\) 是有效的工具变量。识别条件为 \(\Sigma_x = E[z^2] > 0\),即 \(x\) 不能被 \(\{\psi_j\}\) 完全线性表示。此时,\(\beta_0 = E[z y] / E[z^2]\),可通过样本矩估计。

这个最小内核揭示了论文的核心数学操作:通过将内生部分 \(m(x)\) 投影到已知子空间 \(S\),构造出与 \(m(x)\) 正交的剩余部分 \(z\) 作为IV。一般情形(无穷维 \(S\)、非线性模型)只是这个特例的推广,需要处理截断误差和更复杂的估计。

三、这篇论文做了什么

三句话

  1. 研究问题:提出一种半参数投影(SP)方法,通过将结构误差的条件均值函数投影到回归元生成的子空间,构造内部工具变量(CIV),从而在无需外部IV的情况下识别和估计线性、非线性、非参数和半参数回归模型中的结构参数。
  2. 核心工具/方法:利用正交投影分解 \(y = x^\top\beta_0 + m(x) + e\),将 \(m(x)\) 用正交基函数展开,构造 \(z = x - P_S x\) 作为IV,通过2SLS或NLS估计参数;同时提出LASSO方法从数据中选择投影子空间 \(S\)
  3. 主要结论:建立了SP估计量的识别条件(\(\Sigma_x > 0\))和渐近正态性(Theorem 3.1),证明其对弱内生性具有不变性(Theorem 4.1),LASSO选择方法能一致地恢复子空间 \(S\)(Theorem 5.1),并推广到非线性模型(Theorem A.1, A.2)。真实数据例子(教育回报)显示SP估计与合理选择的2SLS结果接近,且模型拟合更优。

关键设定与假设

  • Assumption 2.1(识别条件):
  • (i) \(\lambda^\top x \in L_2\) 对任意 \(\lambda\)(基本矩条件)。
  • (ii) \(E[x m(x)] \neq 0\)\(E[m(x)]=0\)(确认内生性存在)。
  • (iii) 存在真闭子空间 \(S \subsetneq L_2\) 使得 \(m(x) \in S\)\(\lambda^\top x \notin S\) 对任意 \(\lambda \neq 0\)(关键:线性部分与混淆部分分离)。该假设保证了 \(\Sigma_x > 0\)(Lemma 2.1)。
  • Assumption 3.1(估计理论):
  • (i) i.i.d. 样本,条件方差有限。
  • (ii) 基函数四阶矩一致有界。
  • (iii) \(m(\cdot)\)\(s \geq d\) 阶连续导数(光滑性)。
  • (iv) 截断参数 \(k\) 满足 \(k^2/n = o(1)\)\(k^{-2s/d} n = o(1)\)(控制截断误差和维数)。
  • 相比已有文献:本文的假设比传统IV方法更弱(不需要外部IV),但比异方差方法更强(需要指定子空间 \(S\))。与系列估计文献相比,本文的假设标准(如光滑性、基函数矩条件)类似。

主要结果

  • Theorem 3.1(线性模型SP估计量的渐近性质):
  • (i) 渐近无偏。
  • (ii) \(\sqrt{n} (\hat{\beta}_{SP} - \beta_0) \xrightarrow{d} N(0, \Sigma_x^{-1} \sigma_e^2)\),其中 \(\Sigma_x = E[zz^\top]\)\(\sigma_e^2 = E[e^2]\)。收敛速度为 \(\sqrt{n}\),与无内生性时的OLS相同,但方差更大(因为 \(\Sigma_x \leq E[xx^\top]\))。
  • (iii) 方差可被一致估计。
  • Theorem 3.2 & 3.3(弱内生性检验):
  • 提出Hausman型统计量 \(T_n\),在原假设 \(H_0: m(x)=0\) 下渐近正态;在局部备择 \(H_1: m_n(x) = a_n m(x)\) 下,若 \(a_n^2 n k_{\max}^{-1/2} \to \infty\),则检验势趋于1。该速率接近最优(\(a_n = n^{-1/2}\) 在参数设定下不可达)。
  • Theorem 4.1(弱内生性下的SP估计):
  • \(m_n(x) = a_n m(x)\)\(a_n \to 0\) 时,SP估计量仍 \(\sqrt{n}\)-一致且渐近正态,只要 \(a_n n k^{-2s/d} \to 0\)。表明SP方法对弱内生性具有不变性。
  • Theorem 5.1(LASSO选择的一致性):
  • 在稀疏性假设下,两步自适应LASSO能一致地选择正确的基函数子集(即 \(Pr(\hat{S}^{(k)} = S^{(k)}) \to 1\)),且最终SP估计量 \(\hat{\beta}^\dagger\) 渐近正态。
  • Theorem A.1 & A.2(非线性模型):
  • 将SP方法推广到参数非线性模型 \(y = g(x, \theta_0) + \varepsilon\),证明NLS型估计量的相合性和渐近正态性,渐近方差为 \(\sigma_e^2 \Sigma_g^{-1}\),其中 \(\Sigma_g = E[g_1 g_1^\top] - \sum_j E[g_1 \psi_j] E[\psi_j g_1^\top]\)

证明路线与技术技巧

整体路线(以线性模型Theorem 3.1为例): 1. 模型变换:将 \(y = x^\top\beta_0 + m(x) + e\) 用基函数展开为 \(y = X\beta_0 + V\gamma + \delta + e\),其中 \(\delta\) 为截断误差。 2. 投影消去:左乘 \(M_v = I - V(V^\top V)^{-1}V^\top\),得到 \(M_v y = M_v X\beta_0 + M_v \delta + M_v e\)。由于 \(M_v V = 0\)\(\gamma\) 被消去。 3. 估计\(\hat{\beta}_{SP} = (X^\top M_v X)^{-1} X^\top M_v y\)。 4. 渐近分析: - 证明 \(\frac{1}{n} X^\top M_v X \xrightarrow{P} \Sigma_x\)(利用基函数正交性和大数定律)。 - 证明 \(\frac{1}{\sqrt{n}} X^\top M_v e \xrightarrow{d} N(0, \Sigma_x \sigma_e^2)\)(利用鞅差CLT,因为 \(e_i\) 是鞅差序列)。 - 证明 \(\frac{1}{\sqrt{n}} X^\top M_v \delta = o_P(1)\)(利用截断误差的 \(L_2\) 范数界和光滑性假设)。 5. 方差估计:证明 \(\frac{1}{n} X^\top M_v \hat{\Omega} M_v X \xrightarrow{P} \Sigma_x \sigma_e^2\),其中 \(\hat{\Omega}\) 基于残差 \(\hat{e}_i\)

关键跳跃点: - 识别条件 \(\Sigma_x > 0\) 的证明(Lemma 2.1):利用 \(m(x) \in S\)\(\lambda^\top x \notin S\),通过正交分解得到 \(\Sigma_x = E[M_S(x) M_S(x)^\top] > 0\)。这是整个方法的基石。 - 截断误差处理:需要控制 \(\frac{1}{\sqrt{n}} X^\top M_v \delta\) 的阶。作者利用光滑性假设 \(m \in C^s\) 得到 \(E[\delta_k^2] = O(k^{-2s/d})\),结合 \(k^{-2s/d} n = o(1)\) 证明其为 \(o_P(1)\)。 - LASSO选择的一致性(Theorem 5.1):证明分四步:(i) 建立限制特征值条件(由于基函数正交性自动满足);(ii) 证明初始LASSO估计的收敛速率;(iii) 通过自适应权重证明符号一致性;(iv) 证明最终SP估计量的渐近正态性。关键技巧是利用基函数的正交性简化协方差矩阵结构。

技术技巧点名: - 正交基展开与投影:核心工具,将无限维问题转化为有限维近似。 - 系列估计(sieve estimation):用截断基函数逼近 \(m(x)\),标准技巧。 - LASSO与自适应LASSO:用于变量选择,证明中用到限制特征值条件和Nagaev大偏差不等式。 - 鞅差CLT:用于证明渐近正态性,因为 \(e_i\) 是鞅差序列。 - Hausman型检验:构造非参数统计量 \(T_n\),利用U-统计量渐近理论证明其极限分布。

真实例子与应用

Example 5.1:教育回报(NLSY79数据) - 数据\(n=2639\),变量包括 log(wage) (y)、教育年限 (x, 内生)、父亲教育年限 (z1)、是否靠近四年制大学 (z2) 等5个外部IV。 - 方法应用: - 将 \(x\) 归一化到 \([0, \pi]\),使用三角函数基 \(\{\phi_j(x) = \sqrt{2/\pi} \cos(jx)\}\)。 - 通过LASSO选择基函数:\(\phi_2, \phi_3, \phi_8\)(即 \(\cos(2x), \cos(3x), \cos(8x)\))。 - 用SP方法估计 \(\tilde{\beta}_0\)(归一化后的系数),再转换回原始尺度 \(\beta_0\)。 - 结果: - SP估计:\(\hat{\beta}_0 = 0.0708\)(95% CI: 0.0705-0.0710),即多一年教育工资增加约7.1%。 - 与2SLS比较:使用单一IV (z1) 得0.0720,使用 (z1, z3) 得0.0742,使用 (z1, z2) 得0.0802,使用 (z2) 得0.1795(明显不合理)。SP结果与合理选择的2SLS接近。 - RMSE:SP为0.4131,低于所有2SLS(0.4154-0.7633),表明模型拟合更好。 - 该例子想说明:SP方法在无需外部IV的情况下得到与合理2SLS一致的估计,且模型拟合更优;同时,通过估计 \(\hat{m}(x)\) 可揭示内生性的非线性结构(图2显示 \(\hat{m}(x)\) 明显非线性)。

Appendix B.3.3:股票收益(市场模型) - 数据:Apple, Google, Meta, Microsoft 2012-2020日收益率,S&P500作为市场组合。 - 结果:SP方法估计的 \(\beta\)(市场贝塔)均大于1,且 \(E[\tilde{x} \hat{m}(\tilde{x})] < 0\),表明存在内生性(这些股票占S&P500权重较大)。SP的RMSE低于LS和2SLS。

🔎 结论是否比证明窄

  • 作者声称“SP方法适用于非线性、非参数和半参数模型”,但论文中仅对参数非线性模型(Appendix A.2)给出了完整的渐近理论(Theorem A.1, A.2),对非参数和半参数模型(Appendix A.3)仅“outlines the main ideas”,未给出严格定理。作者在结论中明确说“we wish to write up details for each of them separately”,因此这些扩展目前是conjecture而非proven。
  • 弱内生性下的不变性(Theorem 4.1)要求 \(a_n n k^{-2s/d} \to 0\),这依赖于光滑性假设。若 \(m(x)\) 不光滑,该条件可能不成立,但作者未讨论。
  • LASSO选择的一致性(Theorem 5.1)要求稀疏性假设(\(k_0\) 有限)和信号强度条件(\(\min_{\ell \in C} |\xi_\ell| \gg \sqrt{k_0 \log k / n}\)),这些在实证中可能不满足,但作者未提供敏感性分析。

四、开放问题(点到为止,扎根具体语句)

  1. 非参数 \(m(x)\) 的完整理论:论文对非参数回归模型 \(y = g(x) + \varepsilon\) 仅“outlines the main ideas”(Appendix A.3.2),未给出识别条件和渐近性质。作者写道“substantially new developments are required. We therefore wish to write up such details into a different paper.” —— 这是一个明确的开放问题:能否将SP方法推广到 \(m(x)\) 完全非参数的情形,并建立相应的估计和推断理论?

  2. 高维 \(x\) 的情况:论文假设 \(d\) 固定且较小(Section 2末尾:“we consider the case where \(d\) is finite and fixed”)。当 \(d\) 很大时,基函数数量会爆炸(维数灾难),LASSO选择可能失效。作者在Appendix B.1.1中建议使用乘积基或加性结构,但未给出理论保证。这是一个自然延伸:能否在高维稀疏设定下建立SP方法的理论(如利用惩罚回归同时选择基函数和估计参数)?

  3. 与弱IV文献的衔接:论文第4节处理了弱内生性,但未与经典的弱IV文献(如 Staiger & Stock, 1997; Andrews, Stock & Sun, 2019)进行深入比较。作者仅在第4节末尾提到“This is similar in spirit to those discussed in the weak IV literature”。一个开放问题是:SP方法在弱内生性下的有限样本性质(如置信区间覆盖)是否优于传统弱IV方法?能否将SP估计量纳入弱IV的检验框架(如AR检验)?

  4. 联合高斯性下的失效:作者明确承认“under joint Gaussianity, the endogeneity will be linear and our identification strategy fails as well”(引言脚注2)。这意味着当 \((\varepsilon, x)\) 联合高斯时,SP方法无法识别 \(\beta_0\)(因为 \(m(x)\) 是线性的,与 \(x^\top\beta_0\) 不可分)。这是一个根本性限制。开放问题:能否通过引入非线性变换(如对 \(x\) 做非线性基展开)来突破这一限制?或者,在联合高斯性下,是否存在其他内部IV方法(如异方差方法)可以与SP互补?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论