跳转至

Local projections, autocorrelation, and efficiency

作者: Amaze Lusompa
来源: Quantitative Economics
主题: 经济理论 / 应用
相关性: 6/10
链接: https://doi.org/10.3982/qe1988


一、领域脉络与小综述

这个方向是什么

本方向关注宏观经济学中一个核心的因果推断问题:如何从时间序列数据中估计一个结构性冲击(如货币政策冲击)对宏观经济变量(如产出、通胀)的动态因果效应,即脉冲响应函数(Impulse Response Function, IRF)。 当前的主流方法之一是 Jordà (2005) 提出的局部投影法(Local Projections, LP),它通过在每个预测期分别进行线性回归来估计 IRF,因其对模型误设的稳健性和易于实现而广受欢迎。然而,LP 的一个公认缺陷是效率低下——其估计量的方差通常大于基于向量自回归(VAR)模型的结构性方法。本文试图解决的核心问题是:能否在不牺牲 LP 稳健性的前提下,通过修正其残差的自相关结构来提高其估计效率?

发展脉络(history)

  1. 奠基工作:VAR 与结构性方法

    • Sims (1980) 引入向量自回归(VAR)模型,为宏观时间序列的因果推断奠定了标准框架。通过估计 VAR 系数并计算其脉冲响应,可以得到一致的 IRF 估计。但该方法依赖于模型的正确设定(如滞后阶数),且对非线性或结构突变敏感。
  2. 主要进展:局部投影法(LP)的提出与普及

    • Jordà (2005) 提出了 LP 方法,作为 VAR 的替代方案。其核心思想是:对每个预测期 \( h \),直接回归 \( y_{t+h} \) 对冲击变量 \( x_t \) 和一组控制变量。该方法在模型误设下更稳健,且易于扩展到非线性设定。然而,Jordà (2005) 也明确指出,LP 估计量的残差是序列相关的,这导致其效率低于最优的 VAR 估计量。作者在引言中引用 Jordà (2005) 时,将其定位为“conventional wisdom”的源头,即 LP 必须用 OLS 估计,且 GLS 不可行。
  3. 当前 Frontier:效率改进与稳健性权衡

    • 后续工作主要围绕如何改进 LP 的效率。例如,Montiel Olea & Plagborg-Møller (2021) 证明了 LP 和 VAR 在估计脉冲响应时是渐近等价的,但 LP 的有限样本方差更大。Lusompa (2024) 的这篇论文直接挑战了“GLS 不可行”的传统观点,通过揭示 LP 残差的自相关结构(一个 VMA 过程),提出了一致且更有效的 GLS 估计量。作者将本文定位为“显然的下一步”:既然自相关结构已知,就可以用 GLS 来提升效率。

子线索聚类

  1. 结构性方法(VAR 及其变体):这类方法依赖于对数据生成过程(DGP)的完整参数化建模(如 VAR),通过模型估计间接得到 IRF。优点是效率高,缺点是模型误设风险大。
  2. 半参数/非参数方法(LP 及其变体):这类方法直接对每个预测期的条件期望进行回归,对 DGP 的依赖更弱。优点是稳健,缺点是效率低。本文属于这一线索,但试图通过引入 GLS 来弥补其效率缺陷。

这个方向在追问的核心问题

  1. 效率与稳健性的权衡:如何在保持 LP 稳健性的同时,使其估计效率接近甚至达到 VAR 的水平?
  2. 自相关结构的识别:LP 残差的自相关结构是否可以被解析地刻画?如果可以,如何利用它来构造更优的估计量?
  3. 有限样本性质:在典型宏观时间序列样本量(如 T=200)下,GLS 估计量的有限样本表现如何?是否优于 OLS?

⚠️ 作者的 framing

  • 作者的缺口:作者将缺口 frame 为“传统观点认为 LP 只能用 OLS 且 GLS 不可行,但我证明了 GLS 是可行的,并且更有效”。这直接挑战了 Jordà (2005) 以来的一个普遍认知。
  • 被淡化的竞争路线:作者淡化了 VAR 方法的效率优势。虽然本文的 GLS 估计量旨在缩小与 VAR 的效率差距,但作者并未声称其能超越 VAR。此外,作者也淡化了 GLS 估计量对 DGP 的依赖——虽然它比 VAR 更稳健,但 VMA 过程的正确设定(如阶数)仍然是一个假设。
  • 值得研究者去查的问题Montiel Olea & Plagborg-Møller (2021) 这篇论文在引言中被引用,但作者没有详细讨论其结论(LP 与 VAR 渐近等价)与本文 GLS 估计量之间的关系。一个关键问题是:当 LP 与 VAR 渐近等价时,本文的 GLS 估计量是否也渐近等价于 VAR 估计量?如果等价,那么 GLS 的效率增益是否只是有限样本现象?这值得研究者去查 Montiel Olea & Plagborg-Møller (2021) 的具体结论。

张力

未见明显对立引用。所有被引工作都承认 LP 效率低,本文是第一个系统性地提出 GLS 解决方案的。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
    • \( y_t \)\( m \times 1 \) 的向量,表示在时间 \( t \) 观测到的内生变量(如产出、通胀)。
    • \( x_t \)\( k \times 1 \) 的向量,表示在时间 \( t \) 观测到的冲击变量(如货币政策利率)。
    • \( \varepsilon_t \)\( m \times 1 \) 的向量,表示在时间 \( t \) 的 Wold 误差(即结构性冲击的线性组合,是白噪声过程)。
    • \( h \):预测期数(horizon),\( h = 0, 1, 2, \dots, H \)
    • \( \beta_h \)\( m \times k \) 的矩阵,表示在预测期 \( h \) 的脉冲响应(即 \( x_t \)\( y_{t+h} \) 的因果效应)。
    • \( \Theta_j \)\( m \times m \) 的矩阵,表示 Wold 分解中的移动平均系数(即 \( y_t = \sum_{j=0}^\infty \Theta_j \varepsilon_{t-j} \))。
    • \( T \):样本量。
  • 模型
    • 数据生成过程(DGP)是一个向量移动平均(VMA)过程\( y_t = \sum_{j=0}^\infty \Theta_j \varepsilon_{t-j} \),其中 \( \Theta_0 = I_m \),且 \( \varepsilon_t \) 是均值为 0、协方差矩阵为 \( \Sigma_\varepsilon \) 的独立同分布(i.i.d.)白噪声。
    • 冲击变量 \( x_t \)\( y_t \) 的一个子集或线性组合,且与 \( \varepsilon_t \) 相关(即 \( x_t \) 是内生变量)。为了识别因果效应,需要假设 \( x_t \) 的冲击是外生的(即 \( x_t \) 的变动由 \( \varepsilon_t \) 中的某个特定成分驱动)。在本文的设定中,作者假设 \( x_t \)\( y_t \) 的一个子集,且其冲击可以通过 Cholesky 分解等递归识别方案来识别。
    • 要估计的对象是脉冲响应 \( \beta_h \),即 \( x_t \) 的一个单位冲击对 \( y_{t+h} \) 的边际效应。
  • 可观测数据
    • 研究者可以观测到时间序列 \( \{y_t, x_t\}_{t=1}^T \)
    • 不可观测的是 Wold 误差 \( \varepsilon_t \) 和移动平均系数 \( \Theta_j \)。这些是潜在变量,需要通过模型假设来识别。

第二步:讲最小内核

最简特例:单变量(m=1)、单冲击(k=1)、一阶移动平均(MA(1))过程

假设我们只有一个变量 \( y_t \) 和一个冲击 \( x_t = y_t \)(即冲击就是变量本身)。DGP 是一个 MA(1) 过程:

\[y_t = \varepsilon_t + \theta \varepsilon_{t-1}\]
其中 \( \varepsilon_t \) 是均值为 0、方差为 \( \sigma^2 \) 的 i.i.d. 白噪声。我们想估计 \( x_t \)\( y_{t+1} \) 的脉冲响应 \( \beta_1 \),即 \( \partial y_{t+1} / \partial \varepsilon_t \)

LP 的 OLS 估计: 对于 \( h=1 \),LP 回归方程为:

\[y_{t+1} = \beta_1 y_t + u_{t+1}\]
其中 \( u_{t+1} \) 是回归残差。由于 \( y_t = \varepsilon_t + \theta \varepsilon_{t-1} \),且 \( y_{t+1} = \varepsilon_{t+1} + \theta \varepsilon_t \),我们有:
\[u_{t+1} = y_{t+1} - \beta_1 y_t = (\varepsilon_{t+1} + \theta \varepsilon_t) - \beta_1 (\varepsilon_t + \theta \varepsilon_{t-1})\]
为了识别 \( \beta_1 \),我们需要 \( E[y_t u_{t+1}] = 0 \)。计算可得:
\[E[y_t u_{t+1}] = E[(\varepsilon_t + \theta \varepsilon_{t-1})(\varepsilon_{t+1} + \theta \varepsilon_t - \beta_1 \varepsilon_t - \beta_1 \theta \varepsilon_{t-1})] = \theta \sigma^2 - \beta_1 \sigma^2 - \beta_1 \theta^2 \sigma^2\]
令其等于 0,解得 \( \beta_1 = \theta / (1 + \theta^2) \)。注意,真实的脉冲响应是 \( \partial y_{t+1} / \partial \varepsilon_t = \theta \)。所以 OLS 估计量 \( \hat{\beta}_1^{OLS} \)不一致的,因为它估计的是 \( \theta / (1 + \theta^2) \),而不是 \( \theta \)这就是为什么传统观点认为 LP 的 GLS 不可行——因为 OLS 本身就不一致,GLS 也无法修复。

本文的核心想法: 本文的关键在于,作者假设冲击 \( x_t \)外生的。在单变量例子中,这意味着 \( x_t \) 不是 \( y_t \) 本身,而是一个外生变量,比如 \( x_t = \varepsilon_t \)(即冲击就是 Wold 误差本身)。那么 LP 回归方程变为:

\[y_{t+1} = \beta_1 x_t + u_{t+1}\]
其中 \( x_t = \varepsilon_t \)。此时,\( u_{t+1} = y_{t+1} - \beta_1 x_t = \varepsilon_{t+1} + \theta \varepsilon_t - \beta_1 \varepsilon_t = \varepsilon_{t+1} + (\theta - \beta_1) \varepsilon_t \)。由于 \( x_t = \varepsilon_t \)\( u_{t+1} \) 中的 \( \varepsilon_t \) 相关,OLS 仍然不一致。但如果我们知道 \( \theta \),我们可以通过 GLS 来修正。

GLS 估计: 残差 \( u_{t+1} \) 的自相关结构是:\( u_{t+1} \)\( u_t \) 相关吗?\( u_t = y_t - \beta_1 x_{t-1} = \varepsilon_t + \theta \varepsilon_{t-1} - \beta_1 \varepsilon_{t-1} = \varepsilon_t + (\theta - \beta_1) \varepsilon_{t-1} \)。所以 \( u_{t+1} \)\( u_t \) 都依赖于 \( \varepsilon_t \),因此它们是相关的。更一般地,\( u_{t+1} \) 是一个 MA(1) 过程。如果我们知道这个 MA(1) 过程的参数(即 \( \theta \)\( \sigma^2 \)),我们就可以构造一个 GLS 估计量,它比 OLS 更有效,并且是一致的(因为 \( x_t \) 是外生的,且 GLS 通过加权最小二乘法处理了自相关)。

这个最小内核揭示了本文的核心数学困难:要构造 GLS,需要知道残差的自相关结构,而这个结构又依赖于未知的脉冲响应 \( \beta_h \) 和 Wold 分解系数 \( \Theta_j \)。本文的关键想法是:这个自相关结构可以表示为 Wold 误差和脉冲响应的 VMA 过程,并且可以通过一个两步法来估计:先用 OLS 得到 \( \beta_h \) 的一致估计,然后用这个估计来构造残差,再估计 VMA 参数,最后用 GLS 重新估计 \( \beta_h \)

三、这篇论文做了什么

三句话

  1. 研究了什么问题:本文研究了局部投影法(LP)在估计脉冲响应时的效率问题,挑战了“LP 只能用 OLS 且 GLS 不可行”的传统观点。
  2. 核心工具/方法:作者证明了 LP 残差的自相关结构可以表示为 Wold 误差与脉冲响应的向量移动平均(VMA)过程,并据此构造了一个一致且更有效的 GLS 估计量
  3. 主要结论:蒙特卡洛模拟表明,在有限样本下,GLS 估计量比 OLS 估计量更高效(方差更小),且这种效率增益在长预测期(大 \( h \))和强自相关时更为显著。

关键设定与假设

  • 设定:考虑一个 \( m \)-维时间序列 \( y_t \),其 DGP 是一个平稳的、可逆的 VMA(\( \infty \)) 过程:\( y_t = \sum_{j=0}^\infty \Theta_j \varepsilon_{t-j} \),其中 \( \varepsilon_t \) 是 i.i.d. 白噪声,协方差矩阵为 \( \Sigma_\varepsilon \)
  • 假设
    1. 外生冲击:冲击变量 \( x_t \)\( y_t \) 的一个子集,并且其冲击可以通过递归识别方案(如 Cholesky 分解)来识别。这意味着 \( x_t \) 的冲击与 \( \varepsilon_t \) 中的特定成分一一对应,且这些成分是外生的。这是本文最关键、也是最强的假设,它保证了 OLS 估计量的一致性(在单变量例子中,如果 \( x_t \) 不是外生的,OLS 就不一致)。
    2. 平稳性\( y_t \) 是平稳的,这意味着 VMA 系数 \( \Theta_j \) 是绝对可和的。
    3. 已知的 VMA 阶数:在构造 GLS 时,需要知道 VMA 过程的阶数 \( q \)。作者在模拟中假设 \( q \) 已知,但在实际应用中,这需要通过信息准则(如 AIC、BIC)来估计。这是一个比 VAR 更强的假设,因为 VAR 的阶数通常也未知。
  • 相比已有文献:本文放宽了“GLS 不可行”的认知,但引入了对 VMA 阶数的依赖。相比 VAR,它仍然更稳健(因为不要求 DGP 是有限阶 VAR),但不如原始的 LP 稳健(因为需要估计 VMA 参数)。

主要结果

  • 定理 1(自相关结构):LP 的 \( h \)-步预测误差 \( u_{t+h} = y_{t+h} - \beta_h x_t \) 可以表示为:
    \[u_{t+h} = \sum_{j=0}^{h-1} \Theta_j \varepsilon_{t+h-j} + \sum_{j=h}^\infty (\Theta_j - \beta_h \Phi_j) \varepsilon_{t+h-j}\]
    其中 \( \Phi_j \)\( x_t \)\( \varepsilon_t \) 的脉冲响应。这个表达式表明 \( u_{t+h} \) 是一个 VMA(\( h-1 \)) 过程(第一项)加上一个与 \( \varepsilon_{t+h-j} \)\( j \ge h \))相关的项。关键点是:由于 \( x_t \) 是外生的,第二项中的 \( \varepsilon_{t+h-j} \)\( j \ge h \))与 \( x_t \) 不相关,因此 \( u_{t+h} \) 的自相关结构完全由第一项(一个 VMA(\( h-1 \)) 过程)决定。
  • 定理 2(GLS 估计量的一致性):在正则条件下,基于估计的 VMA 参数构造的可行 GLS(FGLS)估计量 \( \hat{\beta}_h^{GLS} \)\( \beta_h \) 的一致估计量。直觉:第一步的 OLS 估计量 \( \hat{\beta}_h^{OLS} \) 是一致的(因为 \( x_t \) 外生),因此用它构造的残差 \( \hat{u}_{t+h} \) 可以一致地估计 VMA 参数,进而 FGLS 也是一致的。
  • 定理 3(GLS 估计量的渐近效率):FGLS 估计量的渐近方差小于或等于 OLS 估计量的渐近方差。直觉:GLS 利用了残差的自相关结构,通过加权最小二乘法(等价于对数据进行“预白化”处理)来消除自相关,从而提高了估计效率。具体来说,GLS 的渐近方差是 \( \text{Var}(\hat{\beta}_h^{GLS}) = (E[x_t x_t']^{-1} \otimes \Sigma_u(h)) \),其中 \( \Sigma_u(h) \)\( u_{t+h} \) 的长期方差(考虑了自相关),而 OLS 的渐近方差是 \( \text{Var}(\hat{\beta}_h^{OLS}) = (E[x_t x_t']^{-1} \otimes \Omega_u(h)) \),其中 \( \Omega_u(h) \)\( u_{t+h} \) 的方差(忽略了自相关)。由于 \( \Sigma_u(h) \le \Omega_u(h) \)(在矩阵意义下),GLS 更有效。

证明路线与技术技巧

  • 整体路线
    1. 刻画自相关结构:利用 Wold 分解,将 LP 残差 \( u_{t+h} \) 表示为 Wold 误差 \( \varepsilon_t \) 的线性组合,并证明其是一个 VMA(\( h-1 \)) 过程。
    2. 构造 GLS 估计量:基于 VMA 结构,写出 LP 回归方程的 GLS 形式。这需要知道 VMA 参数(即 \( \Theta_j \)\( \Sigma_\varepsilon \))。
    3. 两步法估计
      • 第一步:用 OLS 估计 \( \beta_h \),得到一致估计 \( \hat{\beta}_h^{OLS} \)
      • 第二步:用 \( \hat{\beta}_h^{OLS} \) 构造残差 \( \hat{u}_{t+h} \),然后估计 VMA 参数(例如,通过 Hannan-Rissanen 算法或最大似然估计)。
      • 第三步:用估计的 VMA 参数构造 GLS 估计量 \( \hat{\beta}_h^{GLS} \)
    4. 渐近理论:证明 FGLS 估计量的一致性和渐近正态性,并比较其与 OLS 的渐近方差。
  • 关键跳跃点
    • 从“自相关不可知”到“自相关可建模”:这是本文的核心贡献。作者通过 Wold 分解,将看似复杂的自相关结构简化为一个参数化的 VMA 过程,使得 GLS 成为可能。
    • 两步法的一致性:证明第一步的 OLS 估计量的一致性(依赖于外生冲击假设)是第二步 VMA 参数估计一致性的前提。作者需要证明,用 \( \hat{\beta}_h^{OLS} \) 构造的残差 \( \hat{u}_{t+h} \) 可以一致地估计真实的 VMA 参数。
  • 技术技巧点名
    • Wold 分解:将时间序列分解为确定性部分和随机部分(移动平均过程),是本文所有推导的基础。
    • VMA 过程的估计:使用了 Hannan-Rissanen 算法(一种两步法,先用高阶 AR 模型估计残差,再用残差估计 MA 参数)来估计 VMA 参数。
    • 可行 GLS(FGLS):用估计的协方差矩阵代替真实的协方差矩阵进行 GLS 估计,是计量经济学中的标准技巧。

真实例子与应用

  • 数据/场景:蒙特卡洛模拟。作者生成了来自一个三变量 VAR(1) 模型的数据,并比较了 LP-OLS 和 LP-GLS 在估计脉冲响应时的表现。
  • 方法应用:对于每个模拟数据集,作者先用 OLS 估计 LP,然后用两步法估计 VMA 参数,最后用 GLS 重新估计 LP。
  • 结果
    • 效率增益:在所有预测期 \( h \) 和所有变量组合下,LP-GLS 的均方根误差(RMSE)都小于 LP-OLS。效率增益在长预测期(大 \( h \))和强自相关时更为显著(例如,RMSE 降低 20-40%)。
    • 偏差:LP-GLS 的偏差与 LP-OLS 相当,没有显著增加。
    • 覆盖概率:基于 GLS 标准误的置信区间具有更接近名义水平的覆盖概率(例如,95% 置信区间的实际覆盖概率更接近 95%)。
  • 这个例子想说明什么:验证了理论结果(GLS 更有效),并展示了在有限样本下,GLS 确实能带来实质性的效率改进,且不会引入额外的偏差。

🔎 结论是否比证明窄

  • 窄结论:定理 3 证明了 GLS 的渐近方差小于或等于 OLS 的渐近方差。但作者在引言和结论中多次使用“more efficient”一词,这通常被理解为“在有限样本下更有效”。严格来说,定理 3 只保证了渐近有效性,有限样本下的效率增益是通过模拟展示的,而非严格证明。
  • 泛泛 claim:作者声称 GLS 估计量是“consistent and more efficient”。一致性在定理 2 中证明,但“more efficient”的严格表述是“asymptotically at least as efficient”。在模拟中,它确实更有效,但理论上可能存在某些 DGP 下 GLS 与 OLS 渐近等价的情况(例如,当残差是白噪声时)。

四、开放问题

  1. VMA 阶数的选择:本文假设 VMA 阶数 \( q \) 已知。在实际应用中,如何选择 \( q \)?使用信息准则(如 AIC、BIC)是否会导致过度拟合或欠拟合?这会影响 GLS 的有限样本表现。扎根点:模拟部分假设 \( q \) 已知,但作者在结论中提到了“选择 VMA 阶数”是一个未来工作。
  2. 非线性/非平稳扩展:本文的推导依赖于线性 VMA 表示和平稳性。如何将 GLS 方法扩展到非线性 LP(如平滑过渡 LP)或非平稳时间序列(如单位根过程)?扎根点:引言中提到 LP 的一个优势是易于扩展到非线性设定,但本文的 GLS 方法尚未处理这种情况。
  3. 与 VAR 的效率比较:本文的 GLS 估计量是否在渐近意义上与最优的 VAR 估计量等价?如果等价,那么 GLS 的效率增益是否只是有限样本现象?扎根点:作者在引言中引用了 Montiel Olea & Plagborg-Møller (2021) 关于 LP 与 VAR 渐近等价的结果,但未讨论本文的 GLS 估计量与此的关系。
  4. 外生冲击假设的放松:本文最关键的外生冲击假设在实证中可能不成立(例如,货币政策冲击可能不是完全外生的)。如果冲击是弱外生的,GLS 估计量是否仍然一致?如果不一致,是否存在其他识别策略(如使用工具变量)可以与 GLS 结合?扎根点:定理 2 和 3 的证明都依赖于外生冲击假设。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论