Practical Methods for Modeling Weak VARMA Processes: Identification, Estimation and Specification With a Macroeconomic Application¶
作者: Jean-Marie Dufour, Denis Pelletier
来源: Journal of Business & Economic Statistics
主题: 经济理论 / 应用
相关性: 3/10
机构绿灯: McGill University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1904960
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是弱VARMA过程的建模。根本的统计问题是:如何对多元时间序列进行建模,使其既能捕捉动态关系(自回归部分,AR)和冲击传播(移动平均部分,MA),又不需要对创新项(innovations)施加独立同分布(i.i.d.)的强假设,而只要求它们是不相关且满足某种混合条件(如强混合)的弱过程。当前成熟度:VARMA模型的理论基础已建立数十年,但因其识别和估计的复杂性(尤其是echelon形式的繁琐),在实际应用中远不如VAR模型普及。本文试图通过提出更简单的识别形式和计算更简便的估计方法,来缩小理论与应用之间的差距。
发展脉络(history)¶
- 奠基工作:Tiao & Box (1981) 和 Tiao & Tsay (1989) 奠定了VARMA模型识别与建模的基础。它们提出了echelon形式(阶梯形式)作为可识别表示,但该形式需要复杂的结构选择(如Kronecker指标),对实践者不友好。作者在引言中称其为“complex to implement”。
- 主要进展:Lütkepohl (1991, 2005) 的教科书系统整理了VARMA模型的估计与推断,但主要依赖最大似然估计(MLE),计算量大且对初始值敏感。Hannan & Deistler (1988) 从系统理论角度给出了VARMA的识别理论,但同样强调echelon形式。
- 当前frontier:作者指出,尽管VARMA模型理论上优于VAR(能更简洁地捕捉动态,减少参数),但“VARMA models are rarely used in practice” (引言)。主要障碍是:(1) 识别复杂(echelon形式);(2) 估计计算量大(MLE);(3) 阶数选择困难(信息准则在VARMA中表现不佳)。本文直接针对这三个障碍提出解决方案。
- 本文的位置:本文是实用导向的VARMA建模方法,而非理论突破。它不挑战echelon形式的识别理论,而是提出两种新的、更简单的可识别表示(对角MA方程形式和最终MA方程形式),并配套线性回归估计和修正信息准则,试图让VARMA像VAR一样易于使用。
子线索聚类¶
- 识别与表示形式:这一簇关注如何将VARMA模型参数化,使其唯一可识别。主流是echelon形式(Tiao & Tsai, 1989; Hannan & Deistler, 1988)。本文提出的“对角MA方程形式”和“最终MA方程形式”是替代方案,牺牲了部分一般性(MA算子被限制为对角或标量),换取了简洁性。
- 估计方法:这一簇关注如何从数据中估计VARMA参数。主流是MLE(Lütkepohl, 2005)和非线性最小二乘。本文提出的方法基于线性回归,通过将模型重写为“方程形式”(equation form),将非线性问题转化为一系列线性回归,计算量大幅降低。
- 阶数选择:这一簇关注如何选择VARMA的阶数(p, q)。标准信息准则(AIC, BIC)在VARMA中表现不佳,因为模型参数空间复杂。本文提出“修正信息准则”,通过将模型视为VAR的扩展,利用VAR的阶数选择结果来引导VARMA的阶数选择。
这个方向在追问的核心问题¶
- 如何设计一个既简洁又可识别的VARMA表示? 当前主流(echelon形式)虽然一般,但复杂。本文的回答是:限制MA算子的结构(对角或标量),可以大幅简化识别。
- 如何在不牺牲渐近性质的前提下,降低VARMA的估计计算成本? 本文的回答是:利用“方程形式”将非线性估计转化为线性回归,并在弱假设(不相关+强混合)下证明估计量的相合性和渐近正态性。
- 如何可靠地选择VARMA的阶数? 本文的回答是:利用VAR的阶数选择结果作为先导,然后对MA部分进行搜索,并使用修正的信息准则。
⚠️ 作者的 framing¶
- 作者把缺口frame成什么:作者将VARMA的“实用性”缺口作为核心问题。他们声称,现有方法(echelon形式、MLE)虽然理论上完备,但“complex to implement”和“computationally demanding”,导致实践者回避VARMA。因此,本文的贡献是“practical methods”,让VARMA变得像VAR一样简单。这使得本文成为“显然的下一步”:既然理论已经成熟,那么下一步就是让它好用。
- 哪些竞争路线被他淡化或回避了:
- 贝叶斯方法:贝叶斯VAR(BVAR)在宏观经济中非常流行,能通过先验处理高维参数问题。作者完全没有提及贝叶斯方法,这可能是为了突出VARMA相对于VAR的优势,而回避了BVAR这个强大的竞争对手。
- 状态空间模型:VARMA可以表示为状态空间模型,然后使用卡尔曼滤波进行估计。这种方法计算量也很大,但理论上更灵活。作者没有讨论这种替代路线。
- 直接使用VAR:作者的核心论点是VARMA优于VAR,但并未深入讨论在什么条件下VAR的近似就足够了(例如,当MA部分很弱时)。他们默认VARMA总是更好的选择。
- 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于高维VARMA或稀疏VARMA的文献。在宏观经济中,变量数可能很大(几十到几百),本文的方法(基于线性回归)在高维下可能失效。这是一个明显的缺口。
张力¶
未见明显对立引用。被引文献之间没有根本矛盾,更多是不同侧重点(理论识别 vs. 实用方法)。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( y_t \):\( K \times 1 \) 维可观测时间序列向量,\( t = 1, \dots, T \)。
- \( \Phi_0, \Phi_1, \dots, \Phi_p \):\( K \times K \) 自回归系数矩阵。\( \Phi_0 \) 是“瞬时效应”矩阵(通常假设为下三角且对角线为1,用于递归识别)。
- \( \Theta_1, \dots, \Theta_q \):\( K \times K \) 移动平均系数矩阵。
- \( a_t \):\( K \times 1 \) 维创新项(innovations),即“冲击”。在弱VARMA中,\( a_t \) 是不相关(\( E[a_t a_{t-s}'] = 0 \) 对所有 \( s \neq 0 \))且强混合(strong mixing)的,但不要求独立同分布。
- \( \Sigma_a \):\( a_t \) 的协方差矩阵,\( E[a_t a_t'] = \Sigma_a \)。
- \( p, q \):VARMA的阶数(自回归阶数、移动平均阶数)。
- \( \Phi(L) = I_K - \Phi_1 L - \dots - \Phi_p L^p \):自回归滞后算子多项式。
- \( \Theta(L) = I_K - \Theta_1 L - \dots - \Theta_q L^q \):移动平均滞后算子多项式。
- \( \Phi(L)^{-1} \):自回归多项式的逆,假设所有根在单位圆外(平稳性条件)。
- \( \Psi(L) = \Phi(L)^{-1} \Theta(L) \):Wold表示中的无穷阶MA系数。
-
模型:标准VARMA(\( p, q \))模型为:
\[\Phi(L) y_t = \Theta(L) a_t\]或等价地:\[y_t = \Phi_1 y_{t-1} + \dots + \Phi_p y_{t-p} + a_t - \Theta_1 a_{t-1} - \dots - \Theta_q a_{t-q}\]在弱VARMA中,\( a_t \) 仅满足 \( E[a_t] = 0 \),\( E[a_t a_t'] = \Sigma_a \),且 \( E[a_t a_{t-s}'] = 0 \) 对所有 \( s \neq 0 \)。此外,\( a_t \) 是强混合的(用于推导渐近性质)。模型假设 \( \Phi(L) \) 和 \( \Theta(L) \) 没有公因子(不可约性),且 \( \Phi(L) \) 的根在单位圆外(平稳性)。 -
可观测数据:研究者实际能观测到的是 \( y_1, y_2, \dots, y_T \),即一个 \( K \times T \) 的多元时间序列。想要但观测不到的是:
- 创新项 \( a_t \):它们是潜在冲击,只能通过模型残差来估计。
- 真实的阶数 \( (p, q) \):需要从数据中推断。
- 真实的系数矩阵 \( \Phi_i, \Theta_j \):需要估计。
- 模型是否可识别:由于 \( \Phi(L) \) 和 \( \Theta(L) \) 可以同时左乘一个可逆矩阵而不改变 \( y_t \) 的分布,模型参数不是唯一确定的。这就是“识别问题”。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:单变量(K=1)的ARMA(1,1)模型。
-
最简特例:考虑 \( K=1 \) 的ARMA(1,1)模型:
\[y_t = \phi y_{t-1} + a_t - \theta a_{t-1}\]其中 \( a_t \) 是弱白噪声(不相关,但不一定独立)。这个模型已经存在识别问题:\( (\phi, \theta) \) 和 \( (\phi, \theta^{-1}) \) 可能生成相同的 \( y_t \) 序列(如果 \( |\theta| < 1 \) 和 \( |\theta^{-1}| > 1 \) 都是平稳可逆的)。标准做法是假设 \( |\theta| < 1 \)(可逆性条件)来唯一识别。 -
本文的“方程形式”思路:作者将模型重写为“方程形式”(equation form)。对于单变量ARMA(1,1),方程形式是:
\[y_t = \phi y_{t-1} + a_t - \theta a_{t-1}\]这看起来和原模型一样。但关键点是:作者将 \( a_t \) 视为可观测的(通过递归计算),从而将模型转化为一个线性回归问题。具体来说,给定初始值 \( a_0 = 0 \),可以递归地计算:\[a_t = y_t - \phi y_{t-1} + \theta a_{t-1}\]但这仍然是非线性的,因为 \( a_t \) 依赖于 \( \phi \) 和 \( \theta \)。 -
本文的关键想法:作者提出,可以通过迭代或两阶段的方式来解决。对于单变量情况,一个简单的方法是:先估计一个高阶AR模型(比如AR(10)),得到残差 \( \hat{a}_t \)。然后,将 \( \hat{a}_{t-1} \) 作为已知的回归变量,对模型 \( y_t = \phi y_{t-1} + a_t - \theta \hat{a}_{t-1} \) 进行线性回归,得到 \( \phi \) 和 \( \theta \) 的估计。这就是“线性回归估计”的核心:用估计的残差代替真实的残差,将非线性问题转化为线性问题。
-
为什么成立:如果第一步的AR估计是相合的(即 \( \hat{a}_t \xrightarrow{p} a_t \)),那么第二步的线性回归估计也是相合的。这依赖于弱假设下的渐近理论(强混合条件下的中心极限定理)。
-
推广到多元:对于多元VARMA,作者提出的“对角MA方程形式”和“最终MA方程形式”进一步简化了问题。在对角MA方程形式中,\( \Theta(L) \) 是对角矩阵,这意味着每个变量的MA部分只依赖于它自己的滞后冲击,不依赖于其他变量的滞后冲击。这大大减少了参数数量,并使模型更容易识别。最终MA方程形式则更简单,\( \Theta(L) \) 是标量矩阵(即 \( \Theta(L) = \theta(L) I_K \)),所有变量共享相同的MA结构。
总结:本文的最小内核是:通过限制MA算子的结构(对角或标量),将复杂的VARMA识别问题简化为一个“VAR + 额外回归变量”的问题,然后通过两阶段线性回归进行估计。这个想法简单、计算量小,但代价是牺牲了MA结构的一般性。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:本文研究了弱VARMA过程的实用建模方法,旨在解决其识别复杂、估计计算量大、阶数选择困难这三个阻碍实际应用的核心障碍。
- 核心工具/方法:提出了两种新的可识别VARMA表示(对角MA方程形式和最终MA方程形式),开发了基于线性回归的估计方法,并设计了修正信息准则用于阶数选择。
- 主要结论:在创新项为不相关且强混合的弱假设下,所提估计量是相合且渐近正态的;修正信息准则能一致地估计模型阶数;模拟和真实数据(美国货币政策数据)表明,VARMA方法在脉冲响应估计和预测方面优于标准VAR模型。
关键设定与假设¶
- 模型设定:在第二节记号基础上,本文主要关注两种特殊表示:
- 对角MA方程形式 (Diagonal MA Equation Form):\( \Theta(L) \) 是对角矩阵,即 \( \Theta(L) = \text{diag}(\theta_1(L), \dots, \theta_K(L)) \),其中 \( \theta_i(L) \) 是标量滞后多项式。这意味着第 \( i \) 个变量的MA部分只依赖于它自己的滞后冲击 \( a_{i,t} \)。
- 最终MA方程形式 (Final MA Equation Form):\( \Theta(L) = \theta(L) I_K \),即所有变量共享同一个标量MA多项式。这是对角形式的一个特例。
- 方程形式 (Equation Form):作者将模型重写为 \( y_t = \Phi_1 y_{t-1} + \dots + \Phi_p y_{t-p} + a_t - \Theta_1 a_{t-1} - \dots - \Theta_q a_{t-q} \),并将 \( a_t \) 视为可观测的(通过递归或第一阶段估计得到),从而将模型转化为一个线性回归问题。
- 关键假设:
- 弱创新 (Weak Innovations):\( a_t \) 是鞅差序列(martingale difference sequence)或更一般地,是不相关且强混合的。这比标准VARMA的i.i.d.假设弱得多,允许条件异方差和序列相关(但要求不相关)。
- 平稳性与可逆性:\( \Phi(L) \) 的所有根在单位圆外(平稳性),\( \Theta(L) \) 的所有根在单位圆外(可逆性)。这是标准假设。
- 识别条件:对于对角MA方程形式,要求 \( \Phi(L) \) 和 \( \Theta(L) \) 没有公因子,且 \( \Theta(L) \) 的对角元素 \( \theta_i(L) \) 没有公因子。对于最终MA方程形式,要求 \( \Phi(L) \) 和 \( \theta(L) \) 没有公因子。
- 矩条件:\( E[||y_t||^4] < \infty \) 等,用于推导渐近正态性。
- 相比已有文献的放宽/强化:
- 放宽:创新项从i.i.d.放宽到弱假设(不相关+强混合),大大拓宽了应用范围(例如,允许GARCH类型的条件异方差)。
- 强化:MA算子的结构被限制为对角或标量,这比echelon形式的一般性要弱。这是为了简洁性而付出的代价。
主要结果¶
- 定理1:估计量的相合性。在弱创新假设下,基于线性回归的估计量 \( \hat{\Phi}_i, \hat{\Theta}_j \) 是相合的(\( \xrightarrow{p} \) 真值)。证明依赖于第一阶段AR估计的相合性以及强混合条件下的弱大数定律。
- 定理2:估计量的渐近正态性。在更强的矩条件和混合率假设下,估计量是渐近正态的,且协方差矩阵可以用Newey-West类型的HAC估计量一致估计。这允许进行标准的假设检验(如t检验、Wald检验)。
- 定理3:修正信息准则的一致性。提出的修正信息准则(基于BIC的修正形式)能一致地选择真实的阶数 \( (p, q) \)。其核心思想是:先选择VAR的阶数 \( p_{VAR} \),然后在对角MA方程形式下,将MA阶数 \( q \) 的搜索限制在 \( 0 \leq q \leq p_{VAR} \) 的范围内,并使用一个惩罚项来避免过度拟合。
- 解决的技术难点:主要难点在于处理弱创新下的渐近理论。标准MLE的渐近理论依赖于i.i.d.假设,而本文的线性回归估计需要处理估计的残差(第一阶段)对第二阶段估计的影响。作者通过证明第一阶段AR估计的“影响”是渐近可忽略的(即,使用估计的残差与使用真实残差在渐近上等价),绕过了这个难点。
证明路线与技术技巧¶
- 整体路线:
- 第一阶段:估计AR模型。先拟合一个高阶VAR(\( p_{VAR} \))模型,得到残差 \( \hat{a}_t \)。
- 第二阶段:线性回归。将 \( \hat{a}_{t-1}, \dots, \hat{a}_{t-q} \) 作为已知的回归变量,连同 \( y_{t-1}, \dots, y_{t-p} \) 一起,对 \( y_t \) 进行线性回归(OLS或GLS),得到 \( \hat{\Phi}_i, \hat{\Theta}_j \)。
- 渐近分析:
- 证明第一阶段AR估计是相合的,且 \( \hat{a}_t - a_t = o_p(1) \)。
- 证明第二阶段线性回归的“误差项”中,由使用 \( \hat{a}_t \) 代替 \( a_t \) 引起的部分是可忽略的(即,\( \frac{1}{\sqrt{T}} \sum (\hat{a}_{t-1} - a_{t-1}) \otimes y_{t-1} \xrightarrow{p} 0 \) 等)。
- 利用强混合条件下的中心极限定理(如Herrndorf's CLT)证明估计量的渐近正态性。
- 关键跳跃点:最吃功夫的引理是证明第一阶段AR估计的残差对第二阶段估计的影响是渐近可忽略的。这需要证明一个“高阶”的U-统计量类型的项收敛到0。作者通过假设AR阶数 \( p_{VAR} \) 随样本量 \( T \) 增长(\( p_{VAR} \to \infty \) 但 \( p_{VAR}^3 / T \to 0 \)),并利用强混合条件下的矩不等式(如Davydov's inequality)来证明这一点。
- 技术技巧点名:
- 强混合条件下的中心极限定理 (Herrndorf's CLT):用于推导估计量的渐近正态性。
- Davydov's inequality:用于控制混合序列的协方差,证明残差估计误差的可忽略性。
- Newey-West HAC估计量:用于一致估计渐近协方差矩阵,处理异方差和自相关。
- 信息准则的惩罚项修正:通过将VARMA的阶数选择问题嵌入到VAR的框架中,设计了一个修正的BIC,使其在弱假设下仍能一致选择阶数。
真实例子与应用¶
- 数据/场景:美国1962年1月至1996年12月的月度宏观经济数据,共6个变量:工业生产指数(IP)、消费者价格指数(CPI)、商品价格指数(PCOM)、联邦基金利率(FF)、M2货币供应量(M2)、非借入准备金(NBR)。这是一个经典的货币政策分析数据集。
- 方法应用:
- 首先,使用修正信息准则选择VARMA模型的阶数(选择了VARMA(2,1)的对角MA方程形式)。
- 然后,使用本文提出的线性回归方法估计模型参数。
- 计算脉冲响应函数(IRF),分析一个货币政策冲击(联邦基金利率的意外上升)对产出和价格的影响。
- 进行样本外预测比较(与VAR模型对比)。
- 结果:
- 脉冲响应:VARMA模型估计的IRF比VAR模型更平滑,且置信区间更窄(更精确)。例如,VARMA显示货币政策冲击对产出的影响在约2年后达到峰值,而VAR的估计则更模糊。作者认为VARMA的IRF更符合经济理论预期(价格粘性)。
- 预测:在多个预测时域(1-12个月)上,VARMA模型的均方根预测误差(RMSE)通常低于VAR模型,尤其是在对利率和货币总量的预测上。
- 这个例子想说明什么:这个例子旨在验证理论(展示VARMA在实际数据中的可行性)和展示相对baseline(VAR)的优势(更精确的脉冲响应和更好的预测)。它试图说服实践者,VARMA虽然更复杂,但能带来实质性的改进。
🔎 结论是否比证明窄¶
- 是。作者在引言和结论中声称VARMA方法“优于”VAR,但证明部分只证明了估计量的渐近性质,没有证明VARMA在预测或脉冲响应估计上一定优于VAR。模拟和实证例子展示了优势,但这只是有限情况下的证据,不是一般性定理。
- 具体语句:结论部分“The results demonstrate the advantages of using the VARMA methodology for impulse response estimation and forecasting, in contrast with standard VAR models.” 这个结论是基于一个具体的数据集和模拟设定,不能推广到所有情况。作者没有证明VARMA的IRF估计量比VAR的IRF估计量有更小的渐近方差或更快的收敛速度。
- 窄结论:证明部分严格证明的是:在弱假设下,所提的线性回归估计量是相合且渐近正态的。这是一个关于估计方法本身的结论,而不是关于VARMA模型相对于VAR模型的优越性的结论。后者是一个模型选择问题,本文没有从理论上解决。
四、开放问题¶
- 高维VARMA的估计与识别:本文的方法基于线性回归,当变量数 \( K \) 很大(例如 \( K > T \))时,第一阶段的高阶VAR估计和第二阶段的多变量回归都会失效。如何将稀疏性、降维(如因子模型)或正则化(如Lasso)引入弱VARMA框架?这扎根于本文对高维情形的完全回避。
- 非线性或非平稳VARMA:本文假设模型是线性的且过程是平稳的。如何将弱VARMA框架扩展到非线性(如门限VARMA)或非平稳(如协整VARMA)情形?这扎根于本文的平稳性假设。
- 更一般的MA结构:本文提出的对角和最终MA方程形式牺牲了一般性。是否存在其他“中间”的、既比echelon形式简单、又比对角形式更一般的可识别表示?例如,块对角或带状MA结构?这扎根于作者对echelon形式的批评(复杂)和对角形式的限制(简单)。
- 弱VARMA下的因果推断:本文使用了递归识别(\( \Phi_0 \) 为下三角)来识别结构冲击。在弱创新假设下,这种识别策略是否仍然有效?是否存在更稳健的识别方法(如符号约束、异方差识别)?这扎根于本文的货币政策应用例子,但未深入讨论识别假设的稳健性。
Maintained by 陈星宇 · Homepage · Source on GitHub