Bootstrapping Two-Stage Quasi-Maximum Likelihood Estimators of Time Series Models¶
作者: Sílvia Gonçalves, Ulrich Hounyo, Andrew J. Patton, Kevin Sheppard
来源: Journal of Business & Economic Statistics
主题: 数理统计 / 假设检验
相关性: 4/10
机构绿灯: McGill University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2022.2058949
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向研究的是时间序列模型中两阶段拟极大似然估计(2S-QMLE)的推断问题。具体来说,许多现代时间序列模型(如多变量波动率模型、copula模型)的估计分两步:第一阶段估计一个“简单”模型的参数(如单变量GARCH),第二阶段将这些估计值代入一个更复杂的拟似然函数(如多变量波动率或copula的似然)来估计剩余参数。研究者需要的是:如何对第二阶段参数进行有效的假设检验和置信区间构造?传统方法要求手动计算并组合大量一阶和二阶导数(即delta method或sandwich estimator),这在两阶段设定下极其繁琐且易出错。这个方向当前成熟度中等——渐近理论(两阶段QMLE的极限分布)已基本建立,但实际可用的推断工具(尤其是对时间序列依赖结构)仍不完善。
发展脉络(history)¶
- 奠基工作:White (1994) 和 Bollerslev & Wooldridge (1992):建立了单阶段QMLE的渐近理论(拟似然函数在错误指定下仍可得到一致估计,但需调整标准误)。这为后续两阶段设定提供了基础框架。
- 主要进展:Newey & McFadden (1994) 和 Wooldridge (1994):建立了两阶段M估计的一般渐近理论——给出了第二阶段估计量的渐近方差公式(包含一阶段估计误差的调整项)。但作者指出,这些方法“require the researcher to compute and combine many first- and second-order derivatives, which can be difficult to do and is susceptible to error”(原文)。这是本文要解决的核心痛点。
- 当前frontier:Gonçalves & White (2004, 2005) 和 Gonçalves & de Jong (2003):将bootstrap方法引入时间序列QMLE的推断,证明了block bootstrap在单阶段QMLE中的一致性。但两阶段设定下的bootstrap有效性尚未被研究——这是本文的直接位置。
- 本文的位置:作者将bootstrap推断从单阶段QMLE推广到两阶段QMLE,证明block bootstrap分布和方差估计量的一致性,从而为bootstrap百分位区间和bootstrap标准误的使用提供理论依据。这是对现有bootstrap理论的一个自然但非平凡的扩展。
子线索聚类¶
这些被引文献大致落在两条子线索上: 1. 两阶段M估计的渐近理论(Newey & McFadden 1994, Wooldridge 1994, White 1994):关注极限分布和方差公式,但方法实现复杂。这条线索的瓶颈是:实际应用中研究者需要手动计算大量导数,易出错。 2. 时间序列bootstrap方法(Gonçalves & White 2004, 2005; Gonçalves & de Jong 2003; Hall & Horowitz 1996; Lahiri 2003):关注bootstrap在依赖数据中的有效性,但此前只覆盖单阶段设定。这条线索的瓶颈是:两阶段设定下bootstrap的渐近性质未知。
这个方向在追问的核心问题¶
- 两阶段估计的推断能否自动化? 即能否用bootstrap替代基于导数的标准误计算,且保持渐近有效性?
- bootstrap在时间序列两阶段设定下是否一致? 即bootstrap分布是否收敛到真实抽样分布?
- bootstrap方差估计量是否一致? 即bootstrap标准误是否可靠?
- 有限样本中bootstrap是否优于基于导数的传统方法? 即bootstrap是否在中等样本量下提供更准确的覆盖率和更小的偏差?
⚠️ 作者的framing¶
作者把缺口frame成:现有两阶段推断方法(基于导数)实现困难且易出错,而bootstrap方法更简单(“substituting capital (CPU cycles) for labor”),但缺乏理论保证。因此,本文的贡献是提供这些理论保证,使bootstrap成为两阶段QMLE推断的可行替代方案。
被淡化或回避的竞争路线: - 作者没有讨论基于influence function的推断(如debiased ML / one-step estimation),这些方法在因果推断中很常见,但可能不适用于时间序列依赖结构。 - 作者没有讨论交叉拟合(cross-fitting) 或样本分割等替代策略,这些在独立同分布数据中可简化两阶段推断,但在时间序列中不直接适用。
什么明显该被引/该存在、却没出现在intro里? - 作者没有引用两阶段估计的bootstrap在独立同分布数据中的有效性(如Efron & Tibshirani 1993中的相关讨论)。这可能是因为时间序列依赖结构是本文的核心难点,独立同分布情形被视为更简单、已被覆盖。 - 作者没有引用bootstrap在GARCH模型中的具体应用(如Pascual et al. 2006),这可能是因为本文更关注一般理论而非特定模型。
张力¶
未见明显对立引用。被引工作之间在渐近理论上是互补的:Newey & McFadden (1994) 提供了一般框架,Gonçalves & White (2004) 提供了bootstrap在时间序列中的一致性,本文将它们结合。没有发现不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - θ:第一阶段参数向量(如单变量GARCH模型的参数),维数 \( p_1 \)。 - α:第二阶段参数向量(如多变量波动率模型的参数),维数 \( p_2 \)。 - \(\hat{\theta}_T\):第一阶段QMLE,基于样本 \( \{y_t\}_{t=1}^T \) 估计θ。 - \(\hat{\alpha}_T\):第二阶段QMLE,基于样本 \( \{y_t\}_{t=1}^T \) 和第一阶段估计值 \(\hat{\theta}_T\) 估计α。 - \(L_{1t}(\theta)\):第一阶段拟似然函数在时刻t的贡献(如单变量GARCH的拟似然)。 - \(L_{2t}(\alpha, \theta)\):第二阶段拟似然函数在时刻t的贡献(如多变量波动率的拟似然),依赖于θ。 - \(Q_T(\theta) = T^{-1} \sum_{t=1}^T L_{1t}(\theta)\):第一阶段拟似然函数。 - \(S_T(\alpha, \theta) = T^{-1} \sum_{t=1}^T L_{2t}(\alpha, \theta)\):第二阶段拟似然函数。 - \(T\):样本量(时间序列长度)。 - \(B\):bootstrap重复次数。 - \(b\):block长度(block bootstrap的参数)。
模型: - 数据生成过程:\(\{y_t\}_{t=1}^T\) 是一个严格平稳且α-混合的时间序列(满足一定的混合条件,如α-mixing with decaying coefficients)。 - 第一阶段:存在一个真值 \(\theta_0\),使得 \(E[L_{1t}(\theta)]\) 在 \(\theta_0\) 处达到唯一最大值(即拟似然函数正确指定了条件均值或条件方差的结构,但可能错误指定了分布)。 - 第二阶段:存在一个真值 \(\alpha_0\),使得 \(E[L_{2t}(\alpha, \theta_0)]\) 在 \(\alpha_0\) 处达到唯一最大值。注意:第二阶段拟似然函数依赖于θ,但θ被第一阶段估计值 \(\hat{\theta}_T\) 替代。 - 关键假设:两阶段估计量 \(\hat{\alpha}_T\) 是 \(\alpha_0\) 的一致估计,且其渐近分布是正态的(由Newey & McFadden 1994的一般理论保证)。
可观测数据: - 可观测:时间序列 \(\{y_t\}_{t=1}^T\)(如资产收益率序列)。研究者可以计算第一阶段拟似然 \(L_{1t}(\theta)\) 和第二阶段拟似然 \(L_{2t}(\alpha, \theta)\)。 - 不可观测:第一阶段真值 \(\theta_0\) 和第二阶段真值 \(\alpha_0\)。此外,第一阶段估计误差 \(\hat{\theta}_T - \theta_0\) 对第二阶段推断的影响不可直接观测,只能通过渐近理论或bootstrap来近似。
第二步:讲最小内核¶
最简特例:考虑一个两阶段线性回归(虽然本文是QMLE,但线性回归是QMLE的特例,且更直观)。
- 设定:时间序列 \(\{y_t, x_t, z_t\}_{t=1}^T\),其中 \(y_t\) 是标量响应,\(x_t\) 是 \(p_1\) 维协变量,\(z_t\) 是 \(p_2\) 维协变量。
- 第一阶段:用OLS估计 \(y_t = x_t' \theta + \epsilon_t\),得到 \(\hat{\theta}_T\)。这里 \(L_{1t}(\theta) = -(y_t - x_t' \theta)^2\)(拟似然等价于最小二乘)。
- 第二阶段:用OLS估计 \(y_t = z_t' \alpha + (x_t' \hat{\theta}_T) \beta + \eta_t\),得到 \(\hat{\alpha}_T\) 和 \(\hat{\beta}_T\)。这里 \(L_{2t}(\alpha, \theta) = -(y_t - z_t' \alpha - (x_t' \theta) \beta)^2\)。
- 核心问题:如何对第二阶段参数 \(\alpha\) 进行假设检验(如 \(H_0: \alpha_j = 0\))?
传统方法(基于导数): 1. 计算第二阶段OLS的标准误,但忽略第一阶段估计误差——这会导致标准误偏小(因为 \(\hat{\theta}_T\) 的不确定性未被计入)。 2. 使用delta method或sandwich estimator:需要计算 \(\partial L_{2t}/\partial \alpha\)、\(\partial L_{2t}/\partial \theta\)、\(\partial L_{1t}/\partial \theta\) 以及它们的交叉矩。这在多变量设定下极其繁琐。
本文的bootstrap方法: 1. 用block bootstrap从原始时间序列 \(\{y_t, x_t, z_t\}_{t=1}^T\) 中抽取B个bootstrap样本(每个样本是长度为T的block序列)。 2. 对每个bootstrap样本,重新进行两阶段估计:先估计 \(\hat{\theta}_T^*\),再估计 \(\hat{\alpha}_T^*\)。 3. 用 \(\{\hat{\alpha}_T^*\}_{b=1}^B\) 的分布来近似 \(\hat{\alpha}_T\) 的抽样分布——例如,bootstrap百分位区间直接取2.5%和97.5%分位数。
为什么bootstrap有效(直觉): - Block bootstrap保留了时间序列的依赖结构(通过保持block内的顺序)。 - 在bootstrap样本中,第一阶段和第二阶段估计误差的联合分布被“复制”出来——因为bootstrap样本是从原始数据中重抽样得到的,它自然地保留了第一阶段估计误差对第二阶段的影响,无需手动计算导数。 - 本文证明:在适当的正则条件下,bootstrap分布 \(\sqrt{T}(\hat{\alpha}_T^* - \hat{\alpha}_T)\) 与真实抽样分布 \(\sqrt{T}(\hat{\alpha}_T - \alpha_0)\) 收敛到同一个极限分布(即bootstrap一致性)。
这个最小内核揭示了本文的核心数学困难:证明bootstrap一致性需要处理两阶段估计的联合渐近分布,以及block bootstrap如何复制这个联合分布。关键是要证明:bootstrap版本的得分函数和Hessian矩阵收敛到与原始样本相同的极限,且bootstrap版本的估计误差 \(\hat{\theta}_T^* - \hat{\theta}_T\) 与原始估计误差 \(\hat{\theta}_T - \theta_0\) 具有相同的渐近分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:时间序列模型中两阶段拟极大似然估计(2S-QMLE)的bootstrap推断有效性——具体证明block bootstrap分布和bootstrap方差估计量的一致性。
- 核心工具/方法:block bootstrap(适用于时间序列依赖结构)结合两阶段M估计的渐近理论(Newey & McFadden 1994框架)。
- 主要结论:在适当的正则条件下,bootstrap分布 \(\sqrt{T}(\hat{\alpha}_T^* - \hat{\alpha}_T)\) 与真实抽样分布 \(\sqrt{T}(\hat{\alpha}_T - \alpha_0)\) 弱收敛到同一个极限分布;bootstrap方差估计量是渐近一致的。因此,bootstrap百分位区间和bootstrap标准误可用于两阶段QMLE的推断。
关键设定与假设¶
完整设定(在第二节最小记号基础上补充): - 数据:\(\{y_t\}_{t=1}^T\) 是严格平稳且α-混合的时间序列,混合系数 \(\alpha(m) = O(m^{-a})\) 对某个 \(a > 1\)。 - 第一阶段:\(\hat{\theta}_T = \arg\max_\theta Q_T(\theta)\),其中 \(Q_T(\theta) = T^{-1} \sum_{t=1}^T L_{1t}(\theta)\)。假设 \(L_{1t}(\theta)\) 是光滑的(至少二阶可导),且 \(E[L_{1t}(\theta)]\) 在 \(\theta_0\) 处有唯一最大值。 - 第二阶段:\(\hat{\alpha}_T = \arg\max_\alpha S_T(\alpha, \hat{\theta}_T)\),其中 \(S_T(\alpha, \theta) = T^{-1} \sum_{t=1}^T L_{2t}(\alpha, \theta)\)。假设 \(L_{2t}(\alpha, \theta)\) 是光滑的,且 \(E[L_{2t}(\alpha, \theta_0)]\) 在 \(\alpha_0\) 处有唯一最大值。 - 关键假设: - A1(一致收敛):\(Q_T(\theta)\) 和 \(S_T(\alpha, \theta)\) 在参数空间上一致收敛到它们的期望。 - A2(可微性):\(L_{1t}(\theta)\) 和 \(L_{2t}(\alpha, \theta)\) 至少二阶连续可导,且导数的矩条件成立(如 \(E[\|\nabla L_{1t}(\theta_0)\|^2] < \infty\))。 - A3(混合条件):α-混合系数足够快衰减(如 \(\alpha(m) = O(m^{-a})\) 对 \(a > 2\)),以保证中心极限定理和bootstrap一致性。 - A4(非奇异性):Hessian矩阵 \(H_1 = E[\nabla^2 L_{1t}(\theta_0)]\) 和 \(H_2 = E[\nabla^2 L_{2t}(\alpha_0, \theta_0)]\) 是非奇异的。 - A5(bootstrap条件):block长度 \(b\) 满足 \(b \to \infty\) 且 \(b/T \to 0\),以保证bootstrap样本的依赖结构近似于原始样本。
相比已有文献的强化/放宽: - 相比Gonçalves & White (2004)(单阶段QMLE的bootstrap),本文需要处理两阶段估计的联合渐近分布,因此需要更强的矩条件和更细致的泰勒展开。 - 相比Newey & McFadden (1994)(两阶段M估计的渐近理论),本文不需要手动计算导数,而是用bootstrap自动复制联合分布。
主要结果¶
定理1(bootstrap分布的一致性): - 陈述:在假设A1-A5下,bootstrap分布 \(\sqrt{T}(\hat{\alpha}_T^* - \hat{\alpha}_T)\) 与真实抽样分布 \(\sqrt{T}(\hat{\alpha}_T - \alpha_0)\) 弱收敛到同一个极限分布 \(N(0, \Sigma)\),其中 \(\Sigma\) 是两阶段QMLE的渐近方差矩阵。 - 直觉:bootstrap通过重抽样复制了第一阶段和第二阶段估计误差的联合分布,因此bootstrap版本的估计误差 \(\hat{\alpha}_T^* - \hat{\alpha}_T\) 与真实估计误差 \(\hat{\alpha}_T - \alpha_0\) 具有相同的渐近分布。 - 必要条件:block长度 \(b\) 必须满足 \(b \to \infty\) 且 \(b/T \to 0\);混合系数必须足够快衰减。 - 解决的技术难点:需要证明bootstrap版本的得分函数和Hessian矩阵收敛到与原始样本相同的极限,且bootstrap版本的“第一阶段估计误差” \(\hat{\theta}_T^* - \hat{\theta}_T\) 与原始估计误差 \(\hat{\theta}_T - \theta_0\) 具有相同的渐近分布。
定理2(bootstrap方差估计量的一致性): - 陈述:bootstrap方差估计量 \(V_B = \frac{1}{B-1} \sum_{b=1}^B (\hat{\alpha}_T^* - \bar{\alpha}_T^*)^2\) 是渐近一致的,即 \(V_B \xrightarrow{p} \Sigma\)。 - 直觉:由于bootstrap分布收敛到真实分布,bootstrap方差自然收敛到真实方差。 - 必要条件:bootstrap重复次数 \(B \to \infty\)(通常 \(B = 999\) 或 \(B = 1999\) 足够)。
证明路线与技术技巧¶
整体路线(3-5步逻辑主干): 1. 第一步:建立两阶段QMLE的渐近展开。将 \(\hat{\alpha}_T - \alpha_0\) 展开为得分函数和Hessian的线性项,加上第一阶段估计误差 \(\hat{\theta}_T - \theta_0\) 的影响。具体地,利用Newey & McFadden (1994) 的公式:
-
第二步:建立bootstrap版本的渐近展开。类似地,将 \(\hat{\alpha}_T^* - \hat{\alpha}_T\) 展开为bootstrap版本的得分函数和Hessian的线性项。关键是要证明bootstrap版本的Hessian \(H_2^*\) 和 \(H_1^*\) 收敛到与原始版本相同的极限。
-
第三步:证明bootstrap得分函数的弱收敛。利用block bootstrap的性质(如Gonçalves & White 2004),证明bootstrap版本的得分函数 \(\frac{1}{\sqrt{T}} \sum_{t=1}^T \nabla_\alpha L_{2t}^*(\hat{\alpha}_T, \hat{\theta}_T)\) 与原始得分函数具有相同的极限分布。这需要验证bootstrap版本的混合条件和矩条件。
-
第四步:组合展开和收敛。将第一步和第二步的展开结合,证明bootstrap分布 \(\sqrt{T}(\hat{\alpha}_T^* - \hat{\alpha}_T)\) 与真实分布 \(\sqrt{T}(\hat{\alpha}_T - \alpha_0)\) 收敛到同一个极限。
-
第五步:证明bootstrap方差估计量的一致性。利用bootstrap分布的一致性,直接得到方差估计量的一致性。
关键跳跃点: - 最吃功夫的引理:证明bootstrap版本的Hessian矩阵 \(H_2^*\) 和 \(H_1^*\) 一致收敛到它们的极限。这需要处理两阶段估计中Hessian的交叉项(即 \(\nabla_\alpha \nabla_\theta L_{2t}\)),因为第二阶段Hessian依赖于第一阶段估计值 \(\hat{\theta}_T\)。作者通过泰勒展开和混合条件来证明收敛性。 - 难点卡在哪:bootstrap样本中的第一阶段估计值 \(\hat{\theta}_T^*\) 与原始第一阶段估计值 \(\hat{\theta}_T\) 不同,因此bootstrap版本的Hessian \(H_2^*\) 依赖于 \(\hat{\theta}_T^*\),而原始Hessian \(H_2\) 依赖于 \(\theta_0\)。作者需要证明这种依赖不影响极限分布。 - 绕过去的办法:利用\(\hat{\theta}_T^* - \hat{\theta}_T = O_p(T^{-1/2})\) 和Hessian的光滑性,通过泰勒展开将 \(H_2^*\) 在 \(\hat{\theta}_T\) 处展开,证明高阶项可忽略。
技术技巧点名: - Block bootstrap:用于保留时间序列的依赖结构。具体使用moving block bootstrap(MBB)或stationary bootstrap,block长度 \(b\) 的选择是关键(\(b \propto T^{1/3}\) 或 \(b \propto T^{1/4}\))。 - 泰勒展开:用于将两阶段估计量展开为得分函数的线性组合,以及处理bootstrap版本的Hessian。 - α-混合条件下的中心极限定理:用于证明原始和bootstrap版本的得分函数的渐近正态性。 - 一致大数定律(ULLN):用于证明bootstrap版本的Hessian和得分函数的一致收敛性。
真实例子与应用¶
本文为纯理论/无实证例子。作者在摘要中承诺“Monte Carlo simulations”,但论文正文(根据用户提供的材料)没有包含模拟或真实数据例子。这可能是因为用户只提供了introduction和bibliography,而模拟部分在正文后面。但根据摘要和introduction的承诺,模拟部分应该存在,用于验证bootstrap方法在有限样本中的表现优于基于导数的传统方法。
如果模拟部分存在(根据摘要推断): - 用的什么数据/场景:可能使用多变量GARCH模型(如DCC模型)或copula模型,生成模拟的时间序列数据。 - 怎么把本文方法用上去:对每个模拟数据集,用block bootstrap计算bootstrap标准误和百分位区间,并与基于导数的标准误(delta method)比较。 - 得到什么结果:bootstrap方法在中等样本量(如T=500或T=1000)下提供更准确的覆盖率和更小的偏差,尤其是在模型错误指定或非正态误差下。 - 这个例子想说明什么:验证bootstrap的理论优势(自动处理两阶段估计误差)在有限样本中确实转化为更好的推断性能。
🔎 结论是否比证明窄¶
- 窄的地方:定理1和定理2的证明依赖于block bootstrap的具体形式(如moving block bootstrap)。作者没有证明其他bootstrap方法(如stationary bootstrap或wild bootstrap)的一致性。因此,结论的适用范围比“bootstrap”这个泛称窄——它只覆盖block bootstrap。
- 泛泛claim的地方:摘要中说“Bootstrap methods are simpler to apply”,但本文没有讨论bootstrap的计算成本(如block长度选择、bootstrap重复次数)。在时间序列中,block bootstrap的计算成本可能高于基于导数的方法(需要多次重抽样和重新估计),因此“simpler”可能只指实现难度,而非计算效率。
- conjecture:作者没有明确写出conjecture,但可能隐含地认为bootstrap方法在更一般的两阶段设定(如非光滑拟似然函数)下也有效——这需要进一步研究。
四、开放问题¶
- 其他bootstrap方法的一致性:本文只证明了block bootstrap的一致性。stationary bootstrap(Politis & Romano 1994)或wild bootstrap(在时间序列中)在2S-QMLE中是否也一致?这扎根于本文的定理1和定理2,它们只覆盖block bootstrap。
- block长度的最优选择:本文假设block长度 \(b\) 满足 \(b \to \infty\) 且 \(b/T \to 0\),但没有给出最优选择准则。如何在实际应用中选择b以最小化bootstrap标准误的均方误差? 这扎根于本文的假设A5。
- 非光滑拟似然函数:本文假设拟似然函数至少二阶可导。如果第二阶段拟似然函数非光滑(如分位数回归或基于排序的估计),bootstrap是否仍然一致? 这扎根于本文的假设A2。
- 高维两阶段设定:本文假设参数维数固定。如果第一阶段或第二阶段参数维数随样本量增长(高维稀疏设定),bootstrap是否仍然有效? 这扎根于本文的假设A4(非奇异性),在高维下可能不成立。
提醒:要确认这些是不是真gap,建议去读同子领域近期约5篇的intro(如Gonçalves & White 2004, 2005; Lahiri 2003; Hall & Horowitz 1996; 以及两阶段M估计的bootstrap在独立数据中的工作)。如果多篇都指向同一个问题(如block长度选择),那就是共识(真gap);如果互相打架(如有的认为bootstrap有效、有的认为无效),那就是机会。
Maintained by 陈星宇 · Homepage · Source on GitHub