On the Least Squares Estimation of Multiple-Threshold-Variable Autoregressive Models¶
作者: Xinyu Zhang, Dong Li, Howell Tong
来源: Journal of Business & Economic Statistics
主题: 因果推断
相关性: 2/10
机构绿灯: Tsinghua University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2023.2174124
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是多阈值变量时间序列模型的统计推断。其根本问题是:当一个时间序列的动力学(如自回归系数)依赖于多个不同的阈值变量(threshold variables)是否超过各自的门槛值时,如何对这些门槛值(即阈值参数)进行一致估计和有效推断。当前成熟度:单阈值变量模型(TAR)的理论与推断已相当成熟,但多阈值变量模型(K-TAR)的推断理论,尤其是阈值参数的联合推断与置信区间构造,仍是一个开放且活跃的研究前沿。
发展脉络(history)¶
-
奠基工作:单阈值变量模型(TAR)的建立与估计
- Tong (1978, 1983, 1990):开创性地提出了阈值自回归(TAR)模型,为非线性时间序列分析提供了基础框架。其核心思想是,时间序列的动态行为在不同“体制”(regime)之间切换,切换由某个阈值变量是否超过一个未知门槛值决定。
- Chan (1993):建立了单阈值变量TAR模型中阈值参数的最小二乘估计(LSE)的渐近理论,证明了估计量的超一致(super-consistency)性质(收敛速度为 \(n^{-1}\),而非通常的 \(n^{-1/2}\))和极限分布(复合泊松过程)。这是该领域的里程碑式工作,为后续所有阈值模型推断提供了理论基础。
- Hansen (2000):将阈值模型推广到回归设定(threshold regression),并提出了基于似然比检验的置信区间构造方法,解决了阈值参数推断中的“Davies问题”(参数在零假设下不可识别)。该方法在单阈值变量设定下被广泛采用。
-
主要进展:向多阈值变量模型的初步探索
- Li, Ling, and Tong (2016):研究了两阈值变量TAR模型(2-TAR)的LSE。他们发现,两个阈值参数的LSE在渐近意义上是独立的,这是一个关键且非平凡的性质。然而,他们的工作主要聚焦于估计量的渐近性质,并未提供构造阈值参数置信区间的实用方法。这构成了一个明确的缺口:理论上有渐近独立性,但实践中无法直接用于推断。
- Yu, Li, and Tong (2023):进一步研究了2-TAR模型的LSE,并尝试构造置信区间。他们发现,经典的Hansen (2000) 方法在阈值变量外生时表现良好,但当阈值变量内生时(即与模型误差相关),其置信区间的覆盖概率会严重偏离名义水平。这揭示了现有推断方法的一个关键局限性。
-
当前Frontier与本文位置
- 本文 (Zhang, Li, and Tong, 2024):直接针对上述缺口。作者在Li, Ling, and Tong (2016) 的渐近独立性结果基础上,提出了加权Nadaraya-Watson (NW) 方法来构造阈值参数的置信区间。本文的核心贡献是:这是目前唯一一种无论阈值变量是内生还是外生,都能提供良好概率覆盖的置信区间构造方法。作者还明确将结果从2-TAR推广到了K-TAR(K>2)模型。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 单阈值变量模型的推断理论:以Tong (1978, 1983, 1990)、Chan (1993)、Hansen (2000) 为代表。这一簇的核心是建立单阈值参数估计的渐近理论(超一致性、极限分布)和实用的推断工具(如基于似然比的置信区间)。其瓶颈在于,这些方法在推广到多阈值变量时,会面临内生性问题和联合推断的复杂性。
- 多阈值变量模型的估计与推断:以Li, Ling, and Tong (2016)、Yu, Li, and Tong (2023) 和本文为代表。这一簇的核心是探索多阈值参数估计的渐近性质(如独立性)并开发可靠的推断方法。其瓶颈在于,如何在内生阈值变量下构造有效的置信区间,以及如何将理论推广到K>2的一般情形。
这个方向在追问的核心问题¶
- 多阈值参数的联合推断:当存在多个阈值变量时,如何构造它们的联合置信域(joint confidence region)?本文证明了渐近独立性,但并未给出联合推断的具体方法。
- 内生阈值变量下的推断:当阈值变量与模型误差相关时,如何保证推断方法的有效性?这是本文要解决的核心问题。
- K>2的一般化:如何将2-TAR模型的理论结果(如渐近独立性、加权NW方法)系统性地推广到K个阈值变量的情形?本文给出了扩展思路,但未提供完整的理论证明。
- 模型选择与检验:如何确定阈值变量的个数K?如何检验一个变量是否应作为阈值变量?这是模型应用中的实际问题,本文未涉及。
⚠️ 作者的Framing¶
作者将缺口frame为:“现有方法(如Hansen, 2000)在内生阈值变量下失效,而我们的加权NW方法是唯一能同时处理内生和外生情形的方法。” 他们淡化了以下竞争路线: * 基于似然比的方法:作者指出,Hansen (2000) 的方法在内生性下失效,因此他们转向了基于核平滑的方法。 * 其他非参数或半参数方法:作者没有讨论使用工具变量或更复杂的半参数方法来处理内生性,而是直接对阈值参数的“profile”目标函数进行核平滑。
什么明显该被引/该存在、却没出现在intro里? * 关于“Davies问题”的更一般处理:Hansen (2000) 是处理该问题的经典方法,但后续有大量关于在非标准设定下(如高维、非线性)处理参数不可识别问题的文献,本文未提及。 * 关于内生性处理的因果推断文献:既然作者明确处理内生阈值变量,那么因果推断中处理内生性的标准方法(如工具变量、控制函数、近端因果推断)的文献应该被提及,以说明为什么选择加权NW方法而非这些更主流的因果推断工具。这可能是作者有意回避的,因为加权NW方法并非因果推断的标准工具。
张力¶
未见明显对立引用。文献脉络是线性的:单阈值 → 多阈值估计 → 多阈值推断(发现内生性问题)→ 本文提出解决方案。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(y_t\): 在时间点 \(t\) 观测到的响应变量(标量)。
- \(x_t\): 在时间点 \(t\) 观测到的阈值变量(向量,维度为 \(K\))。在2-TAR模型中,\(K=2\),\(x_t = (x_{1t}, x_{2t})'\)。
- \(\mathbf{r} = (r_1, r_2, ..., r_K)'\): 阈值参数(向量),是待估计的未知门槛值。每个 \(r_k\) 对应一个阈值变量 \(x_{kt}\)。
- \(\boldsymbol{\phi}_j\): 第 \(j\) 个体制(regime)下的自回归系数(向量)。在2-TAR模型中,有 \(2^K = 4\) 个体制,对应 \(\boldsymbol{\phi}_1, \boldsymbol{\phi}_2, \boldsymbol{\phi}_3, \boldsymbol{\phi}_4\)。
- \(\mathbf{z}_t\): 在时间点 \(t\) 的回归变量(向量),通常包含 \(y_t\) 的滞后项,如 \(\mathbf{z}_t = (1, y_{t-1}, ..., y_{t-p})'\)。
- \(\varepsilon_t\): 在时间点 \(t\) 的模型误差(标量),通常假设为独立同分布(i.i.d.)的零均值随机变量。
- \(n\): 样本量(时间序列长度)。
- \(\mathbb{I}(\cdot)\): 示性函数(indicator function)。
-
模型:一个 \(K\)-阈值变量自回归模型(K-TAR)的数据生成机制如下:
\[y_t = \sum_{j=1}^{2^K} \boldsymbol{\phi}_j' \mathbf{z}_t \cdot \mathbb{I}\left( (x_{1t}, ..., x_{Kt}) \in \mathcal{R}_j(\mathbf{r}) \right) + \varepsilon_t\]其中,\(\mathcal{R}_j(\mathbf{r})\) 是由阈值参数 \(\mathbf{r}\) 划分的 \(2^K\) 个不相交的“体制区域”(regime regions)。例如,对于2-TAR模型,四个区域为:- \(\mathcal{R}_1 = \{x_{1t} \le r_1, x_{2t} \le r_2\}\)
- \(\mathcal{R}_2 = \{x_{1t} \le r_1, x_{2t} > r_2\}\)
- \(\mathcal{R}_3 = \{x_{1t} > r_1, x_{2t} \le r_2\}\)
- \(\mathcal{R}_4 = \{x_{1t} > r_1, x_{2t} > r_2\}\) 模型假设:\(\mathbf{z}_t\) 和 \(\varepsilon_t\) 是已知的;\(\boldsymbol{\phi}_j\) 和 \(\mathbf{r}\) 是待估参数。阈值变量 \(x_t\) 可以是外生的(与 \(\varepsilon_t\) 独立)或内生的(与 \(\varepsilon_t\) 相关)。
-
可观测数据:研究者能观测到的是时间序列 \(\{y_t, \mathbf{z}_t, x_t\}_{t=1}^n\)。想要但观测不到的是:真实的阈值参数 \(\mathbf{r}\)、各体制下的系数 \(\boldsymbol{\phi}_j\)、以及模型误差 \(\varepsilon_t\)。识别依赖于模型假设(如误差的独立性、阈值变量的可观测性)。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:一个2-TAR模型,且两个阈值变量都是外生的。
在这个特例下,要解决的问题是:如何估计两个阈值参数 \(r_1\) 和 \(r_2\),并构造它们的置信区间?
-
估计:最小二乘估计(LSE)通过最小化残差平方和来同时估计所有参数:
\[(\hat{\mathbf{r}}, \hat{\boldsymbol{\phi}}_1, ..., \hat{\boldsymbol{\phi}}_4) = \arg \min_{\mathbf{r}, \boldsymbol{\phi}} \sum_{t=1}^n \left( y_t - \sum_{j=1}^4 \boldsymbol{\phi}_j' \mathbf{z}_t \cdot \mathbb{I}\left( (x_{1t}, x_{2t}) \in \mathcal{R}_j(\mathbf{r}) \right) \right)^2\]由于 \(\mathbf{r}\) 是离散的(在观测数据点上取值),这个优化可以通过网格搜索实现:对每个候选的 \((r_1, r_2)\) 组合,用OLS估计 \(\boldsymbol{\phi}_j\),然后选择使总残差平方和最小的那个组合。 -
核心发现(渐近独立性):Li, Ling, and Tong (2016) 证明,在这个外生设定下,两个阈值参数的LSE \(\hat{r}_1\) 和 \(\hat{r}_2\) 在渐近意义上是独立的。这意味着,它们的联合推断可以简化为两个独立的单变量推断问题。这个性质非常强,它源于两个阈值变量在划分样本空间时的“正交”结构。
-
置信区间构造(加权NW方法):本文的核心贡献是,即使在这个外生特例下,如何构造 \(\hat{r}_1\) 的置信区间?传统的Hansen (2000) 方法依赖于似然比统计量,但它在内生性下会失效。本文提出的加权NW方法则不同:
- 思路:考虑一个“profile”目标函数 \(S_n(r_1)\),它是固定 \(r_1\) 后,对 \(r_2\) 进行优化得到的最小残差平方和。\(S_n(r_1)\) 在真实值 \(r_1^0\) 附近有一个“谷底”。加权NW方法的核心是,用核密度估计来平滑这个目标函数,从而得到一个更稳定的估计和置信区间。
- 具体操作:对于每个候选的 \(r_1\),计算一个“加权”的profile目标函数:
\[\tilde{S}_n(r_1) = \frac{\sum_{i=1}^n K\left(\frac{r_1 - x_{1i}}{h}\right) \cdot S_n(x_{1i})}{\sum_{i=1}^n K\left(\frac{r_1 - x_{1i}}{h}\right)}\]其中 \(K(\cdot)\) 是核函数,\(h\) 是带宽。这本质上是对 \(S_n(r_1)\) 进行Nadaraya-Watson核回归。然后,置信区间可以通过 \(\tilde{S}_n(r_1)\) 的“谷底”位置和某种渐近正态性来构造。
- 为什么有效:加权NW方法通过局部平均,有效地“抹平”了由于有限样本波动和潜在内生性带来的噪声,使得估计的阈值参数更稳定,其置信区间也更可靠。它不依赖于似然比统计量的特定分布,因此对模型设定(如内生性)更稳健。
总结:本文的最小内核是:利用两个阈值参数LSE的渐近独立性,将联合推断分解为两个独立的单变量推断问题;然后,针对每个单变量推断问题,提出一种基于核平滑的加权NW方法,以构造稳健的置信区间。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:研究了多阈值变量自回归模型(K-TAR)的最小二乘估计(LSE),特别是2-TAR模型下两个阈值参数的联合推断问题,并解决了内生阈值变量下置信区间构造的难题。
- 核心工具/方法:提出了加权Nadaraya-Watson (NW) 方法,通过对profile目标函数进行核平滑来构造阈值参数的置信区间。
- 主要结论:证明了2-TAR模型下两个阈值参数的LSE渐近独立;证明了加权NW方法构造的置信区间,无论阈值变量是内生还是外生,都具有正确的渐近覆盖概率;并将结果推广到了K-TAR模型。
关键设定与假设¶
- 模型:K-TAR模型,如第二节所述。本文重点研究2-TAR模型,并讨论向K>2的扩展。
- 假设:
- A1 (平稳性与遍历性):\(\{y_t, \mathbf{z}_t, x_t\}\) 是严格平稳且绝对正则(\(\beta\)-mixing)的。这是时间序列渐近理论的标准假设。
- A2 (阈值变量的连续性):阈值变量 \(x_{kt}\) 的累积分布函数(CDF)是连续的,且在真实阈值 \(r_k^0\) 处有正密度。这是保证阈值参数可识别和估计量超一致性的关键。
- A3 (误差项):\(\varepsilon_t\) 是i.i.d.的,均值为0,方差为 \(\sigma^2\),且与 \(\mathbf{z}_t\) 独立。注意:这里允许 \(\varepsilon_t\) 与阈值变量 \(x_t\) 相关(即内生性),这是本文与以往工作的关键区别。
- A4 (核函数与带宽):核函数 \(K(\cdot)\) 是对称、有界、Lipschitz连续的概率密度函数;带宽 \(h\) 满足 \(h \to 0\) 且 \(nh^2 \to \infty\)。这是核平滑方法的标准条件。
- 相比已有文献:相比Li, Ling, and Tong (2016),本文放宽了对阈值变量外生性的要求;相比Yu, Li, and Tong (2023),本文提出了一个能处理内生性的新方法。
主要结果¶
- 定理1 (渐近独立性):在2-TAR模型下,两个阈值参数的LSE \(\hat{r}_1\) 和 \(\hat{r}_2\) 是渐近独立的。具体地,它们的联合极限分布是两个独立的复合泊松过程的乘积。这个结果直接来自Li, Ling, and Tong (2016),本文将其作为基础。
- 定理2 (加权NW置信区间的渐近覆盖概率):对于2-TAR模型,由加权NW方法构造的置信区间 \(CI_{1-\alpha}(r_k)\) 满足:
\[\lim_{n \to \infty} P\left( r_k^0 \in CI_{1-\alpha}(r_k) \right) = 1 - \alpha\]这个结果不依赖于阈值变量 \(x_{kt}\) 是否与误差 \(\varepsilon_t\) 相关。这是本文的核心理论贡献。证明的关键在于,加权NW方法通过局部平均,有效地消除了内生性带来的偏差。
- 定理3 (向K-TAR的扩展):作者论证了,对于K-TAR模型,K个阈值参数的LSE是渐近独立的。因此,加权NW方法可以独立地应用于每个阈值参数,从而构造其置信区间。这个扩展是直接的,但作者没有给出完整的证明,而是提供了详细的论证思路。
证明路线与技术技巧¶
-
整体路线:
- 建立LSE的渐近性质:首先,证明2-TAR模型下LSE的一致性,并推导出两个阈值参数LSE的渐近独立性(引用Li, Ling, and Tong, 2016)。
- 构造profile目标函数:定义关于单个阈值参数 \(r_1\) 的profile目标函数 \(S_n(r_1)\),它是在固定 \(r_1\) 后,对 \(r_2\) 和所有 \(\boldsymbol{\phi}_j\) 进行优化得到的最小残差平方和。
- 分析profile目标函数的渐近行为:证明 \(S_n(r_1)\) 在真实值 \(r_1^0\) 附近有一个“谷底”,且其形状由复合泊松过程决定。这是证明加权NW方法有效性的基础。
- 引入加权NW方法:用核平滑方法对 \(S_n(r_1)\) 进行平滑,得到 \(\tilde{S}_n(r_1)\)。
- 证明加权NW估计量的渐近正态性:证明 \(\tilde{S}_n(r_1)\) 的“谷底”位置(即加权NW估计量 \(\tilde{r}_1\))是渐近正态的,且其方差可以被一致估计。这个证明依赖于核平滑的渐近理论(如U-统计量的渐近正态性)和profile目标函数的局部行为。
- 构造置信区间:基于渐近正态性,构造 \(\tilde{r}_1\) 的置信区间,并证明其渐近覆盖概率为 \(1-\alpha\)。关键步骤是证明,无论内生性是否存在,加权NW方法都能消除偏差,使得置信区间有效。
-
关键跳跃点:
- 从LSE的渐近独立性到加权NW方法的有效性:渐近独立性保证了我们可以单独处理每个阈值参数,但如何将这种独立性转化为一个可操作的、对内生性稳健的推断方法?这是本文的核心跳跃。作者通过引入核平滑,将离散的、非光滑的profile目标函数转化为一个光滑的、渐近正态的估计量,从而绕过了内生性带来的复杂问题。
- 处理内生性:当阈值变量内生时,profile目标函数 \(S_n(r_1)\) 的“谷底”位置可能是有偏的。加权NW方法通过局部平均,有效地“抹平”了这个偏差。证明这一点需要仔细分析 \(S_n(r_1)\) 在 \(r_1^0\) 附近的局部行为,并利用核平滑的偏差-方差权衡。
-
技术技巧点名:
- 核平滑 (Kernel Smoothing):加权NW方法本身就是一种核平滑技术,用于估计profile目标函数的条件期望。
- U-统计量渐近理论:证明加权NW估计量的渐近正态性时,需要用到U-统计量的渐近理论,因为 \(\tilde{S}_n(r_1)\) 可以看作一个二阶U-统计量。
- 经验过程理论 (Empirical Process Theory):用于处理profile目标函数 \(S_n(r_1)\) 的随机性,并证明其一致收敛性。
- 复合泊松过程 (Compound Poisson Process):用于描述LSE的极限分布,这是阈值模型推断的标准工具。
真实例子与应用¶
本文包含两个真实数据例子:
-
美国失业率数据:
- 数据/场景:美国月度失业率数据(1948-2022年)。作者试图用2-TAR模型来建模失业率的动态变化,其中两个阈值变量分别是失业率自身的一阶滞后和一个经济政策不确定性指数。
- 方法应用:作者首先用LSE估计了2-TAR模型,然后使用加权NW方法为两个阈值参数构造了置信区间。
- 结果:模型识别出了两个不同的体制,分别对应“低失业率/低不确定性”和“高失业率/高不确定性”时期。置信区间显示,阈值参数的估计是相当精确的。
- 例子目的:展示2-TAR模型在实际经济数据中的应用价值,并验证加权NW方法在真实数据上的表现。
-
中国GDP增长率数据:
- 数据/场景:中国季度GDP增长率数据(1992-2022年)。作者试图用2-TAR模型来建模经济增长的“换挡”现象,其中两个阈值变量分别是GDP增长率自身的一阶滞后和一个货币供应量增长率。
- 方法应用:同上。
- 结果:模型识别出了“高速增长”和“中高速增长”两个体制,并发现货币供应量是影响增长换挡的一个重要阈值变量。
- 例子目的:进一步验证模型在不同经济背景下的适用性,并展示其发现结构性变化的能力。
🔎 结论是否比证明窄¶
- 是。本文的核心定理(定理2)严格证明了加权NW方法在2-TAR模型下的渐近覆盖概率。然而,作者在结论部分声称该方法可以“直接”推广到K-TAR模型,并给出了一个扩展思路(定理3)。这个扩展思路缺乏严格的证明,它依赖于一个未经验证的假设:K个阈值参数的LSE是渐近独立的。虽然这个假设在2-TAR下成立,但在K>2时,其证明可能更复杂,且可能依赖于额外的条件。因此,“直接推广”的结论比严格证明的结论要宽。读者应将其视为一个合理的猜想或未来工作方向,而非一个已被证明的事实。
四、开放问题¶
-
K-TAR模型的严格证明:本文对K-TAR模型的扩展(定理3)仅提供了思路,缺乏严格的数学证明。一个开放问题是:在K>2的一般设定下,能否严格证明K个阈值参数的LSE是渐近独立的? 这需要处理高维参数空间的复杂性,并可能依赖于更强的假设(如阈值变量的联合分布具有某种“正交”结构)。【扎根于:定理3的陈述及其后的讨论】
-
联合置信域的构造:本文证明了渐近独立性,并给出了单个参数的置信区间,但未提供多个阈值参数的联合置信域(joint confidence region)。一个开放问题是:如何利用渐近独立性构造一个具有正确渐近覆盖概率的联合置信域? 例如,一个简单的做法是使用Bonferroni校正,但可能过于保守。是否存在更高效的方法?【扎根于:定理1和定理2,以及作者在结论部分未讨论联合推断】
-
模型选择与检验:本文假设阈值变量的个数K是已知的。一个更实际的问题是:如何从数据中确定K? 是否存在一个类似于信息准则(如AIC、BIC)或假设检验(如似然比检验)的方法来选择K?由于阈值参数在零假设下不可识别,这个问题在统计上具有挑战性。【扎根于:作者在引言中未讨论模型选择问题】
-
与其他内生性处理方法的比较:本文提出的加权NW方法是一种非参数平滑方法。一个开放问题是:与其他处理内生性的标准方法(如工具变量法、控制函数法)相比,加权NW方法的优劣如何? 例如,在什么条件下,加权NW方法比工具变量法更有效或更稳健?这种比较需要更深入的因果推断理论。【扎根于:作者在引言中淡化了其他竞争路线,但未提供直接比较】
Maintained by 陈星宇 · Homepage · Source on GitHub