Autoregressive Models for Matrix-Valued Time Series¶
讲者: Kewen Shi
会场: Advances in Network Time Series and Risk Spillovers
报告题目: Heterogeneous Autoregressive Model for Symmetric Matrix-Valued Time Series
链接: arXiv
来源: JCSDS 2026 · 返回会议总览
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:如何对以矩阵形式(而非向量形式)观测到的时间序列数据进行建模与推断。在许多应用中(如宏观经济指标-国家面板、动态交通网络、脑功能成像),每个时间点的观测天然是一个矩阵,其行和列代表不同的分类(如经济指标 vs. 国家)。传统的做法是将矩阵“拉直”成向量,然后使用标准的向量自回归(VAR)模型或因子模型。然而,这种做法会丢失矩阵的固有结构(行-列交互),导致参数数量爆炸(从 \(m^2 + n^2\) 到 \(m^2 n^2\)),且模型系数难以解释。当前这个子方向的成熟度属于早期方法提出与理论奠基阶段——已有零星的因子模型和回归模型尝试利用矩阵结构,但尚未有系统的自回归模型框架。
发展脉络(history)¶
- 奠基工作:向量时间序列的两种主流范式。在矩阵时间序列建模兴起之前,高维时间序列的研究主要分为两条线:
- (i) 正则化向量自回归 (VAR):以 Davis et al. (2012) 的稀疏VAR、Song and Bickel (2011) 的大型VAR、Basu and Michailidis (2015) 的稀疏高维VAR、Negahban and Wainwright (2011) 的低秩矩阵估计为代表。这些工作通过Lasso、低秩约束等正则化手段处理高维VAR中的参数爆炸问题,但核心假设仍是“将多变量观测视为向量”,未利用矩阵的行-列结构。
- (ii) 动态因子模型:以 Lam and Yao (2012) 的因子模型、Fan et al. (2013) 的POET方法为代表。这些工作通过提取少数潜在因子来降维,但同样将观测视为向量,因子载荷矩阵不反映矩阵的行-列分类。
- 主要进展:意识到矩阵结构并初步利用。一些工作开始探索如何利用观测的矩阵结构:
- Hallin and Liška (2011) 研究了多变量时间序列中的子面板结构(subpanel structures),这是对矩阵行/列分组结构的早期关注。
- Tsai and Tsay (2010) 考虑了时间序列间的组约束。
- Wang et al. (2019) 提出了矩阵值高维时间序列的因子模型,采用双线性形式 \(X_t = R F_t C' + E_t\),其中 \(R\) 和 \(C\) 是行和列因子载荷矩阵。这是最接近本文的工作,但它是因子模型而非自回归模型。
- 当前 frontier 与本文的位置:本文(Chen, Xiao, Yang, 2019)是第一个系统性地提出矩阵自回归(MAR)模型的工作。它将VAR(1)的系数矩阵约束为Kronecker积形式 \(\Phi = B \otimes A\),从而将参数从 \(m^2 n^2\) 降至 \(m^2 + n^2\),并保留了行(A)和列(B)的独立解释。本文的位置是在“向量VAR”和“矩阵因子模型”之间开辟了一个新方向:它比正则化VAR更结构化(参数更少、解释性更强),比矩阵因子模型更动态(直接建模自回归依赖而非潜变量)。
子线索聚类¶
这些被引文献大致落在以下3条子线索上: 1. 正则化向量自回归(VAR with regularization):包括 Davis et al. (2012), Song and Bickel (2011), Basu and Michailidis (2015), Guo et al. (2015), Han et al. (2015), Kock and Callot (2015), Negahban and Wainwright (2011), Nardi and Rinaldo (2011), Nicholson et al. (2015)。这一簇的核心是在高维向量设定下,通过稀疏或低秩约束估计VAR系数,但未利用矩阵结构。 2. 矩阵/张量回归与因子模型(Matrix/Tensor regression & factor models):包括 Wang et al. (2019)(矩阵因子模型)、Zhou et al. (2013) 和 Raskutti et al. (2015)(张量回归)、Wang et al. (2018)(标量-矩阵双线性回归)。这一簇的核心是利用双线性或张量结构进行降维,但主要关注回归或因子分解,而非时间序列的自回归建模。 3. Kronecker积与矩阵计算(Kronecker product & matrix computation):包括 Van Loan (2000) 和 Kaufman (1975)。这一簇提供了将矩阵问题转化为Kronecker积形式的技术工具(如最近Kronecker积投影、变量投影法),是本文估计方法(PROJ、LSE)的数学基础。
这个方向在追问的核心问题¶
- 如何定义并解释矩阵时间序列的自回归结构? 即,如何用行和列两个系数矩阵(A和B)来刻画“行内交互”和“列内交互”,并使其具有可解释性?
- 如何估计双线性自回归模型? 由于模型是非线性的(双线性),最小二乘没有闭式解。需要开发迭代算法(如交替最小二乘)或基于Kronecker积投影的方法。
- 如何利用误差协方差矩阵的矩阵结构(Kronecker积形式)来提高效率? 误差矩阵 \(E_t\) 的协方差是一个4维张量,将其分解为行协方差 \(\Sigma_r\) 和列协方差 \(\Sigma_c\) 的Kronecker积,可以大幅减少参数并提高估计效率。
- 如何检验MAR(1)模型相对于无约束VAR(1)的充分性? 即,检验系数矩阵是否真的具有Kronecker积结构。
⚠️ 作者的 framing¶
- 作者的缺口frame:作者将缺口frame成“现有方法(VAR和因子模型)要么参数过多、要么结构利用不足”。具体来说:
- 正则化VAR虽然能处理高维,但“fails to recognize the strong connections within the columns and within the rows”(引言第2段),且系数矩阵“does not have any assumed structure”且“very difficult to interpret”。
- 矩阵因子模型(Wang et al., 2019)虽然利用了矩阵结构,但它是因子模型而非自回归模型,不直接建模时间依赖。
- 因此,本文提出的MAR(1)模型是“显然的下一步”:它同时利用了矩阵结构(双线性形式)和自回归依赖,且参数数量远少于VAR。
- 被淡化或回避的竞争路线:
- 多项式模型(5):作者提到了更一般的模型 \(X_t = \sum_{i=1}^d A_i X_{t-1} B_i' + E_t\),但明确表示“focus on MAR(1) model... Extensions will be investigated elsewhere”。这意味着作者回避了更灵活但更复杂的多Kronecker积模型,因为其可识别性更差、估计更困难。
- 稀疏或低秩MAR:作者在引言中提到了“we may require both A and B to be sparse”或“low ranks”,但同样表示“these extensions are beyond the scope of this paper”。这意味着作者回避了高维矩阵情形下的正则化估计,只处理了固定维数(m, n较小)的情况。
- 什么明显该被引/该存在、却没出现在intro里?:作者没有引用任何关于非因果VAR(如 Davis and Song, 2020)或非高斯VAR的工作。考虑到作者在讨论“causality condition”时提到了非因果模型的可能性(第18页),但未深入,这是一个值得研究者去查的潜在缺口:MAR模型在非因果或非高斯设定下的识别与估计。
张力¶
未见明显对立引用。所有被引工作基本沿着“向量VAR → 利用矩阵结构”的线性发展,没有出现彼此矛盾或在略不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(X_t\):\(m \times n\) 矩阵,表示时间 \(t\) 的观测。\(m\) 是行数(如经济指标数),\(n\) 是列数(如国家数)。
- \(A\):\(m \times m\) 矩阵,行自回归系数,刻画行之间的交互(如不同经济指标之间的影响)。
- \(B\):\(n \times n\) 矩阵,列自回归系数,刻画列之间的交互(如不同国家之间的影响)。
- \(E_t\):\(m \times n\) 矩阵,白噪声误差,均值为0,协方差为 \(\text{Cov}(\text{vec}(E_t)) = \Sigma\)(一个 \(mn \times mn\) 矩阵)。
- \(\text{vec}(\cdot)\):矩阵向量化算子,将矩阵按列堆叠成向量。
- \(\otimes\):Kronecker积。
- \(\|\cdot\|_F\):Frobenius范数。
- \(\rho(\cdot)\):矩阵的谱半径。
- 参数/estimand:\(A\) 和 \(B\) 是待估的自回归系数。\(\Sigma\)(或 \(\Sigma_r, \Sigma_c\))是待估的误差协方差参数。
- 随机变量/样本:\(X_t\) 是观测到的随机矩阵序列。\(E_t\) 是不可观测的随机误差。
- 维数/样本量:\(m, n\) 是矩阵的行数和列数(固定)。\(T\) 是时间序列长度(样本量)。
- 潜在量:无。这是一个完全可观测的时间序列模型,没有反事实或潜在变量。
-
模型:
- MAR(1)模型:\(X_t = A X_{t-1} B' + E_t\)。
- 数据生成机制:给定 \(X_{t-1}\),\(X_t\) 的条件均值是 \(A X_{t-1} B'\),加上一个均值为0的随机噪声 \(E_t\)。
- 等价向量形式:\(\text{vec}(X_t) = (B \otimes A) \text{vec}(X_{t-1}) + \text{vec}(E_t)\)。这显示MAR(1)是VAR(1)的一个特例,其系数矩阵被约束为Kronecker积形式。
- 已知/未知:\(X_t\) 是已知的观测。\(A, B, \Sigma\) 是未知参数,需要估计。
- 因果性条件:\(\rho(A) \cdot \rho(B) < 1\),保证过程平稳且因果(即 \(X_t\) 可以表示为过去噪声的线性组合)。
-
可观测数据:
- 研究者实际能观测到的是矩阵时间序列 \(\{X_1, X_2, \dots, X_T\}\),每个 \(X_t\) 是一个 \(m \times n\) 的实数矩阵。
- 研究者想要但观测不到的是:系数矩阵 \(A\) 和 \(B\),以及误差矩阵 \(E_t\) 及其协方差 \(\Sigma\)。这些只能通过模型假设和估计来推断。
第二步:讲最小内核¶
本文的核心思路可以浓缩为一个最简特例:\(m = n = 2\)(即每个时间点观测到一个 \(2 \times 2\) 矩阵),且误差 \(E_t\) 的条目独立同分布(\(\Sigma = I\))。
在这个特例下,模型为:
要解决的数学问题:给定观测 \(\{X_1, \dots, X_T\}\),如何估计 \(A\) 和 \(B\)?
核心思路:将问题转化为一个最近Kronecker积(NKP)问题或交替最小二乘问题。
-
NKP视角(PROJ估计):
- 首先,忽略Kronecker积结构,直接对向量化数据 \(\text{vec}(X_t)\) 拟合一个无约束的VAR(1)模型,得到 \(\hat{\Phi}\)(一个 \(4 \times 4\) 矩阵)。
- 然后,寻找一个Kronecker积 \(B \otimes A\) 来“最佳逼近” \(\hat{\Phi}\),即求解:
\[\min_{A, B} \| \hat{\Phi} - B \otimes A \|_F^2\]
- 这个NKP问题有闭式解:将 \(\hat{\Phi}\) 重新排列成一个 \(4 \times 4\) 矩阵 \(\tilde{\Phi}\)(具体排列方式见论文),然后对 \(\tilde{\Phi}\) 做SVD,取最大奇异值对应的左、右奇异向量,分别重塑为 \(2 \times 2\) 矩阵,即得到 \(\hat{A}\) 和 \(\hat{B}\)(满足 \(\|\hat{A}\|_F = 1\))。
-
交替最小二乘视角(LSE估计):
- 直接最小化预测误差:
\[\min_{A, B} \sum_{t=2}^T \| X_t - A X_{t-1} B' \|_F^2\]
- 这个问题没有闭式解,但可以通过交替迭代求解:
- 固定 \(A\),更新 \(B\):这是一个关于 \(B\) 的线性最小二乘问题,有闭式解。
- 固定 \(B\),更新 \(A\):同样是一个关于 \(A\) 的线性最小二乘问题。
- 重复直到收敛。初始值可以用PROJ估计。
- 直接最小化预测误差:
为什么这个特例抓住了核心:即使在这个最简单的 \(2 \times 2\) 例子中,双线性形式 \(A X_{t-1} B'\) 已经体现了“行交互”和“列交互”的分离。NKP方法展示了如何从无约束VAR中“提取”Kronecker积结构;交替最小二乘则展示了如何处理双线性优化。论文的一般情形(任意 \(m, n\),结构化误差协方差)只是这个特例的“加壳”——估计方法(PROJ、LSE、MLEs)和理论(渐近正态性)都是在这个核心思想上扩展的。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:提出了一个用于矩阵值时间序列的双线性自回归模型(MAR),该模型通过左乘行系数矩阵 \(A\) 和右乘列系数矩阵 \(B'\) 来建模 \(X_t\) 对 \(X_{t-1}\) 的依赖,从而在保持矩阵结构的同时大幅减少参数数量。
- 核心工具/方法:开发了三种估计方法——投影估计(PROJ)(基于最近Kronecker积投影)、最小二乘估计(LSE)(基于交替最小二乘迭代)、以及结构化误差下的极大似然估计(MLEs)(假设误差协方差具有Kronecker积结构 \(\Sigma_c \otimes \Sigma_r\),并联合迭代估计 \(A, B, \Sigma_r, \Sigma_c\))。
- 主要结论:建立了三种估计量的渐近正态性(Theorem 2-4),证明了在正确设定下MLEs比LSE更有效(Corollary 5),并提出了一个模型设定检验(Corollary 6)来检验MAR(1)相对于无约束VAR(1)的充分性。模拟和真实数据例子验证了方法的有限样本性能。
关键设定与假设¶
- 模型:\(X_t = A X_{t-1} B' + E_t\),其中 \(A \in \mathbb{R}^{m \times m}, B \in \mathbb{R}^{n \times n}\)。
- 可识别性约束:\(\|A\|_F = 1\)(因为 \((A, B)\) 和 \((cA, B/c)\) 生成相同的Kronecker积)。
- 因果性条件:\(\rho(A) \cdot \rho(B) < 1\)(Proposition 1),保证过程平稳且可表示为因果的无穷移动平均。
- 误差假设:
- 基本假设:\(\{E_t\}\) 是矩阵白噪声(无序列相关),均值为0,协方差为 \(\Sigma = \text{Cov}(\text{vec}(E_t))\)。
- LSE的额外假设:\(E_t\) 独立同分布,且绝对连续(Condition R),用于保证最小二乘解的唯一性(有限个局部极小)。
- MLEs的额外假设:\(\Sigma = \Sigma_c \otimes \Sigma_r\)(结构化协方差),且 \(\|\Sigma_r\|_F = 1\)(可识别性)。
- 与已有文献的对比:相比无约束VAR(1)(需要估计 \(m^2 n^2\) 个参数),MAR(1) 只估计 \(m^2 + n^2 - 1\) 个参数(由于可识别性约束),这是一个巨大的降维。相比矩阵因子模型(Wang et al., 2019),MAR(1) 直接建模自回归依赖,而非通过潜变量。
主要结果¶
- Theorem 2(PROJ的渐近分布):在模型(2)正确设定下,PROJ估计量 \(\hat{A}_1, \hat{B}_1\) 以及它们的Kronecker积 \(\hat{B}_1 \otimes \hat{A}_1\) 是 \(\sqrt{T}\)-相合且渐近正态的。渐近协方差由 \(\hat{\Phi}\)(无约束VAR估计)的渐近协方差 \(\Gamma_0^{-1} \otimes \Sigma\) 经过线性变换得到。
- Theorem 3(LSE的渐近分布):在额外假设(R)下,LSE估计量 \(\hat{A}_2, \hat{B}_2\) 是 \(\sqrt{T}\)-相合且渐近正态的。渐近协方差为 \(\Xi_2 = H^{-1} E(W_t \Sigma W_t') H^{-1}\),其中 \(H = E(W_t W_t') + \gamma \gamma'\),\(W_t\) 是一个由 \(X_t, A, B\) 构成的矩阵。
- Theorem 4(MLEs的渐近分布):在结构化协方差假设(4)下,MLEs估计量 \(\hat{A}_3, \hat{B}_3\) 是 \(\sqrt{T}\)-相合且渐近正态的。渐近协方差为 \(\Xi_3 = \tilde{H}^{-1} E(W_t \Sigma^{-1} W_t') \tilde{H}^{-1}\),其中 \(\tilde{H} = E(W_t \Sigma^{-1} W_t') + \gamma \gamma'\)。
- Corollary 5(效率比较):在结构化协方差假设下,\(\Xi_2 \geq \Xi_3\)(矩阵半正定意义下),即MLEs比LSE渐近更有效。证明利用了谱分解和条件协方差的正定性。
- Corollary 6(模型设定检验):基于PROJ估计的残差 \(\hat{D} = \tilde{\Phi} - \text{vec}(\hat{A}_1) \text{vec}(\hat{B}_1)'\),构造了一个检验统计量,在原假设(模型正确)下渐近服从 \(\chi^2_{(m^2-1)(n^2-1)}\) 分布。这提供了一个检验“系数矩阵是否具有Kronecker积结构”的方法。
证明路线与技术技巧(理论型)¶
- 整体路线(以Theorem 3为例):
- 一致性:利用凸性论证(Lemma 8)证明LSE是 \(\sqrt{T}\)-相合的。关键点是:目标函数 \(\sum \|X_t - A X_{t-1} B'\|_F^2\) 是 \((A, B)\) 的凸函数(在向量化后),且当参数远离真值时,目标函数值以高概率大于真值处的值。
- 梯度条件:写出LSE的一阶条件(方程15),并在真值附近做泰勒展开。
- 线性化:将梯度条件线性化为一个关于 \((\text{vec}(\hat{A}_2 - A), \text{vec}(\hat{B}_2' - B'))\) 的线性方程(方程31),其系数矩阵是 \(\sum_t W_{t-1} W_{t-1}'\),右侧是 \(\sum_t W_{t-1} \text{vec}(E_t)\)。
- 处理秩亏:注意到 \(E(W_t W_t')\) 是奇异的(因为 \(E(W_t W_t') (\alpha', -\beta')' = 0\)),但通过添加可识别性约束 \(\|\hat{A}_2\|_F = 1\)(即 \(\alpha' \text{vec}(\hat{A}_2 - A) = o_P(T^{-1/2})\)),将系数矩阵修正为满秩的 \(H = E(W_t W_t') + \gamma \gamma'\)。
- 应用CLT:对 \(\sum_t W_{t-1} \text{vec}(E_t)\) 应用鞅差中心极限定理(Hall and Heyde, 1980),得到其渐近正态性,进而得到 \((\hat{A}_2, \hat{B}_2)\) 的渐近正态性。
- 关键跳跃点:
- 从梯度条件到线性方程:需要处理双线性项 \(A X_{t-1} B'\) 的线性化。关键技巧是使用Kronecker积的性质:\(\text{vec}(A X_{t-1} B') = (B \otimes A) \text{vec}(X_{t-1})\),然后对 \((B \otimes A)\) 在真值附近做一阶展开。
- 处理 \(E(W_t W_t')\) 的奇异性:这是证明中最吃劲的部分。作者巧妙地利用了可识别性约束 \(\|A\|_F = 1\) 来“填补”秩亏,构造了满秩矩阵 \(H\)。这个技巧在Theorem 4的证明中也被使用。
- 技术技巧点名:
- Kronecker积与向量化:贯穿全文,用于将矩阵方程转化为向量方程。
- 最近Kronecker积(NKP)投影:用于PROJ估计,通过SVD得到闭式解。
- 交替最小二乘:用于LSE和MLEs的迭代算法。
- 凸性论证:用于证明LSE的一致性(Lemma 8),利用了目标函数的凸性和边界上的概率下界。
- 鞅差中心极限定理:用于推导LSE和MLEs的渐近正态性。
- 谱分解与条件协方差:用于证明Corollary 5(效率比较),将协方差矩阵的差转化为一个条件协方差矩阵,从而证明其半正定性。
真实例子与应用¶
- 数据:1990-2016年五个国家(加拿大、法国、德国、英国、美国)的四个季度经济指标(3个月银行间利率、GDP增长、工业生产增长、CPI增长),形成一个 \(4 \times 5\) 的矩阵时间序列(\(m=4, n=5, T=107\))。
- 如何应用:拟合MAR(1)模型,使用三种估计方法(PROJ, LSE, MLEs),并与无约束VAR(1)和单变量AR(1)/AR(2)模型比较。
- 结果:
- 拟合优度:MAR(1)-LSE的残差平方和(1468)远小于单变量AR(1)(1724)和AR(2)(1663),但大于VAR(1)(1121)。作者指出VAR(1)的400个参数导致过拟合。
- 系数解释:左系数矩阵 \(A\) 显示,过去利率对当前GDP、生产、CPI有负影响;过去GDP对当前指标有正影响。右系数矩阵 \(B\) 显示,美国过去指标对所有国家当前指标有显著正影响,且影响最大。
- 脉冲响应:展示了“冲击优先”正交脉冲响应函数(s1-oIRF)。例如,美国利率冲击会导致其他国家利率在一年内正向响应,而GDP先正后负。
- 预测:在滚动预测中,MAR(1)-LSE的预测误差平方和(141.82)略大于单变量AR(1)(136.00),但远小于VAR(1)(296.62)。作者认为这是多变量模型的常见现象。
- 这个例子想说明什么:主要目的是验证模型的可解释性——系数矩阵 \(A\) 和 \(B\) 确实能捕捉到经济指标之间和国家之间的有意义的交互模式,且脉冲响应函数具有直观的“行-列分离”结构(如美国利率冲击对各国的影响是成比例的)。次要目的是展示MAR(1)在参数数量远少于VAR(1)的情况下,预测性能并未大幅下降。
🔎 结论是否比证明窄¶
- 窄结论1:Theorem 2-4 的渐近正态性是在固定维数 \(m, n\) 下证明的。论文没有提供当 \(m, n\) 随 \(T\) 增长时的高维理论。作者在结论部分提到“The impact of dimension m and n on the accuracy... are hidden in the asymptotic variances”,并建议使用稀疏或低秩正则化来处理大维情形,但没有给出任何高维下的收敛速度或相合性证明。这是一个明显的“证明比结论窄”的地方。
- 窄结论2:Corollary 5(MLEs比LSE更有效)的证明依赖于误差协方差矩阵 \(\Sigma\) 确实具有Kronecker积结构。如果这个假设错误(如Setting II),MLEs可能并不比LSE更有效(模拟显示两者相似,甚至MLEs略好,但理论未覆盖)。
- 窄结论3:模型设定检验(Corollary 6)的渐近卡方分布是在原假设(模型正确) 下推导的。论文没有分析该检验在局部备择假设下的功效,也没有给出检验统计量的非零分布。模拟中只展示了在“多Kronecker积”备择下的经验功效,但未提供理论保证。
四、开放问题(点到为止,扎根具体语句)¶
- 高维MAR的估计与理论:当 \(m, n\) 随 \(T\) 增长时,如何估计 \(A\) 和 \(B\)?论文在结论中提到“Sparsity, group sparsity or other structures might be imposed on A and B to reach a further dimension reduction”(第36页),但未给出任何理论结果。这是一个明确的开放问题:建立稀疏或低秩MAR模型在高维下的估计相合性与收敛速度。
- 多Kronecker积模型(高阶MAR)的识别与估计:论文提到了更一般的模型 \(X_t = \sum_{i=1}^d A_i X_{t-1} B_i' + E_t\)(方程5),但指出“there is obviously a more severe identifiability issue”(第7页)。如何解决这个可识别性问题?如何设计有效的估计算法? 这是模型扩展的自然方向。
- 非因果或非高斯MAR:论文在讨论因果性条件时提到“non-causal vector autoregression may be considered”(第18页),并引用了 Davis and Song (2012) 和 Lanne and Saikkonen (2013)。在非因果或非高斯设定下,MAR模型是否仍然可识别?估计方法是否需要改变? 这是一个值得探索的交叉方向。
- 模型设定检验的局部功效:论文提出的检验(Corollary 6)在原假设下是有效的,但在局部备择假设(如 \(X_t = A X_{t-1} B' + \frac{\delta}{\sqrt{T}} C X_{t-1} D' + E_t\))下的渐近分布是什么? 这决定了检验能检测到多小的偏离。论文未讨论这一点。
Maintained by 陈星宇 · Homepage · Source on GitHub