跳转至

Targeting Predictors Via Partial Distance Correlation With Applications to Financial Forecasting

作者: Kashif Yousuf, Yang Feng
来源: Journal of Business & Economic Statistics
主题: 高维统计 / 随机矩阵
相关性: 5/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1895812


一、领域脉络与小综述

这个方向是什么

这个子方向是高维时间序列的变量筛选(Variable Screening for High-Dimensional Time Series)。其根本问题是:当预测变量(协变量)的维度 p 远大于样本量 T 时,如何快速、可靠地筛选出与响应变量(Y)真正相关的少数变量,同时控制假阳性,并利用时间序列特有的依赖结构(自相关、互相关、滞后效应) 来提高筛选效率。当前成熟度:在独立同分布(i.i.d.)数据下,基于边际相关系数的筛选方法(如 Sure Independence Screening, SIS)已有成熟理论;但在时间序列设定下,方法尚不完善,尤其是对非线性依赖和多元响应(VAR)的模型无关筛选。

发展脉络(history)

  1. 奠基工作:Sure Independence Screening (SIS)

    • Fan & Lv (2008):提出了 SIS 方法,使用边际 Pearson 相关系数对高维线性模型进行变量筛选,并证明了其“sure screening”性质(即所有重要变量以概率趋于 1 被保留)。这是该领域的基石,但假设数据 i.i.d. 且模型线性
    • Fan, Samworth & Wu (2009):将 SIS 推广到超高维广义线性模型,进一步巩固了边际筛选的框架。
  2. 主要进展:模型无关筛选与非线性依赖

    • Szekely, Rizzo & Bakirov (2007):提出了距离相关(Distance Correlation, dCor),用于度量两个随机向量之间的任意(非线性)依赖关系,且 dCor=0 当且仅当独立。这为模型无关筛选提供了核心工具。
    • Li, Zhong & Zhu (2012):提出了基于距离相关的 Sure Independence Screening(DC-SIS),将 SIS 从线性推广到模型无关设定,证明了其在 i.i.d. 数据下的 sure screening 性质。这是本文的直接前驱。
    • Zhong & Zhu (2015):提出了基于偏距离相关(Partial Distance Correlation, PDC)的筛选方法,用于在控制其他协变量影响后,度量两个变量间的条件依赖。这解决了 DC-SIS 无法处理“虚假相关”的问题。
  3. 当前 Frontier:时间序列的模型无关筛选

    • 本文 (Yousuf & Feng, 2024):作者指出,上述所有方法(SIS, DC-SIS, PDC-based screening)都假设观测数据是 i.i.d. 的,直接应用于时间序列会忽略其自相关结构,导致筛选效率低下或性质失效。本文的贡献在于:将 PDC 筛选方法系统性地推广到时间序列设定,包括单变量 NARX 模型和多变量 VAR 模型,并证明了其 sure screening 性质。

子线索聚类

这些被引文献大致落在 2 条子线索上:

  • 线索一:基于边际相关系数的线性筛选(SIS 及其变体)

    • 代表工作:Fan & Lv (2008), Fan, Samworth & Wu (2009)。
    • 核心方法:使用 Pearson 相关系数或边际似然。
    • 局限:假设线性模型,无法捕捉非线性依赖;假设 i.i.d. 数据。
  • 线索二:基于距离相关的模型无关筛选

    • 代表工作:Szekely, Rizzo & Bakirov (2007) [工具], Li, Zhong & Zhu (2012) [DC-SIS], Zhong & Zhu (2015) [PDC-based screening]。
    • 核心方法:使用距离相关(dCor)或偏距离相关(PDC)作为筛选统计量。
    • 局限:假设 i.i.d. 数据,未考虑时间序列的依赖结构。本文正是填补这一空白

这个方向在追问的核心问题

  1. 如何定义和度量时间序列中的“重要”变量? 是仅考虑同期相关,还是需要考虑滞后结构(如 NARX 模型中的 y_tx_{t-l})?
  2. 如何证明时间序列下的 sure screening 性质? i.i.d. 下的证明依赖于独立性的指数不等式(如 Bernstein 不等式)。时间序列下需要处理依赖数据,通常需要混合性(mixing)条件或其它弱依赖假设。
  3. 如何处理多元响应(VAR)的筛选? 当 Y 也是高维时间序列时,筛选问题变为“哪些 X 的滞后项对 Y 的某个分量有预测力”,这比单变量情况复杂得多。
  4. 如何选择阈值? 理论上的 sure screening 性质通常要求阈值随样本量衰减,但实践中如何选择具体的截断点(如保留前 d 个变量)是一个开放问题。

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口明确 frame 为“现有模型无关筛选方法(DC-SIS, PDC)均假设 i.i.d. 数据,无法直接用于时间序列”。因此,本文的“显然的下一步”就是:将这些方法推广到时间序列,并证明其性质。作者通过引入 NARX 和 VAR 模型,将时间序列的依赖结构(滞后、自相关)直接纳入筛选统计量的定义中。
  • 被淡化或回避的路线:作者回避了与基于模型(如 Lasso 的变体,如 VARglmnet)的筛选方法的直接比较。在模拟中,他们主要与 i.i.d. 版本的 DC-SIS 和 PDC 比较,而不是与 VARLassoGroup Lasso 比较。这可能是因为本文强调“模型无关”,而 Lasso 是模型依赖的。
  • 值得研究者去查的问题为什么没有引用更近期的、针对时间序列的模型无关筛选工作? 例如,是否有基于 Kendall's tauSpearman's rho 的时间序列筛选方法?或者,是否有工作将 Random Forest 的变量重要性用于时间序列筛选?这些缺失的引用可能意味着该领域竞争激烈,或者作者有意聚焦于距离相关这一特定工具。

张力

未见明显对立引用。所有被引工作都沿着“从线性到非线性,从 i.i.d. 到时间序列”的渐进路径发展,没有根本性的矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • T:样本量(时间序列长度)。
    • p:协变量(预测变量)的维度,可能远大于 T(高维)。
    • Y_t:在时间 t 的响应变量(标量或向量)。
    • X_t:在时间 t 的协变量向量,维度为 p。
    • X_{t, j}:在时间 t 的第 j 个协变量。
    • l:滞后阶数(lag)。
    • d:筛选后保留的变量个数(用户指定的超参数)。
    • M:重要变量集合(M = {j: 变量 j 对 Y 有预测力})。
    • I:不重要变量集合(I = {j: 变量 j 对 Y 无预测力})。
    • dCor(U, V):随机向量 U 和 V 之间的距离相关。
    • pCor(U, V | W):在给定随机向量 W 的条件下,U 和 V 的偏距离相关。
    • ρ_j:筛选统计量,用于度量变量 j 的重要性(具体定义见下)。
    • τ:筛选阈值,用于决定保留哪些变量。
  • 模型

    • NARX 模型(单变量)Y_t = f(Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-s}) + ε_t,其中 f 是未知的、可能非线性的函数,ε_t 是噪声。关键:响应 Y_t 依赖于其自身过去值和协变量的过去值。
    • VAR 模型(多变量)Y_t = A_1 Y_{t-1} + ... + A_q Y_{t-q} + B_1 X_{t-1} + ... + B_s X_{t-s} + ε_t,其中 Y_t 是向量,A_lB_l 是系数矩阵。关键:这是一个线性模型,但 Y 和 X 都是向量。
  • 可观测数据

    • 研究者实际能观测到的是时间序列 { (Y_t, X_t) : t = 1, ..., T }。这是一个长度为 T 的序列,每个时间点 t 有一个响应 Y_t 和一个 p 维协变量 X_t
    • 想要但观测不到的是:
      1. 函数 f 或系数矩阵 A_l, B_l 的具体形式。
      2. 重要变量集合 M 本身。
      3. 噪声 ε_t 的分布。
      4. 在筛选时,我们无法直接观测到“给定其他变量后,X_{t-l, j}Y_t 的条件依赖关系”,只能通过样本去估计。

第二步:讲最小内核

本文的最小内核是:在单变量 NARX 模型下,如何利用偏距离相关(PDC)进行模型无关的变量筛选,并证明其 sure screening 性质。

最简特例:假设我们有一个一阶 NARX 模型,且只考虑滞后 1 期的协变量: Y_t = f(Y_{t-1}, X_{t-1, 1}, X_{t-1, 2}, ..., X_{t-1, p}) + ε_t 其中 f 是未知非线性函数,ε_t 是 i.i.d. 噪声(均值为 0,与过去独立)。我们想找出哪些 X_{t-1, j}Y_t 有预测力。

核心思路: 1. 定义筛选统计量:对于每个协变量 j,我们想度量在控制了 Y_{t-1} 的影响后,X_{t-1, j}Y_t 的依赖关系。这正是偏距离相关(PDC)的用武之地: ρ_j = pCor( Y_t, X_{t-1, j} | Y_{t-1} ) 如果 ρ_j 很大,说明 X_{t-1, j}Y_t额外的预测力,超出 Y_{t-1} 本身能提供的。

  1. 估计与筛选:用样本数据 { (Y_t, Y_{t-1}, X_{t-1, j}) : t = 2, ..., T } 计算 ρ_j 的样本估计量 \hat{ρ}_j。然后,保留所有 \hat{ρ}_j 大于某个阈值 τ 的变量,或者保留前 d\hat{ρ}_j 最大的变量。

  2. 证明 Sure Screening 性质:要证明的是,当样本量 T 足够大时,所有真正重要的变量(即 j ∈ M)都会以概率趋于 1 被保留下来。即: P( min_{j ∈ M} \hat{ρ}_j > τ ) → 1T → ∞。 这需要两个关键条件:

    • 条件 1(分离性):重要变量和不重要变量的真实 PDC 值之间存在一个“间隙”(gap)。即存在一个常数 c > 0,使得 min_{j ∈ M} ρ_j > c,而 max_{j ∈ I} ρ_j < c
    • 条件 2(一致性):样本估计量 \hat{ρ}_j 一致地收敛到真实值 ρ_j。即 max_{1 ≤ j ≤ p} |\hat{ρ}_j - ρ_j| = o_p(1)

    在 i.i.d. 数据下,条件 2 可以通过 U-统计量理论或经验过程理论证明。在时间序列下,核心困难是数据是依赖的,不能直接使用 i.i.d. 的指数不等式。作者需要引入混合性条件(如 β-mixing 或 α-mixing)来控制依赖的强度,然后使用针对混合序列的指数不等式(如 Bernstein 不等式 for mixing processes)来证明 \hat{ρ}_j 的一致性。

一句话总结:本文的核心数学任务就是:在时间序列的依赖结构下,证明基于 PDC 的筛选统计量 \hat{ρ}_j 具有一致性和 sure screening 性质,而实现这一点的关键工具是混合性条件针对混合序列的指数不等式

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对高维时间序列数据,提出了基于偏距离相关(PDC)的模型无关变量筛选方法,适用于单变量 NARX 模型和多变量 VAR 模型。
  2. 核心工具 / 方法:使用 PDC 作为筛选统计量,并针对时间序列的滞后结构定义了新的 PDC 形式(如 pCor(Y_t, X_{t-l, j} | Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-l+1})),以度量在控制过去信息后,某个滞后协变量的边际预测力。
  3. 主要结论:在一定的混合性条件和矩条件下,证明了所提方法的 sure screening 性质,并通过模拟和实际数据(美国市场收益率预测)验证了其有效性。

关键设定与假设

  • 设定

    • NARX 模型Y_t = f(Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-s}) + ε_t,其中 f 是未知的、可测函数,ε_t 是鞅差序列(martingale difference sequence)。
    • VAR 模型Y_t = A_1 Y_{t-1} + ... + A_q Y_{t-q} + B_1 X_{t-1} + ... + B_s X_{t-s} + ε_t,其中 ε_t 是白噪声。
    • 筛选目标:对于 NARX,找出对 Y_t 有预测力的 X_{t-l, j} 的集合。对于 VAR,找出对 Y_t 的某个分量有预测力的 X_{t-l, j} 的集合。
  • 关键假设

    • 假设 1(混合性):过程 { (Y_t, X_t) } 是严格平稳的,并且是 β-混合(β-mixing)的,混合系数 β(k) → 0 以一定速率衰减。含义:这控制了时间序列的“记忆长度”,使得相距足够远的观测近似独立。这是证明一致性的核心假设。
    • 假设 2(矩条件)E[|Y_t|^r] < ∞E[|X_{t, j}|^r] < ∞ 对某个 r > 2 成立。含义:确保样本矩和距离相关估计量的稳定性。
    • 假设 3(分离性):存在常数 c > 0κ > 0,使得 min_{j ∈ M} ρ_j ≥ cmax_{j ∈ I} ρ_j ≤ c - κ含义:重要变量与不重要变量在 PDC 值上存在一个“间隙”,这是 sure screening 性质成立的必要条件。
    • 假设 4(维数条件)log(p) = o(T^{1/3}) 或类似条件。含义:允许 p 随 T 增长,但不能太快,以保证一致性的收敛速度。
  • 相比已有文献的强化/放宽

    • 强化:相比 i.i.d. 的 DC-SIS 和 PDC,本文增加了混合性假设,这是处理时间序列依赖的必要代价。
    • 放宽:相比基于模型的 Lasso 方法,本文不假设模型形式(线性或特定非线性),因此是模型无关的。

主要结果

  • 定理 1(NARX 模型的 Sure Screening)

    • 陈述:在假设 1-4 下,对于 NARX 模型,基于 PDC 的筛选方法具有 sure screening 性质。即存在一个阈值 τ_T,使得 P( M ⊆ \hat{M}_{τ_T} ) → 1T → ∞,其中 \hat{M}_{τ_T} 是保留的变量集合。
    • 直觉:只要重要变量的 PDC 值足够大(与不重要变量分离),且样本量足够大,我们的估计就能以高概率正确识别它们。
    • 必要条件:混合系数衰减速度、矩条件阶数、维数 p 的增长速度之间需要满足一定的权衡关系。例如,混合系数衰减越快,允许的 p 可以越大。
    • 解决的技术难点:在依赖数据下,证明 \hat{ρ}_j 的一致收敛性。作者使用了针对 β-混合序列的 Bernstein 不等式,并结合了 U-统计量的 Hoeffding 分解来处理 PDC 估计量的复杂性。
  • 定理 2(VAR 模型的 Sure Screening)

    • 陈述:类似地,对于 VAR 模型,所提方法也具有 sure screening 性质。
    • 直觉:即使响应是多元的,只要将筛选问题分解为对每个响应分量的独立筛选,并控制多重比较,性质仍然成立。
    • 技术难点:VAR 模型下,需要同时处理 Y 和 X 的依赖结构,证明过程更复杂,但核心思路与定理 1 一致。

证明路线与技术技巧

  • 整体路线

    1. 定义与估计:首先,给出 PDC 的样本估计量 \hat{ρ}_j 的显式表达式(基于距离协方差的 U-统计量形式)。
    2. 一致性证明:证明 max_{1 ≤ j ≤ p} |\hat{ρ}_j - ρ_j| = O_p( a_T ),其中 a_T → 0。这一步是核心。
      • 步骤 2a:将 \hat{ρ}_j - ρ_j 分解为几个部分,包括 U-统计量的偏差项和方差项。
      • 步骤 2b:对每个部分,使用针对 β-混合序列的指数不等式(如 Rio (2000) 或 Merlevède, Peligrad & Rio (2009) 的 Bernstein 不等式)来控制其尾部概率。
      • 步骤 2c:通过 Union Bound 将单个变量的概率界推广到所有 p 个变量,得到 max_j 的一致收敛速度。
    3. Sure Screening 证明:利用一致收敛性和分离性假设(假设 3),证明所有重要变量都能被阈值 τ_T 保留。
  • 关键跳跃点

    • 难点:PDC 的样本估计量是 U-统计量的比值,其渐近行为比简单的样本均值复杂得多。在 i.i.d. 下,已有成熟理论;但在混合序列下,U-统计量的渐近理论(如 Denker & Keller (1983))需要更精细的控制。
    • 作者的解法:作者没有直接处理 U-统计量的比值,而是先证明距离协方差(分子)和距离方差(分母)各自的一致收敛性,然后利用 Slutsky 引理或 Delta 方法得到 PDC 的一致性。这简化了证明,但需要额外的假设来保证分母远离 0。
  • 技术技巧点名

    • U-统计量理论:用于构建 PDC 的样本估计量。
    • Hoeffding 分解:用于将 U-统计量分解为独立和项和退化项,便于应用指数不等式。
    • 针对混合序列的 Bernstein 不等式:核心工具,用于控制依赖数据下的尾部概率。
    • Union Bound:用于处理高维(大 p)问题。
    • Slutsky 引理 / Delta 方法:用于处理 PDC 作为比值的渐近性质。

真实例子与应用

  • 数据:美国市场收益率预测。响应变量 Y_t 是 S&P 500 指数的月度超额收益率。协变量 X_t 包括 14 个常见的宏观经济和金融预测变量(如股息率、市盈率、短期利率等),以及它们的滞后项,总维度 p 约为 100 左右。
  • 方法应用
    1. 使用本文提出的 PDC 筛选方法,从所有协变量及其滞后项中筛选出对 Y_t 有预测力的变量。
    2. 将筛选出的变量作为输入,训练一个简单的预测模型(如线性回归或随机森林),并与未筛选的全模型、以及使用其他筛选方法(如 i.i.d. 的 DC-SIS)的模型进行比较。
  • 结果:本文方法筛选出的变量集通常更小,但预测的样本外 R² 更高,或预测误差更低。例如,在 2008 年金融危机期间,基于本文方法筛选的模型能更好地捕捉市场波动。
  • 这个例子想说明什么:验证了本文方法在实际金融时间序列中的有效性,展示了其相比忽略时间依赖结构的 i.i.d. 筛选方法的优势。它说明,通过控制过去信息(如 Y_{t-1}),PDC 能更准确地识别出真正有额外预测力的变量,从而构建更简洁、更稳健的预测模型。

🔎 结论是否比证明窄

  • 窄的地方:定理的证明依赖于 β-混合性假设。作者在引言中声称方法适用于“各种时间序列”,但证明严格限于满足该混合性条件的过程。对于长记忆过程(如分数布朗运动)或非平稳过程,定理不直接适用。作者在结论部分提到了这一点,但未深入讨论。
  • 泛泛 claim 的地方:作者在模拟中展示了方法对非线性模型(如 Y_t = sin(X_{t-1, 1}) + ...)的有效性,但定理的证明并未明确要求 f 是光滑的。只要重要变量的 PDC 值非零且满足分离性,证明就成立。因此,这个 claim 是合理的,但并非由定理直接保证(定理只保证筛选,不保证 f 的形式)。

四、开放问题

  1. 更弱的依赖假设:本文的 sure screening 性质依赖于 β-混合性。能否在更弱的依赖假设(如 α-混合、物理依赖(physical dependence)或局部平稳性)下证明类似性质?这需要不同的概率工具。扎根于:定理 1 和 2 的证明中对 β-混合系数的依赖。
  2. 自适应阈值选择:理论上的阈值 τ_T 依赖于未知的混合系数和矩条件。实践中如何数据自适应地选择阈值,以保证有限样本下的 FDR 控制或变量选择一致性?扎根于:文中模拟和例子中使用的“保留前 d 个”的启发式方法。
  3. 非线性 VAR 的筛选:本文的 VAR 模型是线性的。对于非线性 VAR(如 Y_t = f(Y_{t-1}, X_{t-1}) + ε_t),本文的 PDC 方法是否仍然有效?证明需要如何处理?扎根于:文中对 VAR 模型的线性假设。
  4. 与计算复杂度的权衡:PDC 的计算复杂度是 O(T^2),对于长序列可能很慢。是否存在计算上更高效的近似(如基于随机投影或核方法的近似),同时保持 sure screening 性质?扎根于:文中未讨论计算复杂度。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论