Targeting Predictors Via Partial Distance Correlation With Applications to Financial Forecasting¶
作者: Kashif Yousuf, Yang Feng
来源: Journal of Business & Economic Statistics
主题: 高维统计 / 随机矩阵
相关性: 5/10
机构绿灯: Columbia University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1080/07350015.2021.1895812
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向是高维时间序列的变量筛选(Variable Screening for High-Dimensional Time Series)。其根本问题是:当预测变量(协变量)的维度 p 远大于样本量 T 时,如何快速、可靠地筛选出与响应变量(Y)真正相关的少数变量,同时控制假阳性,并利用时间序列特有的依赖结构(自相关、互相关、滞后效应) 来提高筛选效率。当前成熟度:在独立同分布(i.i.d.)数据下,基于边际相关系数的筛选方法(如 Sure Independence Screening, SIS)已有成熟理论;但在时间序列设定下,方法尚不完善,尤其是对非线性依赖和多元响应(VAR)的模型无关筛选。
发展脉络(history)¶
-
奠基工作:Sure Independence Screening (SIS)
- Fan & Lv (2008):提出了 SIS 方法,使用边际 Pearson 相关系数对高维线性模型进行变量筛选,并证明了其“sure screening”性质(即所有重要变量以概率趋于 1 被保留)。这是该领域的基石,但假设数据 i.i.d. 且模型线性。
- Fan, Samworth & Wu (2009):将 SIS 推广到超高维广义线性模型,进一步巩固了边际筛选的框架。
-
主要进展:模型无关筛选与非线性依赖
- Szekely, Rizzo & Bakirov (2007):提出了距离相关(Distance Correlation, dCor),用于度量两个随机向量之间的任意(非线性)依赖关系,且 dCor=0 当且仅当独立。这为模型无关筛选提供了核心工具。
- Li, Zhong & Zhu (2012):提出了基于距离相关的 Sure Independence Screening(DC-SIS),将 SIS 从线性推广到模型无关设定,证明了其在 i.i.d. 数据下的 sure screening 性质。这是本文的直接前驱。
- Zhong & Zhu (2015):提出了基于偏距离相关(Partial Distance Correlation, PDC)的筛选方法,用于在控制其他协变量影响后,度量两个变量间的条件依赖。这解决了 DC-SIS 无法处理“虚假相关”的问题。
-
当前 Frontier:时间序列的模型无关筛选
- 本文 (Yousuf & Feng, 2024):作者指出,上述所有方法(SIS, DC-SIS, PDC-based screening)都假设观测数据是 i.i.d. 的,直接应用于时间序列会忽略其自相关结构,导致筛选效率低下或性质失效。本文的贡献在于:将 PDC 筛选方法系统性地推广到时间序列设定,包括单变量 NARX 模型和多变量 VAR 模型,并证明了其 sure screening 性质。
子线索聚类¶
这些被引文献大致落在 2 条子线索上:
-
线索一:基于边际相关系数的线性筛选(SIS 及其变体)
- 代表工作:Fan & Lv (2008), Fan, Samworth & Wu (2009)。
- 核心方法:使用 Pearson 相关系数或边际似然。
- 局限:假设线性模型,无法捕捉非线性依赖;假设 i.i.d. 数据。
-
线索二:基于距离相关的模型无关筛选
- 代表工作:Szekely, Rizzo & Bakirov (2007) [工具], Li, Zhong & Zhu (2012) [DC-SIS], Zhong & Zhu (2015) [PDC-based screening]。
- 核心方法:使用距离相关(dCor)或偏距离相关(PDC)作为筛选统计量。
- 局限:假设 i.i.d. 数据,未考虑时间序列的依赖结构。本文正是填补这一空白。
这个方向在追问的核心问题¶
- 如何定义和度量时间序列中的“重要”变量? 是仅考虑同期相关,还是需要考虑滞后结构(如 NARX 模型中的
y_t与x_{t-l})? - 如何证明时间序列下的 sure screening 性质? i.i.d. 下的证明依赖于独立性的指数不等式(如 Bernstein 不等式)。时间序列下需要处理依赖数据,通常需要混合性(mixing)条件或其它弱依赖假设。
- 如何处理多元响应(VAR)的筛选? 当 Y 也是高维时间序列时,筛选问题变为“哪些 X 的滞后项对 Y 的某个分量有预测力”,这比单变量情况复杂得多。
- 如何选择阈值? 理论上的 sure screening 性质通常要求阈值随样本量衰减,但实践中如何选择具体的截断点(如保留前
d个变量)是一个开放问题。
⚠️ 作者的 framing¶
- 作者的缺口 frame:作者将缺口明确 frame 为“现有模型无关筛选方法(DC-SIS, PDC)均假设 i.i.d. 数据,无法直接用于时间序列”。因此,本文的“显然的下一步”就是:将这些方法推广到时间序列,并证明其性质。作者通过引入 NARX 和 VAR 模型,将时间序列的依赖结构(滞后、自相关)直接纳入筛选统计量的定义中。
- 被淡化或回避的路线:作者回避了与基于模型(如 Lasso 的变体,如
VAR的glmnet)的筛选方法的直接比较。在模拟中,他们主要与 i.i.d. 版本的 DC-SIS 和 PDC 比较,而不是与VAR的Lasso或Group Lasso比较。这可能是因为本文强调“模型无关”,而 Lasso 是模型依赖的。 - 值得研究者去查的问题:为什么没有引用更近期的、针对时间序列的模型无关筛选工作? 例如,是否有基于
Kendall's tau或Spearman's rho的时间序列筛选方法?或者,是否有工作将Random Forest的变量重要性用于时间序列筛选?这些缺失的引用可能意味着该领域竞争激烈,或者作者有意聚焦于距离相关这一特定工具。
张力¶
未见明显对立引用。所有被引工作都沿着“从线性到非线性,从 i.i.d. 到时间序列”的渐进路径发展,没有根本性的矛盾。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
T:样本量(时间序列长度)。p:协变量(预测变量)的维度,可能远大于 T(高维)。Y_t:在时间t的响应变量(标量或向量)。X_t:在时间t的协变量向量,维度为 p。X_{t, j}:在时间t的第j个协变量。l:滞后阶数(lag)。d:筛选后保留的变量个数(用户指定的超参数)。M:重要变量集合(M = {j: 变量 j 对 Y 有预测力})。I:不重要变量集合(I = {j: 变量 j 对 Y 无预测力})。dCor(U, V):随机向量 U 和 V 之间的距离相关。pCor(U, V | W):在给定随机向量 W 的条件下,U 和 V 的偏距离相关。ρ_j:筛选统计量,用于度量变量j的重要性(具体定义见下)。τ:筛选阈值,用于决定保留哪些变量。
-
模型:
- NARX 模型(单变量):
Y_t = f(Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-s}) + ε_t,其中f是未知的、可能非线性的函数,ε_t是噪声。关键:响应Y_t依赖于其自身过去值和协变量的过去值。 - VAR 模型(多变量):
Y_t = A_1 Y_{t-1} + ... + A_q Y_{t-q} + B_1 X_{t-1} + ... + B_s X_{t-s} + ε_t,其中Y_t是向量,A_l和B_l是系数矩阵。关键:这是一个线性模型,但 Y 和 X 都是向量。
- NARX 模型(单变量):
-
可观测数据:
- 研究者实际能观测到的是时间序列
{ (Y_t, X_t) : t = 1, ..., T }。这是一个长度为 T 的序列,每个时间点 t 有一个响应Y_t和一个 p 维协变量X_t。 - 想要但观测不到的是:
- 函数
f或系数矩阵A_l, B_l的具体形式。 - 重要变量集合
M本身。 - 噪声
ε_t的分布。 - 在筛选时,我们无法直接观测到“给定其他变量后,
X_{t-l, j}与Y_t的条件依赖关系”,只能通过样本去估计。
- 函数
- 研究者实际能观测到的是时间序列
第二步:讲最小内核¶
本文的最小内核是:在单变量 NARX 模型下,如何利用偏距离相关(PDC)进行模型无关的变量筛选,并证明其 sure screening 性质。
最简特例:假设我们有一个一阶 NARX 模型,且只考虑滞后 1 期的协变量:
Y_t = f(Y_{t-1}, X_{t-1, 1}, X_{t-1, 2}, ..., X_{t-1, p}) + ε_t
其中 f 是未知非线性函数,ε_t 是 i.i.d. 噪声(均值为 0,与过去独立)。我们想找出哪些 X_{t-1, j} 对 Y_t 有预测力。
核心思路:
1. 定义筛选统计量:对于每个协变量 j,我们想度量在控制了 Y_{t-1} 的影响后,X_{t-1, j} 与 Y_t 的依赖关系。这正是偏距离相关(PDC)的用武之地:
ρ_j = pCor( Y_t, X_{t-1, j} | Y_{t-1} )
如果 ρ_j 很大,说明 X_{t-1, j} 对 Y_t 有额外的预测力,超出 Y_{t-1} 本身能提供的。
-
估计与筛选:用样本数据
{ (Y_t, Y_{t-1}, X_{t-1, j}) : t = 2, ..., T }计算ρ_j的样本估计量\hat{ρ}_j。然后,保留所有\hat{ρ}_j大于某个阈值τ的变量,或者保留前d个\hat{ρ}_j最大的变量。 -
证明 Sure Screening 性质:要证明的是,当样本量
T足够大时,所有真正重要的变量(即j ∈ M)都会以概率趋于 1 被保留下来。即:P( min_{j ∈ M} \hat{ρ}_j > τ ) → 1当T → ∞。 这需要两个关键条件:- 条件 1(分离性):重要变量和不重要变量的真实 PDC 值之间存在一个“间隙”(gap)。即存在一个常数
c > 0,使得min_{j ∈ M} ρ_j > c,而max_{j ∈ I} ρ_j < c。 - 条件 2(一致性):样本估计量
\hat{ρ}_j一致地收敛到真实值ρ_j。即max_{1 ≤ j ≤ p} |\hat{ρ}_j - ρ_j| = o_p(1)。
在 i.i.d. 数据下,条件 2 可以通过 U-统计量理论或经验过程理论证明。在时间序列下,核心困难是数据是依赖的,不能直接使用 i.i.d. 的指数不等式。作者需要引入混合性条件(如
β-mixing 或α-mixing)来控制依赖的强度,然后使用针对混合序列的指数不等式(如 Bernstein 不等式 for mixing processes)来证明\hat{ρ}_j的一致性。 - 条件 1(分离性):重要变量和不重要变量的真实 PDC 值之间存在一个“间隙”(gap)。即存在一个常数
一句话总结:本文的核心数学任务就是:在时间序列的依赖结构下,证明基于 PDC 的筛选统计量 \hat{ρ}_j 具有一致性和 sure screening 性质,而实现这一点的关键工具是混合性条件和针对混合序列的指数不等式。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对高维时间序列数据,提出了基于偏距离相关(PDC)的模型无关变量筛选方法,适用于单变量 NARX 模型和多变量 VAR 模型。
- 核心工具 / 方法:使用 PDC 作为筛选统计量,并针对时间序列的滞后结构定义了新的 PDC 形式(如
pCor(Y_t, X_{t-l, j} | Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-l+1})),以度量在控制过去信息后,某个滞后协变量的边际预测力。 - 主要结论:在一定的混合性条件和矩条件下,证明了所提方法的 sure screening 性质,并通过模拟和实际数据(美国市场收益率预测)验证了其有效性。
关键设定与假设¶
-
设定:
- NARX 模型:
Y_t = f(Y_{t-1}, ..., Y_{t-q}, X_{t-1}, ..., X_{t-s}) + ε_t,其中f是未知的、可测函数,ε_t是鞅差序列(martingale difference sequence)。 - VAR 模型:
Y_t = A_1 Y_{t-1} + ... + A_q Y_{t-q} + B_1 X_{t-1} + ... + B_s X_{t-s} + ε_t,其中ε_t是白噪声。 - 筛选目标:对于 NARX,找出对
Y_t有预测力的X_{t-l, j}的集合。对于 VAR,找出对Y_t的某个分量有预测力的X_{t-l, j}的集合。
- NARX 模型:
-
关键假设:
- 假设 1(混合性):过程
{ (Y_t, X_t) }是严格平稳的,并且是β-混合(β-mixing)的,混合系数β(k) → 0以一定速率衰减。含义:这控制了时间序列的“记忆长度”,使得相距足够远的观测近似独立。这是证明一致性的核心假设。 - 假设 2(矩条件):
E[|Y_t|^r] < ∞和E[|X_{t, j}|^r] < ∞对某个r > 2成立。含义:确保样本矩和距离相关估计量的稳定性。 - 假设 3(分离性):存在常数
c > 0和κ > 0,使得min_{j ∈ M} ρ_j ≥ c且max_{j ∈ I} ρ_j ≤ c - κ。含义:重要变量与不重要变量在 PDC 值上存在一个“间隙”,这是 sure screening 性质成立的必要条件。 - 假设 4(维数条件):
log(p) = o(T^{1/3})或类似条件。含义:允许 p 随 T 增长,但不能太快,以保证一致性的收敛速度。
- 假设 1(混合性):过程
-
相比已有文献的强化/放宽:
- 强化:相比 i.i.d. 的 DC-SIS 和 PDC,本文增加了混合性假设,这是处理时间序列依赖的必要代价。
- 放宽:相比基于模型的 Lasso 方法,本文不假设模型形式(线性或特定非线性),因此是模型无关的。
主要结果¶
-
定理 1(NARX 模型的 Sure Screening):
- 陈述:在假设 1-4 下,对于 NARX 模型,基于 PDC 的筛选方法具有 sure screening 性质。即存在一个阈值
τ_T,使得P( M ⊆ \hat{M}_{τ_T} ) → 1当T → ∞,其中\hat{M}_{τ_T}是保留的变量集合。 - 直觉:只要重要变量的 PDC 值足够大(与不重要变量分离),且样本量足够大,我们的估计就能以高概率正确识别它们。
- 必要条件:混合系数衰减速度、矩条件阶数、维数
p的增长速度之间需要满足一定的权衡关系。例如,混合系数衰减越快,允许的p可以越大。 - 解决的技术难点:在依赖数据下,证明
\hat{ρ}_j的一致收敛性。作者使用了针对β-混合序列的 Bernstein 不等式,并结合了 U-统计量的 Hoeffding 分解来处理 PDC 估计量的复杂性。
- 陈述:在假设 1-4 下,对于 NARX 模型,基于 PDC 的筛选方法具有 sure screening 性质。即存在一个阈值
-
定理 2(VAR 模型的 Sure Screening):
- 陈述:类似地,对于 VAR 模型,所提方法也具有 sure screening 性质。
- 直觉:即使响应是多元的,只要将筛选问题分解为对每个响应分量的独立筛选,并控制多重比较,性质仍然成立。
- 技术难点:VAR 模型下,需要同时处理 Y 和 X 的依赖结构,证明过程更复杂,但核心思路与定理 1 一致。
证明路线与技术技巧¶
-
整体路线:
- 定义与估计:首先,给出 PDC 的样本估计量
\hat{ρ}_j的显式表达式(基于距离协方差的 U-统计量形式)。 - 一致性证明:证明
max_{1 ≤ j ≤ p} |\hat{ρ}_j - ρ_j| = O_p( a_T ),其中a_T → 0。这一步是核心。- 步骤 2a:将
\hat{ρ}_j - ρ_j分解为几个部分,包括 U-统计量的偏差项和方差项。 - 步骤 2b:对每个部分,使用针对
β-混合序列的指数不等式(如 Rio (2000) 或 Merlevède, Peligrad & Rio (2009) 的 Bernstein 不等式)来控制其尾部概率。 - 步骤 2c:通过 Union Bound 将单个变量的概率界推广到所有
p个变量,得到max_j的一致收敛速度。
- 步骤 2a:将
- Sure Screening 证明:利用一致收敛性和分离性假设(假设 3),证明所有重要变量都能被阈值
τ_T保留。
- 定义与估计:首先,给出 PDC 的样本估计量
-
关键跳跃点:
- 难点:PDC 的样本估计量是 U-统计量的比值,其渐近行为比简单的样本均值复杂得多。在 i.i.d. 下,已有成熟理论;但在混合序列下,U-统计量的渐近理论(如 Denker & Keller (1983))需要更精细的控制。
- 作者的解法:作者没有直接处理 U-统计量的比值,而是先证明距离协方差(分子)和距离方差(分母)各自的一致收敛性,然后利用 Slutsky 引理或 Delta 方法得到 PDC 的一致性。这简化了证明,但需要额外的假设来保证分母远离 0。
-
技术技巧点名:
- U-统计量理论:用于构建 PDC 的样本估计量。
- Hoeffding 分解:用于将 U-统计量分解为独立和项和退化项,便于应用指数不等式。
- 针对混合序列的 Bernstein 不等式:核心工具,用于控制依赖数据下的尾部概率。
- Union Bound:用于处理高维(大 p)问题。
- Slutsky 引理 / Delta 方法:用于处理 PDC 作为比值的渐近性质。
真实例子与应用¶
- 数据:美国市场收益率预测。响应变量
Y_t是 S&P 500 指数的月度超额收益率。协变量X_t包括 14 个常见的宏观经济和金融预测变量(如股息率、市盈率、短期利率等),以及它们的滞后项,总维度p约为 100 左右。 - 方法应用:
- 使用本文提出的 PDC 筛选方法,从所有协变量及其滞后项中筛选出对
Y_t有预测力的变量。 - 将筛选出的变量作为输入,训练一个简单的预测模型(如线性回归或随机森林),并与未筛选的全模型、以及使用其他筛选方法(如 i.i.d. 的 DC-SIS)的模型进行比较。
- 使用本文提出的 PDC 筛选方法,从所有协变量及其滞后项中筛选出对
- 结果:本文方法筛选出的变量集通常更小,但预测的样本外 R² 更高,或预测误差更低。例如,在 2008 年金融危机期间,基于本文方法筛选的模型能更好地捕捉市场波动。
- 这个例子想说明什么:验证了本文方法在实际金融时间序列中的有效性,展示了其相比忽略时间依赖结构的 i.i.d. 筛选方法的优势。它说明,通过控制过去信息(如
Y_{t-1}),PDC 能更准确地识别出真正有额外预测力的变量,从而构建更简洁、更稳健的预测模型。
🔎 结论是否比证明窄¶
- 窄的地方:定理的证明依赖于
β-混合性假设。作者在引言中声称方法适用于“各种时间序列”,但证明严格限于满足该混合性条件的过程。对于长记忆过程(如分数布朗运动)或非平稳过程,定理不直接适用。作者在结论部分提到了这一点,但未深入讨论。 - 泛泛 claim 的地方:作者在模拟中展示了方法对非线性模型(如
Y_t = sin(X_{t-1, 1}) + ...)的有效性,但定理的证明并未明确要求f是光滑的。只要重要变量的 PDC 值非零且满足分离性,证明就成立。因此,这个 claim 是合理的,但并非由定理直接保证(定理只保证筛选,不保证f的形式)。
四、开放问题¶
- 更弱的依赖假设:本文的 sure screening 性质依赖于
β-混合性。能否在更弱的依赖假设(如α-混合、物理依赖(physical dependence)或局部平稳性)下证明类似性质?这需要不同的概率工具。扎根于:定理 1 和 2 的证明中对β-混合系数的依赖。 - 自适应阈值选择:理论上的阈值
τ_T依赖于未知的混合系数和矩条件。实践中如何数据自适应地选择阈值,以保证有限样本下的 FDR 控制或变量选择一致性?扎根于:文中模拟和例子中使用的“保留前 d 个”的启发式方法。 - 非线性 VAR 的筛选:本文的 VAR 模型是线性的。对于非线性 VAR(如
Y_t = f(Y_{t-1}, X_{t-1}) + ε_t),本文的 PDC 方法是否仍然有效?证明需要如何处理?扎根于:文中对 VAR 模型的线性假设。 - 与计算复杂度的权衡:PDC 的计算复杂度是
O(T^2),对于长序列可能很慢。是否存在计算上更高效的近似(如基于随机投影或核方法的近似),同时保持 sure screening 性质?扎根于:文中未讨论计算复杂度。
Maintained by 陈星宇 · Homepage · Source on GitHub