跳转至

Consistent causal inference for high-dimensional time series

作者: Francesco Cordoni, Alessio Sancetta
来源: Journal of Econometrics
主题: 因果推断
相关性: 8/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:如何在高维时间序列数据中,从观测数据出发,一致地识别出变量之间的条件因果关系(即因果图 / DAG)。 这里的“高维”指变量个数 p 可能远大于样本量 T(p >> T),而“时间序列”意味着数据存在序列依赖(自相关),这打破了经典因果推断中独立同分布(i.i.d.)的核心假设。当前该领域的成熟度处于“方法快速涌现但理论一致性证明仍稀缺”的阶段,尤其对于非高斯、非线性动态的高维时间序列,现有方法要么依赖强参数假设(如线性 VAR),要么计算上不可行。

发展脉络(history)

根据论文引言及其引用,该方向的发展脉络可梳理如下:

  1. 奠基工作:从 i.i.d. 到时间序列的因果推断

    • Pearl (2009)Spirtes et al. (2000) 奠定了基于条件独立性检验的因果图学习(如 PC 算法)的基础,但主要针对 i.i.d. 数据。
    • Eichler (2012) 将 Granger 因果与 DAG 联系起来,为时间序列的因果图提供了理论框架,但方法上仍受限于低维或特定参数形式。
  2. 主要进展:高维 i.i.d. 因果推断的突破

    • Kalisch & Bühlmann (2007) 证明了在高维稀疏 i.i.d. 高斯数据下,PC 算法可以一致地估计 CPDAG(部分有向无环图)。这是高维因果推断的里程碑,但严格依赖高斯性
    • Harris & Drton (2013) 将 PC 算法推广到非高斯但满足某些分布族(如非参数高斯 copula)的 i.i.d. 数据,通过秩相关系数(如 Spearman's rho)来估计偏相关系数,从而在高维下实现一致估计。这为处理非高斯数据提供了思路,但仍限于 i.i.d. 设定
  3. 当前 Frontier:高维时间序列因果推断

    • Basu et al. (2015)Shojaie & Michailidis (2010) 研究了高维时间序列的 Granger 因果推断,通常通过稀疏向量自回归(VAR)模型来实现。这些方法能处理高维,但假设数据生成过程是线性的,且识别的是 Granger 因果(预测意义上的因果),而非结构因果模型(SCM)下的条件因果关系。
    • 本文的位置:作者声称,现有方法要么假设数据是 i.i.d.(如 Kalisch & Bühlmann 2007, Harris & Drton 2013),要么假设动态是线性的(如 Basu et al. 2015)。本文试图填补的缺口是:在高维、非高斯、非线性动态的时间序列下,如何一致地识别条件因果关系(DAG)。其核心策略是假设一个高斯 copula 动态结构,从而将问题转化为一个稀疏高斯 VAR 的估计问题,同时允许边际分布完全任意。

子线索聚类

这些被引文献大致落在以下三条子线索上:

  • 线索一:基于条件独立性检验的因果图学习(i.i.d. 设定)

    • 代表工作:Pearl (2009), Spirtes et al. (2000), Kalisch & Bühlmann (2007), Harris & Drton (2013)。
    • 核心方法:通过检验条件独立性(如偏相关系数是否为 0)来构建 DAG。核心假设是忠实性(faithfulness)和充分性(causal sufficiency)。
    • 瓶颈:主要针对 i.i.d. 数据,对时间序列的序列依赖处理不足。
  • 线索二:基于稀疏 VAR 的 Granger 因果推断(时间序列设定)

    • 代表工作:Basu et al. (2015), Shojaie & Michailidis (2010)。
    • 核心方法:假设数据由稀疏线性 VAR 生成,通过 Lasso 等惩罚方法估计 VAR 系数矩阵,非零系数对应 Granger 因果关系。
    • 瓶颈:假设线性动态,且识别的是 Granger 因果(预测因果),而非结构因果。此外,Granger 因果与 DAG 的对应关系在非线性情况下复杂。
  • 线索三:基于 copula 的非参数 / 半参数时间序列建模

    • 代表工作:Chen & Fan (2006), Patton (2012)。
    • 核心方法:使用 copula 函数(如高斯 copula)来分离边际分布和依赖结构,从而灵活建模非高斯、非线性的序列依赖。
    • 瓶颈:这些工作通常关注于预测或尾部依赖,而非因果结构识别。本文是首次将高斯 copula 动态与高维 DAG 识别结合。

这个方向在追问的核心问题

  1. 识别问题:在时间序列设定下,如何从观测数据中唯一地识别出因果 DAG?需要哪些假设(如忠实性、充分性、时序性)?
  2. 一致性问题:当 p >> T 时,能否设计一个算法,使得估计的 DAG 在样本量趋于无穷时依概率收敛到真实 DAG?需要什么稀疏性条件?
  3. 非高斯 / 非线性问题:如何在不假设线性高斯动态的前提下,处理高维时间序列的因果推断?现有的非参数方法(如基于核的条件独立性检验)在高维下计算不可行。
  4. 计算可行性:DAG 空间是超指数的,如何设计多项式时间算法(如 PC 算法、贪婪搜索)来逼近最优解,并保证其统计一致性?

⚠️ 作者的 framing

  • 作者的缺口 frame:作者将缺口 frame 为“现有高维因果推断方法要么假设 i.i.d.,要么假设线性动态”。因此,本文通过引入高斯 copula 动态,声称可以同时处理非 i.i.d.(时间序列)非线性(通过单调变换),从而成为“显然的下一步”。
  • 被淡化或回避的竞争路线
    • 非参数条件独立性检验:作者在引言中提及了基于核的方法(如 Zhang et al. 2011),但以“计算上不可行”为由一笔带过。这回避了在非高斯、非线性动态下,是否可能通过更巧妙的非参数方法(如基于距离协方差)实现高维一致性。
    • 结构向量自回归(SVAR):SVAR 是宏观经济学中识别结构因果冲击的标准工具,但通常需要外部工具变量或符号约束等识别假设。作者完全回避了 SVAR 这条路线,可能是因为其识别假设与本文的“基于条件独立性”的识别策略不同。
  • 什么明显该被引 / 该存在、却没出现在 intro 里?
    • 时间序列的 PC 算法变体:有工作(如 Runge et al. 2019, “Detecting and quantifying causal associations in large nonlinear time series datasets”)专门针对时间序列改进了 PC 算法(如 PCMCI),通过先筛选条件集再检验独立性来处理高维非线性时间序列。这篇论文未被引用,可能是一个值得研究者去查的缺口——作者是否认为其理论一致性证明不足?还是其方法在超高维下仍有局限?

张力

未见明显对立引用。所有被引工作基本沿着“从 i.i.d. 到时间序列,从线性到非线性”的渐进路径,彼此之间没有根本性的矛盾。唯一的张力可能存在于“基于条件独立性检验”和“基于稀疏 VAR”两条线索之间,但作者通过引入高斯 copula 动态,试图将两者统一起来。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \( X_t = (X_{1,t}, \dots, X_{p,t})' \):在时间 \( t \) 观测到的 \( p \) 维随机向量。这是核心随机变量。
    • \( p \):变量个数(维数),可能很大(\( p \gg T \))。
    • \( T \):时间序列长度(样本量)。
    • \( F_j \):第 \( j \) 个变量 \( X_{j,t} \) 的边际累积分布函数(CDF)。未知且任意,可以是连续的、离散的、有厚尾的等。
    • \( Z_t = (Z_{1,t}, \dots, Z_{p,t})' \):潜在的高斯得分向量(latent Gaussian score vector)。定义为 \( Z_{j,t} = \Phi^{-1}(F_j(X_{j,t})) \),其中 \( \Phi^{-1} \) 是标准正态分布的逆 CDF。这是不可观测的潜在变量,因为 \( F_j \) 未知。
    • \( \Phi \):标准正态分布的 CDF。
    • \( \Sigma \)\( Z_t \) 的协方差矩阵(假设 \( Z_t \) 是平稳的)。这是要估计的核心参数
    • \( \Omega = \Sigma^{-1} \)\( Z_t \) 的精度矩阵(precision matrix)。其非零元素对应高斯图模型中的条件依赖关系。
    • \( A \):VAR(1) 模型的系数矩阵(\( p \times p \))。在本文的设定中,\( Z_t \) 的动态由 \( Z_t = A Z_{t-1} + \epsilon_t \) 描述,其中 \( \epsilon_t \) 是独立同分布的高斯白噪声。这是要估计的另一个核心参数
    • \( \Theta \)\( \epsilon_t \) 的协方差矩阵。
    • \( \Gamma = \text{Var}(Z_t) \)\( Z_t \) 的边际协方差矩阵。它和 \( A, \Theta \) 满足 Lyapunov 方程:\( \Gamma = A \Gamma A' + \Theta \)
    • \( \text{DAG} \):有向无环图,其节点是 \( X_{1,t}, \dots, X_{p,t} \),有向边表示条件因果关系。本文声称可以从 \( A \)\( \Theta \) 中识别出这个 DAG。
  • 模型

    • 核心假设:存在一个单调变换(由边际 CDF \( F_j \) 给出),使得变换后的数据 \( Z_t \) 的动态由一个高斯向量自回归(VAR) 过程描述。这等价于说,\( X_t \) 的序列依赖结构由一个高斯 copula 捕捉。
    • 数据生成机制
      1. 潜在高斯过程:\( Z_t = A Z_{t-1} + \epsilon_t \)\( \epsilon_t \sim N(0, \Theta) \)
      2. 观测过程:\( X_{j,t} = F_j^{-1}(\Phi(Z_{j,t})) \),其中 \( F_j \) 是任意严格单调递增的 CDF。
    • 已知:观测数据 \( \{X_t\}_{t=1}^T \)
    • 要估的对象\( A \)\( \Theta \)(或等价地,\( \Gamma \)\( \Omega \))。这些参数完全描述了潜在高斯过程的动态和条件依赖结构。
  • 可观测数据

    • 研究者实际能观测到的是 \( \{X_t\}_{t=1}^T \),即 \( p \) 维时间序列的 \( T \) 个观测值。
    • 不可观测:潜在高斯得分 \( Z_t \),以及边际分布 \( F_j \)。整个方法的巧妙之处在于,它声称可以在不知道或估计 \( F_j \) 的情况下,从 \( X_t \) 的秩相关系数(rank correlations)中一致地估计出 \( A \)\( \Theta \)

第二步:讲最小内核

最简特例:p=2 的平稳 VAR(1) 过程

为了看清核心思路,我们考虑最简单的情况:只有两个变量(\( p=2 \)),且潜在过程是平稳的 VAR(1)。

  1. 设定

    • 潜在过程:\( Z_{1,t} = a_{11} Z_{1,t-1} + a_{12} Z_{2,t-1} + \epsilon_{1,t} \)\( Z_{2,t} = a_{21} Z_{1,t-1} + a_{22} Z_{2,t-1} + \epsilon_{2,t} \),其中 \( \epsilon_t \sim N(0, \Theta) \)
    • 观测过程:\( X_{1,t} = F_1^{-1}(\Phi(Z_{1,t})) \)\( X_{2,t} = F_2^{-1}(\Phi(Z_{2,t})) \)\( F_1, F_2 \) 是任意严格单调递增的 CDF(例如,\( F_1 \) 是自由度为 3 的 t 分布 CDF,\( F_2 \) 是指数分布 CDF)。
  2. 核心问题:我们只能观测到 \( X_{1,t}, X_{2,t} \),它们是非高斯、非线性的时间序列。我们能否一致地估计出系数 \( a_{12} \)\( a_{21} \),从而判断 \( X_1 \) 是否 Granger 导致 \( X_2 \)(即 \( a_{21} \neq 0 \))?

  3. 关键想法

    • 由于 \( F_1, F_2 \) 是严格单调的,\( Z_{1,t} \)\( X_{1,t} \) 之间的排序是完全一致的。这意味着,秩相关系数(如 Spearman's rho 或 Kendall's tau)在 \( X_t \)\( Z_t \) 之间是相同的
    • 对于高斯随机向量 \( (Z_{1,t}, Z_{2,t}) \),其 Spearman's rho \( \rho_S \) 和 Pearson 相关系数 \( \rho \) 之间存在一一对应关系:\( \rho = 2 \sin(\pi \rho_S / 6) \)
    • 因此,我们可以从观测数据 \( X_t \) 的秩相关系数中,一致地估计出潜在高斯过程 \( Z_t \) 的 Pearson 相关矩阵,而无需知道 \( F_j \)
  4. 具体步骤(在 p=2 特例下)

    • Step 1: 估计边际协方差矩阵 \( \Gamma \)。计算 \( X_t \) 的 Spearman's rho 矩阵 \( \hat{R}_S \)。然后,通过转换公式 \( \hat{\Gamma}_{ij} = 2 \sin(\pi \hat{R}_{S,ij} / 6) \),得到 \( Z_t \) 的 Pearson 相关矩阵 \( \hat{\Gamma} \) 的一致估计。注意,这里我们假设 \( Z_t \) 的方差为 1,所以相关矩阵就是协方差矩阵。
    • Step 2: 估计 VAR 系数 \( A \)。对于 VAR(1) 过程,有 \( \Gamma(1) = A \Gamma(0) \),其中 \( \Gamma(1) = \text{Cov}(Z_t, Z_{t-1}) \) 是滞后 1 的自协方差矩阵,\( \Gamma(0) = \Gamma \) 是边际协方差矩阵。我们还需要估计 \( \Gamma(1) \)。这可以通过计算 \( X_t \)\( X_{t-1} \) 之间的交叉秩相关系数,再应用同样的转换公式得到。
    • Step 3: 识别 DAG。一旦得到 \( \hat{A} \)\( \hat{\Theta} \),就可以通过检查 \( \hat{A} \) 的非零元素(对应 Granger 因果)和 \( \hat{\Theta} \) 的非零元素(对应同期条件依赖)来构建 DAG。
  5. 为什么这个特例能说明核心思路?

    • 它剥离了高维稀疏性带来的技术复杂性(如惩罚估计、模型选择)。
    • 它清晰地展示了整个方法的核心引擎:利用秩相关系数对单调变换的不变性,将非高斯、非线性时间序列的因果推断问题,转化为一个高斯 VAR 的参数估计问题
    • 在这个特例下,证明的核心就是证明秩相关系数的一致估计性,以及转换公式的正确性。论文的一般情形只是将这个思路推广到高维,并加上稀疏性假设和相应的惩罚估计理论。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在高维时间序列(p >> T)且数据边际分布未知、动态可能非线性的情况下,如何一致地识别变量间的条件因果关系(DAG)。
  2. 核心工具 / 方法:假设数据存在一个单调变换,使得变换后的数据服从一个稀疏高斯 VAR 过程(即高斯 copula 动态)。利用秩相关系数对单调变换的不变性,将问题转化为对稀疏高斯 VAR 参数的估计,并通过惩罚似然或 BIC 实现一致模型选择。
  3. 主要结论:在一定的正则条件和稀疏性假设下,该方法可以一致地估计出描述潜在高斯 VAR 过程的参数(系数矩阵和噪声协方差矩阵),并由此一致地识别出因果 DAG。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 设定:观测数据 \( \{X_t\}_{t=1}^T \) 是一个 \( p \) 维平稳时间序列。存在一个严格单调递增的变换 \( h_j \)(由边际 CDF \( F_j \) 定义),使得 \( Z_{j,t} = h_j(X_{j,t}) \) 服从一个平稳的、稀疏的、高斯 VAR(\( d \)) 过程。为简化,论文主要讨论 VAR(1),但可推广。
  • 假设 1(高斯 copula 动态)\( Z_t \) 是一个平稳的高斯过程,其动态由 VAR(1) 模型 \( Z_t = A Z_{t-1} + \epsilon_t \) 描述,其中 \( \epsilon_t \sim N(0, \Theta) \),且 \( \epsilon_t \) 独立于过去。这是核心假设,它限定了“非线性”的形式只能是单调变换,且变换后的动态必须是线性和高斯的。
  • 假设 2(稀疏性):系数矩阵 \( A \) 和精度矩阵 \( \Omega = \Gamma^{-1} \)(或 \( \Theta^{-1} \))是稀疏的,即非零元素个数远小于 \( p^2 \)。这是高维一致估计的必要条件。
  • 假设 3(平稳性与混合性)\( Z_t \) 是平稳的且满足一定的混合条件(如 \( \beta \)-mixing),以保证样本矩的收敛性。这是时间序列分析的标准假设。
  • 假设 4(忠实性):真实 DAG 与由 \( A \)\( \Theta \) 诱导的分布是忠实的(faithful),即条件独立关系完全由图的结构决定,没有额外的代数巧合。这是基于条件独立性检验的因果推断的标准假设。
  • 相比已有文献的放宽/强化
    • 放宽:相比 Kalisch & Bühlmann (2007),放宽了 i.i.d. 和高斯边际的假设。相比 Basu et al. (2015),放宽了线性动态的假设(允许通过单调变换实现非线性)。
    • 强化:相比 Harris & Drton (2013) 的 i.i.d. 非参数高斯 copula,本文将其推广到时间序列设定,但强化了动态结构必须是高斯 VAR 的假设。这意味着,如果真实数据的动态不能用高斯 copula 描述(例如,条件方差有 ARCH 效应),则方法可能失效。

主要结果

  • 定理 1(参数估计的一致性):在假设 1-3 下,通过最小化一个基于秩相关系数的惩罚似然函数(或使用 BIC),得到的估计量 \( \hat{A} \)\( \hat{\Theta} \) 是相合的。具体来说,\( ||\hat{A} - A||_2 = O_P(\sqrt{s \log(p)/T}) \),其中 \( s \)\( A \) 中非零元素的最大个数。这个收敛速度与标准的高维稀疏 VAR 估计一致,说明使用秩相关系数没有带来额外的统计代价。
  • 定理 2(模型选择的一致性):在更强的稀疏性条件和 Beta-min 条件下(即非零系数不能太小),通过 BIC 或阈值化(thresholding)选择的模型(即 \( \hat{A} \)\( \hat{\Theta} \) 中非零元素的位置)以概率趋于 1 等于真实模型。这意味着可以一致地识别出哪些边存在。
  • 定理 3(DAG 识别的一致性):结合定理 2 和忠实性假设,由估计的 \( \hat{A} \)\( \hat{\Theta} \) 构建的 DAG 以概率趋于 1 等于真实 DAG 的马尔可夫等价类(CPDAG)。这是最终目标。

证明路线与技术技巧

  • 整体路线

    1. 第一步:秩相关 → 高斯相关。证明基于秩的相关系数(如 Spearman's rho)可以一致地估计潜在高斯过程 \( Z_t \) 的 Pearson 相关矩阵 \( \Gamma \) 和滞后交叉相关矩阵 \( \Gamma(1) \)。这一步的关键是证明秩统计量的 U-统计量性质及其在高维时间序列下的收敛性。
    2. 第二步:Yule-Walker 方程。利用估计出的 \( \hat{\Gamma} \)\( \hat{\Gamma}(1) \),通过 Yule-Walker 方程 \( A = \Gamma(1) \Gamma^{-1} \) 得到 \( A \) 的一个初步估计。但由于 \( p \gg T \)\( \Gamma^{-1} \) 无法直接计算。
    3. 第三步:稀疏正则化。将问题转化为一个稀疏回归问题。注意到 VAR(1) 的每个方程 \( Z_{j,t} = \sum_i A_{ji} Z_{i,t-1} + \epsilon_{j,t} \) 是一个稀疏线性回归。由于 \( Z_t \) 不可观测,作者巧妙地利用估计出的相关矩阵,将问题转化为一个稀疏精度矩阵估计问题(类似于 Gaussian graphical model),或者直接对 Yule-Walker 方程施加 Lasso 惩罚。
    4. 第四步:一致性证明。利用高维统计的标准工具(如 restricted eigenvalue condition, irrepresentable condition)证明惩罚估计量 \( \hat{A} \)\( \hat{\Theta} \) 的收敛速度和模型选择一致性。这里需要处理时间序列依赖带来的额外复杂性,通过混合不等式来控制自相关的影响。
  • 关键跳跃点

    • 从秩相关到高斯相关的转换:这个转换本身是已知的,但在高维时间序列下证明其一致性是第一个跳跃。作者需要证明,基于 \( T \) 个观测值计算的秩相关矩阵,在谱范数意义下收敛到真实的高斯相关矩阵,且收敛速度与 \( \sqrt{\log(p)/T} \) 相当。这需要处理秩统计量的高阶依赖结构。
    • 从不可观测的 \( Z_t \) 到可计算的估计量:由于 \( Z_t \) 不可观测,不能直接对 \( Z_t \) 进行回归。作者通过将问题转化为基于相关矩阵的矩估计问题,绕过了对 \( Z_t \) 的直接观测。这个转化是方法的核心创新点。
  • 技术技巧点名

    • U-统计量:Spearman's rho 和 Kendall's tau 都是 U-统计量。作者利用 U-统计量的渐近理论来建立其收敛性。
    • 混合不等式(Mixing inequalities):为了处理时间序列的依赖,使用了 \( \beta \)-mixing 条件下的 Bernstein 不等式或 Fuk-Nagaev 不等式,来控制自相关样本矩的偏差。
    • 稀疏正则化(Lasso / Dantzig selector):用于高维 VAR 系数的估计和模型选择。
    • 精度矩阵估计(Graphical Lasso):用于估计 \( \Omega = \Gamma^{-1} \),从而识别同期条件依赖结构。

真实例子与应用

  • 应用一:供给侧石油冲击对经济的影响

    • 数据:使用了 Kilian (2009) 的经典数据集,包含全球石油产量、全球经济活动指数和原油实际价格等宏观经济变量。这些变量通常被认为是非高斯的。
    • 方法应用:作者将本文提出的方法应用于这些时间序列,估计出一个 DAG。
    • 结果:方法成功识别出石油产量冲击对经济活动的影响路径,与 Kilian (2009) 的 SVAR 分析结果定性一致,但本文的方法不需要预设识别约束(如短期零约束)。
    • 目的:验证方法在经典宏观经济问题上的有效性,并展示其相对于需要强识别假设的 SVAR 的灵活性。
  • 应用二:S&P500 成分股限价订单簿聚合变量间的因果关系

    • 数据:使用了四只 S&P500 成分股(如 MSFT, INTC)的限价订单簿数据,构建了多个聚合变量(如买卖价差、订单不平衡、波动率等)。这是一个高维(变量数 p 可能较大)且非高斯的场景。
    • 方法应用:将本文方法应用于这些高频金融时间序列,估计变量间的 DAG。
    • 结果:方法揭示了一些有趣的因果关系,例如订单不平衡(order imbalance)对短期波动率有显著的 Granger 因果影响,且这种影响在股票间具有相似的结构。
    • 目的:展示方法在高维、非平稳(近似)、非高斯金融数据中的实际应用能力,并挖掘出有经济解释的因果结构。

🔎 结论是否比证明窄

  • 论文的标题和摘要声称“Consistent causal inference for high-dimensional time series”,这是一个非常宽泛的 claim。
  • 然而,证明严格依赖于“高斯 copula 动态”这一核心假设。这意味着,结论的适用范围实际上比标题暗示的要窄。它只适用于那些可以通过一个单调变换转化为高斯 VAR 过程的时间序列。对于更一般的非线性动态(如 threshold VAR, Markov switching VAR, GARCH-type 动态),该方法的理论一致性不再成立。
  • 作者在引言和结论中承认了这一点,但并未在标题中加以限定。这是一个典型的“结论比证明窄”的例子。研究者需要警惕,不要将本文的结论过度泛化到所有高维时间序列因果推断问题。

四、开放问题(点到为止,扎根具体语句)

  1. 非高斯 copula 动态的推广:本文的核心假设是高斯 copula。作者在结论中提及“Extending the methodology to non-Gaussian copulas... is a natural direction for future research”。这是一个明确的开放问题:能否将秩相关方法推广到其他 copula 族(如 t-copula, Clayton copula)?这需要新的识别策略,因为秩相关与 copula 参数之间不再有简单的闭式关系。
  2. 非线性动态的放松:本文的“非线性”仅限于单调变换。对于更一般的非线性动态(如 \( Z_t = f(Z_{t-1}) + \epsilon_t \),其中 \( f \) 是未知非线性函数),本文方法失效。这是一个根本性的挑战,可能需要结合非参数时间序列建模与高维稀疏性。
  3. 滞后阶数选择的适应性:论文主要讨论 VAR(1),并提及可推广到 VAR(d)。但在高维下,滞后阶数 d 的选择本身就是一个开放问题,且错误指定 d 会如何影响 DAG 识别的一致性?作者未深入讨论。
  4. 与 PCMCI 等方法的比较:如前所述,Runge et al. (2019) 的 PCMCI 方法也旨在处理高维非线性时间序列的因果推断,但其理论一致性证明较弱。一个值得探索的问题是:在什么条件下,本文基于高斯 copula 的方法优于 PCMCI,反之亦然? 这需要系统的模拟比较和理论分析。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论