跳转至

Characterization of causal ancestral graphs for time series with latent confounders

作者: Andreas Gerhardus
来源: Annals of Statistics
主题: 因果推断
相关性: 7/10
链接: 期刊页 · arXiv


一、领域脉络与小综述

这个方向是什么

这个子方向致力于为含未观测混杂因子的多元时间序列构建因果图模型,并研究其马尔可夫等价类的刻画与识别。核心问题是:在仅有观测数据、且存在潜在混杂(latent confounders)的情况下,如何用图模型表示时间序列中滞后(lag-specific) 的因果关系与条件独立性,并确定哪些因果结构可以从数据中唯一识别(即等价类)。当前成熟度处于理论刻画阶段,已有多种图模型类(如时间序列DAG、部分祖先图PAG),但作者认为它们对时间滞后结构的表示不够精细,导致因果推断能力受限。

发展脉络(history)

从intro引用的工作串成一条线:

  • 奠基工作:时间序列因果图的基础
  • Dahlhaus & Eichler (2003):将图模型引入时间序列,定义了时间序列DAG(ts-DAG),用有向边表示瞬时与滞后因果关系。这是奠基性工作,但假设无未观测混杂
  • Eichler (2012):引入时间序列部分祖先图(ts-PAG),允许存在未观测混杂,用混合边(有向/双向)表示因果关系与潜在混杂。这是当前主流模型类,但作者认为其滞后结构表示不够精细——ts-PAG将不同滞后的边合并为单一类型,丢失了滞后信息。

  • 主要进展:马尔可夫等价类的刻画

  • Richardson & Spirtes (2002):提出部分祖先图(PAG) 作为静态(非时间序列)因果图的马尔可夫等价类表示。这是静态领域的标准工具。
  • Eichler (2012):将PAG推广到时间序列(ts-PAG),并给出其马尔可夫等价类的图形表示。但作者指出,ts-PAG的等价类表示仍然丢失了滞后信息——它只能区分“有因果边”与“无因果边”,不能区分不同滞后的边。

  • 当前frontier:更精细的滞后结构识别

  • Gerhardus & Runge (2020):提出时间滞后因果图(ts-causal graph),明确区分不同滞后的边,但未处理未观测混杂
  • 本文:在ts-causal graph基础上引入未观测混杂,提出时间滞后因果祖先图(ts-CAG),并完整刻画其性质与马尔可夫等价类。作者声称这是首个能同时处理未观测混杂与精细滞后结构的图模型类。

  • 本文的位置:作者将本文定位为填补ts-PAG与ts-causal graph之间的空白——ts-PAG能处理混杂但丢失滞后信息,ts-causal graph能保留滞后信息但假设无混杂。本文的ts-CAG同时保留两者,且证明它严格包含于ts-PAG(即ts-CAG是ts-PAG的真子集),因此能从ts-CAG中读出比ts-PAG更丰富的因果知识。

子线索聚类

这些被引文献大致落在3条子线索上:

  1. 时间序列因果图模型(ts-DAG, ts-PAG)
  2. 代表:Dahlhaus & Eichler (2003), Eichler (2012)
  3. 核心:用图模型表示时间序列的因果关系与条件独立性,处理滞后与瞬时效应。
  4. 瓶颈:ts-DAG假设无混杂;ts-PAG能处理混杂但丢失滞后信息。

  5. 静态因果图的马尔可夫等价类(PAG, MAG)

  6. 代表:Richardson & Spirtes (2002), Zhang (2008)
  7. 核心:用部分祖先图(PAG)表示静态因果图的马尔可夫等价类,给出识别规则。
  8. 瓶颈:静态设定,不适用于时间序列的滞后结构。

  9. 时间序列因果发现算法

  10. 代表:Runge et al. (2019), Gerhardus & Runge (2020)
  11. 核心:从观测数据中学习时间序列因果图,如PCMCI算法。
  12. 瓶颈:现有算法学习的是ts-PAG或ts-causal graph,无法学到本文提出的ts-CAG的等价类(因为ts-CAG的等价类包含更多信息)。

这个方向在追问的核心问题(2-4个)

  1. 滞后结构识别:在存在未观测混杂时,能否区分不同滞后的因果关系?
  2. 马尔可夫等价类:给定观测数据,哪些因果结构(包括滞后信息)是唯一可识别的?
  3. 模型类选择:是否存在一个图模型类,既能处理混杂、又能保留滞后信息,且其等价类能被因果发现算法学习?
  4. 因果推断:从更精细的图模型中,能否推导出更强的因果效应识别条件(如do-calculus规则)?

当前主流方法与已知瓶颈:主流方法是ts-PAG(Eichler 2012),其瓶颈是等价类表示丢失滞后信息。本文的ts-CAG试图解决此问题,但代价是模型类更复杂(边类型更多),且因果发现算法尚未适配

⚠️ 作者的framing(必须明确标注成“这是作者的说法”)

  • 作者把缺口frame成:“现有模型类(ts-PAG)的马尔可夫等价类表示丢失了滞后信息,导致因果推断能力受限。本文提出的ts-CAG是ts-PAG的真子集,因此能从等价类中读出更多因果知识——无需额外假设。”
  • 被淡化或回避的竞争路线
  • 结构方程模型(SEM):作者未讨论基于SEM的时间序列因果推断(如VAR模型),这类方法也能处理滞后与混杂,但依赖参数假设。作者可能认为图模型方法更通用(非参数)。
  • 潜在结果框架:作者未提及用潜在结果(potential outcomes)处理时间序列混杂(如g-computation、IPW)。这可能是因为图模型方法更关注结构学习而非效应估计
  • 什么明显该被引/该存在、却没出现在intro里?
  • 时间序列的do-calculus:Pearl (2009) 的do-calculus在时间序列中的推广(如Eichler & Didelez 2010)未被引用。这可能是因为本文聚焦于图模型类刻画而非因果效应识别,但do-calculus是因果推断的核心工具,其与ts-CAG的关系值得探讨。
  • 高维时间序列的因果发现:如Shojaie & Michailidis (2010) 的Granger因果图估计。本文未讨论高维场景,这可能是一个开放问题。

张力

未见明显对立引用。所有被引工作基本一致认为“ts-PAG是当前标准”,本文在此基础上提出更精细的模型类。唯一可能的张力是:ts-PAG的支持者可能认为丢失滞后信息是可接受的代价(因为等价类已经足够用于因果效应识别),而本文认为这是不可接受的损失。这需要研究者自行判断。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( \mathbf{X} = \{X_t\}_{t \in \mathbb{Z}} \):多元时间序列,\( X_t \in \mathbb{R}^d \)\( d \) 维观测向量。 - \( \tau \in \mathbb{N}_0 \):滞后阶数(lag),\( \tau = 0 \) 表示瞬时(contemporaneous)关系,\( \tau > 0 \) 表示滞后关系。 - \( G \):时间滞后因果图(time-lag specific causal graph),是一个有向图,顶点集 \( V = \{X_t^{(i)} : i=1,\dots,d, t \in \mathbb{Z}\} \),边集包含两种边: - \( X_{t-\tau}^{(i)} \to X_t^{(j)} \):表示 \( X_{t-\tau}^{(i)} \)\( X_t^{(j)} \) 的直接原因(滞后 \( \tau \))。 - \( X_t^{(i)} \leftrightarrow X_t^{(j)} \):表示 \( X_t^{(i)} \)\( X_t^{(j)} \) 之间存在未观测混杂(仅瞬时)。 - 潜在(potential/counterfactual)量:未观测混杂变量 \( U_t \)(可能为向量),影响多个观测变量,但本身不可观测。 - 参数/estimand:因果图 \( G \) 的结构(边是否存在、方向、滞后阶数)是待估计的目标。本文不估计具体效应,而是刻画哪些结构可以从观测数据中识别(即马尔可夫等价类)。 - 维数/样本量\( d \) 是变量数,\( T \) 是时间序列长度(样本量)。本文理论不依赖 \( d \)\( T \) 的具体值,但因果发现算法需要 \( T \) 足够大。

模型: - 数据生成机制:假设时间序列 \( \mathbf{X} \)结构因果模型(SCM) 生成,其中每个 \( X_t^{(j)} \) 是其直接原因(包括滞后与瞬时)和未观测混杂 \( U_t \) 的函数:

\[X_t^{(j)} = f_j(\{X_{t-\tau}^{(i)} : \tau \ge 0, i \in \text{pa}_\tau(j)\}, U_t, \varepsilon_t^{(j)}),\]
其中 \( \text{pa}_\tau(j) \) 是滞后 \( \tau \) 的直接原因集合,\( \varepsilon_t^{(j)} \) 是独立噪声。 - 已知:观测数据 \( \{X_t\}_{t=1}^T \) 的联合分布 \( P \)。 - 要估的对象:因果图 \( G \) 的结构(边集),特别是滞后边的存在性与方向。

可观测数据: - 实际能观测到:时间序列 \( X_1, X_2, \dots, X_T \),每个 \( X_t \)\( d \) 维向量。 - 不可观测:未观测混杂 \( U_t \),以及因果图 \( G \) 本身(只能通过条件独立性推断)。 - 关键假设因果充分性(causal sufficiency) 不成立——存在未观测混杂,因此观测到的条件独立性可能反映的是混杂而非因果缺失。

第二步:讲最小内核

最简特例:考虑 \( d=2 \) 个变量(\( A_t, B_t \)),滞后阶数最多为 \( \tau=1 \),且无瞬时关系(\( \tau=0 \) 无边)。未观测混杂 \( U_t \) 同时影响 \( A_t \)\( B_t \)

可观测数据\( (A_1, B_1), (A_2, B_2), \dots, (A_T, B_T) \)

核心问题:从观测数据中,能否区分以下两种因果结构?

  • 结构1\( A_{t-1} \to B_t \)\( A \) 滞后影响 \( B \)),且 \( A_t \leftrightarrow B_t \)(瞬时混杂)。
  • 结构2\( B_{t-1} \to A_t \)\( B \) 滞后影响 \( A \)),且 \( A_t \leftrightarrow B_t \)(瞬时混杂)。

在ts-PAG(现有标准)中:两种结构都对应同一个ts-PAG:\( A_t \circ \!\!-\!\!\circ B_t \)(表示存在一条边,但方向未知),且滞后信息丢失。因此无法区分

在ts-CAG(本文)中:两种结构对应不同的ts-CAG: - 结构1:\( A_{t-1} \to B_t \)(滞后边方向确定),\( A_t \leftrightarrow B_t \)(混杂边)。 - 结构2:\( B_{t-1} \to A_t \)(滞后边方向确定),\( A_t \leftrightarrow B_t \)(混杂边)。

关键想法:ts-CAG通过保留滞后边的方向(即明确标注 \( A_{t-1} \to B_t \) 而非 \( A_t \circ \!\!-\!\!\circ B_t \)),使得等价类中滞后边的方向是确定的(如果数据支持)。因此,从ts-CAG的等价类中,可以读出比ts-PAG更多的因果知识——具体来说,滞后边的方向是可识别的

为什么成立:在时间序列中,滞后关系天然具有时间顺序(原因必须在结果之前),因此滞后边的方向由时间顺序唯一确定(\( A_{t-1} \) 在时间上先于 \( B_t \))。ts-PAG丢失了这一信息(因为它将不同滞后的边合并),而ts-CAG保留了它。因此,ts-CAG的等价类比ts-PAG更精细。

数学上:本文证明ts-CAG是ts-PAG的真子集(Theorem 3.1),即每个ts-CAG对应唯一一个ts-PAG,但反之不成立。因此,从ts-CAG可以推导出ts-PAG的所有结论,但还能额外得到滞后方向信息。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对含未观测混杂的多元时间序列,提出时间滞后因果祖先图(ts-CAG) 作为新的图模型类,并完整刻画其性质与马尔可夫等价类。
  2. 核心工具/方法:基于祖先图(ancestral graph) 理论(Richardson & Spirtes 2002),将其推广到时间序列,引入滞后特定边(time-lag specific edges)和混合边(双向边表示混杂),并定义ts-CAG的马尔可夫等价类的图形表示(称为时间滞后部分祖先图,ts-PAG*)。
  3. 主要结论:ts-CAG是ts-PAG的真子集(Theorem 3.1),因此能从ts-CAG的等价类中读出比ts-PAG更丰富的因果知识(特别是滞后边的方向)。作者给出了ts-CAG等价类的完整图形刻画(Theorem 4.1),并证明该刻画比现有因果发现算法(如PCMCI)所能学习的知识更精细。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • 定义1(时间滞后因果图,ts-causal graph):一个有向图 \( G \),顶点集 \( V = \{X_t^{(i)} : i=1,\dots,d, t \in \mathbb{Z}\} \),边集包含:
  • 有向边 \( X_{t-\tau}^{(i)} \to X_t^{(j)} \)\( \tau \ge 0 \)),表示直接因果。
  • 双向边 \( X_t^{(i)} \leftrightarrow X_t^{(j)} \),表示未观测混杂(仅瞬时)。
  • 无向边 \( X_t^{(i)} - X_t^{(j)} \)(仅用于等价类表示,表示方向未知)。
  • 定义2(时间滞后祖先图,ts-CAG):满足祖先图性质的ts-causal graph:无有向环(acyclic),且双向边不形成环(即混杂结构是“无环”的)。这是对静态MAG(最大祖先图)的时间序列推广。
  • 假设
  • 因果充分性不成立:存在未观测混杂。
  • 时间一致性:因果结构在时间上平稳(即边不随时间变化)。
  • 忠实性(faithfulness):观测到的条件独立性完全由因果图决定(无额外独立性)。
  • 无瞬时环:瞬时关系(\( \tau=0 \))不形成有向环(即瞬时因果是DAG)。
  • 相比已有文献:相比ts-PAG(Eichler 2012),本文强化了滞后结构的表示(明确区分不同滞后的边),但未增加额外假设(所有假设与ts-PAG相同)。相比ts-causal graph(Gerhardus & Runge 2020),本文放松了因果充分性假设(允许未观测混杂)。

主要结果

Theorem 3.1(ts-CAG是ts-PAG的真子集): - 陈述:每个ts-CAG对应唯一一个ts-PAG(通过“合并”所有滞后边为一条边),但存在ts-PAG不对应任何ts-CAG(即ts-CAG是ts-PAG的严格子集)。 - 直觉:ts-PAG丢失了滞后信息,因此一个ts-PAG可能对应多个ts-CAG(不同滞后结构)。但ts-CAG保留了滞后信息,因此每个ts-CAG唯一确定一个ts-PAG。 - 必要条件:ts-CAG必须满足时间顺序约束(滞后边的方向由时间决定),而ts-PAG不要求此约束。 - 解决的技术难点:证明ts-CAG的“合并”操作(将不同滞后的边合并为一条)不破坏祖先图性质。

Theorem 4.1(ts-CAG等价类的图形刻画): - 陈述:ts-CAG的马尔可夫等价类可以用时间滞后部分祖先图(ts-PAG*) 表示,其中边类型包括: - \( \to \)(方向确定)、\( \leftrightarrow \)(混杂确定)、\( \circ \!\!-\!\!\circ \)(方向未知)、\( \circ \!\!\to \)(方向部分确定)等。 - 关键区别:ts-PAG滞后边的方向是确定的(因为时间顺序),而ts-PAG中滞后边的方向可能未知。 - 直觉:ts-PAG 比ts-PAG包含更多信息——它明确标注了哪些滞后边的方向是确定的。 - 必要条件:等价类由条件独立性决定,且忠实性假设保证等价类非空。 - 解决的技术难点:证明ts-PAG* 的边类型规则(如哪些边方向可翻转)与静态PAG类似,但需额外考虑时间顺序约束。

Theorem 5.1(因果发现算法的局限性): - 陈述:现有因果发现算法(如PCMCI)学习的是ts-PAG,而非ts-PAG。因此,它们无法识别滞后边的方向(即使数据支持)。 - 直觉:算法输出的是ts-PAG,丢失了滞后信息。要学习ts-PAG,需要修改算法以保留滞后边的方向。 - 必要条件:算法需能区分不同滞后的条件独立性(即测试 \( X_{t-\tau} \perp\!\!\!\perp X_t \mid \text{过去} \) 对不同的 \( \tau \))。

证明路线与技术技巧(理论型必写,要具体)

整体路线(以Theorem 3.1为例): 1. 定义映射:定义从ts-CAG到ts-PAG的映射 \( \phi \),将每个滞后边 \( X_{t-\tau}^{(i)} \to X_t^{(j)} \) 映射为一条瞬时边 \( X_t^{(i)} \circ \!\!-\!\!\circ X_t^{(j)} \)(方向未知),并保留双向边。 2. 证明映射是良定义的:验证 \( \phi(G) \) 满足ts-PAG的定义(无有向环、祖先图性质)。关键:时间顺序保证滞后边不形成环,因此映射后也不形成环。 3. 证明映射是单射:若 \( \phi(G_1) = \phi(G_2) \),则 \( G_1 = G_2 \)。这需要证明滞后信息可以从ts-PAG中恢复?——这正是ts-PAG丢失滞后信息的原因。实际上,映射不是单射:多个ts-CAG可能映射到同一个ts-PAG。因此,ts-CAG是ts-PAG的真子集。 4. 证明存在ts-PAG不在像中:构造一个ts-PAG,其滞后边的方向与时间顺序矛盾(例如 \( A_t \circ \!\!-\!\!\circ B_t \)\( A_{t-1} \to B_t \)\( B_{t-1} \to A_t \) 同时存在),这样的ts-PAG不对应任何ts-CAG。

关键跳跃点: - 跳跃点1:证明ts-CAG的“合并”操作不破坏祖先图性质。难点在于双向边与滞后边的交互——如果滞后边与双向边形成环,合并后可能产生有向环。作者通过时间顺序解决:滞后边方向由时间决定,因此滞后边与双向边不可能形成有向环(因为双向边仅瞬时,滞后边跨时间)。 - 跳跃点2:证明ts-PAG 的边类型规则(Theorem 4.1)是完备的。难点在于时间序列中条件独立性的测试涉及多个滞后,等价类规则需考虑所有滞后。作者借鉴静态PAG的规则(Richardson & Spirtes 2002),但额外引入时间顺序约束*(如滞后边的方向不可翻转)。

技术技巧点名: - 图论:祖先图理论(ancestral graph)、马尔可夫等价类的图形刻画(PAG规则)。 - 条件独立性测试:时间序列的条件独立性测试(如基于偏相关的测试),但本文不涉及具体测试方法。 - 组合构造:构造反例证明ts-PAG不在像中(Theorem 3.1的证明)。

真实例子与应用

本文为纯理论,无实证例子。作者在Section 6中给出了一个玩具例子(Example 6.1),用 \( d=2 \) 变量、滞后 \( \tau=1 \) 的简单场景,展示ts-CAG与ts-PAG的等价类差异。但该例子是人工构造的,未使用真实数据。

🔎 结论是否比证明窄

  • 结论1:“ts-CAG是ts-PAG的真子集”(Theorem 3.1)——证明严格,结论与证明一致。
  • 结论2:“ts-CAG的等价类比ts-PAG包含更多因果知识”(Theorem 4.1)——证明严格,但仅针对等价类的图形表示。作者未证明这些“额外知识”能转化为更强的因果效应识别条件(如do-calculus规则)。因此,结论的实际意义可能比证明窄——它只说了图表示更精细,但未说因果推断更强。
  • 结论3:“现有因果发现算法无法学习ts-CAG的等价类”(Theorem 5.1)——证明严格,但作者未提出新算法。因此,这是一个负结果(现有算法不够好),而非正结果(新算法更好)。

四、开放问题(点到为止,扎根具体语句)

  1. 因果效应识别:ts-CAG的等价类能否推导出更强的do-calculus规则?例如,给定ts-PAG*,能否识别更多因果效应(如滞后效应)?扎根于本文Section 7(Future Work):“The implications of the novel model class for causal effect identification remain to be explored.”

  2. 因果发现算法:如何设计算法从观测数据中学习ts-CAG的等价类(ts-PAG)?需要修改现有算法(如PCMCI)以保留滞后信息。扎根于Theorem 5.1的证明:“Current algorithms learn ts-PAGs, not ts-PAGs.”

  3. 高维场景:当变量数 \( d \) 很大时,ts-CAG的等价类学习是否可行?本文未讨论计算复杂度。扎根于Section 1(Introduction):“We do not address computational aspects in this paper.”

  4. 与潜在结果框架的桥接:ts-CAG的图模型表示能否与潜在结果框架(如g-computation)结合,用于估计时间序列中的因果效应?扎根于Section 7:“Connections to the potential outcomes framework are a natural next step.”


Maintained by 陈星宇 · Homepage · Source on GitHub

评论