Causal DAG Identification for Count Data via Poisson Thinning Structural Equation Models¶
作者: Penggang Gao, Ming Cai, Hisayuki Hara
主题: 因果推断
相关性: 8/10
链接: https://arxiv.org/abs/2609.06098
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向要解决的根本问题是:如何从观测到的计数型(count-valued)数据中,唯一地识别出变量之间的因果有向无环图(DAG)。与连续变量不同,计数数据(如疾病数、事故数、交易数)的离散性和非负性使得经典的线性结构方程模型(SEM)不再适用,而通用的条件独立性测试(如PC算法)通常只能恢复马尔可夫等价类,无法确定因果方向。因此,该方向的核心是设计可识别的、针对计数数据的结构因果模型,使得观测分布能唯一确定DAG的结构和参数。
当前成熟度:处于快速发展期,但尚未形成统一框架。已有工作主要沿着两条互补的路线推进,但每条路线都有明显的局限性。
发展脉络(history)¶
奠基工作:连续变量可识别DAG模型的建立为计数数据模型提供了参照系。Shimizu et al. (2006) 的LiNGAM(线性非高斯)模型首次证明,当噪声非高斯时,线性SEM的DAG是可识别的。Hoyer et al. (2009) 和 Peters et al. (2014) 将可识别性推广到非线性加性噪声模型(ANM)。Zhang and Hyvärinen (2009) 进一步提出了后非线性(PNL)模型。这些工作确立了“利用模型结构而非条件独立性来识别DAG”这一范式。
主要进展(两条路线):
-
条件分布模型路线:直接指定每个节点给定其父节点时的条件分布,并从分布族的参数约束中推导可识别性。
- Park and Raskutti (2015) 提出了Poisson DAG模型,利用过度分散(overdispersion) 评分来学习结构。该模型假设每个节点的条件分布是Poisson,且均值是父节点值的线性函数(即identity link)。
- Park and Raskutti (2018) 将其推广到二次方差函数(QVF)DAG模型,覆盖了更广的分布族。
- Park and Park (2019) 进一步推广到广义超几何分布(GHD)DAG模型。
- Choi et al. (2020) 和 Choi and Ni (2023) 处理了零膨胀计数数据,分别提出了零膨胀Poisson贝叶斯网络和更一般的ZiG-DAG模型。
- Bodik and Chavez-Demoulin (2025) 在更一般的“条件参数化因果模型”框架下,建立了包括Poisson在内的多个参数族的可识别性。
- 共同特点:可识别性来源于对节点条件分布形式的限制。共同局限:通常要求所有节点服从同一分布族(或少数几个族),且模型参数的解释性(如“直接效应”)不如线性SEM直观。
-
Thinning算子模型路线:通过离散版本的“乘法”算子(thinning)来构建结构方程,使得系数具有“直接效应”的解释。
- Qiao et al. (2024) 提出了Poisson分支结构因果模型(PB-SCM),使用二项式thinning(binomial thinning)和独立的Poisson外生噪声。他们开发了基于高阶累积量的准则来识别因果方向,但只能部分识别DAG,且系数限制在(0,1]。
- Xiang et al. (2024) 推导了PB-SCM的概率生成函数,建立了恢复骨架和部分局部方向的条件。
- Qiao et al. (2026) 将PB-SCM扩展到存在潜在混淆变量的情况,研究了局部三变量结构的可识别性。
- 共同特点:模型结构更接近线性SEM,系数有明确的“均值效应”解释。共同局限:PB-SCM的DAG通常不可完全识别,且所有外生噪声必须为Poisson,系数范围受限。
当前frontier:本文(Gao, Cai, Hara, 2026)的工作。它站在PB-SCM的肩膀上,试图解决其两大核心缺陷:1) 系数限制在(0,1];2) 外生噪声必须为Poisson导致DAG不可完全识别。本文通过将二项式thinning替换为Poisson thinning,并允许节点级外生分布来自不同计数分布族,实现了DAG、thinning系数和外生分布的完全可识别。
子线索聚类¶
- 条件分布模型簇:Park & Raskutti (2015, 2018), Park & Park (2019), Choi et al. (2020), Choi & Ni (2023), Bodik & Chavez-Demoulin (2025)。核心是直接建模条件分布,利用分布族的参数特性(如均值-方差关系)实现识别。
- Thinning算子模型簇:Qiao et al. (2024, 2026), Xiang et al. (2024), 以及本文。核心是构建基于thinning的结构方程,系数解释为“均值上的直接效应”。
- 通用因果发现方法簇:PC算法 (Spirtes et al., 2001), GES (Chickering, 2002)。这些方法不依赖特定的函数形式,但通常只能恢复马尔可夫等价类。
这个方向在追问的核心问题¶
- 如何定义离散数据的“因果机制”?线性SEM的“加法”结构在计数数据上不自然。Thinning算子提供了一种“繁殖/生存”的离散类比,但这是否是唯一合理的因果机制?
- 在什么条件下,计数数据的DAG是完全可识别的? 条件分布模型和thinning模型各自给出了不同的充分条件。是否存在一个统一的、更弱的条件?
- 如何设计高效且一致的结构学习算法?精确的DAG搜索(如动态规划)复杂度为O(d²2^d),对节点数d敏感。如何扩展到更大规模的图?
- 如何处理潜在混淆和反馈?现有工作(包括本文)大多假设因果充分性和无环性。现实数据中这两个假设常常被违反。
⚠️ 作者的framing¶
- 作者把缺口frame成什么:作者将PB-SCM的“系数限制在(0,1]”和“所有外生变量为Poisson导致DAG不可完全识别”这两个缺陷,作为本文的直接动机。他们声称PT-SEM通过引入Poisson thinning(允许系数≥0)和放松外生分布假设,自然地解决了这两个问题,使得PT-SEM成为PB-SCM的“显然的下一步”推广。
- 哪些竞争路线被他淡化或回避了:
- 条件分布模型路线(如Poisson DAG模型)被作者在引言中提及,但随后被迅速带过。作者没有深入比较PT-SEM与Poisson DAG模型在识别条件上的强弱。实际上,当所有外生噪声为Poisson时,PT-SEM退化为一个identity-link的Poisson DAG模型(作者自己也承认了这一点)。作者没有讨论:在Poisson外生噪声下,PT-SEM的DAG是否比Poisson DAG模型更容易识别?或者,PT-SEM的识别条件是否比Poisson DAG模型的“过度分散”条件更弱或更强?
- 更一般的广义线性模型(GLM)框架:PT-SEM本质上是一个identity-link的GLM,但作者没有将其置于GLM因果推断的更大背景下讨论。例如,与基于GLM的因果发现方法相比,PT-SEM的独特优势是什么?
- 什么明显该被引/该存在、却没出现在intro里?
- 更广泛的计数时间序列模型(INAR, INGARCH):Poisson thinning算子本身在时间序列领域(如INAR模型)有广泛应用。作者引用了Al-Osh & Alzaid (1987) 和 Latour (1998),但没有讨论这些时间序列模型中的识别问题与本文的因果DAG识别问题之间的异同。这可能是研究者可以深挖的一个点:时间序列中的因果推断与横截面数据的因果推断有何不同?
- 基于矩的因果发现方法:本文的识别和估计大量依赖于协方差矩阵和矩估计。这与一些基于矩的因果发现方法(如LiNGAM的变体)有技术上的亲缘性,但作者没有在引言中建立这种联系。
张力¶
未见明显对立引用。不同路线(条件分布 vs. thinning)之间是互补而非矛盾的关系。PB-SCM和PT-SEM之间是推广与被推广的关系,没有根本性冲突。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
X = (X_1, ..., X_d)^T:一个d维随机向量,每个分量X_i取值于非负整数集N_0 = {0, 1, 2, ...}。这是可观测的随机变量。G = (V, E):一个有向无环图(DAG),V = [d]是节点集,E是有向边集。pa_G(i)和ch_G(i)分别表示节点i的父节点集和子节点集。这是要估计的目标。α_ij:thinning系数,表示从节点j到节点i的直接效应。α_ij >= 0。当j不是i的父节点时,α_ij = 0。这是要估计的参数。ε_i:节点i的外生噪声变量,取值于N_0。所有ε_i相互独立。这是潜在/不可观测的,其分布是要估计的目标。α ◦_p X:Poisson thinning算子。α ◦_p X = sum_{l=1}^X Z_l,其中Z_li.i.d. ~ Poisson(α),且与X独立。这是模型的核心机制。M_X(t) = E[exp(tX)]:矩母函数(MGF)。K_X(t) = log M_X(t):累积量生成函数(CGF)。N:样本量。D_N = {x^(i)}_{i=1}^N是来自观测分布P_0的i.i.d.样本。
-
模型(PT-SEM):
- 数据生成机制:对于每个节点
i,X_i = sum_{j in pa_G(i)} α_ij ◦_p X_j + ε_i。 - 结构:这是一个递归定义。由于
G是无环的,可以按照拓扑顺序依次生成X_i。所有Poisson offspring变量(用于thinning)和所有外生噪声ε_i都是相互独立的。 - 关键性质:
E[X_i | X_{pa_G(i)}] = E[ε_i] + sum_{j in pa_G(i)} α_ij X_j。这意味着thinning系数α_ij直接解释了父节点X_j对子节点X_i条件均值的影响,类似于线性SEM中的回归系数。
- 数据生成机制:对于每个节点
-
可观测数据:
- 可观测:
X的i.i.d.样本,即D_N。我们能观测到的是每个样本中所有d个计数变量的联合实现。 - 不可观测/潜在:
- DAG
G的结构(谁是谁的父节点)。 - Thinning系数
α_ij。 - 外生噪声
ε_i的具体实现值及其分布。
- DAG
- 识别依赖的假设:要仅从
X的观测分布中唯一确定上述不可观测量,需要依赖模型假设(PT-SEM的结构)和对外生噪声的正则性条件(A1-A3)。
- 可观测:
第二步:讲最小内核¶
整篇论文的识别证明本质上是双变量情况(d=2)的推广。因此,最小内核就是双变量PT-SEM。
最简特例:双变量PT-SEM
考虑两个计数变量X_1和X_2。假设真实的因果方向是X_1 -> X_2,模型为:
X_1 = ε_1
X_2 = α ◦_p X_1 + ε_2,其中 α > 0。
ε_1和ε_2是相互独立的、非退化的计数分布,满足 (A1)-(A3)。
核心问题:仅从(X_1, X_2)的联合观测分布,能否唯一确定因果方向是X_1 -> X_2,而不是反向的X_2 -> X_1?
核心思路(反证法):
假设观测分布也能由一个反向的PT-SEM生成:
X_2 = ε^*_2
X_1 = β ◦_p X_2 + ε^*_1,其中 β >= 0。
如果能证明这个反向模型与观测分布矛盾,那么X_1 -> X_2就是可识别的。
证明的数学核心(用条件MGF的矛盾):
-
从正向模型推导条件MGF的关系: 定义
M_s(t) = E[exp(tX_1) | X_2 = s],s = 0, 1, 2。 在正向模型下,通过贝叶斯公式和Poisson卷积的性质,可以证明(Lemma 5):M_1(t) = γ_0 M_0(t) + γ_1 M'_0(t)M_2(t) = δ_0 M_0(t) + δ_1 M'_0(t) + δ_2 M''_0(t)其中γ_1 > 0, δ_2 > 0。这是一个线性微分关系。 -
从反向模型推导条件MGF的关系: 在反向模型下,由于
X_2是根节点,X_1的条件分布是β ◦_p X_2与ε^*_1的卷积。可以证明(Lemma 6):M_s(t) = M_0(t) * exp{sβ(e^t - 1)},s = 0, 1, 2。 这是一个指数乘法关系。 -
证明两个关系不可调和: Lemma 7 证明,如果
M_0, M_1, M_2同时满足上述两种关系,会导致数学矛盾(例如,通过求导和代数运算,最终推出一个非零常数必须为零)。因此,反向模型不可能存在。
结论:在双变量情况下,因果方向X_1 -> X_2是唯一可识别的。这个矛盾的核心在于,正向模型产生的条件MGF是M_0及其导数的线性组合,而反向模型产生的条件MGF是M_0乘以一个指数因子。这两种结构在代数上是不兼容的,除非外生噪声是退化的(被(A2)排除)。
三、这篇论文做了什么¶
-
三句话:
- 研究了什么问题:针对计数型变量,提出了一个基于Poisson thinning的结构方程模型(PT-SEM),并证明了在节点级正则条件下,其因果DAG、thinning系数以及节点级外生分布是完全可识别的。
- 核心工具/方法:识别证明的核心工具是条件累积量生成函数(CGF) 的sink节点刻画;结构学习算法是基于矩估计(MoM)的plug-in BIC评分,并通过子集动态规划(DP) 进行精确优化。
- 主要结论:PT-SEM的DAG、系数和外生分布可由观测分布唯一确定。基于plug-in BIC的DP算法在DAG选择和分布族选择上具有一致性。模拟和真实数据实验验证了方法的有效性。
-
关键设定与假设:
- 模型设定:PT-SEM(定义3),使用Poisson thinning算子
α ◦_p X,系数α_ij >= 0,外生噪声ε_i相互独立且来自任意计数分布族。 - 节点级正则条件(A1-A3):
- (A1)
Pr(ε_i = 0) > 0:每个外生噪声有正概率取零。这保证了某些条件事件(如所有父节点为零)有正概率,是识别外生分布的关键。 - (A2)
Var(ε_i) > 0:每个外生噪声非退化。这是排除平凡解、保证识别的基础。 - (A3)
M_{ε_i}(t) < ∞在0附近:矩母函数在0的邻域内有限。这保证了CGF的存在性和解析性,是使用CGF进行代数操作的前提。
- (A1)
- 与已有文献的对比:
- 相比PB-SCM (Qiao et al., 2024):放宽了
α_ij ∈ (0,1]的限制到[0, ∞);放宽了ε_i必须为Poisson的限制到任意满足(A1)-(A3)的计数分布。这是本文的核心贡献。 - 相比Poisson DAG模型 (Park & Raskutti, 2015):当所有
ε_i为Poisson时,PT-SEM是Poisson DAG模型的一个特例(identity link)。但PT-SEM允许更一般的外生分布,因此其识别条件更弱(不要求所有节点同分布族),但模型结构更具体(基于thinning)。
- 相比PB-SCM (Qiao et al., 2024):放宽了
- 模型设定:PT-SEM(定义3),使用Poisson thinning算子
-
主要结果:
- 定理12(PT-SEM的精确可识别性):在(A1)-(A3)下,PT-SEM的观测分布唯一确定
G、A和节点级外生分布。- 证明直觉:
- 识别Sink节点:通过Proposition 10,利用条件CGF的代数形式来刻画sink节点。Sink节点的条件CGF具有
g(t) + (e^t - 1) * sum(b_j x_j)的形式。非sink节点则无法满足此形式(否则会导致与双变量情况类似的矛盾)。 - 递归识别拓扑序:识别出所有sink节点后,将它们从图中移除,剩下的子图仍然是PT-SEM。重复步骤1,即可恢复一个拓扑序。
- 识别父节点和系数:在已知拓扑序后,利用协方差恒等式
Cov(X_k, X_{pre}) = Cov(X_{pre}, X_{pre}) * α_{k, pre}。由于协方差矩阵正定(Lemma 11),α_{k, pre}可由Σ_{pre, pre}^{-1} Σ_{pre, k}唯一确定。其正元素对应父节点,零元素对应非父节点。 - 识别外生分布:条件于所有父节点为零的事件,所有thinning项消失,
X_k的分布即为ε_k的分布。
- 识别Sink节点:通过Proposition 10,利用条件CGF的代数形式来刻画sink节点。Sink节点的条件CGF具有
- 证明直觉:
- 定理14(PB-SCM的可识别性条件):如果PB-SCM中每个非sink节点的外生噪声都是非Poisson的,那么其DAG、系数和外生分布也是可识别的。
- 证明直觉:Proposition 13证明,在PB-SCM中,如果一个非sink节点满足sink节点的CGF刻画(即公式14),那么它的外生噪声必须是Poisson。因此,只要所有非sink节点的外生噪声都不是Poisson,sink节点的刻画就是唯一的,从而可以递归识别。这解释了为什么全Poisson的PB-SCM不可识别——Poisson噪声是那个“例外”。
- 定理18(BIC一致性):基于plug-in MoM估计的BIC评分,通过DP优化得到的DAG
ˆG和分布族分配ˆτ,满足Pr(ˆG = G_0, ˆτ ∈ T_0) → 1。- 证明直觉:证明分为两部分。1) 对于正确设定的模型(能表示真实分布),如果它比真实模型更复杂(多边或多参数),其BIC值会因
log N惩罚项而严格大于真实模型的BIC。2) 对于错误设定的模型(不能表示真实分布),其似然函数的最大值会严格小于真实模型的最大似然,差距为O(N),远大于O(log N)的惩罚项。因此,真实模型最终会被选中。
- 证明直觉:证明分为两部分。1) 对于正确设定的模型(能表示真实分布),如果它比真实模型更复杂(多边或多参数),其BIC值会因
- 定理12(PT-SEM的精确可识别性):在(A1)-(A3)下,PT-SEM的观测分布唯一确定
-
证明路线与技术技巧:
- 整体路线:
- 识别(Section 3):从双变量特例(Proposition 8)出发,建立条件MGF的矛盾。然后推广到多变量,通过条件CGF刻画sink节点(Proposition 10)。最后利用sink递归和协方差方程完成全图识别(Theorem 12)。
- 学习(Section 4):设计一个可分解的BIC评分。为了计算效率,用矩估计(MoM)代替最大似然估计来得到参数plug-in值(Section 4.2)。证明该plug-in BIC评分的一致性(Theorem 18)。最后,利用评分的可分解性,通过子集动态规划(DP)进行精确搜索(Algorithm 1)。
- 关键跳跃点:
- 从双变量到多变量的推广:关键在于如何“局部化”双变量的矛盾。作者通过固定其他变量为零(
X_R = 0_R),并选择一个子节点c,构造了局部条件事件L_s = {X_c = s, X_R = 0_R}。这使得多变量问题在局部退化为一个类似双变量的结构,从而可以应用Lemma 9(多变量版的Lemma 5)。 - Sink节点的CGF刻画:Proposition 10的“当且仅当”条件是整个识别理论的基石。证明“非sink节点不满足该刻画”的部分,需要巧妙地利用Lemma 9和双变量矛盾(Lemma 7)来导出矛盾。
- BIC一致性的证明:证明错误设定模型时,需要处理参数空间可能无界的问题。作者通过一个巧妙的论证(公式A.10),证明如果某个thinning系数太大,似然会趋于负无穷,从而可以将参数限制在一个紧集上,然后利用紧集上的上确界连续性来证明似然差距。
- 从双变量到多变量的推广:关键在于如何“局部化”双变量的矛盾。作者通过固定其他变量为零(
- 技术技巧点名:
- 条件MGF/CGF分析:用于刻画sink节点和建立双变量矛盾。这是整个识别理论的核心工具。
- 矩估计(MoM):用于快速估计thinning系数和外生分布的参数,避免了复杂的卷积似然优化。
- Plug-in BIC:将MoM估计代入似然函数计算BIC,在保持一致性的同时大幅降低了计算成本。
- 子集动态规划(DP):用于在DAG空间中进行精确的全局优化,利用了评分的可分解性。算法复杂度为
O((d^4 + N d^2) 2^d)。 - 紧集上的上确界论证:在证明BIC一致性时,用于处理错误设定模型。
- 整体路线:
-
真实例子与应用:
- 数据:NBA 2015-16至2024-25赛季的常规赛play-by-play数据,共95,808个球队-季度观测。
- 变量:5个计数变量:
FOUL(非进攻犯规数)、FTA(罚球次数)、FTM(罚中次数)、PERS(个人犯规数)、LOOSE(争球犯规数)。 - 如何应用:将PT-SEM的DP-BIC方法应用于每个赛季的数据,学习这5个变量之间的DAG。候选外生分布族与模拟实验相同(Poisson, NB, ZIP, Geometric, Binomial, Bernoulli)。
- 结果:
- DAG恢复:Proposed DP-BIC在每个赛季都完美恢复了预设的参考DAG(
FOUL->PERS,LOOSE,FTA;FTA->FTM),骨架和定向的F1分数均为1.000。而ODS、PC-RCIT、PB-SCM和PB-SCM-PGF的表现均较差。 - 系数估计:估计的thinning系数跨赛季稳定。例如,
FOUL -> FTA的系数均值为1.238,范围在1.187-1.297,均大于1。这符合篮球规则:一次犯规可能导致多次罚球。 - 外生分布选择:不同节点在不同赛季选择了不同的外生分布族(如
FOUL多为二项分布,FTA多为几何分布),展示了模型处理异质性外生噪声的能力。
- DAG恢复:Proposed DP-BIC在每个赛季都完美恢复了预设的参考DAG(
- 这个例子想说明什么:验证了PT-SEM在真实世界事件计数数据上的实用性,展示了其相对于现有方法的优势(更准确的DAG恢复、可解释的系数、灵活的分布选择),并证明了估计结果的跨时间稳定性。
-
🔎 结论是否比证明窄:
- 窄结论:定理12的证明依赖于已知一个拓扑序(通过sink递归获得)。虽然这个拓扑序是从数据中识别出来的,但证明本身假设了我们可以通过Proposition 10递归地找到它。这是一个构造性证明,结论是紧的。
- 泛化声明:作者在结论部分提到“The current theory assumes causal sufficiency and acyclicity.” 这是一个诚实的声明,表明当前结果不适用于存在潜在混淆或反馈的系统。没有发现比证明更宽的泛化声明。
- 潜在窄点:BIC一致性(Theorem 18)的证明依赖于候选分布族集合
M是有限的,并且真实分布族包含在其中。如果真实分布族不在候选集中,一致性不成立。作者在模拟中假设了这一点,但在真实数据应用中,这是一个无法验证的假设。
四、开放问题¶
-
扩展到潜在混淆和反馈系统:作者在结论中明确指出这是当前理论的局限。扎根于:Section 7, "Extensions to latent confounding and feedback systems... remain open." 这是一个明确的、由作者自己提出的开放问题。研究者可以尝试将PT-SEM与proximal causal inference或instrumental variable方法结合,来处理未观测的混淆变量。
-
更大图的可扩展性:DP算法的时间复杂度为
O((d^4 + N d^2) 2^d),对节点数d非常敏感。扎根于:Section 7, "...scalable score optimization for larger graphs... remain open." 这是一个计算上的瓶颈。研究者可以探索基于贪心搜索(如GES)或顺序测试(如PC算法)的变体,并分析其在PT-SEM下的理论性质(如一致性),或者利用稀疏性假设(如节点度有界)来降低复杂度。 -
混合数据类型(计数、分类、连续)的模型:现实数据往往是混合类型的。扎根于:Section 7, "...models for mixed count, categorical, and continuous data remain open." 这是一个模型扩展问题。研究者可以思考如何将Poisson thinning与其他类型的结构方程(如线性、逻辑斯蒂)结合起来,构建一个统一的混合数据因果模型。
-
Thinning系数的假设检验:本文关注点估计和模型选择,但没有讨论系数的假设检验(如
H_0: α_ij = 0)。扎根于:本文的识别和估计部分(Section 3 & 4)提供了√N-一致的估计量(Proposition 16),但未给出其渐近分布用于推断。这是一个自然的后续工作。研究者可以推导MoM估计量的渐近方差,并构建Wald检验或似然比检验,用于判断边的存在性。
Maintained by 陈星宇 · Homepage · Source on GitHub