跳转至

High-Dimensional Covariate-Dependent Discrete Graphical Models and Dynamic Ising Models

讲者: Nanwei Wang
会场: Functional and Graphical Models for Complex Biomedical Data
报告题目: High-Dimensional Covariate-Dependent Discrete Graphical Models and Dynamic Ising Models
链接: arXiv
来源: JCSDS 2026 · 返回会议总览


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:如何构建一个统计模型,使得图模型(Graphical Model)中变量之间的条件依赖结构(即图的边)能够随着外部协变量(如时间、处理剂量、基因型等)的变化而平滑或分段地变化。 传统图模型假设图结构是静态的,但在许多实际场景(如基因调控网络随疾病进展变化、金融市场网络随政策变化)中,这一假设不成立。当前该方向的成熟度处于方法快速发展期:对于高斯图模型(GGM),已有大量工作;但对于离散图模型(尤其是多类别、高阶交互的log-linear模型),协变量依赖的建模仍非常初步。

发展脉络(history)

  1. 奠基工作:静态图模型与贝叶斯框架

    • Lauritzen (1996):奠定了图模型作为概率图与图论桥梁的经典教科书,定义了条件独立性与图结构的关系。
    • Dawid & Lauritzen (1993):引入超马尔可夫律(Hyper Markov Laws),为贝叶斯图模型推断提供了先验与后验一致的框架,是后续所有贝叶斯图模型工作的基石。
    • Wainwright & Jordan (2008):系统阐述了图模型与指数族分布的联系,揭示了图模型如何通过因子分解实现高效计算,是理解图模型计算复杂性的关键参考。
  2. 主要进展:从静态到多组/异质性图模型

    • Guo et al. (2011)Lin et al. (2017):开创性地提出“联合估计多个图模型”,通过惩罚似然来估计不同离散化组(如不同疾病亚型)之间的共同与特异结构。这是从“一个静态图”到“多个离散图”的第一步,但协变量是离散的、分组的。
    • Peterson et al. (2015)Tan et al. (2017)Mitra et al. (2016):在贝叶斯框架下,通过混合先验或图融合先验,实现了对多个异质性图模型的联合估计。这些方法允许图结构在不同组间变化,但组别是预先定义的类别变量。
    • Ni et al. (2022):提出了贝叶斯协变量依赖的高斯图模型,将协变量直接纳入精度矩阵的建模中,允许图结构随连续或离散协变量连续变化。这是该方向在GGM上的一个里程碑,但模型参数化复杂,且局限于高斯数据。
  3. 当前Frontier:协变量依赖的离散图模型

    • Cheng et al. (2014):提出了稀疏协变量依赖的Ising模型,是本文最直接的前驱。该工作将协变量引入二元数据的Ising模型,但模型是稀疏的(通过Lasso惩罚),且未提供完整的似然推断理论(如渐近正态性)。
    • Zhang & Li (2023):提出了高维高斯图回归模型,允许均值与精度矩阵随协变量线性调整,是GGM方向的最新进展之一。
    • Niu et al. (2024):提出了基于随机分割的协变量依赖高斯图模型,通过伪似然和共轭先验来避免直接参数化精度矩阵,是另一种有前景的GGM方法。
  4. 本文的位置

    • 本文(Roach, Li, Wang & Gao, 2025)声称填补了离散图模型在协变量依赖方面的空白。作者指出,现有文献“主要关注协变量依赖的高斯图模型”(引言原文),而他们的工作将经典的层次log-linear模型参数化扩展为“基线图+斜率图”的形式,从而允许离散数据的图结构随协变量变化。本文在方法上更接近Cheng et al. (2014)的Ising模型,但将其推广到一般的离散图模型(多类别、高阶交互),并提供了完整的似然推断理论(MLE的渐近正态性、假设检验)和贝叶斯模型选择算法(SBDMCMC)。

子线索聚类

  1. 高斯图模型(GGM)的协变量依赖:这是最活跃的线索。代表工作包括Guo et al. (2011)、Lin et al. (2017)、Ni et al. (2022)、Zhang & Li (2023)、Niu et al. (2024)。这些方法主要处理连续数据,通过参数化精度矩阵或协方差矩阵来引入协变量。技术核心是处理正定约束和高维惩罚。
  2. 离散图模型的静态推断:这是本文的根基。代表工作包括Lauritzen (1996)、Dawid & Lauritzen (1993)、Letac & Massam (2012)、Massam et al. (2009)、Roach et al. (2025)。这些工作专注于离散数据的log-linear模型,研究其几何结构、共轭先验、贝叶斯因子和模型选择一致性。技术核心是处理列联表的高维性和交互项的层次性。
  3. 离散图模型的协变量依赖(稀疏/特例):这是本文的直接竞争路线。代表工作主要是Cheng et al. (2014)的稀疏协变量依赖Ising模型。该工作通过Lasso惩罚实现稀疏性,但缺乏本文提供的完整似然推断框架和贝叶斯模型选择。
  4. 贝叶斯图模型选择算法:这是本文的工具箱。代表工作包括Mohammadi & Wit (2015)的BDMCMC用于GGM,Dobra & Mohammadi (2018)用于log-linear模型,以及Wang et al. (2023)的SBDMCMC用于混合图模型。这些算法是本文进行结构学习的计算引擎。

这个方向在追问的核心问题

  1. 如何参数化协变量对图结构的影响? 是线性(如本文)、加性、还是非线性?参数化方式直接决定了模型的可解释性和计算复杂度。
  2. 在高维(p > n)离散图模型中,如何进行有效的参数估计和结构学习? 全似然MLE在离散模型中计算量随p指数增长(归一化常数问题),伪似然是主流方案,但其在协变量依赖设定下的理论性质(如估计一致性)需要严格证明。
  3. 如何对协变量依赖的图结构进行统计推断? 即如何检验某个协变量是否显著改变了图结构,或某个特定边是否随协变量变化。这需要推导检验统计量的渐近分布。
  4. 模型选择的一致性: 当p随n增长时,模型选择算法(如SBDMCMC)能否以概率1恢复真实的图结构?本文的Roach et al. (2025)证明了静态离散图模型的贝叶斯模型选择一致性,但协变量依赖下的情况尚未被理论覆盖。

⚠️ 作者的Framing

  • 作者的缺口声明:作者在引言中明确写道:“据我们所知,这种方法在现有文献中尚未被探索,现有文献主要关注协变量依赖的高斯图模型。”(原文:“To our knowledge, this approach has not been explored in existing literature, which primarily focuses on covariate-dependent Gaussian graphical models.”)作者将缺口frame为“离散图模型的协变量依赖化”,从而将自己定位为这一子领域的开创性工作。
  • 被淡化/回避的竞争路线
    • Cheng et al. (2014)的稀疏Ising模型:作者承认这是相关工作,但将其定位为“稀疏”和“Ising模型”的特例,而本文则声称是更一般的“离散图模型”框架。然而,Cheng et al. (2014)也处理了协变量依赖的二元数据,其核心思想(将协变量引入Ising模型的线性项)与本文的Ising模型特例在数学上非常相似。作者没有详细讨论两者在模型参数化上的本质区别,以及本文在理论(如渐近性)上相比Cheng et al. (2014)的具体优势。
    • 非参数/半参数方法:作者完全回避了非参数方法(如基于核的图模型、图值回归Liu et al. (2010))。这些方法不假设协变量效应的线性形式,可能更灵活。作者选择线性参数化,简化了模型但牺牲了灵活性。
  • 什么明显该被引/该存在、却没出现在intro里?
    • 关于高维离散图模型的理论:本文引用了Roach et al. (2025)关于贝叶斯模型选择一致性的工作,但该工作只针对静态图。对于协变量依赖的离散图模型,在高维p > n设定下,伪似然估计的一致性收敛速度的理论结果是什么?本文的Theorem 1只给出了固定p下的渐近正态性,没有处理高维情况。作者没有引用任何关于高维伪似然估计理论的工作(如针对Ising模型的Lasso估计的Oracle性质)。
    • 关于计算复杂度的讨论:本文的SBDMCMC算法是计算密集型的。作者没有讨论其在高维(p=1000)下的可扩展性,也没有与更快的凸优化方法(如Lasso)进行全面的计算时间对比。对于一位关注统计-计算权衡的研究者,这是一个明显的缺失。

张力

未见明显对立引用。所有被引工作基本都沿着“从静态到动态、从高斯到离散、从分组到连续”的渐进式发展路径,彼此之间没有根本性的矛盾。Cheng et al. (2014)与本文在离散图模型上的重叠是竞争关系而非对立关系。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • V = {1, ..., p}:顶点集,代表p个随机变量。
    • Y = (Y_v, v ∈ V):p维随机向量,每个Y_v取有限个离散值(如0,1,...,K-1)。
    • I = ∏_{v∈V} I_v:所有可能的单元格(cell)的集合,I_vY_v的取值集合。i ∈ I代表一个具体的单元格(如i = (1,0,1,...))。
    • n:样本量。
    • x = (x_1, ..., x_H):H维协变量向量。x_0 = 1(截距项)。
    • θ:模型参数。θ = (θ_0, θ_1, ..., θ_H),其中θ_h是第h个协变量对应的参数向量。
    • J_h:第h个协变量对应的生成类(generating class),即模型中包含的交互项集合(如{a, b, ab})。J_0是基线图的生成类,J_h是第h个斜率图的生成类。
    • θ_{j,h}:参数,对应第h个协变量和交互项j ∈ J_h
    • f_{h,i}:设计向量,维度为|J_h|。其第j个分量指示交互项j是否“在”单元格i中(即j的所有变量在i中取值非零,且ji的子集)。
    • p(i|x):给定协变量x时,随机向量Y落在单元格i的概率。
    • θ^*:真实参数值。
    • ℓ_n(θ):n个观测的对数似然函数。
    • ℓ_v(θ_v):第v个变量的伪对数似然函数。
  • 模型

    • 数据生成机制:给定协变量xY服从一个协变量依赖的层次log-linear模型。其核心是,给定x时,单元格i相对于基线单元格0(所有变量取0)的对数概率比,是协变量x的线性函数: log(p(i|x)/p(0|x)) = Σ_{j∈J_0} θ_{j,0} * 1_{j⊆i} + Σ_{h=1}^H x_h * Σ_{j∈J_h} θ_{j,h} * 1_{j⊆i} 其中1_{j⊆i}是指示函数,表示交互项j的所有变量在单元格i中取值非零。
    • 模型结构:模型由H+1个图结构(生成类)定义:一个基线图J_0和H个斜率图J_h。每个图结构决定了哪些交互项(边)是“活跃”的。协变量x_h通过线性地调整这些交互项的强度(θ_{j,h})来改变整个图的结构。
    • 已知/未知:协变量x和观测Y是已知的。图结构J_0, ..., J_H和参数θ是未知的,需要估计。
  • 可观测数据

    • 可观测n个独立同分布的样本{(Y^{(m)}, x^{(m)})}_{m=1}^n。每个Y^{(m)}是一个p维离散向量,x^{(m)}是H维协变量向量。
    • 不可观测/潜在:真实的图结构J_0, ..., J_H和参数θ是潜在变量。此外,模型假设了协变量效应是线性的,这是不可观测的模型假设。

第二步:讲最小内核

本文的核心思路可以用一个最简特例来理解:两个二元变量(p=2),一个协变量(H=1),且只考虑一阶和二阶交互(Ising模型)。

  • 特例设定

    • V = {1, 2}Y_1, Y_2 ∈ {0, 1}
    • 协变量x ∈ R(例如,时间)。
    • 基线图J_0和斜率图J_1都只包含一阶和二阶交互:J_0 = J_1 = {{1}, {2}, {1,2}}。这意味着基线图和斜率图都允许所有可能的边。
    • 参数:θ_0 = (θ_{1,0}, θ_{2,0}, θ_{12,0})θ_1 = (θ_{1,1}, θ_{2,1}, θ_{12,1})
  • 模型退化成什么? 根据公式(5),给定xY=(y_1, y_2)的概率为: log(p(y_1, y_2 | x) / p(0,0 | x)) = (θ_{1,0} + x*θ_{1,1})*y_1 + (θ_{2,0} + x*θ_{2,1})*y_2 + (θ_{12,0} + x*θ_{12,1})*y_1*y_2 这正是动态Ising模型(公式15)在p=2时的形式。可以看到,协变量x通过线性地调整每个参数(主效应和交互效应)来改变模型。

  • 核心思路是什么?

    1. 参数化:将静态图模型的参数θ_j替换为协变量的线性函数:θ_j(x) = θ_{j,0} + Σ_h x_h * θ_{j,h}。这样,图的结构(由θ_j(x)的符号和大小决定)就随x连续变化。
    2. 估计:由于模型属于指数族,可以直接写出似然函数。但全似然MLE需要计算归一化常数z(θ),在p较大时不可行。因此,作者转向伪似然,将问题分解为p个独立的逻辑回归问题。对于每个变量v,其条件概率P(Y_v | Y_{-v}, x)恰好是一个逻辑回归模型,其线性预测项包含了v的邻居和协变量。
    3. 结构学习:当图结构未知时,作者采用贝叶斯方法,通过SBDMCMC算法从后验分布中采样可能的图结构。该算法通过“出生”和“死亡”事件来添加或移除边,其接受率依赖于贝叶斯因子(用BIC近似)。
  • 这个特例揭示了什么?

    • 本文的一般性(多类别、高阶交互)在数学上只是这个二元Ising特例的“加壳”。核心的“线性参数化+伪似然+逻辑回归”思想在特例中已完全体现。
    • 本文的主要技术贡献不在于提出一个全新的统计思想,而在于将这一思想系统化地推广到一般的离散图模型,并提供了完整的理论(MLE渐近性)和计算(SBDMCMC)框架。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:提出了一个协变量依赖的离散图模型,允许离散随机变量之间的条件依赖结构(即图)随外部协变量线性变化,并特别研究了作为其特例的动态Ising模型
  2. 核心工具/方法:采用层次log-linear模型的参数化(基线图+斜率图),利用伪似然方法将高维参数估计转化为一系列逻辑回归问题,并使用可扩展的出生-死亡MCMC(SBDMCMC)算法进行贝叶斯模型选择。
  3. 主要结论:在固定维度下,证明了MLE的渐近正态性;通过模拟实验展示了伪似然估计的准确性(RMSE随样本量下降)和SBDMCMC在结构学习上优于Lasso(F1-score更高);并在流感疫苗基因表达数据上展示了模型的实际应用价值。

关键设定与假设

  • 模型设定:公式(5)定义了核心模型。关键假设是协变量效应是线性的,即log(p(i|x)/p(0|x))x的线性函数。这比非参数模型强,但比假设图结构完全不变要灵活。
  • 假设1(Assumption 1)n^{-1} I_n(θ^*) → I(θ^*),其中I_n是Fisher信息矩阵。这是一个标准的正则性条件,保证了信息矩阵的收敛和正定性,是证明MLE渐近正态性的基础。相比已有文献,本文没有对协变量的分布或图结构的稀疏性做额外假设,这是一个相对较弱的设定。
  • 伪似然方法:将全似然替换为条件似然的乘积。其有效性依赖于一个隐含假设:条件模型(逻辑回归)是正确设定的。如果真实模型不是log-linear形式,伪似然估计可能不一致。
  • SBDMCMC:该算法的收敛性依赖于定理2中定义的出生/死亡速率,该速率确保了马尔可夫链的平稳分布是后验分布。算法假设了BIC/EBIC是边际似然p(y_v | y_{N_v}, x)的一个良好近似,这在p固定时成立,但在高维p>n时,BIC的理论性质需要更仔细的检验。

主要结果

  • 定理1(MLE的渐近正态性)
    • 陈述:在假设1下,存在一个局部极大似然估计θ̂,满足||θ̂ - θ^*||_2 = O_p(n^{-1/2}),且√n(θ̂ - θ^*) → N(0, I(θ^*)^{-1})
    • 直觉:这是指数族MLE的标准结果。由于模型属于指数族,且假设了信息矩阵收敛,MLE具有√n一致性和渐近正态性。
    • 必要条件:假设1(信息矩阵收敛)和模型的可识别性(I(θ^*)正定)。
    • 解决的技术难点:本文的贡献在于验证了该模型属于指数族(公式8),从而可以直接应用指数族MLE的经典理论。技术难点在于推导出似然函数、得分向量和海森矩阵的具体形式(公式8-13),这依赖于对层次log-linear模型参数化的深刻理解。
  • 定理2(BDMCMC的平稳分布)
    • 陈述:如果出生/死亡速率按公式(26)定义,则BDMCMC过程的平稳分布是后验分布p(N_v | y, x)
    • 直觉:这是可逆跳跃MCMC(RJMCMC)的一个特例。通过精心设计出生和死亡速率,使得马尔可夫链满足细致平衡条件,从而收敛到目标后验分布。
    • 必要条件:出生/死亡速率必须按公式(26)定义,这要求能够计算后验概率比p(N'_v | y, x) / p(N_v | y, x)
    • 解决的技术难点:后验概率比的计算被分解为似然比和先验比。似然比p(y_v | y_{N'_v}, x) / p(y_v | y_{N_v}, x)没有闭式解,作者采用BIC/EBIC来近似,这是一个重要的实用技巧,使得算法可行。
  • 模拟实验的核心量化结论
    • MLE估计(表1, 2):对于p=2和p=4的模型,当n=10000时,平均||ϵ||_2/参数数量在0.02到0.06之间,表明MLE在低维下是准确的。
    • 似然比检验(表3):对于检验H_0: θ_1 = 0,当γ=0(原假设为真)时,Type I error接近名义水平0.05;当γ=0.5时,Power达到1。检验是有效的。
    • 伪似然估计(图5):对于p=100的动态Ising模型,RMSE随样本量从10000增加到100000而单调下降,验证了估计的一致性。
    • SBDMCMC vs. Lasso(图6):在p=100的模型选择中,SBDMCMC的F1-score在所有样本量下都显著高于Lasso(例如,在n=60000时,基线图F1-score约0.95 vs. 0.85)。这表明SBDMCMC在结构学习上优于基于惩罚的Lasso方法。

证明路线与技术技巧

  • 整体路线(针对定理1)
    1. 证明模型属于指数族:将似然函数写成exp{<θ, t> - A(θ)}的形式(公式8),其中t是充分统计量。这是应用指数族理论的前提。
    2. 推导得分和海森矩阵:计算得分向量(公式12)和海森矩阵(公式13)。海森矩阵是负定的,保证了似然函数的凹性。
    3. 应用标准MLE理论:在假设1(信息矩阵收敛)下,利用指数族MLE的经典结果(如van der Vaart, 1998),直接得到√n一致性和渐近正态性。
  • 关键跳跃点
    • 本文的证明没有真正的“跳跃点”。定理1的证明是标准且直接的,主要工作量在于代数推导(将log-linear模型的参数化转化为指数族形式),而非提出新的概率论或统计技术。
    • 定理2的证明同样标准,是RJMCMC理论的一个直接应用。其“跳跃点”在于用BIC近似边际似然,这是一个实用但非严格的近似,其在高维下的理论性质未被证明。
  • 技术技巧点名
    • 指数族理论:用于建立似然函数的结构,并直接应用MLE的渐近理论。
    • 伪似然方法:将高维全似然问题分解为p个低维条件似然问题,避免了计算归一化常数。这是处理高维离散图模型的标准技巧。
    • 逻辑回归:在Ising模型特例下,伪似然退化为逻辑回归,使得参数估计可以直接调用标准统计软件。
    • 出生-死亡MCMC(BDMCMC):一种连续时间马尔可夫链蒙特卡洛方法,用于在模型空间中进行搜索,避免了离散时间MCMC的接受/拒绝步骤。
    • 贝叶斯信息准则(BIC):用于近似边际似然,从而计算后验概率比,使得BDMCMC的出生/死亡速率可计算。

真实例子与应用

  • 数据:流感疫苗基因表达数据集(GSE48024),包含848个个体在4个时间点(day 0, 1, 3, 14)的68个基因的表达水平。
  • 如何应用
    1. 数据预处理:将基因表达值按均值二值化(高于均值=1,低于均值=0),得到二元数据。
    2. 模型设定:构建一个动态Ising模型,其中p=68个基因是节点,协变量x是时间点(0, 1, 3, 14)。模型包含一个基线图G_0(代表day 0的基因网络)和一个斜率图G_1(代表时间对网络结构的影响)。
    3. 结构学习:使用SBDMCMC算法,分别用“AND”规则和“OR”规则学习基线图和斜率图的结构。
  • 结果
    • 图7和8展示了学习到的基线图和斜率图。斜率图(图7b, 8b)非常稀疏,表明只有少数基因对的相互作用随时间显著变化。
    • 作者特别指出了一些发现的基因对,如PPIE-TPM2TAP2-NAPSA。其中,TAP2NAPSA被引用文献(Franco et al., 2013)证实与疫苗接种的转录反应和抗体反应相关。
  • 这个例子想说明什么
    • 验证模型实用性:展示了模型能够从真实数据中学习到有生物学意义的、随时间变化的基因网络。
    • 展示方法优势:通过“AND”和“OR”规则的对比,展示了模型在不同稀疏度偏好下的灵活性。斜率图的稀疏性暗示了时间对基因网络的影响是局部的,而非全局的。

🔎 结论是否比证明窄

  • 是的,结论比证明窄。 定理1的渐近正态性是在固定维度p下证明的。然而,论文的标题和摘要都强调了“高维”(High-Dimensional)。在模拟实验中,p=100被当作高维情况处理,但定理1并未覆盖p随n增长的情况。作者在引言中提到了“当p超过n时”的模型选择问题(引用Castelo & Roverato, 2006),但在理论部分并未处理高维下的参数估计问题。因此,“高维”的声称主要依赖于模拟实验和SBDMCMC算法的可扩展性,而非严格的渐近理论。
  • 定理2的证明依赖于BIC近似,而BIC在高维p>n下的模型选择一致性是有条件的(如需要稀疏性假设)。作者没有讨论这些条件是否满足,也没有给出在高维下SBDMCMC一致性的理论保证。因此,模型选择的理论基础在“高维”设定下是薄弱的。

四、开放问题

  1. 高维渐近理论:本文的定理1只适用于固定p。一个自然的开放问题是:当p随n增长时(如p = O(n^α)),伪似然估计θ̂是否仍然一致?其收敛速度是多少? 这需要建立高维M-估计量的理论,可能涉及稀疏性假设和限制性特征值条件。扎根点:论文标题和模拟实验都涉及高维,但理论部分(定理1)并未处理。
  2. SBDMCMC在高维下的一致性:本文用BIC近似边际似然,但BIC在高维p>n下的模型选择一致性需要严格证明。一个开放问题是:在协变量依赖的离散图模型下,SBDMCMC算法能否以概率1恢复真实的图结构?需要什么样的稀疏性条件和信噪比条件? 扎根点:论文第4节使用BIC/EBIC,但未提供其在高维下的理论保证。
  3. 计算复杂度与可扩展性:SBDMCMC算法在每个MCMC迭代中都需要拟合逻辑回归,计算成本高。一个开放问题是:能否设计更快的算法(如基于梯度的方法、变分推断)来学习协变量依赖的离散图模型? 特别是,当p达到数千时,SBDMCMC是否仍然可行?扎根点:论文的模拟实验只做到p=100,且未报告计算时间。
  4. 非线性协变量效应:本文假设协变量效应是线性的。一个开放问题是:如何将模型扩展到非线性效应(如通过样条、核方法或神经网络)? 这可能会显著提高模型的灵活性,但也会带来参数化和计算上的新挑战。扎根点:论文的模型设定(公式5)是线性的,作者在结论中未讨论非线性扩展。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论