跳转至

Nonparanormal Bayesian Learning of Directed Acyclic Graphs under Gamma and Inverse-Gamma Innovation Priors: Closed-Form Scores and Informed Sampling

作者: Samaneh Nazari, Mohammad Arashi
主题: 其他
相关性: 7/10
链接: https://arxiv.org/abs/2609.13008


一、领域脉络与小综述

这个方向是什么

本文所处的子方向是贝叶斯图结构学习,具体而言是在非参数正态(nonparanormal)框架下,对有向无环图(DAG)进行后验推断。其根本的统计问题是:当观测数据的边际分布明显偏离高斯(如偏态、重尾)时,如何仍能利用高斯DAG模型完整的条件独立计算体系,同时避免因边际误设而导致的虚假边或方向错误。该方向的成熟度处于"方法快速扩展但理论尚不完整"的阶段——无向图(Gaussian graphical model)的非参数正态化已有较充分发展,而有向图(DAG)的贝叶斯处理在本文之前几乎空白。

发展脉络

  1. 奠基工作:高斯DAG的贝叶斯推断。本文的起点是 Ben-David et al. (2015) 和 Cao et al. (2019) 建立的DAG-Wishart 先验体系。引用句指出:"a substantial Bayesian literature provides priors, marginal likelihoods, and samplers for learning that support (Ben-David et al. 2015; Cao et al. 2019; Castelletti 2020; Castelletti and Mascaro 2022)"。这一支文献的核心贡献是:在修正Cholesky参数化下构造共轭先验,使得DAG的边际似然有闭式表达,从而可以在图空间上做MCMC。留下的口子是:全部假设数据联合高斯。

  2. 主要进展:无向图的非参数正态化。Liu et al. (2009) 提出 nonparanormal 族,用 Winsorized 经验分布函数加高斯分位数函数做边际变换,将非高斯数据映射到潜在高斯向量。引用句明确说:"In the undirected setting the nonparanormal has been thoroughly developed, both frequentist (Liu et al. 2009, 2012; Xue and Zou 2012; Harris and Drton 2013) and, more recently, Bayesian"。这一支文献证明了无向图情形下秩方法可以达到与参数方法相同的收敛速率,但没有处理有向图——因为DAG的似然依赖于变量的序,变换后的边际分布与联合分布的耦合方式更复杂。

  3. 当前 frontier:有向图的非参数化。本文的定位正是填补上述缺口。引用句:"but for directed graphs, where the modified Cholesky factor carries the causal ordering, a Bayesian treatment is essentially absent. This is the gap the present paper addresses." 作者将无向图nonparanormal的成功经验(Winsorized normal score)移植到有向图,并在此之上叠加了两种新的创新方差先验(Gamma 和 Inverse-Gamma),获得闭式节点得分。

  4. 方法论的辅助支线:Zanella (2020) 的局部平衡(locally-balanced)MCMC 框架为本文的高效采样器提供了理论基础。引用句:"Following the locally-balanced framework of Zanella (2020), fix a balancing function g which is the choice shown by Zanella (2020) to be asymptotically optimal in the Peskun sense." 这条支线的贡献在于:当每个邻域的得分都能闭式计算时,可以构造信息型提议分布,大幅提升混合效率。

子线索聚类

  • 线索 A:DAG 的共轭先验与闭式边际似然(Ben-David et al. 2015; Cao et al. 2019; Castelletti 2020; Castelletti & Mascaro 2022)。核心问题是:什么先验结构能同时保证(i)图空间上的可交换性,(ii)节点回归的闭式积分,(iii)稀疏性诱导。已知瓶颈是:先验的灵活性受限于共轭性要求。

  • 线索 B:非参数正态图模型(Liu et al. 2009, 2012; Xue & Zou 2012; Harris & Drton 2013)。核心问题是:如何用秩变换估计潜在相关/精度结构,并保证估计误差可控。已知瓶颈是:无向图方法依赖精度矩阵的稀疏性假设,且变换误差的传播在DAG情形下更难控制。

  • 线索 C:离散空间上的信息型 MCMC(Zanella 2020)。核心问题是:当目标分布定义在组合空间(如图空间)上时,如何设计提议分布使得接受概率不随维度退化。已知瓶颈是:信息型提议需要每个候选的得分可快速计算。

这个方向在追问的核心问题

  1. 变换误差如何传播:nonparanormal 变换的估计误差(Winsorized 秩变换的偏差)如何影响图结构后验?在无向图情形已有答案(Liu et al. 2012 的秩相合性),但在有向图情形,误差会通过 Cholesky 分解的非线性传播,需要新的分析。
  2. 先验的灵活性-可计算性权衡:如何在保持闭式边际似然的同时,允许系数收缩与方差正则化解耦?
  3. 高维一致性:当 p 随 n 增长时,贝叶斯 DAG 选择是否一致?需要什么条件(beta-min、稀疏度、特征值界)?

⚠️ 作者的 framing

作者将缺口 frame 成:"非参数正态变换 + 创新方差先验" 的组合是显然的下一步。具体来说,作者声称(i)Winsorized normal score 变换可以处理偏态和重尾,(ii)Gamma/Inverse-Gamma 先验能解耦收缩与正则化,(iii)闭式得分使局部平衡采样器成为可能。这是作者的说法。被淡化的竞争路线包括:完全非参数贝叶斯(如 Dirichlet process mixture 建模边际)、以及基于秩似然的频率派方法(如 rankPC)。作者没有讨论这些方法在DAG情形下的潜在优势。一个值得查证的点:作者声称"Bayesian treatment is essentially absent",但未引用任何关于 nonparanormal DAG 的频率派工作(如 Liu et al. 2012 是否处理过有向情形?),也未讨论 copula DAG 模型的识别性问题——潜在高斯向量的联合分布是否由边际变换和DAG唯一决定?这在因果推断中涉及"忠实性"假设。

张力

未见明显对立引用。但存在一个微妙的张力:Cao et al. (2019) 的 DAG-Wishart 先验强调共轭性(从而需要 Inverse-Gamma 或 Wishart 结构),而本文引入的 Gamma 先验是非共轭的,作者通过闭式积分绕过了这一障碍。这意味着作者实际上在挑战"共轭是闭式得分的必要条件"这一隐含假设——这是一个值得注意的断裂点。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据

符号清单(按类别分组):

类别 符号 含义
观测数据 \( X \in \mathbb{R}^{n \times p} \) \( n \) 个样本、\( p \) 个变量的观测矩阵,第 \( j \) 列记 \( x_j \)
潜在变量 \( Z \in \mathbb{R}^{n \times p} \) 变换后的潜在高斯数据,\( z_j \) 为第 \( j \) 列
边际变换 \( f_j: \mathbb{R} \to \mathbb{R} \) 严格递增的未知变换,\( Z_j = f_j(X_j) \)
变换估计 \( \hat{Z}_j = \Phi^{-1}\{\tilde{F}_j(X_j)\} \) Winsorized normal score:\( \tilde{F}_j \) 是截断的经验分布函数,\( \Phi^{-1} \) 是标准正态分位数函数
DAG 结构 \( D \) 有向无环图,节点 \( 1, \ldots, p \) 按拓扑序排列
父集 \( \text{pa}_D(j) \subseteq \{1, \ldots, j-1\} \) 节点 \( j \) 的父节点集合
Cholesky 系数 \( L = (L_{jk}) \) 严格下三角矩阵,\( L_{jk} \neq 0 \iff k \in \text{pa}_D(j) \)
创新方差 \( D = \text{diag}(D_{11}, \ldots, D_{pp}) \) 结构方程中噪声的方差
参数 \( \beta_j = (L_{jk})_{k \in S} \in \mathbb{R}^s \) 节点 \( j \) 的活跃 Cholesky 系数,( s =
先验超参 \( \tau^2, a, b, a_0, b_0 \) 系数先验方差、Gamma/Inverse-Gamma 形状与尺度
得分函数 \( m^\bullet(j, S) \) 节点 \( j \) 以 \( S \) 为父集的边际似然(\( \bullet \in \{NG, NIG\} \))
残差二次型 \( Q_S = z_j^\top M_S^{-1} z_j \) 见下方定义

模型(数据生成机制):

  1. 观测层:\( X_j = f_j^{-1}(Z_j) \),其中 \( f_j \) 未知但严格递增。等价地,\( Z_j = f_j(X_j) \sim N(0, \Sigma) \),\( \Sigma \) 为相关矩阵(为可识别性约束对角为1)。
  2. 潜在层:\( Z \) 服从联合高斯 \( N_p(0, \Sigma) \),且 \( \Sigma^{-1} = (I - L)^\top D^{-1} (I - L) \),其中 \( L \) 严格下三角,其支撑编码 DAG \( D \)。
  3. 结构方程形式:对每个节点 \( j \),
    \[Z_j = \sum_{k \in \text{pa}_D(j)} L_{jk} Z_k + \varepsilon_j, \quad \varepsilon_j \sim N(0, D_{jj}),\]
    且 \( \varepsilon_1, \ldots, \varepsilon_p \) 相互独立。

可观测数据:研究者只能看到 \( X \)(原始偏态数据)。潜在高斯数据 \( Z \) 和变换 \( f_j \) 均不可观测,只能通过 Winsorized normal score 估计为 \( \hat{Z} \)。关键识别假设:变换后的 \( \hat{Z} \) 近似联合高斯,且 DAG 结构由 \( \Sigma^{-1} \) 的支撑决定——这一假设在非参数正态族中成立,但变换误差会随 \( n \) 衰减。

估计目标:后验分布 \( \pi(D, L, D_{jj} \mid \hat{Z}) \),特别是图结构 \( D \) 的后验。

第二步:最小内核

剥掉所有一般性假设后,本文的核心数学问题是:

给定一个节点 \( j \)、一个候选父集 \( S \),以及观测到的响应 \( z_j \) 和设计矩阵 \( Z_S \),在两种不同的创新方差先验下,边际似然 \( m^\bullet(j, S) = \int \int \mathcal{N}(z_j; Z_S \beta, D I_n) \cdot \mathcal{N}(\beta; 0, \tau^2 D I_s) \cdot \pi^\bullet(D) \, d\beta \, dD \) 能否写成闭式?

为什么这是最小内核:因为 DAG 后验分解为节点得分的乘积(式 10),而 MCMC 每次移动只改变一个节点的父集,因此单节点得分的计算是整个算法的原子操作。如果得分需要数值积分,采样器将慢几个数量级;如果得分是闭式的,则局部平衡提议(式 19)可以精确计算。

最简例子:取 \( n = 1 \)(单个观测)、\( s = 1 \)(单个父节点)。此时: - \( z_j, z_k \in \mathbb{R} \) 是标量,\( Q_S = z_j^2 / (1 + \tau^2 z_k^2) \)(由 Woodbury 恒等式)。 - Gamma 先验(式 7):\( \pi^{NG}(D) \propto D^{a-1} e^{-bD} \)。边际似然为

\[m^{NG}(j, S) \propto \int_0^\infty D^{-1/2} e^{-Q_S/(2D)} \cdot D^{a-1} e^{-bD} \, dD = \int_0^\infty D^{(a-1/2)-1} e^{-bD - Q_S/(2D)} \, dD.\]
这正是广义逆高斯(GIG)分布的归一化常数,由 Lemma 1 给出闭式:
\[m^{NG}(j, S) \propto \left(\frac{Q_S}{2b}\right)^{(a-1/2)/2} K_{a-1/2}(\sqrt{2b Q_S}),\]
其中 \( K_\nu \) 是第三类修正 Bessel 函数。

  • Inverse-Gamma 先验(式 8):\( \pi^{NIG}(D) \propto D^{-a_0-1} e^{-b_0/D} \)。边际似然为
    \[m^{NIG}(j, S) \propto \int_0^\infty D^{-1/2} e^{-Q_S/(2D)} \cdot D^{-a_0-1} e^{-b_0/D} \, dD = \int_0^\infty D^{-(a_0+3/2)-1} e^{-(Q_S/2 + b_0)/D} \, dD,\]
    这是标准的 Gamma 积分,闭式为
    \[m^{NIG}(j, S) \propto \left(\frac{Q_S}{2} + b_0\right)^{-(a_0+1/2)}.\]

这个例子的意义:它展示了本文的核心技术贡献——两种先验都能得到闭式得分,但形式截然不同:Gamma 先验产生 Bessel 函数(非初等但可快速数值求值),Inverse-Gamma 先验产生幂律(Student-t 形式)。这种差异直接导致 Theorem 4 的微分收缩行为:Gamma 先验的得分函数在 \( Q_S \) 大时衰减更慢(因为 Bessel 函数的渐近行为是 \( K_\nu(x) \sim e^{-x}/\sqrt{x} \)),而 Inverse-Gamma 先验的得分衰减是幂律。这就是"哪个先验更保守"的数学根源。

一般情形(\( n \) 个观测、\( s \) 个父节点):上述推导逐字不变,只需将 \( Q_S \) 替换为式 (13) 的残差二次型,\( n/2 \) 替换 \( 1/2 \) 作为高斯似然的幂指数。因此最小内核完整地捕捉了本文的数学本质。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在 nonparanormal 框架下进行贝叶斯 DAG 结构学习,即观测数据经未知单调变换后服从高斯 DAG 模型,目标是从偏态/重尾数据中恢复有向无环图结构。
  2. 核心方法:在修正 Cholesky 参数化上引入两种创新方差先验——非共轭的 Gamma 先验和共轭的 Inverse-Gamma 先验——并证明两者都能得到节点边际似然的闭式表达式(分别通过 Bessel 函数和 Student-t 形式),从而构建局部平衡的知情 MCMC 采样器。
  3. 主要结论:模拟显示,数据高斯时性能与高斯方法匹配;数据偏态时显著优于高斯方法;在 Sachs 蛋白信号数据上以高后验概率恢复已知交互,优于约束-based 方法。理论上证明了图选择相合性(Theorem 6),但需要比高斯情形更强的 beta-min 条件。

关键设定与假设

  • 已知拓扑序:模型假设节点存在固定拓扑序 \( 1, 2, \ldots, p \),边只能从低序号指向高序号。这是简化假设——真实应用中序未知,但作者在模拟和 Sachs 分析中均使用已知序(Sachs 数据中按信号通路顺序排列)。相比 Cao et al. (2019) 的 Gaussian DAG 设定,本文没有放宽这一假设。

  • Winsorized normal score 变换(式 5):\( \hat{Z}_{ij} = \Phi^{-1}\{\tilde{F}_j(X_{ij})\} \),其中 \( \tilde{F}_j \) 是截断经验分布函数,截断水平 \( \delta_n = (4n^{1/4}\sqrt{\pi\log n})^{-1} \)。这一选择来自 Liu et al. (2009),保证变换误差以 \( O(\sqrt{\log n / n}) \) 速率衰减。关键假设:变换后的数据近似联合高斯,且 DAG 结构在变换下不变(单调变换保持条件独立关系)。

  • 创新方差先验:

  • Gamma 先验(式 7):\( D_{jj} \sim \text{Gamma}(a, b) \),非共轭,但通过 GIG 积分得到闭式得分。
  • Inverse-Gamma 先验(式 8):\( D_{jj} \sim \text{IG}(a_0, b_0) \),共轭,得分是 Student-t 形式。

  • 系数先验(式 6):\( \beta_j \mid D_{jj} \sim N(0, \tau^2 D_{jj} I_s) \),即岭回归型收缩。\( \tau^2 \) 固定。

  • 边先验(式 9):每条边独立 Bernoulli(\( \theta \)),且限制最大入度 \( \leq s_{\max} \)。这是关键的技术假设——它保证了所有回归的维度有界,从而特征值控制可以一致成立(Condition 2 的 C2)。

  • 高维条件(Condition 2):

  • C1: \( \log p = o(n) \),\( s_{\max} \log p = o(n) \)。
  • C2: 潜在精度矩阵的所有 \( \leq s_{\max} + 1 \) 阶主子矩阵特征值在 \( [\kappa^{-1}, \kappa] \) 内。
  • C3: 边先验 \( \theta_n = p^{-(1+u)} \),\( u > u_0 = 1 + 2C_\star s_{\max}^2 \)。
  • C4: beta-min 条件 \( \beta_{\min}^2 \geq c_\beta s_{\max} \sqrt{\log(p \vee n)/n} \),\( c_\beta > 32\kappa^2(1 + C_\star s_{\max}) \)。

相比已有文献的放宽/强化: - 放宽:从高斯到 nonparanormal 族,允许任意单调边际变换。 - 强化:beta-min 条件比 Cao et al. (2019) 的 Gaussian DAG 情形强一个因子 \( s_{\max} \sqrt{\log(p \vee n)/n} \)(见 Remark 1)。作者明确承认这是"估计 \( p \) 个边际变换的代价"。

主要结果

定理 1(Gamma 先验的 Bessel 得分):节点得分 \( m^{NG}(j, S) \) 有闭式表达式(式 14),涉及第三类修正 Bessel 函数 \( K_{a-n/2} \)。计算复杂度 \( O(ns^2) \)。

定理 2(Inverse-Gamma 先验的 Student-t 得分):节点得分 \( m^{NIG}(j, S) \) 有闭式表达式(式 15),是 Student-t 核。计算复杂度同样 \( O(ns^2) \)。

定理 3(全条件分布):给定 DAG,参数 \( (\beta_j, D_{jj}) \) 的全条件分布是精确的——\( \beta_j \) 是高斯,\( D_{jj} \) 在 Gamma 先验下是 GIG、在 Inverse-Gamma 先验下是 Inverse-Gamma。无需 Metropolis 步骤。

定理 4(微分收缩):后验精度 \( E[D^{-1} \mid Q] \) 在两种先验下的比较。关键结论:当 \( (a+a_0)^2 > 4bb_0 \) 时,存在区间 \( (v_-, v_+) \) 使得 Gamma 先验的精度更小(即收缩更强)。这给出了哪个先验更保守的精确刻画。

定理 5(变换误差传播):在 Condition 1 下,plug-in 变换导致的得分误差以 \( O(s_{\max}^2 \sqrt{n \log p}) \) 为界(式 28)。关键点:误差是 \( O(\sqrt{n \log p}) \) 而非 \( O(\sqrt{n \log p}) \) 的倍数,因为残差二次型 \( Q_S \) 的 Lipschitz 常数在特征值有界时是 \( O(1) \)。

定理 6(图选择相合性):在 Condition 2 下,后验质量集中在真实 DAG \( D_0 \) 上:\( \pi(D_0 | \hat{Z}) \xrightarrow{P} 1 \)。证明路线: 1. 分离性:对任意 \( D \neq D_0 \),证明 \( \log \pi(D|\hat{Z})/\pi(D_0|\hat{Z}) \) 有负漂移。 2. 过选择分支:对含 \( r \) 条虚假边的 \( D \),每个虚假边贡献 \( -\frac{1}{2}\log n - (1+u)\log p + O_P(1) \)(式 45),而熵贡献 \( \leq 2r \log p \)。由 C3 的 \( u > 1 + 2C_\star s_{\max}^2 \),净漂移为负。 3. 欠选择分支:对缺失 \( m \) 条真实边的 \( D \),每个缺失边贡献 \( -c n \beta_{\min}^2 \)(式 46),由 C4 的 beta-min 条件,这主导熵贡献 \( m \log p \)。 4. 变换误差:Theorem 5 保证 plug-in 误差不改变上述漂移的符号。

证明路线与技术技巧

整体路线:先建立"理想化"高斯模型下的后验一致性(假设 \( Z \) 已知),再通过 Theorem 5 的传播界将结论转移到 plug-in 变换 \( \hat{Z} \) 上。这种"先理想后转移"的策略在 semiparametric 理论中很标准,但本文的创新点在于传播界的精细常数——它精确刻画了变换误差如何与先验超参数相互作用。

关键技巧: 1. Woodbury 恒等式(式 13 的证明):将 \( Q_S = z_j^\top M_S^{-1} z_j \) 从 \( O(n^3) \) 降为 \( O(ns^2) \),这是整个算法可扩展性的基础。 2. GIG 积分(Lemma 1):通过 Bessel 函数的积分表示,将 Gamma 先验下的二维积分化为单个 Bessel 函数求值。 3. Bessel-free 近似(Proposition 3):利用 Olver 等的大阶渐近展开(式 21),将 Bessel 函数替换为初等函数,误差 \( O(n^{-2}) \),从而避免特殊函数调用。 4. 局部平衡提议(Proposition 2):利用 \( g(t) = \sqrt{t} \) 的平衡性质,接受概率简化为邻域归一化常数之比(式 20),无需额外得分计算。 5. 微分收缩的二次型刻画(Theorem 4):将先验比较转化为 GIG 矩的渐近展开,保留 \( O(n^{-1}) \) 项。

真实例子与应用

Sachs 蛋白信号数据(\( n = 853 \),\( p = 11 \)):这是因果发现的标准基准数据。作者的处理方式: - 数据:11 个信号蛋白的流式细胞术测量,边际分布强烈右偏(图 1 显示偏度 2-4,峰度 10-30)。 - 方法应用:固定拓扑序为共识通路顺序,运行 Algorithm 1 的两种先验版本。 - 结果:NPN-NG 和 NPN-NIG 均以高后验概率(>0.9)恢复 5 条共识边(PKA→Akt, PKC→P38, PKC→Jnk, Raf→Mek, PIP2→PIP3),并引入一条虚假边(Akt→Erk)。与 PC 算法(恢复 3 条共识边 + 多条虚假边)和 rankPC(恢复 4 条共识边)相比,贝叶斯方法在精确率上更优。 - 关键对比:高斯贝叶斯模型(G-NG)在非高斯数据上恢复 3 条共识边且引入 2 条虚假边,而 NPN 版本恢复 5 条共识边且仅 1 条虚假边——这直接验证了 nonparanormal 变换的价值。

模拟设计:\( p = 20 \),\( n = 200 \),随机 DAG(期望入度 2),系数 \( \pm[0.4, 0.9] \),方差 \( [0.5, 1.5] \)。两种非高斯边际:指数分布和立方变换。14 次重复。结果以骨架 SHD 和 F1 报告(图 8)。

🔎 结论是否比证明窄

是,存在明显的不匹配:

  1. Theorem 6 的证明依赖已知拓扑序,但摘要和引言中的表述("learning of directed acyclic graphs")暗示了更一般的场景。作者在 Remark 1 中承认序未知时结论不成立,但这一限制在摘要中未提及。

  2. Theorem 5 的传播界要求 \( s_{\max} = O(1) \)(固定入度上界),但模拟中 \( s_{\max} = 2 \) 确实满足,而 Sachs 数据中最大入度也仅 3。然而,作者在讨论中暗示方法可扩展到 \( s_{\max} \) 随 \( n \) 缓慢增长的情形,这并未被 Theorem 5 覆盖。

  3. Bessel-free 近似的误差界(Proposition 3) 是在 \( Q_S \leq cn \) 条件下证明的,但 Theorem 6 的证明需要该近似在所有 \( Q_S \) 值上保持误差 \( O(n^{-2}) \)。作者在附录 C 中声称"uniform over \( x \in [0, c\sqrt{n}] \)",但 Theorem 6 的证明中 \( Q_S \) 可能超过 \( cn \)(当 D 含虚假边时,残差可能很大)。这是一个技术漏洞——虽然可以通过截断论证修复,但文中未明确处理。

  4. 微分收缩定理(Theorem 4)的渐近展开 是在 \( n \to \infty \) 下成立的,但模拟中 \( n = 200 \) 是否足够大以保证展开的精度?作者未提供有限样本验证。


四、开放问题

  1. 未知拓扑序的扩展(扎根于 Remark 1):作者明确承认"the known-ordering assumption can be relaxed by sampling over orderings jointly with the structure",但未给出理论保证。要确认这是否为真 gap,可查阅近期关于 order-MCMC 的工作(如 Deligiannidis et al. 2021 的 partition MCMC)是否已处理 nonparanormal 情形。

  2. Bessel-free 近似的严格误差界(扎根于 Proposition 3 的证明):如前述,\( Q_S > cn \) 情形的误差未覆盖。一个具体问题是:能否用截断论证(truncation argument)将 Theorem 6 的证明扩展到所有 \( Q_S \)?这需要精细的尾部估计。

  3. 自适应超参数选择(扎根于 Theorem 4 的讨论):微分收缩的区间 \( (v_-, v_+) \) 依赖于超参数 \( a, b, a_0, b_0 \)。作者建议"choosing the hyperparameters so that the typical weak-edge residual variance falls inside this band tunes the false-discovery behaviour directly",但未给出数据驱动的选择准则。这涉及经验贝叶斯或分层先验的扩展。

  4. 变换误差的高阶展开(扎根于 Theorem 5):传播界是 \( O(s_{\max}^2 \sqrt{n \log p}) \),但常数 \( C_\star \) 依赖特征值界 \( \kappa \)。一个自然的问题是:能否用 Edgeworth 展开得到更精确的误差分布,从而构造变换误差的置信区间?这需要 nonparanormal 变换的 Bahadur 表示。

  5. 与频率派方法的效率比较:作者在模拟中比较了 PC 和 rankPC,但未与半参数效率界比较。一个具体问题是:nonparanormal DAG 的贝叶斯后验是否达到 semiparametric efficiency bound?这需要计算影响函数并验证 Bernstein-von Mises 定理在 nonparanormal 设定下是否成立。

查证建议:要确认第 1 条是否真 gap,建议检索近 5 年关于 Bayesian causal discovery with unknown order 的文献(如 Ann Nicholson、Marloes Maathuis 团队的工作),看是否已有 nonparanormal 版本。若多篇近期论文都指向"未知序 + 非高斯"这一组合,则说明这是共识性 gap;若文献互相矛盾(有的声称已解决,有的声称不可能),则更值得深挖。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论