跳转至

Toward a Semiparametric Efficiency Theory under Equality Constraints in Nested Markov Models

作者: Razieh Nabi, Anna Guo, Lin Liu
主题: 因果推断
相关性: 9/10
链接: https://arxiv.org/abs/2608.24602


一、领域脉络与小综述

这个方向是什么

本文研究的根本问题是:在含隐变量的有向无环图(latent-variable DAG)所诱导的嵌套马尔可夫模型(nested Markov models)中,如何发展半参数效率理论。嵌套马尔可夫模型由隐变量DAG的潜在投影——有向无环混合图(ADMG)——定义,其施加的等式约束(称为Verma约束)超越了普通条件独立性。半参数效率理论的目标是刻画统计模型的切空间(tangent space),从而得到任意光滑目标泛函的有效影响函数(efficient influence function)和半参数效率界。该方向当前成熟度较低:尽管嵌套马尔可夫模型的图形表示和因果识别理论已相当成熟,但其半参数效率理论仅在少数特例中有结果,缺乏一般性框架。

发展脉络(history)

奠基工作:Verma和Pearl (1990) 首次发现隐变量DAG会施加超越条件独立性的等式约束,即Verma约束。Robins (1999) 在结构嵌套模型(structural nested models)中研究了无直接效应假设(no-direct-effect)所隐含的嵌套马尔可夫约束。Richardson (2003) 系统定义了ADMG的马尔可夫性质。Richardson et al. (2023) 建立了嵌套马尔可夫性质的完整图形刻画,包括fixing操作和嵌套马尔可夫分解。这些工作奠定了嵌套马尔可夫模型的图形与概率基础。

主要进展:在因果识别方面,Tian和Pearl (2002a) 以及Shpitser和Pearl (2008) 给出了含隐变量DAG中因果效应的完全识别理论,其核心工具正是fixing操作。Evans (2018) 证明了离散状态下嵌套马尔可夫模型的可检验性。Zhao (2025) 进一步研究了ADMG的统计与因果模型。在效率理论方面,Rotnitzky和Smucler (2020) 以及Guo et al. (2023b) 发展了无隐变量DAG下的图形化效率理论,通过变量消除和条件独立性刻画切空间。Phung和Shpitser (2026) 研究了由普通边际和条件独立性定义的半参数模型的切空间正交补,但明确排除了Verma约束。

当前frontier:近年来,一些工作开始针对特定ADMG结构推导效率界。Bhattacharya et al. (2022) 对前门模型等发展了半参数推断。Guo et al. (2023a) 和Guo et al. (2025) 分别对扩展前门图和Napkin图(均含单个Verma约束)推导了切空间刻画和效率界,但方法依赖于具体图形和估计目标。Liu et al. (2021) 在无直接效应假设下研究了最优治疗策略的有效估计。这些工作表明Verma约束能带来效率增益,但缺乏统一框架。

本文的位置:本文首次将Verma约束转化为加权条件矩限制(Ai and Chen, 2003, 2012),从而将嵌套马尔可夫模型的半参数效率问题纳入条件矩限制模型的几何框架。在此基础上,对单个Verma约束完整刻画了切空间正交补,并给出了有效影响函数的投影和最小方差刻画。对多个约束,给出了正交补的一个子空间。本文是建立嵌套马尔可夫模型通用效率理论的第一步。

子线索聚类

  1. 嵌套马尔可夫模型的图形与识别理论:Verma and Pearl (1990), Robins (1999), Richardson (2003), Shpitser et al. (2022), Richardson et al. (2023), Tian and Pearl (2002a), Shpitser and Pearl (2008), Evans (2018), Zhao (2025)。这一簇工作建立了ADMG的图形性质、fixing操作、嵌套马尔可夫分解和因果识别。

  2. 半参数效率理论在因果图模型中的应用:van der Laan and Robins (2003), Tsiatis (2006), Rotnitzky and Smucler (2020), Guo et al. (2023b), Phung and Shpitser (2026), Witte et al. (2020), Henckel et al. (2022), Bhattacharya et al. (2022), Guo et al. (2023a), Guo and Nabi (2024), Guo et al. (2025), Liu et al. (2021)。这一簇工作针对不同图形结构(无隐变量DAG、特定ADMG)推导切空间和有效影响函数。

  3. 条件矩限制的半参数估计:Ai and Chen (2003, 2012), Chen and Xie (2026)。这一簇工作为含未知函数的条件矩限制模型提供了半参数效率理论,本文将其与fixing操作结合。

  4. Verma约束的检验:Bhattacharya and Nabi (2022), Thams et al. (2023), Guo and Shah (2025), Dhawan et al. (2026)。这些工作利用fixing操作将Verma约束转化为可检验的假设,但未涉及效率理论。

这个方向在追问的核心问题

  1. 如何将Verma约束转化为可操作的半参数限制? 当前瓶颈:Verma约束不是普通条件独立性,不能直接用于切空间刻画。本文的解决方案:通过fixing操作转化为加权条件矩限制。

  2. 单个Verma约束下切空间的正交补是什么? 本文给出了完整刻画(Theorem 1)。

  3. 多个Verma约束下切空间如何刻画? 本文仅给出子空间(Proposition 3),完整刻画仍开放。

  4. 如何构造参数子模型来证明切空间刻画是紧的? 本文通过显式构造非线性路径(Dong et al., 2026)解决了单个约束下的反向包含,但多个约束下一般方法未知。

⚠️ 作者的framing

作者将缺口frame为:“嵌套马尔可夫模型的半参数效率理论尚未发展,主要障碍是Verma约束不能表示为普通条件矩限制,而需要通过fixing操作产生加权正交关系。” 他们通过将Verma约束表示为加权条件矩限制,从而借用条件矩限制模型的工具,这是“显然的下一步”。作者淡化了以下竞争路线:直接对ADMG的嵌套马尔可夫分解进行参数化(如Shpitser et al., 2012, 2018; Evans 2018),但指出这些参数化仅在少数子类中存在。作者也回避了离散状态空间下的已有结果(Evans 2016),因为本文考虑一般状态空间。

什么明显该被引/该存在、却没出现在intro里? 未见对高维或非参数回归中条件矩限制的近期进展(如sieve方法、神经网络)的引用,这些可能为有限维基逼近提供更丰富的工具。此外,关于半参数效率理论中“局部误设定下有效估计仍可取”的讨论(Adusumilli 2026)被引用,但未深入讨论其对实际应用的意义。

张力

未见明显对立引用。各工作之间在假设和结论上基本一致,只是适用范围不同。例如,Phung和Shpitser (2026) 明确排除Verma约束,而本文填补了这一空白。


二、最核心、最简单的例子 / 数学问题

第一步:符号、模型、可观测数据交代清楚

符号: - \(G(V;W)\):条件ADMG,\(V\)为随机变量集,\(W\)为固定变量集。本文中通常\(W=\emptyset\),记\(G(V)\)。 - \(O\):可观测数据,即\(V\)中所有变量。 - \(p(V)\):观测数据的联合密度(或概率质量函数)。 - \(\phi_R(\cdot)\):fixing操作,作用于变量集\(R\subseteq V\)。fixing后得到后fixing核\(q_{V\setminus R|W\cup R}\)。 - \(\omega_R(M)\):fixing权重,\(\omega_R(M) = \tilde{p}(R) / p(R \mid \text{mb}_G(R))\),其中\(\text{mb}_G(R)\)是\(R\)的马尔可夫毯(Markov blanket),\(\tilde{p}(R)\)是已知参考密度。 - \(M = (R, \text{mb}_G(R))\):fixing操作涉及的变量集。 - \(P_{\phi_R}\):后fixing分布,由后fixing核与参考密度结合得到。 - \(E_{\phi_R}[\cdot]\):在后fixing分布下的期望。 - \(L^2_0(P)\):均值为零的平方可积函数空间,内积\(\langle h_1, h_2\rangle = E[h_1(O)h_2(O)]\)。 - \(\Lambda_P\):模型\(\mathcal{P}\)在分布\(P\)处的切空间(tangent space)。 - \(\Lambda_P^\perp\):切空间的正交补。 - \(\varphi_{\text{np}}\):非参数模型下的影响函数。 - \(\varphi_{\text{eff}}\):半参数有效影响函数。

模型:嵌套马尔可夫模型\(\mathcal{P}_G\)由ADMG \(G\)定义,其所有分布满足嵌套马尔可夫分解(Richardson et al., 2023)。该分解通过fixing操作和district factorization给出。Verma约束是嵌套马尔可夫模型特有的等式约束,形式为\(X \perp\!\!\!\perp Y \mid Z \; [\phi_R(p)]\),表示在后fixing分布\(P_{\phi_R}\)下\(X\)与\(Y\)条件独立于\(Z\)。

可观测数据:研究者能观测到\(O = V\)中所有变量(假设无缺失)。潜在/不可观测的是:隐变量(被投影掉)、后fixing分布(需通过fixing权重从观测分布计算)、以及Verma约束本身(不是直接可检验的普通条件独立性)。

第二步:最小内核——Napkin图

Napkin图(Figure 2(a))是含单个Verma约束的最简ADMG之一。变量:\(W, Z, A, Y\),其中\(W\)是观测到的混杂,\(Z\)是锚变量,\(A\)是处理,\(Y\)是结局。该图隐含的无直接效应假设\(Y(z,a) = Y(a)\)导致嵌套条件独立性:

\[Y \perp\!\!\!\perp Z \mid A \; [\phi_Z(p)].\]
即,在fixing \(Z\)后的分布中,\(Y\)与\(Z\)条件独立于\(A\)。

记号特化:\(R = Z\),\(\text{mb}_G(Z) = W\),\(M = (Z, W)\),\(\omega_Z(M) = \tilde{p}(Z) / p(Z \mid W)\)。后fixing条件期望:

\[E_{\phi_Z}[h(O) \mid A] = \frac{E[\omega_Z(M) h(O) \mid A]}{E[\omega_Z(M) \mid A]}.\]

核心思路:该Verma约束等价于:对所有平方可积函数\(f(Z,A)\)和\(g(Y,A)\),

\[E_{\phi_Z}\big[ \{ f(Z,A) - E_{\phi_Z}[f(Z,A) \mid A] \} g(Y,A) \big] = 0.\]
利用加权表示,转化为观测分布下的加权条件矩限制:
\[E\big[ \omega_Z(M) \{ f(Z,A) - E_{\phi_Z}[f(Z,A) \mid A] \} g(Y,A) \big] = 0.\]
这个限制对切空间施加了正交条件。通过路径wise微分,得到正交补方向:
\[\chi_{f,g}(O) = \tilde{\chi}_{f,g}(O) - E[\tilde{\chi}_{f,g}(O) \mid W, Z] + E[\tilde{\chi}_{f,g}(O) \mid W],\]
其中
\[\tilde{\chi}_{f,g}(O) = \omega_Z(M) \{ f(Z,A) - E_{\phi_Z}[f(Z,A) \mid A] \} \{ g(Y,A) - E_{\phi_Z}[g(Y,A) \mid A] \}.\]
这就是Theorem 1在Napkin图下的特例。整个论文的一般情形只是将这个模式推广到任意ADMG和任意fixing集\(R\)。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在嵌套马尔可夫模型(由ADMG定义,含Verma约束)中发展半参数效率理论,刻画切空间正交补,推导有效影响函数和效率界。
  2. 核心工具/方法:将Verma约束表示为fixing操作诱导的加权条件矩限制,利用路径wise微分和Hilbert空间几何刻画正交补,通过正交投影或最小方差公式得到有效影响函数。
  3. 主要结论:对单个Verma约束,完整刻画了切空间正交补(Theorem 1);给出了有限维基逼近的有效影响函数(Theorem 2);建立了索引不变性下的正交补(Theorem 3);对多个约束,给出了正交补的一个子空间(Proposition 3)。通过Napkin图和扩展前门图等例子验证了理论,模拟和真实数据展示了效率增益。

关键设定与假设

  • 设定:观测数据来自嵌套马尔可夫模型\(\mathcal{P}_G\),由ADMG \(G(V)\)定义。考虑单个Verma约束\(X \perp\!\!\!\perp Y \mid Z \; [\phi_R(p)]\),其中\(R\)是有效fixing集,\(X,Y,Z \subseteq V \setminus R\)两两不交。假设\(P\)位于\(\mathcal{P}_G\)的内部(即存在正则参数子模型)。
  • 假设:
  • positivity:\(p(R \mid \text{mb}_G(R)) > 0\)几乎处处在参考密度\(\tilde{p}(R)\)的支持上。
  • 平方可积:所有涉及的函数属于相应的\(L^2\)空间。
  • 正则性:参数子模型是正则的,允许微分和积分交换。
  • 参考密度已知:\(\tilde{p}(R)\)是已知的,且支持包含于\(p(R \mid \text{mb}_G(R))\)的支持。
  • 相比已有文献:本文不假设离散状态空间(如Evans 2016),也不限于特定图形(如Guo et al. 2023a, 2025)。与Phung和Shpitser (2026)相比,本文处理了Verma约束而非仅普通条件独立性。

主要结果

Theorem 1(单个Verma约束下切空间正交补的完整刻画):设模型\(\mathcal{P}_G\)由单个Verma约束\(X \perp\!\!\!\perp Y \mid Z \; [\phi_R(p)]\)定义。则在\(P \in \text{int}(\mathcal{P}_G)\)处,

\[\Lambda_P^\perp = \overline{\text{span}}\{ \chi_{f,g}(O) : f \in L^2(P_{X,Z}), g \in L^2(P_{Y,Z}) \},\]
其中\(\chi_{f,g}\)由(12)-(13)式给出。直觉:每个Verma约束通过fixing权重和条件中心化产生一族正交补方向,这些方向张成整个正交补。必要条件:存在参数子模型使得反向包含成立(通过显式构造非线性路径证明)。解决的技术难点:需要构造二阶扰动项来满足约束,证明这些方向确实张成整个正交补。

Theorem 2(有限维基逼近):给定基函数\(\{f_j\}, \{g_k\}\),定义\(\chi_{jk}\),则有效影响函数的有限维逼近为\(\varphi_{\text{eff,basis}} = \varphi_{\text{np}} - (\alpha^{\text{opt}})^\top \chi\),其中\(\alpha^{\text{opt}} = \Sigma^{-1} b\),\(\Sigma = E[\chi \chi^\top]\), \(b = E[\chi \varphi_{\text{np}}]\)。方差减少量为\(b^\top \Sigma^{-1} b\)。

Theorem 3(索引不变性下的正交补):若目标参数\(\psi(P)\)由一族索引识别泛函\(\psi(P;x)\)满足\(\psi(P;x) = \psi(P)\)对所有\(x\)成立,则正交补由\(\varphi_{\text{np}}(P;x) - \varphi_{\text{np}}(P;x_0)\)张成。有效影响函数是这些影响函数的仿射组合中方差最小的。

Proposition 3(多个约束下的子空间):对\(J\)个Verma约束,正交补包含由各约束方向之和张成的子空间\(\tilde{\Lambda}_P^\perp\)。但反向包含(即\(\tilde{\Lambda}_P^\perp = \Lambda_P^\perp\))是猜想,仅在特例中验证。

证明路线与技术技巧

整体路线(以Theorem 1为例): 1. 正向包含:对任意正则参数子模型,微分加权条件矩限制,得到\(\chi_{f,g}\)与任意score正交,故\(\chi_{f,g} \in \Lambda_P^\perp\)。这一步通过路径wise微分和条件期望的商规则完成。 2. 反向包含:需要证明任意与所有\(\chi_{f,g}\)正交的score必然属于\(\Lambda_P\)。等价地,构造一个参数子模型,其score与所有\(\chi_{f,g}\)正交,且该子模型位于\(\mathcal{P}_G\)内。构造思路:对观测分布进行扰动,扰动形式为\(p_t = p \cdot \Psi_t(s, u_t)\),其中\(s\)是候选score,\(u_t\)是二阶项。通过精心选择\(u_t\)(满足特定积分方程),使得扰动后的分布仍满足Verma约束。这需要解一个关于\(u_t\)的方程,作者给出了显式解(见附录S2.3)。

关键跳跃点: - 从微分加权矩限制到\(\chi_{f,g}\)的显式形式:需要处理fixing权重的导数以及条件期望的导数,最终得到残差化结构。 - 反向包含中构造\(u_t\):需要确保扰动后分布满足Verma约束,这要求\(u_t\)满足一组复杂的积分方程。作者通过将\(u_t\)分解为\(s\)的函数,并利用后fixing分布下的条件矩条件,证明了存在性。

技术技巧点名: - 路径wise微分:对参数子模型求导,得到score与正交补方向的内积。 - 条件期望的商规则:处理加权条件期望的导数。 - 逆概率加权:fixing操作本质上是IPW,权重\(\omega_R\)。 - 残差化:正交补方向通过减去条件期望得到,类似于普通条件独立性中的残差乘积。 - 隐函数定理/积分方程:在反向包含中,通过解积分方程构造二阶扰动项(借鉴Dong et al. 2026)。 - Hilbert空间投影:有效影响函数通过正交投影得到。 - 有限维基逼近:用基函数张成子空间,通过最小二乘得到投影系数。

真实例子与应用

本文包含模拟研究和两个真实数据应用(均在附录中): - 模拟:针对扩展前门图和Napkin图,比较了五种估计量(固定Z索引、等权索引、最优索引、Verma投影)。结果显示Verma投影估计量具有最小的渐近方差,且有限样本表现与理论一致。Experiment 3展示了基函数丰富度的影响:从Y到Y,Y^2,Y^3,方差单调递减。 - 真实数据: - Framingham心脏研究(附录S6.1):估计当前吸烟对冠心病时间的因果效应。Verma投影估计量的置信区间长度约为等权索引估计量的0.73-0.75倍。 - 芬兰生命历程研究(附录S6.2):估计教育对收入的影响,按性别和智力分组。Verma投影估计量在所有8个亚组×对比中均产生更短的置信区间,平均相对长度为0.52-0.65。

这些例子说明:利用Verma约束可以带来实质性的效率增益,且基函数越丰富增益越大。

🔎 结论是否比证明窄

  • 多个约束的完整刻画:Proposition 3只给出了正交补的一个子空间,作者明确说“仍为开放问题”(Remark 5)。在正文中,他们仅声称“characterize a subspace of the orthocomplement”,并未声称完整刻画。但在结论部分(Concluding Remarks)提到“An important conjecture discussed in Remark 5 remains to be solved”,这是诚实的。
  • 反向包含的证明:Theorem 1的反向包含在附录中通过构造参数子模型完成,但该构造依赖于一些技术假设(如mb(R)与{X,Y}不交,否则需另作处理)。作者在附录中处理了mb(R)与{X,Y}相交的情形(如Napkin图),但未给出一般性证明。因此,Theorem 1的完备性在一般情形下可能依赖于具体图形结构。
  • 有限维基逼近的收敛性:Theorem 2只给出了有限维逼近的表达式,未证明当基函数趋于无穷时逼近收敛到真实有效影响函数。作者在附录S2.4中提及“under standard sieve approximation conditions”,但未给出具体条件或证明。

四、开放问题

  1. 多个Verma约束下切空间的完整刻画:Proposition 3只给出了正交补的一个子空间,完整刻画(即反向包含)仍是开放问题。作者猜想当约束列表完备时成立,但仅通过特例验证。扎根点:Remark 5和Concluding Remarks。

  2. 构造参数子模型的一般方法:本文对单个约束通过显式构造非线性路径证明了反向包含,但该方法依赖于解特定的积分方程。对于多个约束或更复杂的ADMG,是否存在系统性的构造方法?扎根点:Concluding Remarks提到“A possible direction is to adopt the strategy of Guo et al. (2025), in which they employed the implicit function theorem”。

  3. 有限维基逼近的收敛速率与最优基选择:Theorem 2未给出当基函数数目趋于无穷时逼近误差的收敛速率,也未讨论如何选择基函数以最小化有限样本方差。扎根点:Theorem 2本身以及附录S2.4的简短讨论。

  4. 计算可行性:本文的Verma投影估计量需要计算正交补方向\(\chi_{f,g}\),这涉及fixing权重和条件期望的估计。在高维或连续变量下,这些估计可能不稳定。如何结合现代机器学习方法(如深度神经网络)实现有效估计?扎根点:本文未讨论计算问题,但这是实际应用的关键。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论