Causal mediation analysis for zero-inflated longitudinal data in the presence of treatment non-compliance and multiple mediators¶
作者: Saurabh Bhandari, Wreetabrata Kar, Michael J. Daniels, Bikram Karmakar
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2608.15775
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是纵向因果中介分析,具体是在处理非依从性(treatment non-compliance) 和零膨胀(zero-inflated)数据的复杂设定下,估计多重时变中介变量的因果效应。该方向的核心统计问题是:当处理分配(如邮件类型)与处理实际接受(如是否打开邮件)不一致,且中介变量(如打开邮件后的天数)和结局(如购买次数)存在大量零值和右偏分布时,如何从观测数据中识别并估计出处理对结局的直接效应和通过中介的间接效应。当前该领域的成熟度处于方法快速发展但应用挑战巨大的阶段:已有针对横截面数据或完美依从性的理论框架,但将非依从性、零膨胀、多重中介和纵向结构同时纳入一个统一的、可实际部署的推断框架,仍是开放问题。
发展脉络(history)¶
作者在引言和文献综述中,将已有工作串成了一条清晰的线索:
-
奠基工作:横截面中介分析与工具变量方法
- VanderWeele and Vansteelandt (2014):引入了联合中介效应的概念,为处理多个同时测量的中介变量提供了基础框架。但作者指出,该工作聚焦于横截面数据,无法处理纵向依赖。
- Angrist, Imbens and Rubin (1996) 和 Yamamoto (2013):提出了基于工具变量的局部平均处理效应(LATE) 和意向性治疗(ITT) 框架来处理非依从性。作者明确指出,这些方法依赖于单调性和排他性约束假设,在本文的“干预-干预”比较(而非“治疗-对照”比较)中难以证明其合理性。
-
主要进展:主分层因果效应与干预效应
- Frangakis and Rubin (1999):提出了主分层因果效应(PCE) 框架,通过将个体划分为基于潜在依从行为的潜在亚组(如“始终依从者”)来处理非依从性。作者将此框架作为处理非依从性的核心工具。
- VanderWeele and Tchetgen Tchetgen (2017) 和 Zheng and van der Laan (2017):为解决纵向设置中“反悔证人问题”(recanting witness problem),引入了干预效应(interventional effects)。作者指出,干预效应通过随机化干预中介分布,避免了自然直接/间接效应所需的、不可检验的跨世界假设。这是本文因果估计量的核心选择。
-
当前前沿:纵向多重中介与非参数识别
- Tai et al. (2023) 和 Díaz, Williams and Rudolph (2023):建立了存在多个时变中介变量时,干预效应的非参数识别结果。作者明确区分了自己的贡献:Tai et al. 依赖参数模型(需正确设定),Díaz et al. 基于半参数效率理论(开发了基于影响函数的估计量),而本文则采用灵活的贝叶斯框架(EDPM + G-computation)来同时处理复杂数据结构和不确定性量化。
-
本文的位置:作者将自己的工作定位为填补“灵活建模”与“复杂纵向因果推断”之间的空白。具体而言,它是在Tai et al. (2023) 和 Díaz et al. (2023) 的非参数识别结果基础上,提供了一个可扩展的、基于贝叶斯非参数混合模型(EDPM)的估计方法,专门应对零膨胀、右偏分布和多重中介等实际数据挑战。
子线索聚类¶
这些被引文献大致落在以下三条子线索上:
- 线索一:处理非依从性的因果推断。核心是主分层框架(Frangakis and Rubin, 1999)和工具变量方法(Angrist, Imbens and Rubin, 1996)。本文属于此线索,但将其扩展到了纵向和多重中介设定。
- 线索二:纵向因果中介分析。核心是处理时变混杂和“反悔证人问题”。主要方法包括自然效应(需强假设)和干预效应(VanderWeele and Tchetgen Tchetgen, 2017; Zheng and van der Laan, 2017)。本文采用后者。
- 线索三:复杂数据结构的灵活建模。核心是使用贝叶斯非参数方法(如DP、EDPM)来避免参数模型误设。作者引用了Wade et al. (2011, 2014) 的EDPM模型,以及Burns and Daniels (2023) 的截断近似,作为其建模工具的基础。
这个方向在追问的核心问题¶
- 识别问题:在存在非依从性和时变混杂的纵向设置中,如何定义并识别出有意义的因果效应(直接、间接)?需要哪些假设(如主层忽略性、中介忽略性)?
- 估计问题:如何对复杂的、高维的、非标准分布(零膨胀、右偏)的纵向数据进行灵活且可扩展的建模,以准确估计上述因果效应?
- 不确定性量化:在贝叶斯框架下,如何为复杂的因果估计量(如主层干预效应)提供校准良好的不确定性区间(如可信区间)?
- 策略优化:如何基于估计的因果效应,设计出能够最大化期望结局(如购买次数)的个性化、序贯处理策略?
⚠️ 作者的 framing(必须明确标注成"这是作者的说法")¶
- 作者把缺口 frame 成什么:作者声称,尽管已有非参数识别结果(Tai et al., 2023; Díaz et al., 2023),但缺乏一个能够同时处理纵向非依从性、零膨胀多重中介,并提供统一的不确定性量化的灵活估计框架。因此,他们的EDPM + G-computation框架是“显然的下一步”。
- 哪些竞争路线被他淡化或回避了:
- 半参数效率方法:作者在引言中承认Díaz et al. (2023) 基于半参数效率理论,但将其描述为“开发了基于半参数效率理论的估计量”,而自己的贡献是“灵活的贝叶斯框架”。作者淡化了半参数方法在效率上的优势(如双稳健性、渐近正态性),并回避了其EDPM模型是否能达到半参数效率界的问题。作者在讨论部分(Section 7)才承认其可信区间在模型误设下不保证名义频率覆盖,并建议“纳入半参数校正”(Yiu et al., 2025)。
- 频率学派方法:作者完全采用了贝叶斯范式,没有与任何频率学派方法(如基于IPW或AIPW的估计量)进行模拟比较。这使得读者无法判断其贝叶斯方法相对于更标准、计算成本更低的频率学派方法的优劣。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 值得研究者去查的问题:作者在讨论部分提到了“纳入半参数校正”(Yiu et al., 2025)作为未来方向,但引言中完全没有提及任何关于贝叶斯非参数模型的后验校准或频率学派性质的文献。对于一个声称提供“统一的不确定性量化”的框架,这是一个明显的缺失。研究者应去查:在贝叶斯非参数因果推断中,后验可信区间是否具有频率学派覆盖性质?有哪些方法可以改善这一点?
张力¶
未见明显对立引用。作者引用的工作之间是互补关系:识别理论(Tai, Díaz)为估计提供了目标,而贝叶斯非参数模型(EDPM)为估计提供了工具。主要张力在于贝叶斯 vs. 频率学派的范式选择,但作者并未在引言中正面讨论这一张力。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
i:个体索引,i = 1, ..., n。t:时间点,t = 1, ..., T。本文中T=3。L_{i,0}:基线协变量向量(如性别、年龄)。Z_{it}:处理分配(treatment assignment),二元变量。Z_{it}=1表示收到“价值增值激励”邮件(如免运费),Z_{it}=0表示收到“价格折扣”邮件(如5%折扣)。D_{it}:处理接受(treatment receipt),二元变量。D_{it}=1表示打开邮件,D_{it}=0表示未打开。这是非依从性的来源。M_{it} = (M^{(1)}_{it}, M^{(2)}_{it}):中介变量向量。M^{(1)}_{it}是“自上次打开邮件以来的天数”,M^{(2)}_{it}是“自上次购买以来的天数”。它们是时变的、零膨胀的。Y_i:结局变量,研究结束时的总购买次数。零膨胀且右偏。U_1 = (D_1(1), D_1(0)):主层(principal stratum),基于个体在t=1时对两种处理分配的潜在接受行为。有四种类型:(1,1) 活跃型,(1,0) 价值关注型,(0,1) 价格关注型,(0,0) 非活跃型。θ(z_T, z^*_T):核心因果参数,表示在给定主层U_1的条件下,当处理分配按z_T进行,但中介分布按z^*_T进行时,期望结局Y的值。
-
模型:
- 数据生成机制由一个有向无环图(DAG,图1)描述,展示了
L_0, Z_t, D_t, M_t, Y之间的时序依赖关系。关键特征是D_t同时受过去Z_t影响,又影响未来的Z_{t+1}, M_t, Y,构成了“反悔证人问题”。 - 作者采用贝叶斯非参数方法,使用富集狄利克雷过程混合模型(EDPM) 来联合建模所有变量的分布。EDPM 是一个两层混合模型:外层(β-层)对结局模型参数聚类,内层(θ-层)对中介、处理接受等模型参数聚类。
- 在每个聚类内部,变量被假定服从局部参数模型,例如:结局
Y_i服从高斯障碍模型(Gaussian hurdle model),即Y_i = 0的概率为π,否则Y_i服从一个截断正态分布。中介变量也类似。
- 数据生成机制由一个有向无环图(DAG,图1)描述,展示了
-
可观测数据:
- 研究者实际能观测到的是
O_i = {L_{i,0}, Z_{it}, D_{it}, M_{it}, Y_i}对于t=1,...,T。 - 想要但观测不到的量:
- 潜在结局:
Y_i(z_T, d_T, m_T),即在不同处理、接受和中介历史下的反事实结局。 - 潜在处理接受:
D_{it}(z_t),即在不同处理分配下的反事实打开邮件行为。 - 潜在中介:
M_{it}(z_t, d_t),即在不同处理分配和接受下的反事实中介值。 - 主层成员身份:
U_1 = (D_1(1), D_1(0)),这是基于潜在变量的分类,无法直接观测。
- 潜在结局:
- 研究者实际能观测到的是
第二步:讲最小内核¶
本文的核心思路可以浓缩为:在纵向非依从性设置下,通过“干预效应”和“主分层”的组合,将复杂的因果估计量 θ(z, z^*) 表达为一系列可观测数据条件分布的积分(G-formula),然后用一个灵活的贝叶斯混合模型(EDPM)来估计这些条件分布。
最简特例:考虑一个极度简化的版本:T=2,只有一个中介变量 M_t,且所有变量都是连续的、非零膨胀的,没有随机效应。那么,核心因果参数 θ(z, z^*) 的 G-formula (公式4) 退化为:
θ(z, z^*) = ∫∫∫ E[Y | Z_2=z_2, D_2=d_2, M_2=m_2, L_0=ℓ_0]
× f(M_2=m_2 | Z_2=z^*_2, D_2=d_2, M_1=m_1, L_0=ℓ_0)
× f(D_2=d_2 | Z_2=z_2, D_1=d_1, M_1=m_1, L_0=ℓ_0)
× f(M_1=m_1 | Z_1=z^*_1, D_1=d_1, L_0=ℓ_0)
× f(L_0=ℓ_0) d(m_2) d(d_2) d(m_1) d(ℓ_0)
这个公式在说什么?
1. 外积分:对所有可能的基线协变量 ℓ_0、t=1 的中介 m_1、t=2 的处理接受 d_2 和中介 m_2 进行积分(平均)。
2. 内层:对于每一组 (ℓ_0, m_1, d_2, m_2),计算条件期望 E[Y|...],其中 Y 的条件分布是在处理分配为 z_T 的路径下。
3. 权重:这个条件期望被以下三个密度函数加权:
* f(M_2=m_2 | ...):中介 M_2 的分布是在处理分配为 z^*_T 的路径下。
* f(D_2=d_2 | ...):处理接受 D_2 的分布是在处理分配为 z_T 的路径下。
* f(M_1=m_1 | ...):中介 M_1 的分布是在处理分配为 z^*_T 的路径下。
核心思路:这个公式通过“混合”不同处理路径下的分布,巧妙地构造了一个“干预”世界:我们让处理分配按 z_T 进行(影响结局和接受行为),但让中介的分布按 z^*_T 进行(模拟一种“如果中介行为像在另一种处理下会怎样”的反事实)。这样,θ(z, z^*) 就衡量了当处理分配改变,但中介分布保持不变时,结局的变化,从而分离出直接效应。整个证明(Proposition 1)就是通过一系列忽略性假设,将公式中的潜在变量替换为可观测数据的条件分布。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在存在处理非依从性(未打开邮件)、多个时变中介变量(打开邮件和购买后的天数)以及零膨胀结局(购买次数)的纵向数字营销数据中,如何估计价值增值激励(免运费)相对于价格折扣激励(5%折扣)的因果直接效应和间接效应。
- 核心工具 / 方法:提出了一个贝叶斯半参数框架,该框架结合了富集狄利克雷过程混合模型(EDPM) 来灵活建模复杂的联合分布,并使用G-computation算法来估计基于主层干预效应的因果估计量。
- 主要结论:忽略邮件打开行为会显著低估处理效应;价值增值激励在累积购买金额上持续优于价格折扣;基于估计的因果参数设计的个性化序贯邮件发送策略能进一步提升期望购买次数。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
* 主层干预效应:作者定义了主层因果效应(PCE),并将其分解为主层干预直接效应(PIDE) 和主层联合干预间接效应(PJIIE)(公式3)。PIDE 衡量在固定中介分布为 z^* 时,改变处理分配为 z 的效应;PJIIE 衡量在处理分配固定为 z 时,改变中介分布为 z 的效应。
* 五个关键识别假设:
1. 一致性:观测到的变量等于其对应的潜在变量(假设1)。
2. 处理分配的可忽略性:给定协变量历史,当前处理分配与所有未来潜在变量独立(假设2)。作者认为这在营销经理基于历史数据决策的背景下是合理的。
3. 跨世界处理接受的可忽略性:t=1 时对一种处理的潜在接受行为,与未来在另一种处理世界下的潜在变量独立(假设3)。这是最关键的假设,作者承认其不可验证,但通过敏感性分析(Section S3)来评估其违反的影响。
4. 中介的可忽略性:给定协变量历史,当前中介与未来潜在处理接受和结局独立(假设4)。
5. 积极性:所有处理、接受和中介值的条件概率都为正(假设5)。
* 相比已有文献的强化/放宽:相比Tai et al. (2023) 的参数模型,本文通过EDPM放宽了模型形式假设;相比Díaz et al. (2023) 的半参数方法,本文提供了贝叶斯不确定性量化,但放弃了半参数效率性质。
主要结果¶
- 核心量化结论(表1):比较 {V,V,V} vs {P,P,P} 时,直接效应的估计值为3.91(95% CI: 2.45, 5.23),而忽略邮件打开信息的“朴素”分析仅为2.76(不显著)。间接效应的估计值为-1.15(95% CI: -2.22, -0.33),而朴素分析为-0.06(不显著)。这表明调整非依从性后,效应被放大且变得显著。
- 累积效应(表2):随着价值增值邮件数量的增加,直接效应单调递增(从 {V,P,P} 的1.86到 {V,V,V} 的3.91),间接效应的绝对值也单调递增。
- 与基线对比(图3):{V,V,V} 序列的期望购买次数(8.25)是 {P,P,P} 序列(5.50)的约1.5倍。
- 个性化策略(图5):基于逻辑回归的个性化策略在所有主层中均优于全局最优策略 {V,V,V},其中价值关注型客户的提升最显著(从8.05到8.66)。
证明路线与技术技巧¶
- 整体路线:
- 定义目标:定义主层干预效应
θ(z, z^*)。 - 非参数识别:通过一系列忽略性假设(假设1-5),将
θ(z, z^*)表达为可观测数据条件分布的积分,即G-formula(公式4,Proposition 1)。证明过程(Section S2)通过反复应用条件独立性和一致性,将潜在变量替换为观测变量。 - 灵活建模:使用EDPM模型(公式5-7)来估计G-formula中出现的所有条件分布。EDPM通过两层聚类(β-层和θ-层)来捕捉异质性,并在每个聚类内使用简单的参数模型(如高斯障碍模型、probit回归)。
- 后验计算:采用截断近似(Section S5)将无限混合模型截断为有限混合,并使用阻塞吉布斯采样器(Blocked Gibbs Sampler)从后验分布中抽样。
- G-computation:在每次MCMC迭代后,使用G-computation算法(Algorithm S1)通过蒙特卡洛积分来估计
θ(z, z^*)。该算法模拟了在给定主层和干预方案下的反事实轨迹。
- 定义目标:定义主层干预效应
- 关键跳跃点:
- 从潜在变量到观测变量:证明Proposition 1时,最大的跳跃在于如何利用跨世界处理接受的可忽略性(假设3) 来切断
D_1(1)和D_1(0)之间的依赖,从而将条件期望从U_1转移到可观测的D_1上。这是整个识别策略的核心难点。 - 从无限混合到有限截断:EDPM模型是无限混合,无法直接计算。作者采用Burns and Daniels (2023) 的截断近似,将外、内层聚类数分别固定为
N=10和M=4,并证明了其收敛性。这使得后验计算变得可行。
- 从潜在变量到观测变量:证明Proposition 1时,最大的跳跃在于如何利用跨世界处理接受的可忽略性(假设3) 来切断
- 技术技巧点名:
- EDPM:用于灵活建模联合分布,捕捉异质性。
- G-computation:用于从拟合的模型中模拟反事实轨迹,估计因果效应。
- 阻塞吉布斯采样:用于从截断EDPM的后验分布中高效抽样。
- 高斯障碍模型:用于处理零膨胀和右偏的连续型数据(作者将计数数据近似为连续)。
- 敏感性分析:基于可解释的敏感性参数
(k_0, k_1),评估违反假设3的影响。
真实例子与应用¶
- 数据:来自一家美国零售商的18,571名客户,在三个时间点收到促销邮件。数据包括基线协变量(性别、年龄)、处理分配(价值/价格激励)、处理接受(是否打开邮件)、两个时变中介(打开邮件和购买后的天数)和结局(总购买次数)。
- 方法应用:作者将提出的EDPM模型和G-computation算法应用于该数据集,估计了不同邮件序列组合下的主层干预直接、间接和总效应。
- 结果:
- 验证了调整非依从性的必要性(表1)。
- 揭示了价值增值激励的累积优势(表2,图3)。
- 分析了间接效应为负的原因:价值增值邮件导致客户打开邮件和购买的时间间隔更长,从而降低了购买意愿(图4)。
- 设计并评估了个性化序贯邮件策略,证明其优于全局最优策略(图5)。
- 例子想说明什么:这个例子旨在展示所提出的框架能够处理真实世界因果推断中的多重复杂挑战(非依从性、零膨胀、多重中介、纵向结构),并产出具有实际商业价值的、可操作的见解。
🔎 结论是否比证明窄¶
- 是。作者在引言和结论中声称其框架“提供了统一的不确定性量化”,但模拟研究(Section 6) 明确显示,在模型误设下(Scenario 2),EDPM模型的95%可信区间未能达到名义覆盖水平(例如,活跃客户的直接效应覆盖率为65%)。作者在讨论中承认了这一点,并建议“纳入半参数校正”作为未来工作。因此,其关于“统一不确定性量化”的声明仅限于模型正确设定或近似正确设定的情况,并非一个普遍成立的结论。这是一个值得研究者注意的窄结论。
四、开放问题¶
-
半参数后验校正:本文的EDPM模型在模型误设下无法提供名义频率覆盖。作者在讨论中(Section 7)提到“纳入半参数校正(Yiu et al., 2025)”。要证什么:能否将Yiu et al. (2025) 的半参数后验校正方法应用于本文的EDPM框架,使得在模型误设下,后验可信区间也能达到名义覆盖水平?扎根于:Section 7, "incorporating a semiparametric correction (Yiu et al., 2025) within our framework may help address this limitation."
-
多通道扩展:作者在讨论中提到“现代营销活动通常是多通道的”。要估什么:如何将本文的框架扩展到处理向量
Z_{it}是多维的(如同时包含邮件、短信、应用通知)情况?这需要重新定义主层(依从性是多维的)和干预效应。扎根于:Section 7, "extending our framework to accommodate channel-specific treatment vectors would allow evaluation of dynamic cross-channel intervention strategies." -
动态主层:本文仅使用
t=1时的主层U_1。要证什么:在更长的纵向研究中,个体的依从行为可能随时间变化。如何定义和识别时变主层(time-varying principal strata)?这会导致主层数量指数级增长,需要新的识别假设或降维策略。扎根于:Section 3.4, "we modify the standard definition of PCE in our study by only considering the principal stratum at time 1. This is a reasonable compromise..." 作者承认这是一个妥协,为更一般的理论留下了空间。
Maintained by 陈星宇 · Homepage · Source on GitHub