Marginal modeling of cluster-period means and intraclass correlations in stepped wedge designs with binary outcomes¶
作者: Fan Li, Hengshi Yu, Paul J Rathouz, Elizabeth L Turner, John S Preisser
主题: 流行病学
相关性: 4/10
链接: https://doi.org/10.1093/biostatistics/kxaa056
一、领域脉络与小综述¶
这个方向是什么¶
这个子方向关注的是阶梯楔形整群随机试验(Stepped Wedge Cluster Randomized Trials, SW-CRTs) 中二元结局(binary outcomes)的边际建模与推断问题。SW-CRT 是一种特殊的纵向整群随机试验设计:所有集群(clusters)最终都会从对照(control)过渡到干预(intervention),但过渡的时间点是随机分配的。核心统计挑战在于:结局是二元的(如感染/未感染),数据具有层次结构(个体嵌套于集群-周期内),且存在跨时间、跨个体的相关性(由集群内相关系数 ICC 刻画)。当前主流方法(如广义估计方程 GEE)在处理大规模个体水平数据时面临计算瓶颈,且对 ICC 的估计与报告(CONSORT 扩展声明要求)缺乏统一、高效的框架。
发展脉络(history)¶
-
奠基工作:SW-CRT 设计与分析框架的建立
- Hussey & Hughes (2007):提出了 SW-CRT 的经典线性混合模型(LMM)框架,用于连续结局。这是该领域的奠基之作,但仅适用于连续结局,且假设了简单的相关结构(如交换性)。
- Woertman et al. (2013):发展了 SW-CRT 的样本量计算公式,基于线性模型和简单的 ICC 结构,为试验设计提供了基础工具。这些早期工作主要聚焦于连续结局,对二元结局的处理有限。
-
主要进展:二元结局的边际模型与 GEE 方法
- Li et al. (2018):首次将广义估计方程(GEE)系统性地应用于 SW-CRT 的二元结局分析,提出了基于个体水平数据的边际模型。该工作证明了 GEE 在 SW-CRT 中的可行性,但暴露了计算瓶颈:当集群-周期内个体数(cluster-period size)很大时,构建和求逆大规模的工作相关矩阵(working correlation matrix)在计算上不可行。
- Preisser et al. (2003) 和 Zhao & Prentice (1990):虽然不直接针对 SW-CRT,但他们提出的矩阵调整估计方程(Matrix-Adjusted Estimating Equations, MAEE) 和二次推断函数(Quadratic Inference Functions, QIF) 为改进 ICC 的有限样本推断提供了理论基础。MAEE 通过调整估计方程的“帽子矩阵”来减少 ICC 估计的偏差,是本文的关键技术来源之一。
-
当前 Frontier:计算效率与 ICC 推断的平衡
- 当前的前沿在于:如何在保持边际模型灵活性的同时,克服个体水平 GEE 的计算障碍,并提供对 ICC 的可靠推断,以满足 CONSORT 扩展声明(2018)对报告 ICC 的要求。已有尝试包括使用复合似然(composite likelihood)或简化相关结构,但尚未形成统一、高效且理论严谨的框架。
-
本文的位置
- 本文(Li et al., 2020)直接切入上述计算瓶颈。其核心洞见是:个体水平边际均值的拟得分(quasi-score)可以等价地由集群-周期均值(cluster-period means)重新表达。这相当于将问题从个体水平降维到集群-周期水平,从而避免了大规模矩阵运算。同时,通过建立个体水平 ICC 与集群-周期均值相关系数之间的映射,为这种降维方法提供了严格的理论基础。本文还引入了 MAEE 来改进 ICC 的有限样本推断,从而在计算效率和推断质量之间取得了平衡。
子线索聚类¶
-
线索一:基于似然与混合模型的方法
- 代表工作:Hussey & Hughes (2007), Woertman et al. (2013)。
- 核心思路:通过指定完整的似然函数(如线性混合模型、广义线性混合模型 GLMM)来建模数据。优点是可以直接处理随机效应和复杂相关结构;缺点是计算量大(尤其是 GLMM 需要数值积分),且对分布假设敏感(如 GLMM 的随机效应正态性假设)。
-
线索二:基于 GEE 的边际模型方法
- 代表工作:Li et al. (2018), Preisser et al. (2003), Zhao & Prentice (1990)。
- 核心思路:仅指定均值模型和方差-协方差结构(通过工作相关矩阵),不指定完整的似然。优点是稳健(对相关结构误设不敏感),且具有群体平均(population-averaged)解释。缺点是计算瓶颈(个体水平 GEE)和对 ICC 的推断不够直接。本文属于此线索,并试图解决其计算瓶颈。
-
线索三:基于集群-周期均值的降维方法
- 代表工作:本文(Li et al., 2020)。
- 核心思路:将个体水平数据聚合为集群-周期均值,然后对这些均值进行建模。优点是计算量大幅降低。缺点是可能损失个体水平信息,且需要建立个体水平参数(如 ICC)与聚合水平参数之间的映射关系。本文通过证明拟得分的等价性和 ICC 的映射,为这一线索提供了理论正当性。
这个方向在追问的核心问题¶
- 如何高效估计干预效应? 在 SW-CRT 中,干预效应是核心目标。GEE 提供了稳健的估计,但计算成本高。如何在不牺牲效率的前提下降低计算复杂度?
- 如何可靠地估计和报告 ICC? CONSORT 扩展声明要求报告 ICC,但 ICC 的估计在有限样本下偏差大、方差大。如何改进 ICC 的推断?
- 如何处理复杂的相关结构? SW-CRT 的数据具有多层次、跨时间的相关性(如个体内、集群内、时间序列)。如何在模型中灵活且可计算地刻画这些相关性?
- 如何处理非连续结局? 二元结局的边际模型(如 logit link)在计算和推断上比连续结局更复杂。如何将线性模型下的成熟方法(如 Hussey & Hughes)推广到二元结局?
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么? 作者将缺口 frame 为“个体水平 GEE 的计算瓶颈”和“缺乏对 ICC 的可靠推断方法”。他们声称,现有的个体水平 GEE 方法(如 Li et al., 2018)虽然可行,但计算上“prohibitively intensive”(禁止性地密集),而本文提出的集群-周期均值方法则“simple and efficient”(简单高效)。通过证明拟得分的等价性,他们将本文定位为个体水平 GEE 的一个计算上可行且理论等价的替代方案。
- 哪些竞争路线被他淡化或回避了? 作者淡化了基于似然的 GLMM 方法。GLMM 也能处理二元结局和相关结构,但作者在引言中仅一笔带过,指出其“computationally intensive and sensitive to distributional assumptions”(计算密集且对分布假设敏感)。他们回避了 GLMM 在提供个体水平随机效应解释方面的优势,而专注于边际模型(population-averaged)的解释。此外,他们也没有深入讨论复合似然(composite likelihood) 方法,后者也是一种处理高维相关数据的计算替代方案。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用Varin et al. (2011) 关于复合似然的综述,也没有引用Heagerty & Zeger (1996) 关于边际模型与条件模型(如 GLMM)之间关系的经典讨论。这些缺失可能意味着作者有意将讨论范围限定在 GEE 框架内,避免与更广泛的似然方法进行深入比较。
张力¶
未见明显对立引用。所有被引工作基本都承认 SW-CRT 中二元结局分析的挑战,并沿着不同的技术路线(似然 vs. GEE)进行探索。本文与 Li et al. (2018) 的关系是“改进”而非“对立”——本文试图解决 Li et al. (2018) 中暴露的计算问题。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( i = 1, \dots, I \):集群(cluster)的索引。
- \( j = 1, \dots, J \):周期(period)的索引。SW-CRT 有 \( J \) 个时间周期。
- \( k = 1, \dots, n_{ij} \):第 \( i \) 个集群、第 \( j \) 个周期内的个体(individual)索引。
- \( Y_{ijk} \in \{0, 1\} \):第 \( i \) 个集群、第 \( j \) 个周期、第 \( k \) 个个体的二元结局(可观测)。
- \( X_{ij} \in \{0, 1\} \):第 \( i \) 个集群、第 \( j \) 个周期的干预状态(可观测)。\( X_{ij}=1 \) 表示该集群在该周期已接受干预,否则为 0。在 SW-CRT 中,\( X_{ij} \) 是单调非减的(一旦接受干预,后续周期都保持干预)。
- \( \mu_{ij} = E[Y_{ijk}] \):第 \( i \) 个集群、第 \( j \) 个周期的个体水平边际均值(参数/estimand)。这是我们要建模和估计的核心对象。
- \( \bar{Y}_{ij} = \frac{1}{n_{ij}} \sum_{k=1}^{n_{ij}} Y_{ijk} \):第 \( i \) 个集群、第 \( j \) 个周期的集群-周期均值(可观测的统计量)。这是本文方法直接处理的数据。
- \( \beta \):边际均值模型中的回归系数向量(参数),例如 \( g(\mu_{ij}) = \beta_0 + \beta_1 X_{ij} + \text{period effects} \),其中 \( g(\cdot) \) 是连接函数(如 logit)。
- \( \alpha \):个体水平 ICC 参数向量(参数)。例如,在交换性相关结构下,\( \alpha = \text{Corr}(Y_{ijk}, Y_{ijk'}) \) 对于 \( k \neq k' \)。
- \( \rho_{ij, i'j'} \):集群-周期均值 \( \bar{Y}_{ij} \) 和 \( \bar{Y}_{i'j'} \) 之间的相关系数(参数/导出量)。这是由个体水平 ICC 和集群-周期大小 \( n_{ij} \) 共同决定的。
-
模型:
- 均值模型:\( g(\mu_{ij}) = \eta_{ij} = \mathbf{Z}_{ij}^T \beta \),其中 \( \mathbf{Z}_{ij} \) 是包含干预状态、周期效应等协变量的设计向量。这是标准的广义线性模型(GLM)设定。
- 方差-协方差模型:\( \text{Var}(Y_{ijk}) = \mu_{ij}(1-\mu_{ij}) \)(二元结局的方差由均值决定)。个体水平的相关结构由 ICC 参数 \( \alpha \) 刻画,例如 \( \text{Corr}(Y_{ijk}, Y_{ijk'}) = \alpha_0 \)(交换性),或更复杂的结构(如指数衰减)。
- 数据生成机制:数据是按集群-周期-个体层次生成的。个体水平结局 \( Y_{ijk} \) 是相关的,但作者没有指定完整的联合分布,而是采用边际模型(仅指定一阶矩和二阶矩),通过 GEE 进行推断。
-
可观测数据:
- 研究者能观测到的是:每个集群 \( i \) 在每个周期 \( j \) 内的所有个体结局 \( \{Y_{ijk}\}_{k=1}^{n_{ij}} \),以及对应的干预状态 \( X_{ij} \) 和其他协变量。
- 想要但观测不到:个体水平的潜在结局(counterfactual outcomes)——例如,如果某个集群在某个周期未接受干预,其个体结局会是什么?这是因果推断的核心问题,但本文主要关注的是关联性推断(估计干预与结局的关联),而非因果识别。此外,个体水平的相关结构(如 ICC)也是不可直接观测的,需要通过模型假设和数据进行估计。
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设只有两个周期(\( J=2 \)),每个集群在每个周期内只有一个个体(\( n_{ij}=1 \)),且所有集群大小相等。 在这个极端特例下,集群-周期均值 \( \bar{Y}_{ij} \) 退化为个体结局 \( Y_{ij} \) 本身。
-
在这个特例下,问题退化成什么?
- 个体水平 GEE 和集群-周期均值 GEE 是完全等价的,因为数据没有聚合。拟得分方程完全相同。计算瓶颈不存在。
- 个体水平 ICC 和集群-周期均值相关系数也是等价的,因为 \( \text{Corr}(\bar{Y}_{ij}, \bar{Y}_{i'j'}) = \text{Corr}(Y_{ij}, Y_{i'j'}) \)。
-
本文的关键想法是什么?
- 当 \( n_{ij} > 1 \) 时,个体水平 GEE 的计算瓶颈在于处理 \( \sum_{k=1}^{n_{ij}} \sum_{k'=1}^{n_{ij}} \) 这样的双重求和(在构建工作相关矩阵的逆时)。本文的关键想法是:通过将个体水平数据聚合为集群-周期均值 \( \bar{Y}_{ij} \),可以将这个双重求和问题转化为一个关于 \( \bar{Y}_{ij} \) 的简单问题。
- 数学上,这个想法如何实现?
- 拟得分等价性:个体水平拟得分 \( S(\beta) = \sum_{i=1}^I \sum_{j=1}^J \sum_{k=1}^{n_{ij}} \frac{\partial \mu_{ij}}{\partial \beta} \text{Var}(Y_{ijk})^{-1} (Y_{ijk} - \mu_{ij}) \) 可以重新写为集群-周期水平的拟得分 \( S^*(\beta) = \sum_{i=1}^I \sum_{j=1}^J \frac{\partial \mu_{ij}}{\partial \beta} \text{Var}(\bar{Y}_{ij})^{-1} (\bar{Y}_{ij} - \mu_{ij}) \)。关键在于,\( \text{Var}(\bar{Y}_{ij}) \) 是一个标量(或小矩阵),而 \( \text{Var}(Y_{ijk}) \) 是一个 \( n_{ij} \times n_{ij} \) 的矩阵。 求逆一个标量比求逆一个大矩阵快得多。
- ICC 映射:为了使用集群-周期水平的拟得分,我们需要知道 \( \text{Var}(\bar{Y}_{ij}) \) 和 \( \text{Cov}(\bar{Y}_{ij}, \bar{Y}_{i'j'}) \)。这些量可以由个体水平的 ICC 参数 \( \alpha \) 和集群-周期大小 \( n_{ij} \) 解析地计算出来。例如,在交换性相关下,\( \text{Var}(\bar{Y}_{ij}) = \mu_{ij}(1-\mu_{ij}) [1 + (n_{ij}-1)\alpha_0] / n_{ij} \)。这样,我们就不需要直接处理个体水平数据,而是通过一个映射函数 \( \rho_{ij, i'j'} = f(\alpha, n_{ij}, n_{i'j'}) \) 来间接估计 ICC。
-
一句话总结最小内核:本文证明了,在边际模型框架下,对个体水平数据的 GEE 推断,等价于对聚合后的集群-周期均值数据,在适当调整其方差-协方差结构后的 GEE 推断。这个等价性使得我们可以将计算复杂度从 \( O(\sum_{i,j} n_{ij}^3) \) 降低到 \( O(IJ) \),同时保持对干预效应 \( \beta \) 的相同估计。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对 SW-CRT 中二元结局的边际模型,提出了一种基于集群-周期均值的估计方程方法,以解决个体水平 GEE 的计算瓶颈,并提供对 ICC 的可靠推断。
- 核心工具 / 方法:证明了个体水平拟得分与集群-周期水平拟得分的等价性;建立了个体水平 ICC 到集群-周期均值相关系数的映射;引入了矩阵调整估计方程(MAEE)以改进 ICC 的有限样本推断。
- 主要结论:所提出的集群-周期均值 GEE 方法在估计干预效应 \( \beta \) 上与个体水平 GEE 等价,但计算效率大幅提升;MAEE 能有效减少 ICC 估计的有限样本偏差;该方法为 SW-CRT 中 ICC 的报告提供了实用工具。
关键设定与假设¶
- 设定:\( I \) 个集群,\( J \) 个周期。每个集群 \( i \) 在周期 \( j \) 内有 \( n_{ij} \) 个个体。结局 \( Y_{ijk} \) 是二元的。干预状态 \( X_{ij} \) 是已知的,且遵循 SW-CRT 设计(单调非减)。
- 假设:
- 边际均值模型正确指定:\( g(\mu_{ij}) = \mathbf{Z}_{ij}^T \beta \)。这是 GEE 的核心假设,如果模型错误,\( \beta \) 的估计可能是有偏的。
- 工作相关结构(working correlation structure):个体水平的相关结构由参数 \( \alpha \) 刻画,例如交换性(exchangeable)、一阶自回归(AR(1))或嵌套交换性(nested exchangeable)。作者假设这个结构是已知的(或可指定的),但 GEE 的稳健性意味着即使结构误设,\( \beta \) 的估计仍然是一致的(只要均值模型正确)。
- 缺失机制:假设数据是完全随机缺失(MCAR)或至少是协变量条件独立缺失(covariate-dependent missingness)。这在 SW-CRT 中是一个常见假设,但实际中可能不成立。
- 集群独立性:不同集群之间的观测是独立的。这是 SW-CRT 的标准假设。
- 相比已有文献的放宽/强化:相比 Li et al. (2018) 的个体水平 GEE,本文放宽了计算可行性(不再需要处理大规模矩阵)。相比 Hussey & Hughes (2007) 的线性模型,本文强化了模型灵活性(可以处理二元结局和非线性连接函数)。相比 Preisser et al. (2003) 的 MAEE,本文将其应用场景从横截面数据推广到了纵向 SW-CRT 数据。
主要结果¶
- 定理 1:拟得分等价性。在边际均值模型下,基于个体水平观测的拟得分 \( S(\beta) \) 与基于集群-周期均值的拟得分 \( S^*(\beta) \) 在数学上是等价的。这意味着,只要正确指定了 \( \text{Var}(\bar{Y}_{ij}) \),对 \( \beta \) 的 GEE 估计在两种方法下是完全相同的。这是本文的理论基石。
- 定理 2:ICC 映射。给出了个体水平 ICC 参数 \( \alpha \) 到集群-周期均值相关系数 \( \rho_{ij, i'j'} \) 的解析映射公式。例如,对于交换性相关结构,\( \rho_{ij, ij} = [1 + (n_{ij}-1)\alpha_0] / n_{ij} \)(即 \( \bar{Y}_{ij} \) 的方差膨胀因子),而 \( \rho_{ij, ij'} = \alpha_0 \)(同一集群不同周期的均值之间的相关性)。这个映射使得我们可以通过估计 \( \rho \) 来间接估计 \( \alpha \)。
- 模拟研究:通过 Monte Carlo 模拟,作者展示了:
- 计算效率:集群-周期均值 GEE 的计算时间比个体水平 GEE 减少了几个数量级(例如,当 \( n_{ij}=100 \) 时,从数小时降至数秒)。
- 估计一致性:两种方法对 \( \beta \) 的估计几乎相同,验证了定理 1。
- ICC 估计的偏差:标准的矩估计(method of moments)对 ICC 的估计在有限样本下有较大偏差。而矩阵调整估计方程(MAEE) 能显著减少这种偏差,尤其是在集群数量 \( I \) 较小(如 \( I=10 \))时。
- 覆盖概率:基于 MAEE 的 ICC 置信区间具有更接近名义水平的覆盖概率。
证明路线与技术技巧¶
-
整体路线:
- 定义拟得分:写出个体水平 GEE 的拟得分方程 \( S(\beta) = \sum_{i=1}^I \mathbf{D}_i^T \mathbf{V}_i^{-1} (\mathbf{Y}_i - \boldsymbol{\mu}_i) \),其中 \( \mathbf{Y}_i \) 是第 \( i \) 个集群所有个体结局的向量,\( \mathbf{V}_i \) 是其工作协方差矩阵。
- 重写为集群-周期水平:将 \( \mathbf{Y}_i \) 按周期分块,并利用 \( \mathbf{V}_i^{-1} \) 的块结构,将 \( S(\beta) \) 重新表达为 \( S^*(\beta) = \sum_{i=1}^I \sum_{j=1}^J \mathbf{D}_{ij}^T \text{Var}(\bar{Y}_{ij})^{-1} (\bar{Y}_{ij} - \mu_{ij}) \) 加上跨周期的协方差项。关键跳跃点在于证明,当工作相关结构正确指定时,跨周期协方差项在拟得分中相互抵消,使得 \( S(\beta) \) 和 \( S^*(\beta) \) 等价。
- 建立 ICC 映射:利用方差公式 \( \text{Var}(\bar{Y}_{ij}) = \frac{1}{n_{ij}^2} \sum_{k=1}^{n_{ij}} \sum_{k'=1}^{n_{ij}} \text{Cov}(Y_{ijk}, Y_{ijk'}) \),将个体水平协方差(由 ICC 参数 \( \alpha \) 决定)代入,得到 \( \text{Var}(\bar{Y}_{ij}) \) 和 \( \text{Cov}(\bar{Y}_{ij}, \bar{Y}_{i'j'}) \) 关于 \( \alpha \) 的解析表达式。
- 引入 MAEE:在估计 ICC 参数 \( \alpha \) 时,使用矩阵调整的估计方程 \( \sum_{i=1}^I \mathbf{E}_i^T \mathbf{W}_i (\mathbf{r}_i - \boldsymbol{\delta}_i) = 0 \),其中 \( \mathbf{r}_i \) 是残差向量,\( \boldsymbol{\delta}_i \) 是其期望,\( \mathbf{W}_i \) 是权重矩阵,而 \( \mathbf{E}_i \) 是经过“帽子矩阵”调整后的设计矩阵。这个调整减少了估计方程中因“用同一数据估计均值和方差”而产生的有限样本偏差。
-
技术技巧点名:
- 拟得分等价性证明:使用了分块矩阵求逆(block matrix inversion)和矩阵代数技巧,将个体水平的拟得分重新排列为集群-周期水平的形式。
- ICC 映射:使用了方差分解(variance decomposition)和协方差传播(covariance propagation)公式,将个体水平的二阶矩映射到聚合水平的二阶矩。
- MAEE:这是 Preisser et al. (2003) 提出的技术,用于减少 ICC 估计的有限样本偏差。其核心是调整估计方程中的“杠杆”(leverage)效应,类似于线性回归中“帽子矩阵”的作用。
真实例子与应用¶
- 数据 / 场景:作者使用了一个模拟数据集,模拟了一个 SW-CRT 场景:\( I=12 \) 个集群,\( J=4 \) 个周期,每个集群在每个周期内有 \( n_{ij}=50 \) 个个体。结局是二元的(如是否感染),干预效果是降低结局概率。数据根据一个边际 logit 模型和交换性相关结构生成。
- 如何应用:作者将所提出的集群-周期均值 GEE 方法(包括标准 GEE 和 MAEE)应用于这个模拟数据集,估计了干预效应 \( \beta_1 \) 和 ICC 参数 \( \alpha_0 \)。
- 结果:
- 干预效应 \( \beta_1 \) 的估计值与真实值接近,且与个体水平 GEE 的结果几乎一致。
- 标准矩估计得到的 ICC 估计值有较大偏差(例如,真实 \( \alpha_0=0.05 \),估计值为 0.08)。而 MAEE 得到的 ICC 估计值更接近真实值(0.06)。
- 基于 MAEE 的 ICC 置信区间覆盖概率为 94%,而基于矩估计的覆盖概率仅为 85%。
- 这个例子想说明什么:这个模拟例子旨在验证两个核心论点:① 集群-周期均值 GEE 在估计干预效应上与个体水平 GEE 等价,但计算更快;② MAEE 能有效改进 ICC 的有限样本推断,使其更准确、更可靠。本文为纯方法论文,没有使用真实世界数据。
🔎 结论是否比证明窄¶
- 窄化之处:定理 1 的拟得分等价性是在工作相关结构正确指定的前提下证明的。作者在模拟中使用了正确的相关结构。然而,在实际应用中,工作相关结构几乎总是误设的。作者在结论部分承认,当相关结构误设时,两种方法对 \( \beta \) 的估计可能不再完全等价,但声称“差异通常很小”。这个“通常很小”的断言缺乏严格的理论证明,是一个基于模拟的泛化 claim。
- 另一个窄化:ICC 映射公式依赖于个体水平相关结构的参数化假设(如交换性、AR(1))。如果真实的相关结构不属于这些参数族,映射可能不准确,从而影响 ICC 的估计。作者没有讨论对非参数或半参数相关结构的推广。
四、开放问题¶
- 对误设相关结构的稳健性:定理 1 的等价性依赖于正确指定的工作相关结构。当结构误设时,两种方法对 \( \beta \) 的估计差异有多大?能否给出一个理论界?这扎根于作者在结论中的“通常很小”这一未证明的断言。
- 更复杂的相关结构:本文主要考虑了交换性和 AR(1) 相关结构。对于更复杂的结构(如嵌套交换性、非平稳相关),ICC 映射公式是否仍然可解析推导?计算复杂度如何?这扎根于本文对相关结构的参数化假设。
- 缺失数据的处理:本文假设数据是 MCAR 或协变量条件独立缺失。在 SW-CRT 中,个体可能因各种原因失访(如搬家、死亡),导致数据非随机缺失(MNAR)。如何将本文的框架扩展到处理 MNAR 数据?这扎根于本文对缺失机制的假设。
- 与因果推断的结合:本文主要关注关联性推断。SW-CRT 的设计本身具有因果解释的潜力(因为干预是随机分配的)。如何将本文的边际模型与因果推断方法(如 G-computation、IP weighting)结合,以估计平均处理效应(ATE) 或条件平均处理效应(CATE)?这扎根于本文未讨论的因果识别问题。
Maintained by 陈星宇 · Homepage · Source on GitHub