跳转至

Causal inference for recurrent event data using pseudo-observations

作者: Chien-Lin Su, Robert W Platt, Jean-François Plante
来源: Biostatistics
主题: 因果推断
相关性: 7/10
机构绿灯: McGill University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxaa020


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在观察性研究中,当每个个体可能经历同一事件多次(如多次住院、多次癫痫发作),且处理分配(如是否接受某种治疗)受混杂因素影响时,如何无偏地估计处理对事件发生率的因果效应。核心挑战在于:复发事件数据的结构(同一主体内事件间相关、随访期长度不同、删失)与混杂偏倚同时存在,而标准因果推断方法(如IPTW、G-computation)主要针对单次结局(binary/continuous/survival time),直接推广到复发事件场景需要处理“累积率函数(CRF)”作为目标estimand时的识别与估计问题。当前成熟度:方法学上已有一些工作(如Lin et al. 2000的加性/乘性强度模型、Andersen et al. 2003的边际模型),但边际因果比较(即不假设特定强度模型形式、直接比较两组CRF)的框架仍不完整,本文填补了这一缺口。

发展脉络(history)

  1. 奠基工作:复发事件数据的标准统计方法始于Andersen & Gill (1982) 的计数过程框架(Cox-type强度模型),以及Lin et al. (2000) 的加性/乘性均值模型。这些工作建立了复发事件数据的回归建模基础,但处理分配被当作外生变量,未考虑混杂。

  2. 因果推断引入复发事件Hernán et al. (2001) 将边际结构模型(MSM)与IPTW引入复发事件数据,通过逆概率加权处理时依混杂。这是因果推断进入该领域的标志性工作,但其目标estimand是“如果所有人都接受某处理时的平均事件数”,而非直接比较两组CRFCook & Lawless (2007) 的专著系统总结了复发事件数据的统计方法,但因果推断部分仍以强度模型为主。

  3. 伪观测(Pseudo-observations)框架的兴起Andersen et al. (2003) 提出伪观测方法用于生存数据的回归建模(如限制平均生存时间),其核心思想是:对每个个体计算一个“伪观测值”(基于留一法Jackknife),然后将其作为响应变量拟合广义线性模型。Andersen & Perme (2010) 将其推广到竞争风险场景。这些工作展示了伪观测在边际比较中的灵活性——不需要指定完整的似然,只需一个一致估计的总体均值。但这些工作均假设处理是随机分配的,未处理混杂。

  4. 当前frontier与本文位置:在本文之前,混杂调整下的复发事件数据边际比较存在明显缺口:IPTW方法(Hernán et al. 2001)需要正确指定处理模型;回归调整方法(如Lin et al. 2000的均值模型)需要正确指定结局模型;而双重稳健估计量(同时允许处理模型或结局模型之一错误指定)在复发事件场景下尚未被系统发展。本文的工作是:将伪观测框架与因果推断中的IPTW、回归调整、双重稳健估计相结合,系统性地推广到复发事件数据的CRF边际比较。作者在引言中明确写道:“现有方法要么假设处理随机分配(如Andersen & Perme 2010),要么只处理单次结局(如Bang & Robins 2005),复发事件场景下的双重稳健估计仍是一个开放问题。”

子线索聚类

这些被引文献大致落在三条子线索上:

  • 线索A:复发事件数据的标准统计方法(无因果调整)
    包括Andersen & Gill (1982)、Lin et al. (2000)、Cook & Lawless (2007)。这些工作建立了复发事件数据的建模框架(强度模型、均值模型),但处理分配被视为外生。本文的伪观测框架直接继承自Andersen et al. (2003)和Andersen & Perme (2010),但将它们从“随机处理”推广到“观察性研究”。

  • 线索B:因果推断中的边际结构模型与双重稳健估计
    包括Hernán et al. (2001)(IPTW用于复发事件)、Bang & Robins (2005)(双重稳健估计用于单次结局)、Robins et al. (2000)(G-computation)。这些工作提供了因果调整的工具箱,但目标结局是单次测量(如二值/连续/生存时间),而非复发事件的累积率函数。本文的贡献在于将这些工具适配到CRF这一特定estimand

  • 线索C:伪观测方法及其在生存/竞争风险中的应用
    包括Andersen et al. (2003)、Andersen & Perme (2010)、Klein & Andersen (2005)。这些工作展示了伪观测在边际比较中的灵活性,但假设处理随机分配。本文的关键创新是:将伪观测与倾向性得分加权/回归调整结合,使伪观测方法适用于观察性研究

这个方向在追问的核心问题(2-4个)

  1. 如何定义复发事件场景下的因果estimand?
    是处理对“事件发生强度”的效应(需要指定强度模型),还是对“累积率函数”的边际效应(不需要模型假设)?本文选择后者,因为CRF是复发事件数据最自然的边际描述量。

  2. 如何同时处理混杂与复发事件数据的内在相关性?
    同一主体内的事件间相关使得标准方差估计(如三明治估计)失效,且影响双重稳健估计量的构造。本文采用bootstrap处理方差估计,但理论上的影响函数推导仍是一个开放问题

  3. 双重稳健性质在复发事件场景下是否成立?
    对于单次结局,双重稳健估计量在“处理模型正确”或“结局模型正确”时一致。本文证明其伪观测版本也成立,但证明依赖于伪观测的渐近线性展开,且需要额外的正则条件(如随访期长度有限、事件数有界)。

  4. 如何检验两组CRF是否相等?
    标准两样本检验(如log-rank)不适用于复发事件数据,且需要调整混杂。本文提出了基于伪观测的调整后两样本伪得分检验。

⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)

作者把缺口frame成:“现有方法要么假设处理随机分配(伪观测方法),要么只处理单次结局(双重稳健估计),复发事件场景下的边际因果比较仍是一个开放问题。” 这样,本文成为“显然的下一步”:将伪观测框架与因果调整工具结合,系统性地推广到复发事件数据。

被淡化或回避的竞争路线: - 基于强度模型的方法(如Lin et al. 2000的加性均值模型)被作者视为“需要模型假设”的替代方案,但作者未充分讨论:当强度模型正确指定时,其效率可能优于本文的边际方法。 - G-computation方法(Robins et al. 2000)在复发事件场景下的推广(如通过Monte Carlo模拟整个事件过程)被作者一笔带过,未比较其与伪观测方法的优劣。

什么明显该被引/该存在、却没出现在intro里? - van der Laan & Rose (2011) 的Targeted Maximum Likelihood Estimation (TMLE) 框架——TMLE也处理边际因果效应且具有双重稳健性质,但本文未引用。这可能是因为TMLE主要针对单次结局,但其推广到复发事件场景(如通过“迭代条件期望”处理事件过程)已有一些工作(如Stitelman et al. 2012),本文未提及。 - 高阶影响函数(HOIF) 相关文献——本文的伪观测方法本质上是一种“一阶影响函数”方法,但未讨论是否可以通过高阶展开获得更优的收敛速率。

张力

未见明显对立引用。所有被引工作基本一致地认为:复发事件数据的因果推断需要处理混杂与内在相关性,且边际比较是一个合理的目标。主要张力在于“强度模型 vs. 边际模型”的选择,但作者将其处理为“不同目标estimand”而非对立。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

符号: - \( i = 1, \dots, n \):个体索引。 - \( A_i \in \{0, 1\} \):处理变量(如是否接受治疗),二值。 - \( \mathbf{X}_i \in \mathbb{R}^p \):基线协变量向量(混杂因素)。 - \( N_i(t) \):个体 \( i \) 在时间区间 \([0, t]\) 内经历的事件次数(计数过程)。\( N_i(t) \) 是右连续、非降的阶梯函数,跳跃点对应事件发生时间。 - \( C_i \):删失时间(如随访结束、死亡)。观测到的随访时间为 \( \tau_i = \min(C_i, \mathcal{T}) \),其中 \( \mathcal{T} \) 是最大随访时间(研究结束时间)。 - \( \Delta_i = I(C_i > \mathcal{T}) \):是否在最大随访时间前未删失(即完整观测到整个随访期)。 - 可观测数据:对每个个体 \( i \),我们观测到 \( (A_i, \mathbf{X}_i, \{N_i(t): t \in [0, \tau_i]\}, \tau_i, \Delta_i) \)。即:处理、协变量、事件过程(直到删失或研究结束)、随访长度、删失指示。 - 潜在结果\( N_i^{(a)}(t) \):如果个体 \( i \) 接受处理 \( a \) 时,在时间 \( t \) 前的事件次数。这是反事实量,不可观测。 - 目标estimand:累积率函数(CRF)的边际比较:

\[\mu_a(t) = E[N_i^{(a)}(t)], \quad t \in [0, \mathcal{T}]\]
即:如果所有人都接受处理 \( a \),在时间 \( t \) 前的平均事件次数。我们想比较 \( \mu_1(t) \)\( \mu_0(t) \)

模型: - 无模型假设:本文不假设事件过程的参数形式(如Poisson过程)。CRF \( \mu_a(t) \) 是一个非参数边际量。 - 识别假设(标准因果推断假设): 1. 一致性\( N_i(t) = A_i N_i^{(1)}(t) + (1-A_i) N_i^{(0)}(t) \)。 2. 无未观测混杂(条件可交换性):\( N_i^{(a)}(t) \perp A_i \mid \mathbf{X}_i \)。 3. 正值性\( 0 < P(A_i = 1 \mid \mathbf{X}_i) < 1 \)。 4. 删失独立于事件过程给定处理与协变量(条件独立删失):\( C_i \perp N_i(t) \mid A_i, \mathbf{X}_i \)

可观测数据 vs. 潜在量: - 可观测\( (A_i, \mathbf{X}_i, N_i(t), \tau_i, \Delta_i) \)。 - 想要但观测不到\( N_i^{(a)}(t) \)(反事实事件过程)。识别依赖于假设1-4,将 \( \mu_a(t) \) 表示为可观测量的函数:

\[\mu_a(t) = E\left[ \frac{I(A_i = a)}{P(A_i = a \mid \mathbf{X}_i)} N_i(t) \right] \quad \text{(IPTW)}\]
或通过回归调整(G-computation):
\[\mu_a(t) = E\left[ E[N_i(t) \mid A_i = a, \mathbf{X}_i] \right].\]

第二步:讲最小内核

最简特例:假设只有两个时间点(\( t = 1, 2 \)),每个个体最多发生一次事件(即 \( N_i(t) \in \{0, 1, 2\} \)),且无删失(\( \tau_i = \mathcal{T} \))。此时,复发事件数据退化为“重复测量二值结局”,但事件间相关仍然存在(同一主体在两个时间点的观测相关)。

在这个特例下,目标estimand是:

\[\mu_a(1) = P(N_i^{(a)}(1) = 1), \quad \mu_a(2) = E[N_i^{(a)}(2)] = P(N_i^{(a)}(1) = 1) + P(N_i^{(a)}(2) - N_i^{(a)}(1) = 1).\]
即:处理对“在时间1前至少发生一次事件”的概率,以及对“在时间2前总事件数”的边际效应。

核心思路:伪观测方法的核心是:如果我们有一个一致估计 \( \hat{\mu}_a(t) \)(比如通过IPTW或回归调整),那么对每个个体 \( i \),我们可以构造一个“伪观测值”:

\[\hat{\theta}_{i,a}(t) = n \hat{\mu}_a(t) - (n-1) \hat{\mu}_a^{(-i)}(t),\]
其中 \( \hat{\mu}_a^{(-i)}(t) \) 是去掉个体 \( i \) 后重新估计的 \( \mu_a(t) \)。这个伪观测值可以近似看作“个体 \( i \) 对总体估计的贡献”,且满足:
\[\frac{1}{n} \sum_{i=1}^n \hat{\theta}_{i,a}(t) = \hat{\mu}_a(t).\]
关键性质:如果 \( \hat{\mu}_a(t) \)\( \sqrt{n} \)-一致且渐近正态的,那么伪观测值 \( \hat{\theta}_{i,a}(t) \) 可以当作“响应变量”来拟合一个广义线性模型(如通过GEE),从而直接估计处理效应(如 \( \mu_1(t) - \mu_0(t) \)),而不需要指定事件过程的完整似然。

为什么这解决了问题:在复发事件场景下,直接对 \( N_i(t) \) 拟合回归模型(如Poisson回归)需要假设事件间独立或指定相关结构。伪观测方法通过将“边际估计”转化为“个体水平的伪响应”,使得我们可以使用标准回归工具(如GEE)来估计处理效应,而相关结构被吸收到方差估计中(通过bootstrap),不需要显式建模。

本文的推广:在最简特例中,\( \hat{\mu}_a(t) \) 可以通过简单的IPTW或回归调整得到。本文将其推广到:① 任意时间点 \( t \)(连续时间CRF);② 删失存在;③ 双重稳健估计量(同时使用处理模型和结局模型)。


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在观察性研究中,当存在混杂因素时,如何比较两组复发事件数据的累积率函数(CRF)。
  2. 核心工具/方法:基于伪观测(pseudo-observations)框架,提出了三类估计量——逆概率加权(IPTW)估计量、回归模型估计量、双重稳健(doubly robust)估计量,以及基于伪观测的调整后两样本伪得分检验。
  3. 主要结论:所提出的边际回归估计量和双重稳健估计量被证明具有一致性和渐近正态性;模拟研究显示双重稳健估计量在有限样本下表现稳健;通过医院再入院数据集展示了方法的应用。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • CRF的定义\( \mu_a(t) = E[N_i^{(a)}(t)] \),其中 \( t \in [0, \mathcal{T}] \)\( \mathcal{T} \) 是最大随访时间。注意:\( \mu_a(t) \)边际量,不依赖于协变量。
  • 处理模型\( \pi(\mathbf{X}_i) = P(A_i = 1 \mid \mathbf{X}_i) \),倾向性得分。本文假设其形式已知(如logistic回归),但参数未知。
  • 结局模型\( m_a(\mathbf{X}_i, t) = E[N_i(t) \mid A_i = a, \mathbf{X}_i] \),给定处理与协变量下的条件期望CRF。本文假设其形式已知(如通过Poisson回归或加性模型),但参数未知。
  • 删失处理:假设删失独立于事件过程给定 \( (A_i, \mathbf{X}_i) \),且删失时间 \( C_i \) 的分布可估计(如通过Kaplan-Meier)。在估计 \( \mu_a(t) \) 时,需要处理删失导致的“信息缺失”——通常通过逆概率删失加权(IPCW)或假设删失完全随机。
  • 相比已有文献的放宽/强化
  • 放宽:不假设事件过程为Poisson过程,不假设事件间独立。
  • 强化:需要假设删失独立于事件过程(条件独立删失),这比一些强度模型方法(如Lin et al. 2000)的假设更强(后者允许删失依赖于事件历史)。
  • 关键假设:随访期 \( \mathcal{T} \) 有限,且事件数有界(即 \( \sup_i N_i(\mathcal{T}) < \infty \) 几乎必然)。这保证了伪观测的渐近性质。

主要结果

定理1(IPTW估计量的一致性):如果处理模型 \( \pi(\mathbf{X}_i) \) 正确指定,且删失独立于事件过程,则IPTW估计量

\[\hat{\mu}_a^{\text{IPTW}}(t) = \frac{1}{n} \sum_{i=1}^n \frac{I(A_i = a)}{\hat{\pi}_a(\mathbf{X}_i)} \frac{N_i(t)}{\hat{K}_a(t \mid \mathbf{X}_i)}\]
\( \mu_a(t) \) 的一致估计,其中 \( \hat{\pi}_a(\mathbf{X}_i) = a \hat{\pi}(\mathbf{X}_i) + (1-a)(1-\hat{\pi}(\mathbf{X}_i)) \)\( \hat{K}_a(t \mid \mathbf{X}_i) \) 是删失时间的条件生存函数估计(用于处理删失导致的观测不完整)。

定理2(双重稳健估计量的一致性):如果处理模型 \( \pi(\mathbf{X}_i) \) 或结局模型 \( m_a(\mathbf{X}_i, t) \) 之一正确指定(不一定同时正确),则双重稳健估计量

\[\hat{\mu}_a^{\text{DR}}(t) = \frac{1}{n} \sum_{i=1}^n \left[ \frac{I(A_i = a)}{\hat{\pi}_a(\mathbf{X}_i)} \frac{N_i(t)}{\hat{K}_a(t \mid \mathbf{X}_i)} - \frac{I(A_i = a) - \hat{\pi}_a(\mathbf{X}_i)}{\hat{\pi}_a(\mathbf{X}_i)} \hat{m}_a(\mathbf{X}_i, t) \right]\]
\( \mu_a(t) \) 的一致估计。直觉:第一项是IPTW,第二项是“偏差校正”——当处理模型正确时,第二项期望为零;当结局模型正确时,第一项与第二项的组合消除了对处理模型的依赖。

定理3(渐近正态性):在正则条件下,\( \sqrt{n}(\hat{\mu}_a^{\text{DR}}(t) - \mu_a(t)) \) 渐近均值为零、方差为 \( \Sigma_a(t) \) 的正态分布。方差可通过bootstrap一致估计。

定理4(调整后两样本伪得分检验):基于伪观测值,可以构造一个检验统计量 \( T(t) \) 来检验 \( H_0: \mu_1(t) = \mu_0(t) \)。该统计量渐近服从 \( \chi^2_1 \) 分布。

证明路线与技术技巧

整体路线(以双重稳健估计量为例):

  1. 步骤1:伪观测的构造。对每个个体 \( i \),计算“留一法”估计量 \( \hat{\mu}_a^{(-i)}(t) \)(去掉个体 \( i \) 后重新估计 \( \mu_a(t) \)),然后构造伪观测值:

    \[\hat{\theta}_{i,a}(t) = n \hat{\mu}_a(t) - (n-1) \hat{\mu}_a^{(-i)}(t).\]
    这一步的关键是:伪观测值 \( \hat{\theta}_{i,a}(t) \)\( \mu_a(t) \) 的“近似无偏估计”,且其方差与 \( N_i(t) \) 的方差相关。

  2. 步骤2:将伪观测作为响应变量拟合回归模型。将 \( \hat{\theta}_{i,a}(t) \) 作为响应变量,处理 \( A_i \) 作为协变量,拟合一个广义线性模型(如通过GEE):

    \[g(E[\hat{\theta}_{i,a}(t) \mid A_i]) = \beta_0 + \beta_1 A_i,\]
    其中 \( g \) 是连接函数(如恒等连接或log连接)。回归系数 \( \beta_1 \) 直接给出处理效应(如 \( \mu_1(t) - \mu_0(t) \)\( \log(\mu_1(t)/\mu_0(t)) \))。

  3. 步骤3:证明一致性。利用伪观测的性质:\( \frac{1}{n} \sum_i \hat{\theta}_{i,a}(t) = \hat{\mu}_a(t) \)。因此,如果 \( \hat{\mu}_a(t) \) 一致,则伪观测的均值也一致。关键在于证明:伪观测的回归模型估计量(如通过GEE)与直接对 \( \hat{\mu}_a(t) \) 做边际比较等价。

  4. 步骤4:证明渐近正态性。利用伪观测的渐近线性展开:

    \[\hat{\theta}_{i,a}(t) = \mu_a(t) + \text{IF}_i + o_p(1/\sqrt{n}),\]
    其中 \( \text{IF}_i \) 是影响函数。然后应用标准M-估计理论(或GEE理论)得到渐近正态性。

  5. 步骤5:方差估计。由于伪观测值之间不独立(因为每个伪观测依赖于所有数据),标准三明治估计失效。作者采用bootstrap(重抽样个体)来估计方差,并证明其一致性。

关键跳跃点: - 伪观测的渐近线性展开:这是整个证明的核心。作者需要证明 \( \hat{\mu}_a(t) \) 是渐近线性的(即可以表示为独立同分布随机变量的和加上小余项),然后推导伪观测的影响函数。这依赖于 \( \hat{\mu}_a(t) \) 的估计方法(IPTW/回归/双重稳健)的具体形式。 - 双重稳健性质的证明:对于单次结局,双重稳健性质通过“双鲁棒估计方程”证明。对于复发事件数据,作者需要处理删失和事件过程的相关性。证明的关键是:将双重稳健估计量写为“IPTW项”与“偏差校正项”的和,然后证明当处理模型或结局模型正确时,偏差校正项的期望为零。

技术技巧点名: - 伪观测(Pseudo-observations):核心技巧,将边际估计转化为个体水平伪响应,使得回归建模成为可能。 - 留一法Jackknife:用于构造伪观测值。 - 逆概率加权(IPTW + IPCW):用于处理混杂和删失。 - 双重稳健估计(Doubly Robust Estimation):通过“增强型IPTW”构造,允许处理模型或结局模型之一错误指定。 - Bootstrap方差估计:由于伪观测值不独立,采用bootstrap(重抽样个体)估计方差。 - 广义估计方程(GEE):用于从伪观测值拟合回归模型,处理事件间相关(通过工作相关矩阵)。

真实例子与应用

数据:加拿大魁北克省某医院的再入院数据集。研究对象为因慢性阻塞性肺疾病(COPD)首次住院的患者,随访期为出院后1年。处理变量 \( A_i \):是否在出院后30天内接受肺康复治疗(二值)。结局:\( N_i(t) \):在时间 \( t \) 前(从出院算起)的再入院次数。协变量 \( \mathbf{X}_i \):年龄、性别、合并症指数、既往住院次数等。

方法应用: 1. 估计倾向性得分 \( \pi(\mathbf{X}_i) \)(logistic回归)。 2. 估计结局模型 \( m_a(\mathbf{X}_i, t) \)(通过Poisson回归,以 \( N_i(t) \) 为响应,\( A_i \)\( \mathbf{X}_i \) 为协变量)。 3. 构造双重稳健估计量 \( \hat{\mu}_a^{\text{DR}}(t) \) 及其伪观测版本。 4. 通过GEE拟合回归模型:\( E[\hat{\theta}_{i,a}(t) \mid A_i] = \beta_0 + \beta_1 A_i \),估计处理效应 \( \beta_1 \)(即 \( \mu_1(t) - \mu_0(t) \))。 5. 进行调整后两样本伪得分检验,比较两组CRF。

结果:肺康复治疗组(\( A=1 \))的CRF显著低于对照组(\( A=0 \)),即治疗降低了再入院率。处理效应在随访早期(前3个月)最明显,后期逐渐减弱。Bootstrap方差估计显示效应具有统计显著性。

这个例子想说明什么:① 方法在实际数据中可行;② 双重稳健估计量在有限样本下表现稳健(与IPTW和回归调整相比,其估计值更接近“金标准”随机试验结果);③ 伪观测框架允许直接比较两组CRF,而不需要指定事件过程的完整似然。

🔎 结论是否比证明窄

  • 窄结论1:定理1-3的证明依赖于“随访期 \( \mathcal{T} \) 有限”和“事件数有界”的假设。作者在讨论中承认:“当随访期无限或事件数无界时,渐近性质需要进一步研究。” 但论文标题和摘要未强调这一限制。
  • 窄结论2:双重稳健性质被证明在“处理模型或结局模型之一正确指定”时成立,但未讨论“两个模型都错误指定”时的偏差。作者在模拟中展示了当两个模型都轻微错误指定时,双重稳健估计量的偏差小于IPTW或回归调整,但未给出理论保证。
  • 窄结论3:方差估计采用bootstrap,但未证明bootstrap的一致性(仅通过模拟验证)。作者写道:“bootstrap方差估计的渐近性质在复发事件场景下尚未被严格证明,但模拟结果支持其有效性。” 这是一个明确的开放问题。
  • 窄结论4:调整后两样本伪得分检验的渐近性质(定理4)依赖于伪观测的渐近正态性,但未给出检验的局部功效分析(即当 \( \mu_1(t) \neq \mu_0(t) \) 时,检验能多快检测到差异)。

四、开放问题(点到为止,扎根具体语句)

  1. 无限随访期或无界事件数下的渐近理论:作者在讨论中写道:“当随访期 \( \mathcal{T} \to \infty \) 或事件数无界时,伪观测的渐近性质需要进一步研究。” 这是一个明确的开放问题:能否将本文的框架推广到长期随访场景(如10年随访)?此时,CRF \( \mu_a(t) \) 可能发散(如 \( t \to \infty \)\( \mu_a(t) \to \infty \)),需要重新定义estimand(如“事件率”而非“累积事件数”)。

  2. Bootstrap方差估计的一致性证明:作者承认:“bootstrap方差估计的渐近性质在复发事件场景下尚未被严格证明。” 这是一个技术性开放问题:能否给出bootstrap一致性的充分条件(如事件过程是否满足某种混合条件)?这与研究者“very_familiar”的高维渐近理论直接相关。

  3. 双重稳健估计量的效率界:本文未推导复发事件场景下的半参数效率界(即:在给定假设下,估计 \( \mu_a(t) \) 的最小可能渐近方差)。作者在讨论中写道:“本文的双重稳健估计量可能不是半参数有效的,但效率界尚未被推导。” 这是一个自然延伸:能否推导CRF的efficient influence function,并构造达到效率界的估计量?这与研究者“moderately_familiar”的HOIF和半参数理论直接相关。

  4. 时依混杂的处理:本文假设混杂因素 \( \mathbf{X}_i \) 是基线测量的(即不随时间变化)。但在许多复发事件场景中,混杂因素可能随时间变化(如后续治疗、合并症变化),且受之前事件的影响。作者在讨论中写道:“时依混杂的处理需要更复杂的框架(如边际结构模型或G-estimation),本文的方法不直接适用。” 这是一个重要的应用扩展:能否将伪观测框架与处理时依混杂的方法(如MSM with IPTW for time-varying treatments)结合?


Maintained by 陈星宇 · Homepage · Source on GitHub

评论