Targeted maximum likelihood estimation for longitudinal two-stage designs with outcome subsampling¶
作者: Kirsten E. Landsiedel (University of California, Berkeley), Maya L. Petersen (University of California, Berkeley), Mark J. van der Laan (University of California, Berkeley)
主题: 因果推断
相关性: 7/10
链接: https://arxiv.org/abs/2607.02702
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的子方向是纵向两阶段设计(two-stage designs)中结局子抽样(outcome subsampling)下的因果参数估计。根本的统计问题是:在第一阶段收集所有参与者的协变量和部分结局信息后,第二阶段仅对选定的子集(如失访者)进行结局追踪,导致数据缺失机制复杂(右删失 + 第二阶段抽样缺失)。目标是在这种双缺失结构下,高效估计边际因果参数(如反事实生存概率)。当前成熟度:方法学上已有点治疗两阶段设计的TMLE(Rose & van der Laan 2011)和半参数有效一步估计量(Barnatchez et al. 2025),但纵向设定(含时变协变量、管理性删失)下的高效估计仍不充分,且bivariate censoring(右删失+第二阶段抽样)下闭式有效影响曲线不存在(van der Laan 1996; Quale et al. 2002)。
发展脉络(history)¶
- 奠基工作:Neyman (1938) 提出两阶段抽样;Cochran (1977) 系统化抽样技术;Robins et al. (1994) 建立缺失数据框架下的逆概率加权估计方程;van der Laan & Robins (2003) 给出一般缺失/删失数据结构的统一方法。
- 主要进展:Rose & van der Laan (2011) 提出点治疗两阶段设计的IPCW-TMLE,但未实现targeting抽样权重的步骤(作者原文:“this step was not implemented in their simulations or in the accompanying
twoStageDesignTMLER package”)。Barnatchez et al. (2025) 提出两阶段抽样下ATE的半参数有效一步估计量,并给出两种渐近等价构造(本文IPCW-LTMLE与其Approach 2精神相似)。Qiu et al. (2026) 提出新的TMLE类,但依赖“stage-two information is structurally independent of stage-one data beyond the sampling weights”的假设,该假设在纵向重抽样设定中被违反(因为τ直接影响第二阶段数据量)。 - 当前frontier:纵向重抽样设计(如HIV死亡率研究)中,加权Kaplan-Meier(wKM)是主流(Geng et al. 2012, 2015; Holmes et al. 2018; Yiannoutsos et al. 2008),但丢弃了丰富的纵向协变量历史。Bakoyannis et al. (2020) 提出sieve IPW估计量但针对条件回归参数而非边际生存函数。Levis et al. (2022) 推导了双抽样下ATE的有效影响曲线和一步估计量,但限于点治疗。Frangakis et al. (2015) 和Qian et al. (2020) 提出基于数值Gateaux导数的演绎方法,但牺牲了分析可处理性。
- 本文位置:作者将重抽样设计形式化为“两阶段设计+结局子抽样”的一个实例(作者声称“to our knowledge, the connection between resampling designs and the broader class of two-stage designs with outcome subsampling has not previously been carefully formalized”),并在此基础上提出两种新估计量:IPCW-LTMLE(纵向扩展Rose & van der Laan)和LTMLE(将Δ作为干预节点,完全避免逆加权)。同时开发交叉拟合方差估计以解决数据自适应方法导致的覆盖不足。
子线索聚类¶
- 两阶段设计的方法论:Rose & van der Laan (2011), Qiu et al. (2026), Barnatchez et al. (2025), Williamson et al. (2026), Tao et al. (2020)。这一簇关注点治疗或横截面设定下的高效估计,通常假设第二阶段抽样独立于第一阶段数据(给定权重)或可推导闭式有效影响曲线。
- 重抽样设计的应用与估计:Geng et al. (2012, 2013, 2015), Holmes et al. (2018), Yiannoutsos et al. (2008), An et al. (2009, 2015), Bakoyannis et al. (2020)。这一簇以HIV死亡率研究为背景,主要使用加权Kaplan-Meier或IPW方法,较少利用纵向协变量。
- bivariate censoring理论:van der Laan (1996), Quale et al. (2002), van der Laan & Robins (2003)。这一簇指出当存在两种删失机制(如右删失τ和第二阶段抽样Δ)时,闭式有效估计量一般不存在,且基于SRA(序贯可忽略性)的估计量在CAR(随机删失)模型下不是有效的。
这个方向在追问的核心问题¶
- Q1:如何利用纵向协变量历史提高效率,超越简单逆加权估计量?
- Q2:在bivariate censoring下,能否构造闭式估计量达到或接近半参数效率界?
- Q3:当使用数据自适应方法估计 nuisance 参数时,如何获得可靠的方差估计和置信区间?
- Q4:如何将两阶段设计的方法推广到纵向设定(含时变治疗、竞争风险等)?
当前主流方法(wKM)的瓶颈:丢弃Δ=0参与者的所有信息,忽略协变量历史,效率损失严重。已知bivariate censoring下无闭式有效估计量,因此现有方法要么是IPW(效率低),要么依赖强假设(如Qiu et al.的结构独立性)。
⚠️ 作者的framing¶
- 作者把缺口frame成:重抽样设计是两阶段设计(结局子抽样)的一个实例,这一形式化此前未被仔细建立。因此,可以借用两阶段设计文献中的IPCW-TMLE框架,并进一步提出避免逆加权的LTMLE。作者强调“establishing it allows us to draw on the two-stage design literature to motivate and construct more efficient estimators”。
- 被淡化或回避的竞争路线:Qiu et al. (2026) 的TMLE类被指出依赖结构独立性假设,在纵向重抽样中不成立,因此本文的方法更一般。但作者没有详细比较与Qian et al. (2020) 演绎方法的效率差异。此外,作者承认bivariate censoring下无法达到完全有效,但未量化与效率界的差距。
- 什么明显该被引/该存在、却没出现在intro里:未见明显缺失。但可注意:本文引用了Barnatchez et al. (2025) 的预印本(arXiv:2506.21777),该工作与本文几乎同期,说明领域活跃。另外,关于纵向两阶段设计的其他工作(如Sun et al. 2025 处理缺失结局的双抽样)被引用,但未深入比较。
张力¶
未见明显对立引用。所有被引工作基本一致认为:逆加权效率低,利用协变量可提高效率;bivariate censoring下无闭式有效估计量。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
符号: - \( T \):死亡时间(潜在)。 - \( \tau \):管理性删失时间(如研究结束或离开诊所),可随个体变化。 - \( W \):基线协变量向量。 - \( L(t) \):时变协变量在时间 \( t \) 的值(如CD4计数、就诊指示)。 - \( \bar{L}(\tau) = (L(1), \dots, L(\tau)) \):时变协变量历史至 \( \tau \)。 - \( Y(t) = I(T > t) \):生存指示(1=存活至 \( t \))。 - \( \bar{Y}(\tau) = (Y(1), \dots, Y(\tau)) \):生存过程历史至 \( \tau \)。 - \( \Delta \in \{0,1\} \):第二阶段结局观测指示。\( \Delta = 1 \) 表示结局已知(通过临床记录或重抽样),\( \Delta = 0 \) 表示结局未知。 - \( R \):重抽样指示(仅对失访者随机选择)。 - \( t_0 \):目标时间点(\( t_0 \leq K \)),估计 \( P(T > t_0) \)。 - \( \Psi(t_0) = E[Y(t_0) \mid \text{干预防止删失至 } t_0, \Delta=1] \):反事实生存概率。
模型: - 全数据 \( X = (W, \tau, \bar{L}(\tau), \bar{Y}(\tau)) \) 是一个右删失纵向生存数据结构。删失由 \( \tau \) 引起:当 \( t > \tau \) 时,\( Y(t) \) 未观测。 - 观测数据 \( O = (V, \Delta, \Delta \bar{Y}(\tau)) \),其中 \( V = (W, \tau, \bar{L}(\tau)) \) 是第一阶段数据(对所有参与者观测)。 - 缺失机制:\( \Delta \) 由设计决定(重抽样概率已知或可估计),且 \( \Delta \) 可能依赖于 \( V \)(例如,已知存活或死亡者 \( \Delta=1 \) 是确定性的)。假设 \( Y(t_0) \perp \Delta \mid V \)(由设计保证)以及序贯可忽略性(SRA)用于删失 \( \tau \)。 - 目标参数通过g-computation公式识别:
可观测数据: - 所有参与者:\( W, \tau, \bar{L}(\tau) \)。 - 仅当 \( \Delta=1 \) 时:\( \bar{Y}(\tau) \)(即 \( Y(1), \dots, Y(\tau) \))。 - 不可观测:\( \Delta=0 \) 的参与者的 \( \bar{Y}(\tau) \);以及所有参与者在 \( t > \tau \) 的 \( Y(t) \)(但目标 \( t_0 \leq \tau \) 时,\( Y(t_0) \) 可能被 \( \tau \) 删失)。
第二步:最小内核¶
考虑最简特例:点治疗横截面设定(无纵向,无时变协变量,无删失 \( \tau \))。此时: - 全数据 \( X = (W, Y) \),其中 \( Y \) 是二值结局(如存活)。 - 第一阶段观测 \( V = W \)。 - 第二阶段抽样指示 \( \Delta \in \{0,1\} \),已知抽样概率 \( \pi(W) = P(\Delta=1 \mid W) \)(由设计已知或可估计)。 - 观测数据 \( O = (W, \Delta, \Delta Y) \)。 - 目标参数 \( \Psi = E[Y] \)(边际均值)。
最小内核问题:如何利用所有参与者的 \( W \) 信息(包括 \( \Delta=0 \) 的)来更高效地估计 \( \Psi \),而不是仅用 \( \Delta=1 \) 的子样本做逆加权?
核心思路: 1. IPCW-TMLE(Rose & van der Laan 2011):在 \( \Delta=1 \) 的子样本上运行TMLE(估计 \( E[Y \mid W] \)),每个观测权重为 \( 1/\pi(W) \)。即使 \( \pi \) 已知,估计 \( \pi \) 可以降低方差,因为估计利用了所有 \( W \) 信息(包括 \( \Delta=0 \) 的)来更精确地估计 \( \pi \)。进一步,targeting \( \pi \) 可以强制影响曲线均值为零,获得额外效率增益。 2. 避免逆加权的LTMLE(本文核心创新):将 \( \Delta \) 视为一个干预节点。定义反事实 \( Y^{\Delta=1} \)(即如果所有人都被观测到结局时的 \( Y \))。识别公式为 \( \Psi = E[ E[Y \mid W, \Delta=1] ] \)。这可以通过两步实现:① 在 \( \Delta=1 \) 的子样本上回归 \( Y \) 对 \( W \);② 对所有参与者(包括 \( \Delta=0 \))用该回归预测,然后取平均。这完全避免了逆加权,且利用了所有 \( W \) 信息。在纵向设定中,类似地,将 \( \Delta \) 作为最后一个干预节点纳入序贯回归。
为什么这个最小内核抓住了论文本质:论文的纵向LTMLE正是这个思路的推广——将 \( \Delta \) 作为干预节点,与删失 \( \tau \) 一起处理,通过序贯回归实现plug-in估计。IPCW-LTMLE则是逆加权版本的纵向推广。模拟显示,避免逆加权的LTMLE方差最低。
三、这篇论文做了什么¶
三句话¶
- 研究问题:在纵向两阶段设计(结局子抽样)中,如何高效估计因果生存参数(如反事实生存概率),以HIV死亡率重抽样设计为动机。
- 核心工具:① IPCW-LTMLE:将Rose & van der Laan (2011) 的点治疗IPCW-TMLE扩展到纵向,并实现targeting已知抽样权重以降低方差;② LTMLE:将第二阶段抽样指示 \( \Delta \) 作为干预节点纳入序贯回归,完全避免逆概率加权,实现plug-in估计。
- 主要结论:模拟显示LTMLE相比加权Kaplan-Meier方差降低可达73%(常见设置30-50%),IPCW-LTMLE稳定降低20-35%;交叉拟合方差估计对有效推断至关重要(非交叉拟合覆盖低至76%,交叉拟合恢复名义水平)。
关键设定与假设¶
- 全数据:\( X = (W, \tau, \bar{L}(\tau), \bar{Y}(\tau)) \),右删失纵向生存数据。
- 观测数据:\( O = (V, \Delta, \Delta \bar{Y}(\tau)) \),其中 \( V = (W, \tau, \bar{L}(\tau)) \)。
- 识别假设:
- 序贯可忽略性(SRA)用于删失机制:\( Y(t_0) \perp C(t) \mid \bar{Y}(t-1), \bar{L}(t-1), \bar{C}(t-1)=1 \)(作者承认SRA比CAR更强,但便于估计)。
- \( \Delta \) 的随机化:\( Y(t_0) \perp \Delta \mid V \)(由设计保证,可依赖于 \( V \))。
- 正性:\( P(\Delta=1 \mid V) > 0 \) a.s.,且删失概率有界。
- 相比已有文献的放宽/强化:
- 放宽了Qiu et al. (2026) 的结构独立性假设(该假设要求第二阶段信息独立于第一阶段数据,在纵向重抽样中因 \( \tau \) 直接决定数据量而被违反)。
- 但强化了SRA假设(相比CAR),因此IPCW-LTMLE在bivariate censoring下不是半参数有效的(作者明确承认)。
- 特殊处理:确定性信息(已知存活或死亡)被排除出回归拟合,但保留在预测中,以稳定估计。
主要结果¶
- 模拟设计:纵向数据 \( t=1,\dots,10 \),样本量 \( N \in \{500,1000,3000\} \),基线协变量 \( W_1,W_2,W_3 \),时变CD4,死亡报告概率0.2,重抽样概率0.2。目标 \( \Psi(t_0) = P(T > t_0) \)。
- 效率比较(以 \( N=1000, t=1 \) 为例):
- LTMLE方差 \( 5.0 \times 10^{-5} \),wKM(已知权重)方差 \( 9.9 \times 10^{-5} \)(降低49%)。
- IPCW-LTMLE(targeted)方差 \( 6.8 \times 10^{-5} \),wKM(已知权重)方差 \( 9.9 \times 10^{-5} \)(降低31%)。
- 加权KM(估计权重)方差 \( 9.8 \times 10^{-5} \),接近已知权重。
- IPCW-LTMLE中权重估计的影响(图1,\( N=1000 \)):已知权重方差约 \( 1.0 \times 10^{-4} \)(t=1),估计权重方差约 \( 9.9 \times 10^{-5} \),targeted权重方差约 \( 6.8 \times 10^{-5} \)(降低36%)。
- 覆盖性能:
- 非交叉拟合方差估计:IPCW-LTMLE覆盖低至76.2%(\( N=500, t=1 \)),LTMLE低至86.8%(\( N=500, t=10 \))。
- 交叉拟合方差估计:所有TMLE方法覆盖恢复至92-97%(接近名义95%)。
- 在 \( N=500, t=1 \) 时,LTMLE的oracle覆盖(用模拟方差)低于名义(约90%),表明点估计本身有偏;但交叉拟合方差估计偏保守,导致实际覆盖约98%。
- 总体层次:LTMLE方差最低,Hazard TMLE次之,IPCW-LTMLE第三,wKM最差。但wKM(估计权重)在后期时间点(t=10)有时超过TMLE,因为避免了稀疏结局回归。
证明路线与技术技巧¶
本文没有提供渐近理论证明(如一致性、渐近正态性、效率界),而是完全依赖模拟验证。因此“证明路线”实为方法构造和模拟设计。
整体路线(方法构造): 1. IPCW-LTMLE: - 在 \( \Delta=1 \) 的子样本上运行标准LTMLE(处理删失 \( \tau \)),权重为 \( \Delta / \hat{\Pi}_\Delta \)。 - 初始估计 \( \hat{\Pi}_\Delta \)(用Super Learner)。 - 估计全数据影响曲线 \( \hat{D}^F \)。 - 估计投影 \( E[\hat{D}^F \mid V, \Delta=1] \)。 - 构造clever covariate \( H = \hat{E}[\hat{D}^F \mid V, \Delta=1] / \hat{\Pi}_\Delta \)。 - 用逻辑回归更新 \( \hat{\Pi}_\Delta \)(offset logit(\( \hat{\Pi}_\Delta \)) + \( \epsilon H \)),使影响曲线均值为零。 - 迭代至收敛。 2. LTMLE(避免逆加权): - 将观测数据写为纵向形式,\( \Delta \) 作为最后一个干预节点(在 \( Y(t_0) \) 之前)。 - 移除中间 \( Y(t) \) 节点,只保留终端 \( Y(t_0) \)。 - 从 \( t=K \) 向后序贯回归:在每一步,在遵循干预(\( \bar{C}(t)=1, \Delta=1 \))且非确定性的子样本上回归当前伪结局对历史,然后对所有参与者预测。 - 处理确定性信息:已知存活者 \( Y=1 \),已知死者 \( Y=0 \),不参与回归但保留预测。 - 最终估计为基线回归预测的均值。 3. 交叉拟合方差估计: - 保留全数据点估计,仅对方差估计进行样本分割。 - 对每折,在训练集上拟合序贯回归(不targeting),在验证集上计算影响曲线贡献。 - 对IPCW-LTMLE,还需交叉拟合投影项。 - 当数据稀疏时回退到GLM。
关键跳跃点: - 将 \( \Delta \) 作为干预节点需要重新定义数据顺序,移除中间 \( Y(t) \) 节点,这改变了标准LTMLE的节点结构。作者论证了这是合理的,因为结局确定发生在第二阶段之后。 - 处理确定性信息:标准LTMLE软件无法自动处理,作者编写了自定义代码,允许时变Super Learner库,并在稀疏时回退到非交叉验证的lasso。 - 交叉拟合方差估计的设计:点估计用全数据(避免小样本不稳定),方差估计用交叉拟合(纠正过拟合导致的低估)。作者强调这是“hybrid approach”。
技术技巧点名: - Super Learner:用于估计所有nuisance参数(序贯回归、抽样概率、投影项)。 - Targeting:通过clever covariate和逻辑回归更新抽样概率,使影响曲线方程成立。 - Cross-fitting:用于方差估计,避免Donsker类条件。 - Fallback策略:当Super Learner在稀疏数据中失败时,回退到GLM或非交叉验证lasso。
真实例子与应用¶
本文没有使用真实数据,所有结果来自模拟。模拟数据生成过程(DGP)模拟了HIV死亡率研究:10个时间点,基线协变量(3个二值),时变CD4(自回归+噪声),死亡概率依赖基线、就诊史和CD4,死亡报告概率0.2,管理性删失时间 \( \tau \in \{5,7,9,10\} \),重抽样概率0.2。该DGP旨在复现真实研究的特征(高失访率、确定性信息、稀疏事件)。模拟结果用于验证方法相对于wKM的效率增益和交叉拟合方差估计的必要性。
🔎 结论是否比证明窄¶
- 作者声称“highly efficient closed-form alternatives”,但没有证明达到任何效率界。他们明确承认bivariate censoring下闭式有效估计量不存在(引用van der Laan 1996; Quale et al. 2002),因此“highly efficient”是基于模拟比较,而非理论保证。
- 作者在Discussion中写道:“fully efficient closed-form estimators do not exist in general... The estimators proposed in this paper are therefore best understood as highly efficient closed-form alternatives”。这是诚实的限定。
- 模拟中LTMLE在 \( N=500, t=1 \) 时oracle覆盖低于名义,表明点估计本身有偏(可能由于稀疏性和确定性信息),但作者未深入分析该偏差来源。
- 交叉拟合方差估计的渐近性质未证明,仅通过模拟展示覆盖恢复。
四、开放问题¶
-
完全有效估计量的构造:在bivariate censoring下,能否构造达到半参数效率界的闭式估计量?作者提到“future work might include attempting to construct a fully efficient estimator in this setting – if for no other reason than to assess how much efficiency is lost by using such closed-form estimators”(Discussion)。扎根于论文第28页:“fully efficient closed-form estimators do not exist in general”。
-
第二阶段数据收集失败的处理:当选定重抽样但实际未能获取结局时(如参与者拒绝),如何处理?作者明确说“we did not address how to proceed with estimation when second-stage data collection is attempted but fails for a given subset of participants; we leave this important consideration for future work”(Discussion)。
-
时变治疗的扩展:本文仅考虑删失和抽样,未包含时变治疗。作者说“extension to settings with time-varying treatment is the subject of ongoing work”(Section 2.1)。扎根于第5页:“While the framework can additionally handle treatments \( A(t) \), we restrict attention here to censoring and sampling mechanisms”。
-
交叉拟合方差估计在稀疏数据下的理论性质:当回退到GLM时,交叉拟合方差估计是否仍保持一致性?作者仅通过模拟验证,未提供理论分析。可进一步研究在稀疏确定性信息下的渐近行为。
(注意:以上开放问题均扎根于论文具体语句,不替研究者判断可行性。)
Maintained by 陈星宇 · Homepage · Source on GitHub