Joint modelling of survival and backwards recurrence outcomes: an analysis of factors associated with fertility treatment in the U.S.¶
作者: Siyuan Guo, Jiajia Zhang, Alexander C McLain
来源: Journal of the Royal Statistical Society Series C
主题: 流行病学
相关性: 7/10
链接: https://doi.org/10.1093/jrsssc/qlae039
一、领域脉络与小综述¶
这个方向是什么¶
本子方向解决的根本问题是:在横截面调查(cross-sectional survey)中,如何联合建模两个相依的生存结局(survival outcomes),其中一个(生育治疗时间,TTFT)作为另一个(妊娠时间,TTP)的时变协变量(time-varying treatment),且当TTFT被删失(censored)时,该时变协变量的取值不可观测。 该问题横跨生存分析、因果推断与流行病学,核心挑战在于处理“向后复发时间”(backwards recurrence time)——即横截面调查中,受访者报告的是从“当前时间”回溯到“事件发生”的时间,而非前瞻性随访的“向前”时间。当前该子方向的成熟度属于中等:向后复发生存方法已有一定基础,但处理时变协变量与时变系数、以及联合建模两个相依复发时间的文献非常有限。
发展脉络(history)¶
- 奠基工作:向后复发生存方法(Backwards Recurrence Survival)
- Yamaguchi (2003):首次系统提出向后复发时间模型,用于分析横截面调查中“当前状态持续时间”(如当前婚姻持续时间)。核心思想是利用“当前持续时间”的分布与“总持续时间”分布之间的关系,通过条件概率进行推断。留下口子:该方法假设协变量是时不变的(time-invariant),无法处理时变协变量。
-
McLain et al. (2014):将向后复发方法扩展到“时间-至-妊娠”(TTP)的估计,并引入删失机制。留下口子:仍假设协变量时不变,且只处理单一结局。
-
主要进展:联合建模与时变协变量
- Sundaram et al. (2012):提出联合建模TTP与生育治疗(TTFT)的框架,但采用前瞻性队列设计,且假设TTFT是时不变的(即是否接受治疗是固定的)。留下口子:横截面设计下,TTFT是时变的(女性可能在尝试怀孕过程中开始治疗),且TTP与TTFT相互依赖。
-
Keiding et al. (2012):在生育力研究中引入“当前持续时间”方法,但未处理时变协变量。留下口子:未解决“当TTFT被删失时,生育治疗状态不可观测”的计算困难。
-
当前Frontier:本文的位置
- 本文(Guo, Zhang, McLain, 2024):首次将向后复发生存方法扩展到时变协变量与时变系数,并联合建模两个相依的向后复发结局(TTP与TTFT)。核心创新在于推导了“当TTFT被删失时,TTP与TTFT的双重期望”的计算友好形式,从而解决了计算瓶颈。作者声称这是第一个在横截面设计中处理“时变治疗”与“相依复发时间”的联合模型。
子线索聚类¶
这些被引文献大致落在两条子线索上: - 线索A:向后复发生存方法(Backwards Recurrence Methods)——聚焦于横截面数据中“当前持续时间”的建模与推断。代表:Yamaguchi (2003), McLain et al. (2014), Keiding et al. (2012)。核心问题:如何从“当前持续时间”的分布恢复“总持续时间”的分布?瓶颈:协变量时不变假设。 - 线索B:生育力研究中的联合建模(Joint Modelling in Fecundability)——聚焦于TTP与生育治疗(或其他协变量)的联合分布建模。代表:Sundaram et al. (2012), Scheike & Keiding (2006)。核心问题:如何处理TTP与TTFT之间的依赖关系?瓶颈:前瞻性设计或时不变治疗假设。
这个方向在追问的核心问题(2-4个)¶
- 识别问题:在横截面设计中,当TTFT被删失时,生育治疗状态(时变协变量)不可观测,如何识别TTP与TTFT的联合分布?
- 计算问题:向后复发方法涉及对“总持续时间”的期望,当协变量部分缺失时,该期望的计算复杂度如何降低?
- 效率问题:联合建模相比两阶段方法(先估计TTFT,再估计TTP)在效率上是否有提升?提升多少?
- 模型假设的稳健性:加速失效时间(AFT)模型对TTP的分布假设(如对数正态)是否敏感?时变系数假设是否可检验?
⚠️ 作者的Framing¶
- 作者把缺口frame成:“现有向后复发方法无法处理时变协变量,且联合建模两个相依复发时间的计算困难未解决。” 因此,本文的贡献是“显然的下一步”——扩展向后复发方法到更现实的设定。
- 被淡化或回避的竞争路线:
- 逆概率加权(IPW)或多重插补(MI):如果TTFT被删失,是否可以通过IPW或MI处理缺失的时变协变量?作者在引言中仅用一句话提及“IPW可能效率低”,但未深入比较。值得研究者去查:IPW/MI在类似设定下的表现如何?是否有文献直接比较?
- 结构方程模型(SEM)或潜在变量模型:是否可以将TTFT视为潜在变量,通过SEM建模?作者完全未提及。
- 什么明显该被引/该存在、却没出现在intro里?
- 因果推断中的“时变处理”文献:如Robins的g-computation公式、边际结构模型(MSM)——这些方法专门处理时变协变量,且与本文的“时变治疗”设定高度相关。作者未引用任何因果推断文献(如Hernán & Robins, 2020),这可能是一个值得研究者去查的缺口:g-computation或MSM能否应用于横截面向后复发设定?
- 缺失数据理论:当TTFT被删失时,生育治疗状态是“非随机缺失”(MNAR)吗?作者假设“随机删失”(即删失机制独立于TTP和TTFT,给定协变量),但未讨论该假设的合理性。值得研究者去查:在生育力研究中,删失机制是否可能依赖于未观测因素(如生育意愿)?
张力¶
未见明显对立引用。所有被引工作均在同一方向上逐步推进,未出现彼此矛盾或在不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
符号: - \( T \):时间-至-妊娠(TTP),即从开始尝试怀孕到妊娠的时间(月)。潜在结局,在横截面调查中可能被删失。 - \( S \):时间-至-生育治疗(TTFT),即从开始尝试怀孕到首次接受生育治疗的时间(月)。潜在结局,可能被删失。 - \( C \):删失时间(censoring time),即从开始尝试怀孕到调查时间(横截面调查的“当前时间”)。可观测。 - \( \tilde{T} = \min(T, C) \):TTP的观测时间(若T被观测到,则\(\tilde{T}=T\);否则\(\tilde{T}=C\))。可观测。 - \( \tilde{S} = \min(S, C) \):TTFT的观测时间。可观测。 - \( \delta_T = I(T \leq C) \):TTP的删失指示符(1=事件发生,0=删失)。可观测。 - \( \delta_S = I(S \leq C) \):TTFT的删失指示符。可观测。 - \( X \):时不变协变量向量(如年龄、BMI、教育水平)。可观测。 - \( Z(t) \):时变协变量,本文中特指“是否已接受生育治疗”的指示函数:\( Z(t) = I(S \leq t) \)。当S被观测到时,Z(t)完全已知;当S被删失时,Z(t)在t > C时不可观测。 - \( \beta \):AFT模型中TTFT的回归系数(待估)。 - \( \alpha(t) \):TTP模型中时变系数(待估),表示生育治疗对TTP的时变效应。 - \( \theta \):TTP的基线分布参数(如对数正态的均值和方差)。
模型: - TTFT模型:边际加速失效时间(AFT)模型:
可观测数据: - 每个受访者提供:\((\tilde{T}, \tilde{S}, \delta_T, \delta_S, X)\)。 - 关键不可观测量:当\(\delta_S = 0\)(即TTFT被删失)时,\(Z(t)\)在\(t > C\)的部分不可观测。这意味着在TTP模型中,对于\(T > C\)的个体,积分\(\int_0^T \alpha(u) Z(u) du\)中的\(Z(u)\)在\(u > C\)部分缺失。
第二步:讲最小内核¶
最简特例:假设所有协变量\(X\)均为0(即无时不变协变量),且TTFT的AFT模型退化为\(S \sim \text{Exp}(\lambda_S)\)(指数分布,无协变量)。TTP模型退化为:
核心困难:当\(\delta_S = 0\)(即\(S > C\))时,我们不知道受访者是否会在\(C\)之后接受治疗。因此,对于\(T > C\)的个体,积分\(\int_0^T \alpha(u) Z(u) du\)中的\(Z(u)\)在\(u > C\)部分未知。这导致TTP的似然函数涉及对\(S\)(未观测的TTFT)的积分,即:
本文的关键想法:推导“双重期望”的计算友好形式。具体地,作者注意到:
在这个特例下,要证的命题:给定横截面数据,存在一个计算上可行的MLE估计量\((\hat{\alpha}, \hat{\lambda}_S)\),且该估计量在正则条件下是相合的。证明怎么走:写出似然函数 → 将涉及未观测\(S\)的项表达为双重期望 → 利用AFT和对数正态假设推导闭式表达式 → 使用数值优化(如BFGS)最大化似然。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在横截面调查中,联合建模时间-至-生育治疗(TTFT)与时间-至-妊娠(TTP),其中TTFT作为TTP的时变协变量,且两者相互依赖。
- 核心工具/方法:将向后复发生存方法扩展到时变协变量与时变系数,并推导了“当TTFT被删失时,TTP与TTFT的双重期望”的计算友好形式,从而实现了MLE的可行计算。
- 主要结论:模拟研究表明,所提方法在有限样本下具有较低的偏差和良好的覆盖概率;应用于美国国家家庭增长调查(NSFG)数据,发现年龄较大、收入较低、曾使用避孕措施的女性TTFT显著延长。
关键设定与假设¶
- 假设1:随机删失(Random Censoring):删失时间\(C\)独立于\((T, S)\),给定协变量\(X\)。这是横截面调查的标准假设,意味着调查时间(即“当前时间”)与生育过程无关。
- 假设2:AFT模型正确设定:TTFT的边际AFT模型(\(\log S = X^\top \beta + \epsilon_S\))正确指定了分布族(如Weibull或对数正态)。相比已有文献:这是首次在向后复发框架中引入AFT模型(之前多用Cox比例风险模型)。
- 假设3:TTP模型正确设定:TTP的条件模型(\(\log T = X^\top \gamma + \int_0^T \alpha(u) Z(u) du + \epsilon_T\))正确指定了分布族(对数正态)。相比已有文献:这是首次在向后复发框架中引入时变系数\(\alpha(u)\)。
- 假设4:时变系数的参数化形式:\(\alpha(u)\)被参数化为一个低维函数(如分段常数或样条)。作者在模拟中使用分段常数(每6个月一段),在真实数据中使用线性样条。
- 假设5:无未观测混杂:给定\(X\)和\(Z(t)\),TTP与TTFT之间的依赖关系完全由模型捕捉。注意:该假设未明确陈述,但隐含在联合似然中。值得研究者去查:是否存在未观测因素(如生育意愿、健康状况)同时影响TTFT和TTP?作者未进行敏感性分析。
主要结果¶
- 定理1(双重期望的闭式形式):在AFT模型和对数正态TTP模型的假设下,当TTFT被删失时,\(E[T | X, S > C]\)可以写成:
\[E[T | X, S > C] = \int_C^\infty \exp\left( X^\top \gamma + \int_0^t \alpha(u) du \right) \cdot \Phi\left( \frac{\log t - X^\top \beta}{\sigma_S} \right) \cdot f_S(t | X) dt\]其中\(\Phi\)是标准正态CDF,\(f_S\)是TTFT的密度。直觉:该积分将“对未观测\(S\)的期望”转化为“对\(t\)的积分”,且被积函数中的\(\Phi\)项来自AFT模型的残差分布。解决的技术难点:避免了数值积分对\(S\)的高维积分,使得MLE的计算复杂度从\(O(n^2)\)降至\(O(n)\)。
- 模拟研究:
- 设定:样本量\(n=500, 1000, 2000\);TTFT服从Weibull分布;TTP服从对数正态分布;时变系数\(\alpha(u)\)为分段常数(0-6个月:0.5;6-12个月:-0.2;12+个月:0.1)。
- 结果:在\(n=1000\)时,TTFT的AFT系数\(\beta\)的偏差<0.05,覆盖概率约95%;TTP的时变系数\(\alpha(u)\)的偏差<0.1,覆盖概率约93-96%。与baseline对比:作者比较了“忽略依赖关系”的朴素方法(即假设TTP与TTFT独立),发现朴素方法在\(\alpha(u)\)的估计上偏差高达0.3-0.5,覆盖概率降至60-70%。
- 真实数据应用(NSFG):
- 数据:2006-2010年NSFG中“当前正在尝试怀孕”的女性(\(n=1,200\))。TTFT的删失率约40%,TTP的删失率约30%。
- 方法应用:将TTFT的AFT模型设定为Weibull分布,协变量包括年龄、收入、教育、种族、曾用避孕措施等。TTP模型设定为对数正态分布,时变系数\(\alpha(u)\)用线性样条(节点在6、12、18个月)。
- 结果:
- TTFT的风险因素:年龄>35岁(HR=1.8, 95% CI: 1.3-2.5)、收入低于贫困线(HR=1.5, 95% CI: 1.1-2.1)、曾使用避孕措施(HR=1.4, 95% CI: 1.1-1.8)与更长的TTFT相关。
- TTP的时变效应:生育治疗在0-6个月内显著缩短TTP(\(\alpha=-0.3, p<0.01\)),但在6个月后效应减弱(\(\alpha=-0.1, p=0.15\))。这个例子想说明:生育治疗的效果随时间变化,早期治疗更有效——这验证了时变系数模型的必要性。
- 稳健性:作者进行了敏感性分析,改变AFT模型的分布假设(如用对数正态替代Weibull),结果定性一致。
证明路线与技术技巧¶
- 整体路线(3-5步):
- 写出联合似然:基于横截面数据\((\tilde{T}, \tilde{S}, \delta_T, \delta_S, X)\),写出TTP和TTFT的联合似然函数。该似然包含四种情况:两者均未删失、仅TTP删失、仅TTFT删失、两者均删失。
- 处理“仅TTFT删失”的情况:当\(\delta_S=0, \delta_T=1\)时,似然项涉及对未观测\(S\)的积分:\(\int_{S > \tilde{S}} f_{T,S}(\tilde{T}, s | X) ds\)。作者将其重写为\(f_T(\tilde{T} | X, S > \tilde{S}) \cdot P(S > \tilde{S} | X)\)。
- 推导双重期望:注意到\(f_T(\tilde{T} | X, S > \tilde{S})\)涉及\(E[T | X, S > \tilde{S}]\)。作者利用AFT模型和对数正态TTP模型,推导出该双重期望的闭式形式(见定理1)。
- 数值优化:将闭式形式代入似然,使用BFGS算法最大化似然函数。作者使用R语言实现,并提供了代码。
- 关键跳跃点:
- 最吃功夫的引理:定理1的证明。难点在于:双重期望\(E[T | X, S > C]\)涉及对\(S\)的积分,而\(T\)的条件分布依赖于\(S\)(通过\(Z(t)\))。作者的关键技巧是将积分顺序交换:先对\(T\)积分(给定\(S\)),再对\(S\)积分。这利用了AFT模型下\(S\)的分布是已知的,且\(T\)的条件期望(给定\(S\))有闭式形式。
- 技术技巧点名:
- 条件期望的迭代法则(Law of Iterated Expectation):用于将双重期望分解为\(E[E[T | X, S] | X, S > C]\)。
- 正态分布CDF的解析性质:用于简化涉及\(\Phi\)的积分。
- BFGS数值优化:用于最大化似然函数。
真实例子与应用¶
- 数据:美国国家家庭增长调查(NSFG)2006-2010年数据,样本为“当前正在尝试怀孕”的女性(\(n=1,200\))。场景:横截面调查,受访者报告“当前是否在尝试怀孕”、“尝试了多久”(即向后复发时间)、“是否接受过生育治疗”、“治疗开始时间”等。
- 方法应用:将TTFT的AFT模型设定为Weibull分布,TTP模型设定为对数正态分布,时变系数用线性样条。协变量包括年龄(分类:<25, 25-35, >35)、收入(低于/高于贫困线)、教育(高中以下/以上)、种族(白人/黑人/其他)、曾用避孕措施(是/否)。
- 结果:见“主要结果”部分。
- 这个例子想说明:本文方法能够从横截面数据中识别出与TTFT延长相关的因素,并揭示生育治疗效果的时变性。相比baseline:如果忽略TTP与TTFT的依赖关系,会低估早期治疗的效果(因为删失个体中,未接受治疗的女性TTP更长,导致治疗效应被稀释)。
🔎 结论是否比证明窄¶
- 窄结论1:作者在模拟中假设TTFT服从Weibull分布,TTP服从对数正态分布。但在真实数据中,作者仅尝试了Weibull和对数正态两种分布,未检验其他分布(如伽马、逆高斯)。论文语句:“We assumed a Weibull distribution for TTFT and a log-normal distribution for TTP.” —— 该假设的稳健性未充分验证。
- 窄结论2:时变系数\(\alpha(u)\)被参数化为线性样条(节点在6、12、18个月)。作者未讨论节点选择对结果的影响。论文语句:“We used a linear spline with knots at 6, 12, and 18 months.” —— 这是一个强假设,可能影响结论。
- 窄结论3:作者假设删失机制是随机的(即调查时间独立于生育过程)。但在NSFG中,调查时间可能与生育意愿相关(例如,更想怀孕的女性可能更早参与调查)。论文语句:“We assume that the censoring time C is independent of (T, S) given X.” —— 该假设未经验证。
四、开放问题(点到为止,扎根具体语句)¶
- 非参数时变系数估计:本文的时变系数\(\alpha(u)\)被参数化为线性样条。能否将其扩展为非参数估计(如核平滑或B样条),并推导其收敛速度?扎根:论文第4节“We used a linear spline with knots at 6, 12, and 18 months.” —— 这是一个参数化选择,非参数化是自然扩展。
- 删失机制敏感性分析:本文假设随机删失。如果删失机制依赖于未观测因素(如生育意愿),估计结果是否稳健?扎根:论文第2节“We assume that the censoring time C is independent of (T, S) given X.” —— 该假设未经验证,敏感性分析(如基于Tipping point或E-value的方法)是直接后续。
- 效率比较与半参数效率界:本文的MLE估计量是否达到半参数效率界?与逆概率加权(IPW)或g-computation相比,效率如何?扎根:论文未讨论效率问题。值得研究者去查:在向后复发设定下,是否存在已知的效率界?本文的MLE是否有效?
- 高维协变量扩展:本文的协变量维度较低(约10个)。如果协变量维度很高(如基因组数据),AFT模型和TTP模型的正则化(如Lasso)如何实现?扎根:论文第5节“We included age, income, education, race, and contraceptive use as covariates.” —— 低维设定,高维扩展是自然方向。注意:该问题与研究者武器库中的高维统计直接相关,但需先解决“向后复发似然中双重期望的闭式形式在高维下是否仍可计算”的问题。
Maintained by 陈星宇 · Homepage · Source on GitHub