Nonparametric inference for reversed mean models with panel count data¶
作者: Li Liu, Wen Su, Guosheng Yin, Xingqiu Zhao, Ying Zhang
来源: Bernoulli
主题: 非参数 / 半参数
相关性: 5/10
机构绿灯: University of Hong Kong(US News 前 50,免分进入精读)
链接: https://doi.org/10.3150/21-bej1444
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在面板计数数据(panel count data)中,如何对被信息性终止事件截断的复发事件过程进行非参数推断。具体来说,研究者观测到的是个体在离散时间点上的累积事件计数,且每个个体的观测过程最终被一个与事件过程相关的终止事件(如死亡)所截断。本文关注的是复发事件过程在终止事件附近的行为,即“反向均值模型”(reversed mean model)。该方向处于非参数/半参数生存分析与纵向数据分析的交叉地带,成熟度中等——已有大量关于面板计数数据均值函数估计的工作,但针对“终止事件附近行为”且允许信息性截断的非参数推断方法尚不完善。
发展脉络(history)¶
根据论文引言(作者亲手画的领域地图)和参考文献,可将该子方向的发展脉络梳理如下:
-
奠基工作:面板计数数据的均值函数估计
- Sun & Kalbfleisch (1995):提出了面板计数数据均值函数的非参数估计方法,奠定了该领域的基础。他们假设观测时间点是随机的,且与事件过程独立。
- Wellner & Zhang (2007):利用筛似然(sieve likelihood)方法,在更一般的假设下(允许观测时间点与事件过程相关)估计均值函数,并建立了估计量的渐近性质。这是本文直接依赖的核心技术基础之一。
-
主要进展:处理信息性终止事件与截断
- Ghosh & Lin (2000, 2003):首次系统性地研究了复发事件过程被终止事件截断的问题,提出了边际均值模型和比例均值模型。但他们假设终止事件是非信息性的(即与复发事件过程独立)。
- Liu, Wolfe & Huang (2004):提出了共享随机效应模型来处理信息性终止事件,但模型参数化较强。
- Zhao et al. (2013):针对面板计数数据,提出了一个联合建模框架,同时建模复发事件过程和终止事件,允许它们通过共享的脆弱项(frailty)相关。这是处理信息性截断的经典参数/半参数方法。
-
当前 Frontier:非参数推断与“反向”视角
- 本文的位置:作者指出,现有工作大多关注复发事件过程的全局均值函数(即从起始到当前时间点的累积均值),而很少关注其在终止事件附近的行为。本文提出的“反向均值模型”正是填补这一空白:它估计的是在终止事件发生前固定时间窗口内的平均事件数。此外,本文在非参数框架下处理信息性截断,避免了参数脆弱项模型的强假设,这是对Zhao et al. (2013)等工作的一个重要推进。
子线索聚类¶
这些被引文献大致落在以下两条子线索上:
- 线索一:面板计数数据的非参数/半参数均值函数估计。这一簇的工作专注于在给定观测模式(离散时间点)下,如何一致地估计累积均值函数。核心工具是筛似然、非参数最大似然估计(NPMLE)和计数过程的鞅理论。代表工作:Sun & Kalbfleisch (1995), Wellner & Zhang (2007), Lu, Zhang & Huang (2009)。
- 线索二:复发事件过程与终止事件的联合建模。这一簇的工作关注终止事件对复发事件过程的截断效应,并试图在模型中纳入这种相关性。方法包括:共享脆弱项模型(参数/半参数)、边际模型(假设非信息性截断)、以及逆概率加权方法。代表工作:Ghosh & Lin (2000, 2003), Liu, Wolfe & Huang (2004), Zhao et al. (2013)。
这个方向在追问的核心问题¶
- 如何识别和估计终止事件附近的局部行为? 全局均值函数无法捕捉终止事件前的“爆发”或“衰减”模式。反向均值模型提供了一个新的视角,但其识别性依赖于特定的假设(如终止事件时间的可逆性)。
- 如何在非参数框架下处理信息性截断? 参数脆弱项模型虽然灵活,但可能因模型误设而产生偏差。非参数方法(如本文的两阶段筛似然)更稳健,但面临“维数灾难”和计算复杂性(涉及烦扰泛函参数)的挑战。
- 如何对带烦扰参数的M-估计量建立弱收敛理论? 当估计量的收敛速度慢于标准\(\sqrt{n}\)率时(如非参数估计),传统的渐近正态性理论不再适用。需要发展新的工具来处理“慢收敛”的烦扰参数对目标参数估计的影响。
⚠️ 作者的 framing¶
- 作者把缺口 frame 成什么? 作者将现有文献的缺口定位为“缺乏对终止事件附近复发事件行为的非参数推断方法”。他们声称,现有的全局均值函数方法无法回答“在死亡前,老年人的医疗事件频率如何变化?”这类问题。通过提出“反向均值模型”,他们将本文包装成解决这一具体科学问题的“显然的下一步”。
- 哪些竞争路线被他淡化或回避了? 作者淡化了参数/半参数联合建模(如Zhao et al. 2013)的实用性,强调其模型误设风险。他们回避了逆概率加权(IPW)方法——一种处理信息性截断的常见替代方案。IPW方法通过为每个观测到的复发事件赋予一个与终止事件概率成反比的权重来校正偏差。作者没有讨论为什么IPW不适用于他们的设定(可能是因为IPW通常需要连续观测,而面板数据是离散的,或者是因为IPW在估计“反向”均值时效率较低)。
- 什么明显该被引 / 该存在、却没出现在 intro 里? 作者没有引用任何关于因果推断中“截断”或“竞争风险”的文献。例如,Fine & Gray (1999) 关于累积发生率函数的模型,在概念上与“反向均值”有相似之处(都关注一个事件在另一个事件发生前的累积风险)。此外,关于动态治疗规则(dynamic treatment regimes)的文献中,也常涉及在终止事件(如死亡)前对中间结局的建模。这些缺失的引用可能暗示了本文与更广泛的因果推断文献的潜在联系,值得研究者去查。
张力¶
未见明显对立引用。所有被引工作基本沿着“从简单到复杂、从参数到非参数、从全局到局部”的路径演进,没有出现彼此矛盾或在略不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \(i = 1, \dots, n\):个体索引。
- \(T_i\):个体\(i\)的终止事件时间(如死亡时间)。这是一个随机变量。
- \(N_i^*(t)\):个体\(i\)在时间\(t\)之前的潜在累积事件数(如住院次数)。这是一个计数过程。如果个体在\(t\)之前已经终止(\(T_i < t\)),则\(N_i^*(t)\)是未定义的(或定义为终止时的值)。
- \(C_i\):个体\(i\)的删失时间(如研究结束时间)。观测在\(\min(T_i, C_i)\)处结束。
- \(K_i\):个体\(i\)的观测次数(随机)。
- \(0 = U_{i0} < U_{i1} < \dots < U_{iK_i} < \min(T_i, C_i)\):个体\(i\)的观测时间点(离散的、随机的)。在这些时间点上,我们观测到累积事件数。
- \(N_{ij} = N_i^*(U_{ij})\):在观测时间点\(U_{ij}\)观测到的累积事件数。这是可观测数据的核心部分。
- \(\mu(t) = E[N_i^*(t)]\):全局均值函数,即到时间\(t\)为止的平均累积事件数。这是传统方法的目标。
- \(\nu(s) = E[N_i^*(T_i) - N_i^*(T_i - s)]\):反向均值函数。这是本文的目标。它表示在终止事件发生前\(s\)个单位时间内的平均事件数。注意,这里\(T_i\)是随机的,所以\(\nu(s)\)是对所有个体的平均。
- \(s\):时间窗口长度(从终止事件向前看)。
- \(\lambda(t)\):终止事件时间\(T_i\)的风险函数(hazard function)。
- \(\Lambda(t) = \int_0^t \lambda(u) du\):累积风险函数。
- \(\theta\):本文要估计的目标参数,即反向均值函数\(\nu(s)\)。它是一个函数。
- \(\eta\):烦扰泛函参数(nuisance functional parameter),包括终止事件的风险函数\(\lambda(t)\)、观测时间点分布的某些特征等。本文的似然函数中包含了\(\eta\),但研究者不直接关心它。
-
模型:
- 数据生成机制:
- 每个个体\(i\)有一个潜在的终止事件时间\(T_i\),其风险函数为\(\lambda(t)\)。
- 每个个体\(i\)有一个潜在的复发事件过程\(N_i^*(t)\),其均值函数为\(\mu(t)\)。
- 观测过程由一系列随机时间点\(U_{i1}, \dots, U_{iK_i}\)组成,这些时间点可能依赖于\(T_i\)和\(N_i^*(t)\)(即信息性观测)。
- 在\(U_{ij}\)时刻,我们观测到\(N_{ij} = N_i^*(U_{ij})\)。
- 观测在\(\min(T_i, C_i)\)处终止。
- 关键假设:
- 条件独立:给定协变量(如果有),观测时间点\(U_{ij}\)与复发事件过程\(N_i^*(t)\)和终止事件时间\(T_i\)独立。这是一个很强的识别性假设。
- 反向均值模型:本文的核心模型是\(\nu(s) = E[N_i^*(T_i) - N_i^*(T_i - s)]\)。它没有对\(\nu(s)\)的函数形式做任何参数化假设,因此是非参数的。
- 要估的对象:反向均值函数\(\nu(s)\)。
- 数据生成机制:
-
可观测数据:
- 对于每个个体\(i\),我们能观测到:
- 观测时间点集合:\(\{U_{i1}, \dots, U_{iK_i}\}\)。
- 在这些时间点上的累积事件数:\(\{N_{i1}, \dots, N_{iK_i}\}\)。
- 终止事件时间\(T_i\)(如果\(T_i \le C_i\),即观测到终止事件)或删失时间\(C_i\)(如果\(T_i > C_i\))。
- 一个指示变量\(\Delta_i = I(T_i \le C_i)\),表示是否观测到终止事件。
- 想要但观测不到的量:
- 在终止事件发生前\(s\)个单位时间内的真实事件数\(N_i^*(T_i) - N_i^*(T_i - s)\)。因为\(T_i\)是随机的,且我们只在离散时间点观测,所以这个量通常无法直接观测到。我们需要通过模型和观测数据来推断它。
- 对于每个个体\(i\),我们能观测到:
第二步:讲最小内核¶
本文的核心思路可以用一个最简特例来理解:假设所有个体都在同一个时间点\(T\)(比如研究结束)被终止,且观测时间点是固定且等间隔的(比如每周一次)。那么,反向均值函数\(\nu(s)\)就退化为一个简单的历史平均问题。
-
最简特例设定:
- 所有\(n\)个个体都在时间\(T\)被终止(\(T_i = T\),非随机)。
- 观测时间点固定为\(U_j = j \times \Delta\),\(j = 1, \dots, J\),其中\(\Delta\)是间隔,\(J\Delta = T\)。
- 在每个\(U_j\),我们观测到累积事件数\(N_{ij}\)。
- 我们想估计\(\nu(s)\),其中\(s = k\Delta\)是\(\Delta\)的整数倍。
-
在这个特例下,问题退化成什么?
- 对于每个个体\(i\),在终止事件前\(s = k\Delta\)时间内的真实事件数为\(N_i^*(T) - N_i^*(T - k\Delta) = N_{iJ} - N_{i(J-k)}\)。由于观测是离散的,这个量是可观测的!
- 因此,\(\nu(s) = E[N_{iJ} - N_{i(J-k)}]\)。
- 一个自然的估计量就是样本均值:
\[\hat{\nu}(s) = \frac{1}{n} \sum_{i=1}^n (N_{iJ} - N_{i(J-k)})\]
-
证明怎么走?
- 在这个特例下,\(\hat{\nu}(s)\)是独立同分布随机变量的样本均值。由大数定律,它相合于\(\nu(s)\)。由中心极限定理,它渐近正态,收敛速度为\(\sqrt{n}\)。
- 这个特例的证明是平凡的。
-
为什么一般情形困难?
- 问题1:终止事件时间\(T_i\)是随机的。 这意味着我们无法像上面那样固定一个“终止前\(s\)时间”的窗口。对于每个个体,窗口的终点\(T_i\)不同,且\(T_i\)本身可能与事件过程相关(信息性截断)。因此,\(N_i^*(T_i) - N_i^*(T_i - s)\)是一个潜在变量,我们无法直接观测到它。
- 问题2:观测时间点是离散且随机的。 即使我们知道\(T_i\),我们通常也没有在\(T_i - s\)这个精确时间点上的观测。我们需要通过插值或模型来估计\(N_i^*(T_i - s)\)。
- 问题3:存在删失。 如果\(T_i\)被删失了(\(T_i > C_i\)),我们甚至不知道\(T_i\)的值,更无法知道\(T_i - s\)。
-
本文的关键想法怎么破?
- 针对问题1(随机\(T_i\)):作者利用计数过程的逆时间变换(reversed time transformation)。他们定义了一个新的时间尺度\(r = T_i - t\),即“距离终止事件的时间”。在这个新尺度下,所有个体的“终止事件”都发生在\(r=0\),而“过去”对应\(r>0\)。这样,反向均值函数\(\nu(s)\)就变成了在这个新时间尺度下,从\(r=0\)到\(r=s\)的累积均值函数。这个变换将“随机终点”问题转化为“固定起点”问题。
- 针对问题2(离散观测):作者使用筛似然方法。他们用一组基函数(如B样条)来近似\(\nu(s)\),然后通过最大化一个基于观测数据的似然函数来估计这些基函数的系数。这个似然函数巧妙地利用了面板计数数据的结构,将离散观测与连续时间模型联系起来。
- 针对问题3(删失):作者在似然函数中纳入了删失机制,并假设删失时间\(C_i\)与事件过程独立(给定协变量)。这类似于生存分析中的标准删失假设。
- 核心数学困难:在逆时间变换后,似然函数中会出现一个烦扰泛函参数\(\eta\)(即终止事件的风险函数\(\lambda(t)\)的某种变换)。这个参数是无穷维的,且其估计的收敛速度可能慢于\(\sqrt{n}\)。这导致目标参数\(\nu(s)\)的估计量\(\hat{\nu}(s)\)的收敛速度也可能慢于\(\sqrt{n}\),从而无法直接应用标准的M-估计量渐近理论。本文的核心技术贡献就是为这种“慢收敛烦扰参数下的M-估计量”建立了弱收敛理论。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:针对被信息性终止事件截断的面板计数数据,提出了一个反向均值模型来估计复发事件过程在终止事件附近的均值函数\(\nu(s)\)。
- 核心工具/方法:开发了一个两阶段筛似然方法:第一阶段估计烦扰泛函参数\(\eta\)(终止事件的风险函数),第二阶段将\(\hat{\eta}\)代入似然函数,通过筛似然最大化来估计\(\nu(s)\)。
- 主要结论:建立了\(\hat{\nu}(s)\)的相合性和收敛速度(允许慢于\(\sqrt{n}\)),并发展了一套带烦扰泛函参数的M-估计量的弱收敛理论,证明了\(\hat{\nu}(s)\)的渐近正态性。此外,还构造了一个基于该估计量的两样本检验。
关键设定与假设¶
在第二节最小记号的基础上,补全完整设定:
-
设定:
- 有\(n\)个独立同分布的个体。
- 每个个体\(i\)有:
- 终止事件时间\(T_i\),其累积风险函数为\(\Lambda(t)\)。
- 删失时间\(C_i\),与\(T_i\)和\(N_i^*(\cdot)\)独立(给定协变量)。
- 观测时间点\(U_{i1}, \dots, U_{iK_i}\),其中\(K_i\)是随机的。假设观测过程是泊松过程,其强度可能依赖于\(T_i\)和\(N_i^*(\cdot)\),但满足条件独立假设(见下)。
- 观测到的累积事件数\(N_{ij} = N_i^*(U_{ij})\)。
- 目标:估计反向均值函数\(\nu(s) = E[N_i^*(T_i) - N_i^*(T_i - s)]\),其中\(s \in [0, \tau]\),\(\tau\)是一个固定常数。
-
关键假设:
- A1 (条件独立观测):给定\(T_i\)和\(N_i^*(\cdot)\),观测时间点\(U_{ij}\)与\(N_i^*(\cdot)\)和\(T_i\)独立。这个假设保证了观测过程不包含关于事件过程的额外信息,是识别性的关键。
- A2 (光滑性):反向均值函数\(\nu(s)\)是\(p\)阶连续可微的(\(p \ge 1\))。这个假设保证了可以用筛(如B样条)以一定的速率逼近\(\nu(s)\)。
- A3 (终止事件风险的光滑性):终止事件的风险函数\(\lambda(t)\)也是光滑的。
- A4 (观测过程的正则性):观测时间点的分布是正则的,例如,其强度函数有界且远离0。
- 相比已有文献:
- 放宽:相比Zhao et al. (2013)的共享脆弱项模型,本文不假设\(T_i\)和\(N_i^*(\cdot)\)通过一个参数化的脆弱项相关,而是允许它们通过一个非参数的风险函数\(\lambda(t)\)相关(在逆时间变换下)。这放宽了模型假设。
- 强化:相比Wellner & Zhang (2007)的筛似然方法,本文的似然函数更复杂,因为它包含了终止事件的信息,并且目标参数是反向均值函数。本文的假设A1(条件独立观测)比Wellner & Zhang (2007)的假设更强,因为后者允许观测时间点与事件过程相关,而本文为了处理信息性截断,需要更强的条件。
主要结果¶
本文是理论型论文,主要结果是两个定理和一个检验统计量。
-
定理1:相合性与收敛速度
- 陈述:在正则条件下,两阶段筛似然估计量\(\hat{\nu}(s)\)满足:
\[\|\hat{\nu} - \nu_0\|_2 = O_p(n^{-\min(p/(2p+1), \alpha/(2\alpha+1))})\]其中\(\nu_0\)是真实函数,\(\|\cdot\|_2\)是\(L_2\)范数,\(p\)是\(\nu\)的光滑度,\(\alpha\)是烦扰参数\(\eta\)的光滑度。
- 直觉:收敛速度由两个因素中较慢的那个决定:目标参数\(\nu\)的估计速度(\(n^{-p/(2p+1)}\),这是非参数回归的标准速度)和烦扰参数\(\eta\)的估计速度(\(n^{-\alpha/(2\alpha+1)}\))。如果\(\eta\)比\(\nu\)更光滑(\(\alpha > p\)),那么\(\nu\)的估计速度就是瓶颈;反之,\(\eta\)的估计速度会拖慢\(\nu\)的估计。
- 必要条件:光滑度\(p\)和\(\alpha\)必须足够大,以保证收敛速度至少是\(n^{-1/4}\)(这是后续建立渐近正态性的一个技术条件)。
- 解决的技术难点:证明需要处理两阶段估计带来的误差传播。第一阶段估计\(\hat{\eta}\)的误差会通过似然函数传播到第二阶段。作者通过经验过程理论(empirical process theory)和筛逼近(sieve approximation)技巧,将\(\hat{\eta}\)的误差控制在一个可接受的范围内。
- 陈述:在正则条件下,两阶段筛似然估计量\(\hat{\nu}(s)\)满足:
-
定理2:渐近正态性
- 陈述:在更强的条件下(包括收敛速度快于\(n^{-1/4}\)),对于任意固定的\(s\),有:
\[\sqrt{n} (\hat{\nu}(s) - \nu_0(s)) \xrightarrow{d} N(0, \sigma^2(s))\]其中\(\sigma^2(s)\)是渐近方差,其形式由影响函数(influence function)给出。
- 直觉:尽管\(\hat{\nu}\)的收敛速度可能慢于\(\sqrt{n}\),但通过巧妙地构造估计方程(或利用筛似然的性质),可以证明\(\hat{\nu}(s)\)在点\(s\)上是\(\sqrt{n}\)-相合且渐近正态的。这类似于半参数模型中的“根n可估”现象。
- 解决的技术难点:这是本文最核心的理论贡献。作者发展了一套带烦扰泛函参数的M-估计量的弱收敛理论。这个理论的关键是:
- 线性化:将估计方程在真实值处进行泰勒展开,得到一个线性主项加上一个高阶余项。
- 处理烦扰参数:证明烦扰参数\(\hat{\eta}\)的估计误差对线性主项的贡献是渐近可忽略的。这需要烦扰参数的收敛速度足够快(快于\(n^{-1/4}\)),并且目标参数对烦扰参数的泛函导数(functional derivative)存在且光滑。
- 弱收敛:对线性主项应用中心极限定理,得到渐近正态性。
- 陈述:在更强的条件下(包括收敛速度快于\(n^{-1/4}\)),对于任意固定的\(s\),有:
-
两样本检验
- 陈述:基于\(\hat{\nu}(s)\)的渐近正态性,构造了一个Wald-type检验统计量来比较两个独立群体的反向均值函数\(\nu_1(s)\)和\(\nu_2(s)\)。
- 核心量化结论:检验统计量渐近服从卡方分布。
证明路线与技术技巧¶
-
整体路线:
- 构造似然函数:基于逆时间变换,写出面板计数数据的似然函数。这个似然函数是\(\nu(s)\)和烦扰参数\(\eta\)的泛函。
- 筛逼近:用B样条基函数分别逼近\(\nu(s)\)和\(\eta\),将无穷维的泛函优化问题转化为有限维的参数优化问题。
- 两阶段估计:
- 第一阶段:通过最大化一个关于\(\eta\)的边际似然(或部分似然)来估计\(\hat{\eta}\)。这个边际似然只依赖于终止事件时间\(T_i\)和删失指示变量\(\Delta_i\),不依赖于复发事件过程。
- 第二阶段:将\(\hat{\eta}\)代入完整似然函数,然后关于\(\nu\)的筛系数最大化这个“剖面似然”(profile likelihood),得到\(\hat{\nu}\)。
- 建立相合性与收敛速度:利用经验过程理论,证明\(\hat{\nu}\)和\(\hat{\eta}\)在\(L_2\)范数下相合,并给出收敛速度。关键是要控制筛逼近误差和两阶段估计的误差传播。
- 建立渐近正态性:这是最困难的一步。作者没有直接对\(\hat{\nu}\)应用标准M-估计理论,而是:
- 推导影响函数:通过计算剖面似然在真实值处的泛函导数,得到\(\hat{\nu}(s)\)的影响函数。这个影响函数是烦扰参数的函数。
- 证明线性表示:证明\(\sqrt{n}(\hat{\nu}(s) - \nu_0(s))\)可以表示为独立同分布随机变量的和加上一个\(o_p(1)\)项。这个表示依赖于烦扰参数估计的收敛速度和对泛函导数的控制。
- 应用中心极限定理:对线性表示应用中心极限定理,得到渐近正态性。
-
关键跳跃点:
- 从全局收敛到点态收敛:定理1给出的是\(L_2\)范数下的收敛速度(慢于\(\sqrt{n}\)),而定理2需要的是点\(s\)上的\(\sqrt{n}\)-相合性。这个跳跃是通过影响函数的平滑性和筛逼近的局部性质实现的。作者需要证明,尽管\(\hat{\nu}\)整体上收敛得慢,但在任意固定点\(s\)上,其估计误差的“主导部分”是\(\sqrt{n}\)-可估的。
- 处理烦扰参数的误差:在证明渐近正态性时,需要证明\(\hat{\eta}\)的误差对\(\hat{\nu}\)的渐近分布没有一阶影响。这要求\(\hat{\eta}\)的收敛速度足够快(快于\(n^{-1/4}\)),并且目标参数对烦扰参数的泛函导数在真实值处为0(即Neyman正交性,Neyman orthogonality)。作者通过精心构造剖面似然,使得这个正交性条件近似成立。
-
技术技巧点名:
- 经验过程理论:用于控制筛逼近误差和两阶段估计的随机误差,是建立相合性和收敛速度的核心工具。
- 筛似然:将非参数估计转化为参数估计,是处理无穷维参数的标准技巧。
- 剖面似然:通过将烦扰参数“剖掉”,将复杂问题简化为一个关于目标参数的优化问题。
- 泛函导数:用于计算影响函数和建立线性表示,是半参数理论的核心工具。
- Neyman正交性:虽然作者没有明确使用这个术语,但其证明中隐含了类似的思想:通过剖面似然的构造,使得目标参数的估计对烦扰参数的微小变化不敏感。
真实例子与应用¶
- 用的什么数据/场景:中国老年健康长寿纵向调查(CLHLS)的面板计数数据。该调查追踪了大量老年人,记录了他们在多个时间点上的住院次数(作为复发事件),以及死亡时间(作为终止事件)。
- 怎么把本文方法用上去:作者将本文提出的反向均值模型应用于CLHLS数据,估计了老年人在死亡前不同时间窗口内的平均住院次数。他们分别估计了男性和女性的反向均值函数\(\nu(s)\)。
- 得到什么结果:
- 结果显示,在死亡前一年内,老年人的平均住院次数显著增加,且这种增加在死亡前几个月尤为明显。
- 男性的反向均值函数在死亡前短期内高于女性,表明男性在临终前可能经历了更多的住院事件。
- 两样本检验证实了男性和女性在反向均值函数上的差异具有统计学显著性。
- 这个例子想说明什么:
- 验证理论:展示了本文方法在实际数据中的可行性,并验证了其估计结果(如曲线形状)与临床直觉一致。
- 展示相对baseline的优势:作者没有直接与某个特定的baseline方法(如Zhao et al. 2013的联合模型)进行量化对比,而是通过展示反向均值函数能够揭示全局均值函数无法捕捉的“临终前住院激增”现象,来论证其方法的独特价值。这个例子有力地说明了为什么研究者需要关注“终止事件附近”的行为。
🔎 结论是否比证明窄¶
- 是。定理2(渐近正态性)的证明依赖于一个关键条件:烦扰参数\(\hat{\eta}\)的收敛速度快于\(n^{-1/4}\)。作者在证明中假设了这一点,但没有给出\(\hat{\eta}\)达到这个速度的充分条件(除了光滑性假设)。在实际应用中,如果\(\hat{\eta}\)的收敛速度不够快(例如,因为\(\eta\)不够光滑或样本量不够大),那么\(\hat{\nu}\)的渐近正态性可能不成立。作者在结论中声称“建立了渐近正态性”,但这一结论的适用范围可能比其证明所覆盖的要窄。这是一个值得研究者去查的细节:在什么条件下,\(\hat{\eta}\)的收敛速度能保证快于\(n^{-1/4}\)?
四、开放问题¶
- 更弱的识别性假设:本文的核心假设A1(条件独立观测)很强。能否在更弱的假设下(例如,允许观测时间点与事件过程相关,但通过工具变量或辅助信息进行校正)识别和估计反向均值函数?这扎根于本文的假设A1和引言中未讨论的IPW方法。
- 高维协变量:本文的方法没有考虑高维协变量。如何将反向均值模型扩展到高维设定(例如,通过正则化筛似然或双机器学习)?这扎根于本文的设定中未包含协变量。
- 更一般的终止事件:本文假设终止事件是死亡(一个吸收态)。如何将模型推广到存在多个竞争风险或非吸收态终止事件(如疾病复发)的情形?这扎根于本文的引言中未讨论的竞争风险文献。
- 计算效率与可扩展性:本文的两阶段筛似然方法涉及非凸优化,计算复杂度较高。能否开发出更高效、可扩展的算法(例如,基于随机梯度下降或变分推断)来处理大规模面板计数数据?这扎根于本文的模拟研究部分,其中样本量\(n\)较小(通常为200或400)。
Maintained by 陈星宇 · Homepage · Source on GitHub