跳转至

Semiparametric regression on cumulative incidence function with interval-censored competing risks data and missing event types

作者: Jun Park, Giorgos Bakoyannis, Ying Zhang, Constantin T Yiannoutsos
主题: 因果推断
相关性: 5/10
链接: https://doi.org/10.1093/biostatistics/kxaa052


一、领域脉络与小综述

这个方向是什么

这个子方向要解决的根本问题是:在生存分析中,当感兴趣的事件是竞争风险(competing risks,如死于艾滋病 vs. 死于其他原因),且事件时间被区间删失(interval-censored,即只知道事件发生在两次检查之间,如两次门诊之间),同时事件类型(event type,即死于哪种原因)对部分研究对象缺失时,如何对累积发生率函数(cumulative incidence function, CIF)进行半参数回归(semiparametric regression)。这是一个典型的“多重不完整数据”问题——时间不精确、类型不完整——在流行病学队列研究中非常常见(如HIV队列,患者可能失访、死亡原因记录不全)。当前成熟度:方法学上已有针对区间删失竞争风险数据的回归方法,但同时处理事件类型缺失的工作很少,且现有缺失数据处理方法通常依赖较强的“随机缺失”(MAR)假设。

发展脉络(history)

从intro引用的工作串成一条线:

  • 奠基工作:Fine & Gray (1999) 提出了对CIF进行比例风险回归的经典方法(Fine-Gray模型),但假设事件时间被精确观测(或右删失),且事件类型完全已知。这是后续所有工作的基准。
  • 主要进展1:区间删失竞争风险数据的回归。作者引用 Hudgens et al. (2014)Bakoyannis et al. (2017) 作为代表。Hudgens等人提出了基于筛极大似然估计(sieve MLE)的方法,用于区间删失竞争风险数据,但假设事件类型完全已知。Bakoyannis等人进一步将筛MLE推广到更一般的半参数回归设定。这些工作解决了“时间不精确”的问题,但留下了“事件类型缺失”的口子。
  • 主要进展2:缺失事件类型的处理。作者引用 Gao & Tsiatis (2005)Lu & Liang (2008) 作为代表。Gao & Tsiatis针对右删失竞争风险数据,提出了逆概率加权(IPW)和增广逆概率加权(AIPW)估计量来处理缺失事件类型。Lu & Liang则提出了基于多重插补的方法。但这些工作都假设事件时间被精确观测(或右删失),没有处理区间删失。
  • 当前frontier与本文位置:作者指出,同时处理区间删失和事件类型缺失的工作“非常有限”(very limited)。他们引用了 Chen et al. (2014)Li et al. (2017) 作为仅有的两篇相关工作。Chen等人提出了一个基于IPW的估计量,但假设缺失机制是可忽略的(ignorable,即MAR的一个特例),且没有利用辅助变量来弱化假设。Li等人则提出了一个基于多重插补的方法。本文声称是第一个在区间删失竞争风险数据中,针对缺失事件类型提出双重稳健(doubly robust)估计量的工作,并且允许纳入辅助变量(auxiliary variables)来弱化MAR假设。

子线索聚类

这些被引文献大致落在三条子线索上:

  1. 竞争风险CIF回归(完全数据):Fine & Gray (1999), Hudgens et al. (2014), Bakoyannis et al. (2017)。核心是建立CIF与协变量的回归模型,假设事件时间和类型都完全已知(或仅右删失)。
  2. 缺失事件类型的处理(精确时间或右删失):Gao & Tsiatis (2005), Lu & Liang (2008)。核心是处理事件类型缺失,但假设事件时间被精确观测或右删失。方法包括IPW、AIPW、多重插补。
  3. 区间删失+缺失事件类型:Chen et al. (2014), Li et al. (2017), 以及本文。核心是同时处理两个不完整性问题。Chen等人用IPW,Li等人用多重插补,本文用AIPW+筛MLE。

这个方向在追问的核心问题

  1. 如何同时处理区间删失和事件类型缺失? 两个不完整性叠加,使得似然函数变得复杂,标准方法(如仅针对区间删失的筛MLE,或仅针对缺失类型的AIPW)不能直接适用。
  2. 如何放松缺失机制假设? 通常的MAR假设(缺失概率只依赖于观测到的数据)在队列研究中可能不成立。能否通过纳入辅助变量(如最后一次就诊时的健康状况)来使假设更合理?
  3. 如何获得双重稳健性? 在缺失数据问题中,AIPW估计量通常具有双重稳健性:只要缺失概率模型或结果模型之一正确,估计量就一致。但在区间删失+竞争风险的复杂设定下,能否保持这一性质?
  4. 如何估计非参数分量? CIF的半参数回归模型通常包含一个非参数的基准累积发生率函数。在区间删失下,如何用筛(sieve)方法有效逼近它?

⚠️ 作者的 framing

  • 作者把缺口frame成什么:作者将缺口frame为“现有方法要么只处理区间删失(假设事件类型完全已知),要么只处理缺失事件类型(假设事件时间精确或右删失),而同时处理两者的工作非常有限且不满足双重稳健性”。因此,本文成为“显然的下一步”:将AIPW框架与筛MLE结合,同时解决两个问题,并实现双重稳健。
  • 哪些竞争路线被他淡化或回避了:作者淡化了多重插补(MI)路线。他们引用了Lu & Liang (2008)和Li et al. (2017)作为MI的代表,但仅在intro中一笔带过,没有详细比较。他们可能认为MI在区间删失下计算复杂(需要从复杂的后验分布中抽样),且不如AIPW那样容易获得双重稳健性。此外,作者没有讨论基于似然的方法(如直接对联合分布建模的full likelihood方法),这可能是因为在缺失数据下,full likelihood对模型错误设定更敏感。
  • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用任何关于非随机缺失(MNAR)或敏感性分析的工作。在事件类型缺失的背景下,MNAR是一个很自然的担忧(例如,死于艾滋病的人可能更不容易被记录死因)。作者通过引入辅助变量来“弱化”MAR,但并没有真正处理MNAR。这是一个值得研究者去查的问题:是否存在针对区间删失竞争风险数据中MNAR事件类型的方法?如果没有,这是一个明确的gap。

张力

未见明显对立引用。所有被引工作都在各自的设定下(精确时间/区间删失,完全数据/缺失类型)推进,没有出现彼此矛盾或在略不同条件下得相反结论的情况。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(T\): 事件时间(随机变量)。由于竞争风险,\(T\)对应一个事件类型\(\epsilon \in \{1, \dots, K\}\),其中\(\epsilon = k\)表示第\(k\)种事件。在本文中,\(K=2\)(两种竞争风险,如死于艾滋病 vs. 死于其他原因),但方法可推广。
    • \(C\): 删失时间(随机变量)。如果\(T > C\),则个体被右删失。
    • \(U\)\(V\): 两次相邻的检查时间(随机变量),且\(U < V\)。对于区间删失数据,我们只知道\(T\)落在某个区间\((U, V]\)内(如果\(T \le C\)),或者\(T > C\)(右删失)。
    • \(X\): 协变量向量(\(p\)维),用于回归。
    • \(Z\): 辅助变量向量,可能与缺失概率相关,但不一定在回归模型\(F_k(t|X)\)中。这是本文的关键创新点之一。
    • \(\delta\): 事件类型指示变量。如果事件被观测到且类型已知,则\(\delta = \epsilon\);如果事件被观测到但类型缺失,则\(\delta = 0\);如果个体被右删失,则\(\delta = 0\)(通常也视为类型未知)。
    • \(R\): 缺失指示变量。\(R=1\)表示事件类型被观测到(即\(\delta = \epsilon\)),\(R=0\)表示事件类型缺失(即\(\delta = 0\)\(T \le C\))。注意:对于右删失个体,\(R\)未定义或视为0。
    • \(F_k(t|X)\): 第\(k\)种原因的累积发生率函数(CIF),即\(P(T \le t, \epsilon = k | X)\)。这是本文的目标 estimand
    • \(\beta_k\): 回归系数向量,对应\(F_k(t|X)\)中的协变量效应。
    • \(\Lambda_{0k}(t)\): 第\(k\)种原因的基准累积风险函数(非参数分量)。
    • \(\pi(X, Z)\): 事件类型被观测到的概率,即\(P(R=1 | T \le C, X, Z)\)。这是缺失概率模型
    • \(p_k(X, Z)\): 给定事件发生且类型已知的条件下,事件类型为\(k\)的概率,即\(P(\epsilon = k | T \le C, X, Z, R=1)\)。这是事件类型概率模型
  • 模型

    • CIF回归模型:作者采用比例几率模型(proportional odds model)的一个变体,或者更一般地,一个半参数转换模型(semiparametric transformation model)来建模\(F_k(t|X)\)。具体地,他们假设存在一个已知的、单调递增的连接函数\(g(\cdot)\)(如logit函数),使得:
      \[g(F_k(t|X)) = \alpha_k(t) + X^T \beta_k\]
      其中\(\alpha_k(t) = g(\Lambda_{0k}(t))\)是一个未知的、单调递增的基准函数。这个模型将CIF与协变量通过一个已知的链接函数联系起来,类似于广义线性模型。
    • 缺失机制模型:作者假设事件类型是随机缺失(MAR)的,但允许通过辅助变量\(Z\)来“弱化”这个假设。具体地,他们假设:
      \[P(R=1 | T, \epsilon, X, Z) = P(R=1 | T \le C, X, Z)\]
      即缺失概率只依赖于“事件是否发生”这个事实(\(T \le C\))、协变量\(X\)和辅助变量\(Z\),而不依赖于事件时间\(T\)的具体值和事件类型\(\epsilon\)本身。这是一个比标准MAR(只依赖于\(X\))更弱的假设,因为\(Z\)可以包含与缺失概率相关的信息。
    • 数据生成机制:个体\(i\)的完整数据是\((T_i, \epsilon_i, C_i, U_i, V_i, X_i, Z_i)\)。我们观测到的是:检查区间\((U_i, V_i]\)(如果\(T_i \le C_i\))或右删失指示(如果\(T_i > C_i\)),以及事件类型指示\(\delta_i\)(可能缺失)。协变量\(X_i\)和辅助变量\(Z_i\)总是被观测到。
  • 可观测数据

    • 研究者实际能观测到的是:\(\{ (U_i, V_i, \Delta_i, \delta_i, X_i, Z_i) \}_{i=1}^n\),其中\(\Delta_i = I(T_i \le C_i)\)是事件发生指示(1=事件发生,0=右删失)。
    • 想要但观测不到的是:精确的事件时间\(T_i\)(只知道在区间内),以及当\(\delta_i = 0\)\(\Delta_i = 1\)时的事件类型\(\epsilon_i\)(缺失)。
    • 关键识别假设:为了从可观测数据中识别\(F_k(t|X)\),我们需要假设:① 检查时间\(U, V\)与事件时间\(T\)独立(给定\(X\));② 删失时间\(C\)\(T\)独立(给定\(X\));③ 缺失机制是MAR(通过\(Z\)弱化)。

第二步:讲最小内核

本文的最小内核是:在只有两种竞争风险(\(K=2\))、没有协变量(\(X\)为空)、没有辅助变量(\(Z\)为空)的最简单设定下,如何对区间删失数据中缺失的事件类型进行双重稳健估计?

  • 最简特例

    • 假设我们只关心一个总体,没有协变量。那么CIF \(F_1(t)\)\(F_2(t)\)就是两个单调递增的函数,且\(F_1(t) + F_2(t) = P(T \le t)\)(总事件发生率)。
    • 我们观测到每个个体的检查区间\((U, V]\)(或右删失),以及一个可能缺失的事件类型指示\(\delta\)
    • 缺失概率模型简化为\(\pi = P(R=1 | T \le C)\),即事件发生时类型被观测到的概率,是一个常数。
    • 事件类型概率模型简化为\(p_1 = P(\epsilon = 1 | T \le C, R=1)\),即给定类型已知时,事件为类型1的概率,也是一个常数。
  • 核心思路

    1. 完整数据似然:如果事件类型完全已知,我们可以写出基于区间删失数据的似然函数,并通过筛MLE(例如,用单调样条逼近\(F_1(t)\)\(F_2(t)\))来估计它们。
    2. 缺失数据处理:当事件类型缺失时,我们不能直接使用完整数据似然。AIPW的思想是:对于每个个体,我们构造一个“增广”的贡献,使得即使缺失概率模型或事件类型概率模型之一被错误设定,估计量仍然一致。
    3. 具体构造(直觉)
      • 对于事件类型已知的个体(\(R=1\)),我们使用其完整数据贡献。
      • 对于事件类型缺失的个体(\(R=0\)),我们用一个“插补”项来替代缺失的类型。这个插补项是基于事件类型概率模型\(p_k\)的预测。
      • 然后,我们用逆概率加权(\(1/\pi\))来调整缺失个体的权重,并加上一个“增广”项来纠正由于模型错误设定带来的偏差。
    4. 双重稳健性:在这个最简特例下,双重稳健性意味着:只要\(\pi\)的估计\(\hat{\pi}\)是一致的,或者\(p_1\)的估计\(\hat{p}_1\)是一致的(两者不必同时正确),那么最终的CIF估计量\(\hat{F}_1(t)\)就是一致的。
  • 为什么这个特例抓住了核心:即使在这个最简单的设定下,区间删失和事件类型缺失的交互作用已经出现。我们需要同时估计两个非参数函数(\(F_1, F_2\))和一个缺失数据模型(\(\pi, p_1\))。AIPW框架提供了一个优雅的方式来组合这些模型,并实现双重稳健性。论文的一般情形(有协变量、有辅助变量)只是在这个内核上增加了回归模型和更复杂的筛逼近。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:针对区间删失竞争风险数据中事件类型缺失的问题,提出了一种增广逆概率加权筛极大似然估计量(AIPW sieve MLE),用于对累积发生率函数(CIF)进行半参数回归。
  2. 核心工具/方法:将AIPW框架与筛极大似然估计(sieve MLE)相结合。AIPW用于处理缺失的事件类型,筛MLE用于在区间删失下估计CIF的非参数基准分量。通过引入辅助变量\(Z\),弱化了通常的MAR假设。
  3. 主要结论:所提出的估计量是双重稳健的:即使缺失概率模型或事件类型概率模型之一被错误设定,估计量仍保持一致性。模拟研究表明,即使在事件类型大量缺失(如50%)的情况下,该方法仍表现良好。在HIV队列数据上的应用展示了其实用性。

关键设定与假设

在第二节最小记号的基础上,补全完整设定:

  • CIF回归模型:作者采用一个半参数转换模型(semiparametric transformation model):
    \[g(F_k(t|X)) = \alpha_k(t) + X^T \beta_k\]
    其中\(g(\cdot)\)是一个已知的、严格单调递增的连接函数(如logit、probit、cloglog)。\(\alpha_k(t)\)是一个未知的、单调递增的基准函数,用单调样条(monotone splines)或I-样条(I-splines)来逼近(即筛估计)。\(\beta_k\)是待估的回归系数。
  • 缺失机制假设
    • MAR假设\(P(R=1 | T, \epsilon, X, Z) = P(R=1 | T \le C, X, Z)\)。即缺失概率只依赖于“事件是否发生”以及\((X, Z)\),而不依赖于\(T\)\(\epsilon\)的具体值。这是本文的核心假设,比标准MAR(只依赖于\(X\))更弱。
    • 正定性假设\(P(R=1 | T \le C, X, Z) > 0\),即对于所有可能的\((X, Z)\),事件类型被观测到的概率都大于0。这是IPW方法的标准假设。
  • 模型设定
    • 缺失概率模型\(\pi(X, Z; \gamma) = P(R=1 | T \le C, X, Z)\),通常用逻辑回归建模。
    • 事件类型概率模型\(p_k(X, Z; \eta) = P(\epsilon = k | T \le C, X, Z, R=1)\),通常用多项逻辑回归建模。
  • 相比已有文献的放宽/强化
    • 放宽:相比Chen et al. (2014)的IPW方法(假设可忽略缺失),本文通过AIPW和辅助变量\(Z\),允许缺失概率依赖于\(Z\),从而弱化了MAR假设。
    • 强化:本文要求缺失概率模型和事件类型概率模型都是参数化的(如逻辑回归),而CIF模型是半参数的。这比完全非参数的缺失模型更容易处理,但也引入了模型错误设定的风险(双重稳健性正是为了应对这种风险)。

主要结果

本文是理论型论文,主要结果是定理形式的。

  • 定理1:估计量的一致性。在正则条件下,AIPW筛MLE估计量\(\hat{\theta} = (\hat{\beta}_1, \hat{\beta}_2, \hat{\alpha}_1(\cdot), \hat{\alpha}_2(\cdot))\)一致的。具体地,\(\hat{\beta}_k\)收敛到真值\(\beta_{0k}\),且\(\hat{\alpha}_k(t)\)在某种范数下收敛到真值\(\alpha_{0k}(t)\)

    • 直觉:这个定理依赖于筛MLE的一般理论(如Shen & Wong, 1994)和AIPW的矩条件。关键在于证明AIPW构造的“目标函数”的期望在真值处达到唯一最大值,并且筛空间的逼近误差可以控制。
    • 必要条件:① 筛空间的维数\(m_n\)随样本量\(n\)增长的速度要适当(不能太快也不能太慢),以保证逼近误差和估计误差的平衡。② 缺失概率模型或事件类型概率模型之一被正确设定(双重稳健性)。
    • 解决的技术难点:区间删失使得似然函数不是关于\(T\)的简单乘积,而是涉及积分。AIPW的引入使得目标函数不再是标准的似然函数,而是一个“增广”的版本。证明其最大值的唯一性和一致性需要更精细的实证过程(empirical process)理论。
  • 定理2:估计量的渐近正态性。在更强的正则条件下,\(\hat{\beta}_k\)渐近正态的,即\(\sqrt{n}(\hat{\beta}_k - \beta_{0k}) \rightarrow N(0, \Sigma_k)\)

    • 直觉:这个定理依赖于筛MLE的渐近正态性理论(如Huang, 1996)。关键在于证明AIPW目标函数的“有效影响函数”(efficient influence function)存在,并且筛估计量能够以\(\sqrt{n}\)速率估计参数分量。
    • 必要条件:① 筛空间的维数\(m_n\)增长足够快,使得非参数分量的估计误差是\(o_p(n^{-1/4})\)(这是半参数估计中实现\(\sqrt{n}\)速率的常见条件)。② 协方差矩阵\(\Sigma_k\)可以被一致地估计。
    • 解决的技术难点:推导出AIPW估计量的渐近方差表达式,并证明其可以被“三明治”估计量(sandwich estimator)一致估计。这需要处理区间删失和缺失数据带来的复杂协方差结构。

证明路线与技术技巧

  • 整体路线

    1. 构造AIPW目标函数:首先,写出如果事件类型完全已知时的“完整数据”筛对数似然函数。然后,对于每个个体,用AIPW技巧构造一个“增广”的贡献:对于类型已知的个体,使用其完整数据贡献;对于类型缺失的个体,用事件类型概率模型的预测来插补,并用逆概率加权来调整。最终的目标函数是所有个体贡献的和。
    2. 筛逼近:用单调样条(I-splines)来逼近非参数基准函数\(\alpha_k(t)\)。样条的节点数和位置是预先选定的(或通过数据驱动的方式选择),系数是待估参数。这样,无限维的\(\alpha_k(t)\)就被转化为有限维的样条系数向量。
    3. 参数估计:通过最大化AIPW目标函数,同时估计回归系数\(\beta_k\)和样条系数。这是一个有限维的优化问题,可以用标准的数值优化算法(如牛顿-拉夫森)求解。
    4. 渐近理论证明
      • 一致性:利用经验过程理论(empirical process theory),证明AIPW目标函数在真值处达到唯一最大值,并且筛空间的逼近误差可以忽略。关键引理是:AIPW目标函数的期望在真值处是严格凹的(或至少是局部凹的)。
      • 收敛速率:利用筛MLE的收敛速率理论,证明\(\hat{\beta}_k\)\(\sqrt{n}\)速率收敛,而\(\hat{\alpha}_k(t)\)\(n^{-r/(2r+1)}\)速率收敛(其中\(r\)\(\alpha_k\)的光滑度)。
      • 渐近正态性:利用半参数估计的“正交化”技巧,证明\(\hat{\beta}_k\)的渐近方差等于其有效影响函数的方差。然后,通过“三明治”估计量来一致估计这个方差。
  • 关键跳跃点

    • AIPW目标函数的构造:如何将AIPW思想从简单的均值估计(如Gao & Tsiatis, 2005)推广到复杂的筛MLE框架?作者的关键想法是:将AIPW应用于每个个体的“似然贡献”上,而不是直接应用于CIF本身。这使得AIPW可以自然地与筛MLE结合。
    • 双重稳健性的证明:证明双重稳健性需要仔细处理AIPW目标函数的期望。关键引理是:当缺失概率模型正确时,AIPW目标函数的期望等于完整数据似然的期望;当事件类型概率模型正确时,AIPW目标函数的期望也等于完整数据似然的期望。因此,只要两者之一正确,最大化AIPW目标函数就等价于最大化完整数据似然,从而得到一致的估计。
  • 技术技巧点名

    • 经验过程理论(Empirical Process Theory):用于证明估计量的一致性和收敛速率,特别是处理筛空间的复杂性。
    • 筛极大似然估计(Sieve MLE):用于在无限维参数空间中估计非参数基准函数。
    • 增广逆概率加权(AIPW):用于处理缺失数据,实现双重稳健性。
    • 单调样条(I-splines):用于逼近单调递增的基准函数,保证估计的CIF是单调的。
    • 三明治方差估计量(Sandwich Variance Estimator):用于估计回归系数的渐近方差,对模型错误设定具有一定的稳健性。

真实例子与应用

本文包含一个真实数据例子。

  • 用的什么数据/场景:来自撒哈拉以南非洲的HIV队列研究(HIV cohort study in sub-Saharan Africa)。研究对象是HIV感染者,接受抗逆转录病毒治疗(ART)。感兴趣的事件是“死于艾滋病相关原因”和“死于其他原因”(两种竞争风险)。事件时间是从ART开始到死亡的时间。由于患者可能错过门诊,死亡时间通常是区间删失的(只知道在两次门诊之间)。此外,由于资源有限或记录不全,部分死亡事件的死因是缺失的(missing event types)。
  • 怎么把本文方法用上去:作者将提出的AIPW筛MLE方法应用于这个数据集。协变量\(X\)包括年龄、性别、CD4细胞计数、WHO分期等。辅助变量\(Z\)包括最后一次就诊时的体重、血红蛋白水平等(这些变量可能与死因记录的完整性相关)。缺失概率模型\(\pi(X, Z)\)和事件类型概率模型\(p_k(X, Z)\)都用逻辑回归建模。CIF模型采用logit链接函数(即比例几率模型)。
  • 得到什么结果:作者报告了两种竞争原因的CIF估计,以及回归系数\(\beta_k\)的估计值和置信区间。他们发现,例如,较低的CD4细胞计数与更高的艾滋病相关死亡风险相关。他们还比较了完整案例分析(CC)、IPW方法和AIPW方法的估计结果,发现AIPW方法在事件类型缺失比例较高(约30%)的情况下,估计结果与完整案例分析(假设缺失是随机的)有显著差异,表明缺失可能不是随机的,而AIPW通过辅助变量\(Z\)部分纠正了这种偏差。
  • 这个例子想说明什么:这个例子旨在展示本文方法在真实世界复杂数据中的实用性。它说明了:① 区间删失和事件类型缺失在队列研究中是常见的;② 忽略缺失或使用简单的完整案例分析可能导致有偏的估计;③ 本文提出的AIPW方法能够利用辅助变量来弱化MAR假设,并在实践中提供更可靠的推断。

🔎 结论是否比证明窄

  • 窄的claim:定理1和定理2的证明是在参数化的缺失概率模型和事件类型概率模型下完成的。作者在证明中假设这些模型是“正确设定”的(或至少其中之一是)。然而,在真实应用中,这些模型几乎肯定是错误设定的。双重稳健性只保证当一个模型正确时估计量一致,但如果两个都错误,则估计量可能不一致。作者在模拟中测试了模型错误设定的情况,但理论结果并没有覆盖“两个模型都错误”的情形。
  • 泛化的claim:作者在intro和结论中声称方法“弱化了通常的MAR假设”。严格来说,他们只是通过引入辅助变量\(Z\),将MAR假设从“给定\(X\)”扩展到了“给定\(X\)\(Z\)”。这确实是一个弱化,但仍然是MAR框架内的一个变体,并没有真正处理MNAR(非随机缺失)。如果缺失概率依赖于未观测到的\(T\)\(\epsilon\)本身,该方法仍然会失效。这是一个值得注意的“结论比证明宽”的地方。

四、开放问题(点到为止,扎根具体语句)

  1. 非随机缺失(MNAR)下的扩展:本文假设缺失机制是MAR(通过\(Z\)弱化)。一个自然的开放问题是:当事件类型是非随机缺失(MNAR)时,如何识别和估计CIF?例如,当缺失概率直接依赖于事件类型\(\epsilon\)本身时。这需要引入额外的假设(如工具变量)或进行敏感性分析。扎根点:作者在intro中承认“我们的方法依赖于MAR假设”,并在讨论中提及“未来工作可以考虑更复杂的缺失机制”。
  2. 高维协变量下的变量选择:本文假设协变量\(X\)的维数\(p\)是固定的且远小于样本量\(n\)。在基因组学或影像学研究中,\(p\)可能很大。如何在高维设定下(\(p \gg n\))进行CIF回归,同时处理区间删失和缺失事件类型?这需要结合正则化方法(如LASSO)或降维技术。扎根点:作者在讨论中提及“我们的方法可以扩展到高维设定,但这需要额外的正则化技术”。
  3. 更高效的筛逼近:本文使用单调样条来逼近基准函数。样条节点数的选择是一个实际难题。是否存在更数据自适应的方法(如惩罚似然或贝叶斯方法)来选择节点数,或者使用其他筛(如再生核希尔伯特空间,RKHS)来获得更好的逼近效果?扎根点:作者在讨论中提及“筛空间的选择(如节点数)会影响有限样本性能,值得进一步研究”。
  4. 计算效率与大规模数据:本文的优化问题涉及样条系数和回归系数的联合估计。当样本量\(n\)很大或样条节点数很多时,计算可能变得昂贵。是否存在更高效的优化算法(如随机梯度下降或坐标下降)来加速计算?扎根点:作者在讨论中提及“我们的方法在中等规模数据上计算可行,但对于超大规模数据,需要开发更高效的算法”。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论