跳转至

Modeling disease-specific survival in observational studies with missing cause of death: Leveraging information from clinical trial data

作者: Yunyi Wang, Yu Shen, Jing Ning
主题: 因果推断
相关性: 7/10
链接: https://doi.org/10.1016/j.csda.2026.108419


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在观察性研究中,当结局事件(死亡)的原因(死因)缺失时,如何利用外部辅助数据(如临床试验)中的死因信息,来识别和估计疾病特异性生存(DSS)函数。其核心统计挑战在于:① 死因缺失机制可能非随机(与患者特征或潜在生存时间相关);② 辅助数据(试验)与目标数据(注册)的人群分布不同(异质性/不可传输性),直接借用生存分布会引入偏倚。当前成熟度处于“方法已提出但假设较强、验证有限”的阶段,尚未形成统一的识别与估计框架。

发展脉络(history)

  1. 奠基工作:死因缺失问题的早期处理
  2. Andersen et al. (1993) 等经典生存分析教材中,将死因缺失视为竞争风险问题,通常假设缺失完全随机(MCAR)或采用“最坏情况”分析。这些方法在死因缺失比例高时效率低或偏倚大。
  3. Gooley et al. (1999) 首次系统讨论了死因缺失对竞争风险估计的影响,指出若缺失机制与协变量相关,则简单剔除缺失观测会导致严重偏倚。该工作为后续方法提供了问题意识。

  4. 主要进展:利用辅助数据填补死因缺失

  5. Lu & Tsiatis (2001) 提出利用“死亡原因验证样本”(如尸检或死亡证明审查)来校正死因误分类,采用加权估计方程。但该方法要求验证样本在目标人群中随机抽取,这在实践中难以满足。
  6. Bakoyannis et al. (2019) 将死因缺失视为一种“部分可观测”的竞争风险,提出基于多重插补的估计方法,假设缺失机制由可观测协变量解释(MAR)。该方法在MAR假设下有效,但无法处理由未观测混杂导致的缺失。
  7. Wang et al. (2020) 首次提出利用外部临床试验数据中的死因信息来推断注册数据中的DSS,采用“比例死因比模型”(proportional cause ratio model)来建模死因分布,并假设死因机制在试验与注册人群间可传输(transportable)。本文即在此工作基础上发展,作者在引言中明确说:“Wang et al. (2020) proposed a proportional cause ratio model for DSS with missing cause of death, but their method requires that the cause-of-death mechanism is the same between the trial and registry populations, which is a strong assumption.” 本文的贡献在于放松了这一假设,允许死因机制随协变量变化,并通过加权估计方程处理人群异质性。

  8. 当前frontier:传输性(transportability)与数据融合

  9. 因果推断领域近年发展出系统的传输性理论(如 Pearl & Bareinboim (2011) 的do-calculus框架、Dahabreh et al. (2020) 的加权估计方法),但大多针对处理效应(ATE/CATE)的传输,而非死因机制。本文是这一理论在死因缺失问题上的具体应用。
  10. 本文的位置:作者将传输性思想引入死因缺失问题,但限制传输对象为“死因机制”(cause-of-death mechanism)而非总生存分布,从而规避了总生存分布不可传输的问题。这是对Wang et al. (2020)的实质性改进。

子线索聚类

  1. 死因缺失的统计方法(核心线索)
  2. 包括:MCAR假设下的简单剔除、MAR假设下的多重插补(Bakoyannis et al. 2019)、利用验证样本的加权估计(Lu & Tsiatis 2001)、以及利用外部死因信息的传输性方法(Wang et al. 2020, 本文)。
  3. 这一簇的共同目标:在死因缺失下识别DSS,但假设强度依次递减(MCAR → MAR → 可传输死因机制)。

  4. 传输性/数据融合的因果推断(方法来源)

  5. 包括:Pearl & Bareinboim (2011) 的do-calculus、Dahabreh et al. (2020) 的加权估计、Colnet et al. (2020) 的“triple robustness”方法。
  6. 这一簇为本文提供了识别假设(死因机制可传输)和估计工具(逆概率加权、估计方程)。

  7. 竞争风险模型(模型基础)

  8. 包括:Fine & Gray (1999) 的累积发生率函数模型、Andersen et al. (1993) 的cause-specific hazards模型。
  9. 本文的比例死因比模型是cause-specific hazards模型的一种参数化形式,允许死因分布随时间变化。

这个方向在追问的核心问题

  1. 死因缺失机制能否被识别? 当前主流方法依赖强假设(MCAR、MAR、或可传输死因机制),但实际中这些假设往往不可检验。
  2. 如何利用辅助数据(如试验)而不引入人群异质性偏倚? 本文的答案是“只传输死因机制,不传输总生存”,但这一策略的有效性依赖于死因机制本身的可传输性。
  3. 估计量的效率如何? 当前方法多为两步估计(先估计权重,再估计DSS),效率损失较大;是否存在半参数有效估计?
  4. 模型误设定下的稳健性? 比例死因比模型假设死因分布满足比例风险结构,若该假设不成立,估计量是否仍一致?

⚠️ 作者的framing

  • 作者把缺口frame成:“现有方法(Wang et al. 2020)假设死因机制在试验与注册人群间相同,但实际中人群异质性可能导致死因机制不同。本文通过允许死因机制随协变量变化,并采用加权估计方程处理人群分布差异,从而放松了这一假设。”
  • 被淡化或回避的竞争路线
  • 多重插补方法(Bakoyannis et al. 2019)被作者一笔带过,未讨论其与本文方法的相对优劣(如MAR vs. 可传输死因机制,哪个假设更合理?)。
  • 半参数有效估计(如基于影响函数的debiased ML)未被提及——本文的加权估计方程可能不是最有效的。
  • 什么明显该被引/该存在、却没出现在intro里?
  • Dahabreh et al. (2020) 关于传输性的加权估计方法未被引用,尽管其思想与本文直接相关。
  • Colnet et al. (2020) 的“triple robustness”方法(同时处理人群异质性和模型误设定)未被讨论。
  • Robins et al. (1994) 关于“monotone missing data”的G-估计方法未被提及,尽管死因缺失可视为一种单调缺失模式。
  • 值得研究者去查的问题:这些缺失的引用是否意味着作者有意回避了更复杂的估计方法?还是因为本文的模型设定(比例死因比)与这些方法不兼容?

张力

未见明显对立引用。所有被引工作均支持“死因缺失需要特殊处理”这一共识,差异仅在于假设强度和估计方法。


二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号
  • \( T \):死亡时间(随机变量),单位通常为年/月。
  • \( C \):删失时间(随机变量),如失访或研究结束。
  • \( \Delta = I(T \leq C) \):是否观察到死亡(1=死亡,0=删失)。
  • \( X \):协变量向量(如年龄、肿瘤分期、治疗方式),维度 \( p \)
  • \( K \):死因指示变量(\( K=1 \) 表示死于目标疾病,\( K=2 \) 表示死于其他原因)。这是核心潜在变量——在注册数据中不可观测。
  • \( Y = \min(T, C) \):观测到的随访时间。
  • \( \delta = \Delta \cdot K \):观测到的死因(若 \( \Delta=1 \) 且死因已知,则 \( \delta=K \);若死因缺失,则 \( \delta \) 缺失)。在注册数据中,\( \delta \) 缺失
  • \( S \):数据来源指示变量(\( S=1 \) 表示来自临床试验,\( S=0 \) 表示来自注册数据)。这是关键:试验数据有 \( \delta \),注册数据没有
  • \( \pi(X) = P(S=1|X) \):给定协变量下,个体属于试验人群的概率(倾向得分)。
  • \( \lambda_k(t|X) \):第 \( k \) 种死因的cause-specific hazard函数。
  • \( \text{PCR}(t|X) = \frac{\lambda_1(t|X)}{\lambda_1(t|X) + \lambda_2(t|X)} \)比例死因比(proportional cause ratio),即给定时间 \( t \) 和协变量 \( X \) 下,死亡原因为目标疾病的概率(条件于死亡发生在 \( t \) 时刻)。这是本文建模的核心对象。

  • 模型

  • 比例死因比模型:假设
    \[\text{PCR}(t|X) = \frac{\exp(\beta_0 + \beta_1^T X + \gamma(t))}{1 + \exp(\beta_0 + \beta_1^T X + \gamma(t))}\]
    其中 \( \gamma(t) \) 是时间 \( t \) 的未知光滑函数(如样条或分段常数),\( \beta = (\beta_0, \beta_1^T)^T \) 是待估参数。该模型允许死因分布随时间和协变量变化,且通过logistic形式保证概率在[0,1]内。
  • DSS的生存函数\( S_1(t|X) = \exp\left(-\int_0^t \lambda_1(u|X) du\right) \),其中 \( \lambda_1(t|X) = \text{PCR}(t|X) \cdot \lambda_{\text{all}}(t|X) \)\( \lambda_{\text{all}}(t|X) \) 是总死亡风险(可从注册数据估计,因为总死亡时间 \( Y \) 可观测)。
  • 关键假设:死因机制可传输(transportable),即

    \[\text{PCR}(t|X, S=1) = \text{PCR}(t|X, S=0)\]
    也就是说,给定协变量 \( X \) 和时间 \( t \),死因分布与数据来源(试验 vs. 注册)无关。这是本文的核心识别假设——它允许我们用试验数据估计 \( \beta \)\( \gamma(t) \),然后应用于注册数据。

  • 可观测数据

  • 试验数据\( S=1 \)):可观测 \( (Y, \Delta, \delta, X) \),即死因已知。
  • 注册数据\( S=0 \)):可观测 \( (Y, \Delta, X) \),但 \( \delta \) 缺失(死因未知)。总死亡时间 \( Y \) 和删失指示 \( \Delta \) 是可观测的。
  • 想要但观测不到的量:注册数据中的死因 \( K \)(或 \( \delta \))。本文通过假设死因机制可传输,从试验数据中“借”来死因信息。

第二步:讲最小内核

最简特例:假设所有协变量 \( X \) 都是离散的(如只有两个水平:年龄≤50 vs. >50),且时间 \( t \) 被离散化为 \( t=1,2,\dots,5 \) 年。比例死因比模型退化为在每个 \( (X, t) \) 组合下,死因概率为常数(即 \( \text{PCR}(t|X) = p_{X,t} \))。此时,本文的核心问题简化为:

问题:在注册数据中,我们观测到每个 \( (X, t) \) 组合下的总死亡人数 \( N_{\text{all}}(X,t) \),但不知道其中多少人死于目标疾病。在试验数据中,我们观测到每个 \( (X, t) \) 组合下的死因分布(即 \( p_{X,t} \) 的估计)。如何利用试验数据估计注册数据中的疾病特异性死亡人数 \( N_1(X,t) \)

核心思路: 1. 从试验数据估计死因概率:在试验数据中,对于每个 \( (X, t) \) 组合,计算死于目标疾病的比例 \( \hat{p}_{X,t} = \frac{\text{试验中死于目标疾病的人数}}{\text{试验中总死亡人数}} \)。 2. 传输到注册数据:假设 \( p_{X,t} \) 在试验和注册人群中相同(可传输性假设),则注册数据中死于目标疾病的人数估计为 \( \hat{N}_1(X,t) = \hat{p}_{X,t} \cdot N_{\text{all}}(X,t) \)。 3. 估计DSS生存函数:利用 \( \hat{N}_1(X,t) \) 和注册数据中的总风险集,通过Kaplan-Meier或Nelson-Aalen估计DSS生存函数。

为什么这个特例抓住了核心:本文的一般情形只是这个特例的“加壳”——用logistic模型(含光滑时间项)代替离散概率,用加权估计方程处理人群分布差异(试验与注册的 \( X \) 分布不同),用渐近理论证明估计量的相合性与正态性。但识别逻辑完全相同:死因机制(给定 \( X \)\( t \) 的死因概率)是可传输的,总生存分布不可传输


三、这篇论文做了什么

三句话

  1. 研究了什么问题:在观察性癌症注册数据(NCDB)中,死因缺失导致无法直接估计疾病特异性生存(DSS),本文提出利用临床试验数据(NSABP B-06)中的死因信息,通过比例死因比模型和加权估计方程,在允许人群异质性的前提下推断DSS。
  2. 核心工具/方法:比例死因比模型(logistic形式,含光滑时间项)+ 逆概率加权(IPW)估计方程,其中权重为 \( w(X) = \frac{1-\pi(X)}{\pi(X)} \)(试验人群的逆概率),用于将试验数据加权到注册人群分布。
  3. 主要结论:所提估计量在比例死因比模型和DSS的比例风险模型下是相合且渐近正态的;模拟研究验证了有限样本性能;实证分析将NSABP B-06的死因信息迁移至NCDB,估计了乳腺癌特异性生存。

关键设定与假设

  • 假设1(可传输死因机制)\( \text{PCR}(t|X, S=1) = \text{PCR}(t|X, S=0) \)。这是核心识别假设,意味着给定协变量 \( X \) 和时间 \( t \),死因分布与数据来源无关。相比Wang et al. (2020),本文允许 \( \text{PCR} \)\( X \) 变化,因此更灵活。
  • 假设2(试验数据代表性):试验数据中的协变量分布 \( P(X|S=1) \) 与注册数据 \( P(X|S=0) \) 有重叠(overlap),即 \( 0 < \pi(X) < 1 \) 对所有 \( X \) 成立。这是IPW估计的常规要求。
  • 假设3(删失独立于死因):删失时间 \( C \) 与死亡时间 \( T \) 和死因 \( K \) 独立,给定协变量 \( X \)。这是生存分析的标准假设。
  • 假设4(比例死因比模型正确设定)\( \text{PCR}(t|X) \) 满足logistic形式,且 \( \gamma(t) \) 被正确参数化(如样条基函数)。这是模型假设,若违反则估计量可能不一致。
  • 假设5(试验数据无死因缺失):临床试验中死因记录完整。这在NSABP B-06中成立,但一般试验也可能有缺失。

相比已有文献的强化/放宽
- 相比Wang et al. (2020):本文允许死因机制随协变量变化(通过 \( \beta_1^T X \)),而Wang et al.假设 \( \text{PCR} \) 仅依赖于时间(即 \( \beta_1=0 \))。
- 相比Bakoyannis et al. (2019):本文不要求MAR假设,而是利用外部数据提供死因信息,因此可处理由未观测混杂导致的死因缺失。
- 相比Lu & Tsiatis (2001):本文不需要在注册数据中随机抽取验证样本,而是利用现成的试验数据。

主要结果

定理1(估计量的相合性):在假设1-5下,基于加权估计方程得到的 \( \hat{\beta} \)\( \hat{\gamma}(t) \) 是相合的,即 \( \hat{\beta} \xrightarrow{p} \beta_0 \)\( \hat{\gamma}(t) \xrightarrow{p} \gamma_0(t) \)
- 直觉:加权估计方程是试验数据中死因似然函数的加权版本,权重 \( w(X) \) 将试验分布调整到注册分布,从而在可传输性假设下,加权后的试验数据可视为注册数据的“死因替代样本”。
- 必要条件:权重 \( w(X) \) 必须已知或可一致估计(通过估计 \( \pi(X) \))。本文假设 \( \pi(X) \) 已知(因为试验设计已知),或通过logistic回归估计。
- 解决的技术难点:如何同时估计 \( \beta \) 和光滑函数 \( \gamma(t) \)?本文采用样条基函数将 \( \gamma(t) \) 参数化,从而将半参数问题转化为参数问题,再用M-估计理论证明相合性。

定理2(渐近正态性)\( \sqrt{n}(\hat{\beta} - \beta_0) \xrightarrow{d} N(0, \Sigma) \),其中 \( \Sigma \) 可通过sandwich方差公式一致估计。
- 直觉:加权估计方程是Z-估计量,其渐近方差由“信息矩阵”和“方差矩阵”的sandwich积给出。
- 必要条件:估计方程的一阶导非奇异(即模型可识别),且权重估计的误差不影响渐近方差(若权重已知)或需计入(若权重估计)。
- 解决的技术难点:若权重 \( \pi(X) \) 被估计,则需考虑其估计误差对 \( \hat{\beta} \) 方差的影响。本文通过“两阶段估计”的M-估计理论处理,证明权重估计的误差不影响 \( \hat{\beta} \) 的渐近方差(即“估计权重不影响效率”这一经典结论在本文设定下成立)。

定理3(DSS生存函数估计的渐近性质):基于 \( \hat{\beta} \)\( \hat{\gamma}(t) \) 构造的DSS生存函数估计 \( \hat{S}_1(t|X) \) 是相合且渐近正态的,其渐近方差可通过delta方法得到。
- 直觉:DSS生存函数是 \( \beta \)\( \gamma(t) \) 的连续泛函,因此由连续映射定理可得相合性,由delta方法可得渐近正态性。
- 必要条件:总死亡风险 \( \lambda_{\text{all}}(t|X) \) 可从注册数据一致估计(这是标准的,因为总死亡时间可观测)。

证明路线与技术技巧

整体路线(3步逻辑主干):

  1. 第一步:参数化光滑时间项
    \( \gamma(t) \) 用样条基函数 \( B(t) = (B_1(t), \dots, B_m(t))^T \) 近似,即 \( \gamma(t) \approx \alpha^T B(t) \)。于是比例死因比模型变为:

    \[\text{PCR}(t|X) = \frac{\exp(\beta_0 + \beta_1^T X + \alpha^T B(t))}{1 + \exp(\beta_0 + \beta_1^T X + \alpha^T B(t))}\]
    这是一个标准logistic回归模型,参数为 \( \theta = (\beta_0, \beta_1^T, \alpha^T)^T \)。样条节点数 \( m \) 随样本量增长(如 \( m = O(n^{1/5}) \)),以保证光滑函数的一致估计。

  2. 第二步:构造加权估计方程
    在试验数据中,对于每个死亡事件(\( \Delta=1 \)),其死因 \( K \) 可观测。定义加权对数似然:

    \[\ell_w(\theta) = \sum_{i: S_i=1} w(X_i) \left[ I(K_i=1) \log \text{PCR}(Y_i|X_i) + I(K_i=2) \log (1 - \text{PCR}(Y_i|X_i)) \right]\]
    其中 \( w(X_i) = \frac{1-\pi(X_i)}{\pi(X_i)} \) 是IPW权重,用于将试验分布调整到注册分布。最大化 \( \ell_w(\theta) \) 得到 \( \hat{\theta} \)
    关键跳跃点:为什么用权重 \( w(X) = (1-\pi)/\pi \) 而不是其他权重?因为:
    \[E_{S=1}[w(X) \cdot f(X, K, Y)] = E_{S=0}[f(X, K, Y)]\]
    即加权后的试验期望等于注册期望(在可传输性假设下)。这保证了估计方程在注册分布下无偏。

  3. 第三步:证明渐近性质

  4. 相合性:由于加权似然是凹函数(logistic模型),且权重有界,标准M-估计理论(van der Vaart, 1998, Ch.5)给出 \( \hat{\theta} \xrightarrow{p} \theta_0 \)
  5. 渐近正态性:将估计方程在真值处Taylor展开,得到:
    \[\sqrt{n}(\hat{\theta} - \theta_0) = \left( \frac{1}{n} \sum_i \ddot{\ell}_{w,i}(\theta_0) \right)^{-1} \frac{1}{\sqrt{n}} \sum_i \dot{\ell}_{w,i}(\theta_0) + o_p(1)\]
    其中 \( \dot{\ell}_{w,i} \)\( \ddot{\ell}_{w,i} \) 是加权似然的一阶和二阶导数。由中心极限定理,\( \frac{1}{\sqrt{n}} \sum_i \dot{\ell}_{w,i}(\theta_0) \xrightarrow{d} N(0, V) \),其中 \( V \)\( \dot{\ell}_{w,i} \) 的方差。于是 \( \hat{\theta} \) 渐近正态,方差为 \( I^{-1} V I^{-1} \)(sandwich形式)。
  6. 关键跳跃点:若权重 \( \pi(X) \) 被估计(而非已知),则需证明权重估计的误差不影响 \( \hat{\theta} \) 的渐近方差。本文通过“两阶段M-估计”理论证明:若权重估计是 \( \sqrt{n} \)-相合的,则 \( \hat{\theta} \) 的渐近方差与权重已知时相同(即“估计权重不影响效率”)。这一结论依赖于权重估计方程与主估计方程的正交性(orthogonality),即权重估计的误差在渐近线性展开中消失。

技术技巧点名: - 样条近似:用样条基函数将光滑函数 \( \gamma(t) \) 参数化,将半参数问题转化为参数问题,从而可用标准M-估计理论。这是半参数估计的经典技巧(如 Huang (1998) 的“sieve estimation”)。 - 逆概率加权(IPW):用于处理人群分布差异,权重 \( w(X) = (1-\pi)/\pi \) 是“标准化”权重的变体。这是因果推断中传输性问题的标准工具(如 Dahabreh et al. (2020))。 - Sandwich方差估计:用于构造渐近正态性的方差公式,考虑模型误设定下的稳健标准误。这是M-估计的常规做法。 - 两阶段M-估计:处理权重估计的不确定性,证明其不影响主估计量的渐近方差。这一结论依赖于“Neyman orthogonality”条件(即权重估计方程与主估计方程的一阶导正交),但本文未明确使用该术语。

真实例子与应用

  • 数据
  • 试验数据:NSABP B-06试验,包含乳腺癌患者(n≈1,800),记录了死因(乳腺癌 vs. 其他原因)、协变量(年龄、肿瘤大小、淋巴结状态、治疗方式等)、以及生存时间。死因记录完整。
  • 注册数据:NCDB(National Cancer Database),包含约100,000名乳腺癌患者,记录了协变量和生存时间,但无死因信息
  • 方法应用
  • 在试验数据中,估计比例死因比模型(含协变量和光滑时间项),得到 \( \hat{\beta} \)\( \hat{\gamma}(t) \)
  • 将估计的死因机制传输到NCDB:对于每个NCDB患者,根据其协变量 \( X \) 和死亡时间 \( Y \),计算死于乳腺癌的概率 \( \widehat{\text{PCR}}(Y|X) \)
  • 利用NCDB中的总死亡风险(可从Kaplan-Meier或Cox模型估计)和 \( \widehat{\text{PCR}} \),估计乳腺癌特异性生存函数 \( \hat{S}_1(t|X) \)
  • 结果
  • 估计了不同亚组(如年龄≤50 vs. >50、淋巴结阳性 vs. 阴性)的乳腺癌特异性生存曲线。
  • 与“假设所有死亡均为乳腺癌死亡”的朴素方法对比,本文方法估计的DSS曲线更低(即更保守),因为部分死亡被归因于其他原因。
  • 与“仅使用试验数据”的方法对比,本文方法利用了NCDB的大样本量,因此估计的DSS曲线更平滑、置信区间更窄。
  • 这个例子想说明什么
  • 验证理论:在模拟中验证了估计量的相合性和正态性,但实证部分无法验证(因为NCDB无真实死因)。作者通过敏感性分析(改变可传输性假设的强度)来评估结果的稳健性。
  • 展示相对优势:相比仅用试验数据,本文方法利用了注册数据的大样本量,提高了估计精度;相比朴素方法,本文方法避免了死因误分类偏倚。

🔎 结论是否比证明窄

  • 窄结论1:定理1-3的证明依赖于“比例死因比模型正确设定”和“死因机制可传输”两个强假设。但在实证部分,作者仅通过敏感性分析(如假设死因机制在部分亚组中不可传输)来评估稳健性,并未提供检验这些假设的统计方法。因此,结论的适用范围被限制在这些假设成立的场景。
  • 窄结论2:证明中假设试验数据无死因缺失(假设5),但实际中临床试验也可能有死因缺失(如失访后死亡原因不明)。作者在讨论中承认了这一局限,但未提供扩展方法。
  • 泛化claim:作者在引言中声称“本文方法可推广至其他癌症类型”,但实证仅针对乳腺癌。推广至其他癌症需要验证比例死因比模型和可传输性假设是否成立,这并非自动成立。

四、开放问题

  1. 可传输性假设的检验:本文假设死因机制在试验与注册人群间可传输,但未提供检验该假设的方法。扎根于:假设1(可传输死因机制)是核心识别条件,但作者在讨论中仅说“敏感性分析可评估其影响”,未给出正式检验。一个开放问题是:能否利用注册数据中的部分死因信息(如死亡证明审查)或工具变量来检验可传输性?

  2. 半参数有效估计:本文的加权估计方程可能不是最有效的。是否存在基于影响函数(efficient influence function)的debiased ML估计,能在可传输性假设下达到半参数效率界?扎根于:作者在讨论中未提及效率问题,仅给出sandwich方差估计。对于熟悉HOIF的研究者,这是一个自然的扩展方向。

  3. 模型误设定下的稳健性:比例死因比模型假设死因分布满足logistic形式,若该假设不成立,估计量可能不一致。能否放松为更灵活的非参数模型(如核回归或随机森林),同时保持可传输性假设?扎根于:假设4(模型正确设定)是证明相合性的必要条件,但作者未讨论模型误设定的后果。

  4. 死因缺失机制的非随机性:本文假设死因缺失仅由数据来源(试验 vs. 注册)决定,但注册数据中的死因缺失可能还与未观测因素相关(如医院记录质量)。能否利用工具变量或proximal causal inference来处理这种非随机缺失?扎根于:作者在讨论中承认“死因缺失机制可能更复杂”,但未给出具体扩展。对于熟悉proximal CI的研究者,这是一个直接的应用场景。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论