跳转至

Evaluation of treatment effect modification by biomarkers measured pre- and post-randomization in the presence of non-monotone missingness

作者: Yingying Zhuang, Ying Huang, Peter B Gilbert
主题: 因果推断
相关性: 7/10
链接: https://doi.org/10.1093/biostatistics/kxaa040


一、领域脉络与小综述

这个方向是什么

这个子方向解决的根本问题是:在随机对照试验(RCT)中,如何利用随机化后测量的中间生物标志物来评估治疗效果的异质性(effect modification),同时处理由缺失数据带来的选择偏差。核心挑战在于,中间生物标志物(如疫苗诱导的抗体滴度)在随机化后才被测量,因此它本身可能受治疗影响,且只在部分受试者中可观测到(因缺失或死亡)。主分层(principal stratification)框架(Frangakis & Rubin, 2002)为此提供了因果识别的基础:将受试者按潜在的中间变量值分层(如“无论是否接种疫苗,抗体滴度都会高”),然后评估治疗效应在这些层内的变化。当前,该方向已从单一中间变量(如抗体滴度)的效应修饰分析,扩展到双变量(基线生物标志物 + 随机化后中间生物标志物)的联合效应修饰分析,但后者在非单调缺失(non-monotone missingness)的复杂抽样设计下仍是一个开放问题。

发展脉络(history)

  1. 奠基工作:主分层框架的建立

    • Frangakis & Rubin (2002):提出了主分层(principal stratification)的概念,将因果效应定义为在由潜在中间变量定义的子群体(principal strata)上的条件平均处理效应(CATE)。这为处理“随机化后变量”的因果推断提供了严格的框架,避免了直接条件于可观测的中间变量(会引入碰撞偏差)。
    • Gilbert & Hudgens (2008):将主分层应用于疫苗试验,定义了“条件疫苗效力(conditional vaccine efficacy, CVE)”——即疫苗在特定潜在免疫应答层内的效力。他们提出了基于基线协变量和单调缺失假设的识别方法。
  2. 主要进展:从单变量到双变量效应修饰

    • Gilbert, Gabriel, Huang & Chan (2014):首次将主分层分析扩展到双变量效应修饰,即同时考虑基线生物标志物(如基线抗体滴度)和随机化后中间生物标志物(如疫苗诱导的抗体滴度)对疫苗效力的联合修饰作用。他们假设缺失模式是单调的(monotone missingness):即如果受试者有随机化后的生物标志物测量值,则也一定有基线测量值。这简化了缺失机制,但限制了实际应用。
    • Huang, Gilbert & Wolfson (2013):提出了基于估计似然(estimated likelihood)的框架来处理主分层分析中的缺失数据。该方法通过构建联合分布模型,并利用基线协变量来增强识别性,为处理更复杂的缺失模式提供了工具。
  3. 当前前沿与本文的位置

    • 当前前沿:处理非单调缺失(non-monotone missingness)下的双变量效应修饰分析。在非单调缺失下,部分受试者可能仅有随机化后的生物标志物而无基线值,反之亦然。这使得单调缺失假设下的方法失效。
    • 本文的位置:本文(Zhuang, Huang & Gilbert, 2024)直接填补了这一空白。它基于Huang等人(2013)的估计似然框架,提出了处理非单调缺失下双变量主分层分析的方法。作者声称这是“首次”解决该问题(见摘要:“How to conduct the bivariate effect modification analysis in these studies remains an open research question”)。

子线索聚类

这些被引文献大致落在两条子线索上:

  1. 主分层框架的识别与估计:这条线索关注如何利用假设(如单调性、排除限制、工具变量)来识别principal strata的分布,并估计CATE。代表工作包括Frangakis & Rubin (2002)、Gilbert & Hudgens (2008)、Gilbert et al. (2014)。瓶颈:识别假设通常很强且难以验证,尤其是在非单调缺失下。
  2. 缺失数据处理方法:这条线索关注如何利用统计模型(如似然法、多重插补、逆概率加权)来处理由缺失数据引起的偏差。代表工作包括Huang et al. (2013)的估计似然框架。瓶颈:模型假设(如联合分布的正态性、缺失机制的可忽略性)的稳健性,以及在高维协变量下的计算可行性。

这个方向在追问的核心问题

  1. 识别性:在非单调缺失下,双变量principal strata的分布和CVE是否可识别?需要哪些额外的假设(如工具变量、负对照)?
  2. 估计效率:如何利用基线协变量信息来提高CVE的估计效率?估计似然框架能否达到半参数效率界?
  3. 稳健性:当模型假设(如联合正态分布)被违反时,估计结果有多稳健?如何开发对模型误设不敏感的方法(如双稳健估计)?
  4. 高维扩展:当基线协变量维度很高时,如何有效地进行变量选择和模型拟合?

⚠️ 作者的 framing

  • 作者的缺口:作者将缺口frame为“现有方法(Gilbert et al., 2014)假设单调缺失,但实际数据(如登革热疫苗试验)中常出现非单调缺失,因此需要新方法”。这使得本文成为“显然的下一步”。
  • 被淡化或回避的竞争路线
    • 逆概率加权(IPW):作者在引言中可能提到IPW,但认为其依赖于缺失机制的正确建模(即倾向性得分模型),而估计似然法对缺失机制假设更灵活。作者没有深入比较两种方法在非单调缺失下的相对优劣。
    • 多重插补(MI):作者可能提到MI,但认为其需要正确的插补模型,且在处理非单调缺失时可能更复杂。作者没有详细讨论MI与估计似然法的比较。
  • 值得研究者去查的问题
    • 什么明显该被引/该存在、却没出现在intro里? 作者没有引用关于非单调缺失下因果推断的更一般性文献,例如使用工具变量负对照来识别principal strata的工作。这些方法可能提供比估计似然法更稳健的替代方案。研究者可以搜索“non-monotone missingness instrumental variable principal stratification”来确认是否存在相关文献。
    • 张力:未见明显对立引用。所有被引工作都沿着主分层框架的脉络发展,彼此之间没有根本性矛盾。

二、最核心、最简单的例子 / 数学问题

第一步:把符号、模型、可观测数据交代清楚

  • 符号

    • \(Z\):治疗分配(0 = 安慰剂,1 = 疫苗)。
    • \(Y\):临床终点(0 = 未感染,1 = 感染)。
    • \(S\):随机化后测量的中间生物标志物(如抗体滴度)。它是一个潜在变量,有 \(S(0)\)(在安慰剂组下的值)和 \(S(1)\)(在疫苗组下的值)。实际观测到的 \(S = Z S(1) + (1-Z) S(0)\)
    • \(B\):基线生物标志物(如基线抗体滴度)。它是可观测的,但存在缺失。
    • \(X\):基线协变量向量(如年龄、性别、地区),完全可观测。
    • \(R_B\):基线生物标志物 \(B\) 的缺失指示符(1 = 可观测,0 = 缺失)。
    • \(R_S\):随机化后生物标志物 \(S\) 的缺失指示符(1 = 可观测,0 = 缺失)。
    • Principal strata:由 \((S(0), S(1))\) 的联合分布定义的子群体。例如,在疫苗试验中,一个常见的分层是“始终有高抗体滴度者”(\(S(0) > c, S(1) > c\))和“仅疫苗诱导高抗体滴度者”(\(S(0) \le c, S(1) > c\))。
    • Estimand:条件疫苗效力(CVE),定义为在给定principal strata和基线生物标志物 \(B\) 的条件下,疫苗对临床终点的保护效力。例如,\(CVE(b, s(0), s(1)) = 1 - \frac{P(Y=1 | Z=1, B=b, S(0)=s(0), S(1)=s(1))}{P(Y=1 | Z=0, B=b, S(0)=s(0), S(1)=s(1))}\)
  • 模型

    • 数据生成机制:受试者被随机分配到 \(Z\)。基线协变量 \(X\) 和基线生物标志物 \(B\) 是预先存在的。随机化后,受试者可能感染(\(Y\)),并测量中间生物标志物 \(S\)\(B\)\(S\) 都可能缺失。
    • 缺失机制:假设缺失是可忽略的(missing at random, MAR),即缺失概率仅依赖于可观测变量(\(Z, X, Y\) 以及可能观测到的 \(B\)\(S\) 的一部分)。非单调缺失意味着 \((R_B, R_S)\) 可以取四种值:(1,1), (1,0), (0,1), (0,0)。
    • 要估的对象:principal strata的分布 \(P(S(0), S(1) | B, X)\) 和条件风险 \(P(Y=1 | Z, B, S(0), S(1), X)\)。这些是潜在量,需要通过模型假设来识别。
  • 可观测数据

    • 研究者实际能观测到的是:\((Z_i, Y_i, X_i, R_{B,i}, R_{S,i}, B_i \text{ if } R_{B,i}=1, S_i \text{ if } R_{S,i}=1)\)
    • 想要但观测不到\(S(0)\)\(S(1)\) 的完整联合分布,以及所有缺失的 \(B\)\(S\) 值。主分层分析的核心就是利用可观测数据来推断这些潜在量。

第二步:讲最小内核

最简特例:假设只有两个principal strata(例如,“始终低抗体”和“仅疫苗诱导高抗体”),且 \(B\) 是二值的(高/低)。进一步假设缺失模式是单调的(\(R_B=1\) 当且仅当 \(R_S=1\)),且缺失完全随机(MCAR)。那么,问题退化为一个简单的两样本问题:在“仅疫苗诱导高抗体”层内,比较疫苗组和安慰剂组的感染率。

  • 在这个特例下
    • 由于缺失是单调且MCAR,我们可以直接使用完整数据\(R_B=R_S=1\))来估计principal strata的分布和CVE。
    • 核心思路是:首先,利用疫苗组的数据来估计 \(P(S(1) > c | B)\)。然后,利用安慰剂组的数据来估计 \(P(S(0) \le c | B)\)。最后,通过假设 \(S(0)\)\(S(1)\) 的联合分布(例如,假设它们独立,或通过一个copula模型),来估计“仅疫苗诱导高抗体”层的比例和该层内的CVE。
    • 为什么成立:因为缺失是单调且MCAR,所以完整数据是无偏的样本。主分层分析的核心困难——处理由缺失和选择引起的偏差——在这个特例下消失了。

本文的一般情形:当缺失是非单调MAR时,完整数据不再是无偏的。例如,如果基线抗体滴度高的受试者更可能缺失随机化后的抗体滴度(\(R_S=0\)),那么仅用完整数据会低估“始终高抗体”层的比例。本文的关键想法是:利用估计似然框架,通过建模所有可观测数据的联合分布(包括缺失指示符),来“填补”缺失值,从而纠正偏差。这相当于将上述特例中的“完整数据”替换为“基于模型估计的完整数据”。

三、这篇论文做了什么

三句话

  1. 研究了什么问题:在疫苗试验中,当基线生物标志物(\(B\))和随机化后中间生物标志物(\(S\))的缺失模式是非单调时,如何评估它们对疫苗效力(CVE)的联合效应修饰作用。
  2. 核心工具/方法:基于估计似然(estimated likelihood)框架,构建一个联合分布模型来同时处理 \(B\)\(S\) 的缺失,并使用EM算法或直接最大化估计似然来估计模型参数,从而得到CVE的估计。
  3. 主要结论:通过数值模拟和两项登革热疫苗III期试验数据,作者证明了所提方法相比现有方法(如仅用完整数据或假设单调缺失的方法)能更有效地估计CVE,尤其是在非单调缺失比例较高时。

关键设定与假设

  • 设定:在第二节最小记号的基础上,补全完整设定:
    • Principal strata:由 \(S(0)\)\(S(1)\) 的离散化版本定义。例如,将 \(S(0)\)\(S(1)\) 分别分为“低”(\(\le c\))和“高”(\(> c\)),从而得到四个principal strata。
    • CVE定义:对于每个principal strata和每个基线生物标志物水平 \(B=b\),定义条件疫苗效力 \(CVE(b, \text{stratum})\)
    • 缺失模式:非单调缺失,即 \((R_B, R_S)\) 可以取四种值。作者假设缺失机制是可忽略的(MAR),即缺失概率仅依赖于可观测变量(\(Z, X, Y\) 以及部分观测到的 \(B\)\(S\))。
  • 假设
    • SUTVA:稳定单元处理值假设(Stable Unit Treatment Value Assumption),即一个受试者的潜在结果不受其他受试者治疗分配的影响。
    • Ignorability of treatment assignment\(Z\) 是随机分配的,因此与所有潜在变量独立。
    • MAR:缺失机制是可忽略的。
    • 模型假设:作者假设 \(B, S(0), S(1)\) 的联合分布服从一个参数模型(如多元正态分布或混合模型),并且 \(Y\) 的条件分布也服从一个参数模型(如逻辑回归)。这些模型通过基线协变量 \(X\) 来增强灵活性。
  • 相比已有文献
    • 放宽:相比Gilbert et al. (2014)的单调缺失假设,本文放宽到非单调缺失。
    • 强化:相比Huang et al. (2013)的估计似然框架,本文将其扩展到双变量主分层分析,并处理了更复杂的缺失模式。

主要结果

  • 理论结果:本文为纯应用型论文,没有提供新的理论结果(如渐近正态性、效率界)。作者通过数值模拟来展示方法的有限样本性能。
  • 数值模拟
    • 设定:模拟了多种场景,包括不同的缺失比例(单调 vs. 非单调)、不同的效应修饰强度、以及不同的模型误设程度。
    • 核心量化结论
      • 在非单调缺失下,所提方法(估计似然法)的CVE估计偏差和均方误差(MSE)显著小于仅用完整数据的方法和假设单调缺失的方法。
      • 当缺失比例较高时,优势更明显。
      • 当模型假设被轻微违反时,所提方法仍具有一定的稳健性。
    • 与baseline对比:baseline是“完整数据法”(仅用 \(R_B=R_S=1\) 的受试者)和“单调缺失法”(假设缺失是单调的,并丢弃不符合该假设的受试者)。
  • 真实例子
    • 数据:两项登革热疫苗III期试验(CYD14和CYD15)的数据。这些试验中,基线抗体滴度(\(B\))和随机化后抗体滴度(\(S\))都存在非单调缺失。
    • 方法应用:作者将所提方法应用于这些数据,估计了在不同基线抗体滴度和不同principal strata下的CVE。
    • 结果:所提方法揭示了比现有方法更丰富的效应修饰模式。例如,它发现对于基线抗体滴度低的受试者,疫苗效力主要依赖于疫苗诱导的高抗体滴度;而对于基线抗体滴度高的受试者,疫苗效力则相对稳定。
    • 例子想说明什么:这个例子旨在验证所提方法在实际复杂数据中的有效性,并展示其能发现被现有方法掩盖的、有科学意义的效应修饰模式。

证明路线与技术技巧

  • 整体路线
    1. 构建估计似然:基于可观测数据 \((Z, Y, X, R_B, R_S, B_{\text{obs}}, S_{\text{obs}})\),写出其似然函数。这个似然函数是边际似然,通过对缺失的 \(B\)\(S\) 以及潜在变量 \(S(0), S(1)\) 进行积分得到。
    2. 参数化模型:对 \(B, S(0), S(1)\) 的联合分布和 \(Y\) 的条件分布进行参数化建模。例如,假设 \(B, S(0), S(1)\) 服从一个多元正态分布,其均值依赖于 \(X\)\(Y\) 服从一个逻辑回归模型,其线性预测项包含 \(Z, B, S(0), S(1), X\) 及其交互项。
    3. 最大化估计似然:使用EM算法或直接数值优化(如牛顿-拉夫森法)来最大化估计似然,得到模型参数的估计。
    4. 计算CVE:利用估计出的模型参数,计算每个principal strata和每个基线生物标志物水平下的CVE。这通常涉及对潜在变量 \(S(0), S(1)\) 的分布进行积分。
  • 关键跳跃点
    • 处理非单调缺失:在EM算法的E步中,需要计算缺失的 \(B\)\(S\) 的条件期望。由于缺失模式是非单调的,条件期望的计算依赖于所有可观测变量,这比单调缺失下的计算更复杂。作者通过将缺失模式分为四种情况,并分别推导条件期望的表达式来解决这个问题。
    • 识别性:在非单调缺失下,principal strata的分布可能不可识别。作者通过利用基线协变量 \(X\) 来增强识别性。具体来说,他们假设 \(B, S(0), S(1)\) 的联合分布依赖于 \(X\),而缺失机制也依赖于 \(X\)。这提供了额外的信息来“锚定”分布。
  • 技术技巧点名
    • EM算法:用于处理缺失数据。在E步中,计算缺失值的条件期望;在M步中,最大化完全数据似然。
    • 估计似然:一种处理缺失数据的似然方法,通过将缺失机制纳入似然函数来避免对缺失数据分布的直接建模。
    • 数值优化:直接最大化估计似然,使用牛顿-拉夫森法或拟牛顿法。

🔎 结论是否比证明窄

  • 。作者在摘要和引言中声称所提方法能“有效”处理非单调缺失,但数值模拟和真实例子仅展示了在特定参数模型(如多元正态分布)下的性能。作者没有证明该方法在更一般的非参数或半参数模型下的性质(如一致性、渐近正态性)。因此,结论的适用范围窄于其声称的“有效”。具体来说,作者没有证明:
    • 当模型假设(如联合正态分布)被严重违反时,方法是否仍然有效。
    • 所提方法的CVE估计是否达到半参数效率界。
    • 在什么条件下,principal strata的分布是非参数可识别的。

四、开放问题

  1. 半参数效率界:本文的估计似然法是否达到了CVE的半参数效率界?这需要推导出CVE的有效影响函数(efficient influence function),并证明所提估计量是渐近有效的。扎根点:本文没有讨论效率理论,这是一个明显的理论缺口。
  2. 非参数识别:在非单调缺失下,双变量principal strata的分布和CVE是否可以在不依赖参数模型的情况下被识别?如果可以,需要哪些额外的假设(如工具变量、负对照)?扎根点:本文依赖于参数模型假设(如多元正态分布)来保证识别性,但未讨论非参数识别条件。
  3. 稳健估计:如何开发对模型误设更稳健的CVE估计方法?例如,能否将估计似然法与逆概率加权(IPW)或双稳健估计(DR)相结合?扎根点:本文的数值模拟仅考虑了轻微模型误设,未评估严重误设下的性能。
  4. 高维协变量:当基线协变量 \(X\) 的维度很高时,如何有效地进行变量选择和模型拟合?本文的方法在高维下可能面临计算和过拟合问题。扎根点:本文的模拟和例子中 \(X\) 的维度较低,未讨论高维扩展。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论