Inverse probability weighting for auxiliary variable dependent sampling in observational studies of Long COVID¶
作者: Andrea S. Foulkes, Tanayott Thaweethai, Daniel O. Scharfstein, Weixing Huang, Harrison T. Reeder
主题: 流行病学
相关性: 7/10
链接: https://arxiv.org/abs/2608.04918
一、领域脉络与小综述¶
这个方向是什么¶
本文处理的根本问题是:在观察性研究中,当研究对象的某个昂贵或侵入性结局(如影像学、实验室检测)并非对所有参与者都测量,而是根据一组“辅助变量”(auxiliary variables)的值进行选择性采样(即“两相采样”设计)时,如何对暴露-结局关联进行无偏估计。核心挑战在于,采样概率依赖于辅助变量,而这些辅助变量往往又与暴露和结局相关,忽略采样机制会导致严重的选择偏倚。该子方向是“两相采样设计”与“因果推断/缺失数据处理”的交叉,成熟度较高——方法论基础(IPW、半参数效率理论)在20世纪90年代已建立,但在复杂、重复、依赖纵向辅助变量的实际观察性队列中的应用仍不充分,这正是本文的切入点。
发展脉络¶
- 奠基工作 (1980s-1990s):
- Prentice (1986) 提出 case-cohort 设计,为在大型队列中高效研究罕见暴露/结局提供了两相采样的早期框架。
- Robins, Rotnitzky & Zhao (1994) 和 Rotnitzky & Robins (1995) 建立了逆概率加权(IPW)和半参数效率理论在缺失数据与两相采样中的基础,给出了识别条件和效率界。这是本文方法论的直接理论源头。
-
Breslow & Holubkov (1997) 和 Breslow et al. (2003) 将两相采样下的最大似然估计和半参数回归模型的理论系统化,特别是 outcome-dependent sampling 下的渐近性质。
-
主要进展 (2000s-2010s):
- Wang et al. (2009) 将因果推断框架引入 outcome-dependent 两相采样设计,给出了平均处理效应的识别和半参数有效估计。
- Rose & van der Laan (2011) 将 Targeted Maximum Likelihood Estimation (TMLE) 应用于两阶段设计,提供了双稳健的替代方案。
- Gilbert, Yu & Rotnitzky (2014) 研究了在临床试验中,如何基于辅助变量(W)最优地选择第二相样本以估计均值差,给出了最优采样概率的解析形式。这是“最优设计”方向的关键工作。
-
Kennedy (2020) 和 Hejazi et al. (2021) 将非参数/半参数有效估计(efficient influence function)推广到更一般的两相采样和缺失暴露信息场景,提供了在弱非参数条件下仍能实现根号n一致估计的理论保证。
-
当前 Frontier & 本文位置:
- 当前前沿正将上述成熟的方法论应用于更复杂、更现实的采样机制,如重复采样(同一参与者多次有机会被采样)、依赖纵向辅助变量(采样概率随时间变化且依赖于历史信息)、以及与 EHR 数据结合(Zhang et al., 2024; Levis et al., 2024)。
- 本文的位置:它并非提出全新的统计理论,而是将已有的 IPW 框架系统地、步骤化地适配到 RECOVER 队列这种高度复杂的、重复的、依赖纵向辅助变量的两相采样设计中。它处理了“单次采样”和“重复采样”两种场景,并明确区分了暴露在采样前/后测量带来的权重结构差异。本文的贡献在于应用层面的整合与适配,而非理论创新。
子线索聚类¶
- IPW 与半参数效率理论:核心是构造权重以校正选择偏倚,并追求渐近有效估计。代表:Robins et al. (1994), Rotnitzky & Robins (1995), Kennedy (2020), Hejazi et al. (2021)。本文直接继承此线索,但未追求效率(未使用双稳健或有效影响函数)。
- 两相采样设计与最优抽样:关注如何设计第二相的采样规则(基于辅助变量)以最大化估计效率。代表:Prentice (1986), Breslow et al. (2003, 2009), Gilbert et al. (2014), Amorim et al. (2021)。本文的 RECOVER 设计本身是此类设计的实例,但本文不讨论设计优化,而是分析给定设计下的数据。
- 应用驱动的复杂采样机制:将方法论应用于具体领域(疫苗试验、EHR、Long COVID),处理实际数据中的多重缺失、重复测量、触发变量等复杂性。代表:Follmann (2006), Fong & Gilbert (2015), Fu & Gilbert (2017), Zhang et al. (2024), Levis et al. (2024)。本文属于此类,且其处理的“重复采样”和“纵向触发变量”是其中较复杂的场景。
核心问题与瓶颈¶
- 核心问题 1:在给定复杂两相采样机制下,如何一致地估计暴露组和对照组的结局均值及其差值?
- 核心问题 2:如何同时校正由采样设计、失访、结局缺失和混杂因素带来的多重偏倚?
- 核心问题 3:当采样概率依赖于随时间变化的辅助变量(包括暴露本身)时,如何正确定义和估计权重?
- 已知瓶颈:权重估计的模型误设定会导致偏倚;极端权重(接近0或1)会导致方差膨胀;在重复采样场景下,权重的累积乘积可能导致数值不稳定;理论上的效率界和双稳健扩展在如此复杂的采样机制下尚未被充分研究。
⚠️ 作者的 framing¶
- 作者的缺口描述:作者将缺口 frame 为“尽管两相采样方法学已广泛研究,但在观察性队列中,针对重复的、依赖纵向辅助变量的采样设计,其分析方法仍未被充分利用(under-utilized)”。他们将自己论文定位为“描述常见陷阱和一种分析方法”,是“迈向解决更一般问题的第一步”。
- 被淡化/回避的竞争路线:
- 双稳健估计(Doubly Robust, DR):作者在讨论中仅提及“双稳健扩展”是未来工作,但在方法部分完全使用了 IPW。Kennedy (2020) 和 Hejazi et al. (2021) 的工作正是 DR 或半参数有效估计,作者引用了它们,却未采用其方法。这暗示作者可能认为在如此复杂的采样机制下,实现 DR 的工程难度较高,或者其理论性质(如渐近正态性)在重复采样下尚未被充分验证。
- TMLE:Rose & van der Laan (2011) 的工作被引用,但未被采用。同样,TMLE 在复杂纵向设置下的实现可能比 IPW 更复杂。
- 多重插补(Multiple Imputation):未在方法中被讨论,尽管它也是处理缺失数据的常用策略。
- 什么明显该被引/该存在、却没出现在 intro 里?:
- 关于“重复采样”和“事件驱动”采样设计的更一般理论:例如,关于“visiting process”或“observation scheme”的因果推断文献(如关于 longitudinal data with irregular visits 的工作)。这些文献可能更直接地处理了“采样时间由辅助变量决定”的问题,而本文的“重复采样”本质上是一种离散化的、由触发变量驱动的观察过程。
- 关于“单调缺失”假设的讨论:作者假设了单调缺失(
U_k=0 => U_{k+1}=0),这在现实队列中可能不成立(参与者可能跳过某次访问后再次出现)。这个假设的合理性及其违反的后果未被讨论。
张力¶
未见明显对立引用。所有被引工作都在同一方法论框架(IPW/半参数)下,针对不同设定(case-cohort, EHR, 疫苗试验)进行扩展和应用。它们之间是互补而非矛盾的关系。
二、最核心、最简单的例子 / 数学问题¶
第一步:符号、模型、可观测数据交代清楚¶
- 符号:
i = 1, ..., n: 个体索引。k = 1, ..., K: 研究访问(visit)索引。A_k: 个体在访问k时的暴露状态(如 Long COVID 状态,二值:0/1)。这是感兴趣的暴露/处理变量。Y_k: 个体在访问k时的结局(如 UPSIT 测试结果,二值:异常/正常)。这是感兴趣的结局变量。W: 基线协变量向量(如年龄、性别、合并症)。这是需要调整的混杂因素。Z_k: 在访问k时测量的辅助变量向量(如“是否失去嗅觉/味觉”的触发变量)。这些变量影响采样概率,但通常不是调整混杂的目标。U_k: 指示个体是否出席了访问k并满足该次测试的资格要求(二值:1=是,0=否)。这是出席/资格指示器。R_k: 指示个体在访问k是否被采样并完成了该次测试(二值:1=是,0=否)。这是测试完成指示器。π^U_k: 条件概率P(U_k=1 | ...),即出席并满足资格的概率。π^R_k: 条件概率P(R_k=1 | ...),即被采样并完成测试的概率。π^A_k(a; W): 倾向性得分P(A_k=a | W),即给定基线协变量下暴露状态的条件概率。µ^a_k: 调整后的结局均值E[E[Y_k | A_k=a, W]],即暴露组a在访问k的潜在结局均值。-
ψ_k: 调整后的均值差µ^1_k - µ^0_k。 -
模型:
- 数据生成机制:这是一个观察性队列研究,没有随机化。暴露
A_k和结局Y_k都可能受基线协变量W影响(混杂)。辅助变量Z_k在时间上可能先于或与A_k、Y_k同时测量。 - 采样机制:这是两相采样。第一相:所有参与者都测量了
W和Z_k。第二相:只有一部分参与者(基于Z_k和A_k等)被选中测量Y_k。采样概率π^R_k是已知的(由设计决定)或可估计的。 -
关键假设:条件可忽略的采样机制(Conditionally ignorable sampling mechanism)。即,给定用于决定采样的变量(
A_k, Z_k, W等),测试完成指示器R_k与潜在结局Y_k条件独立。这是 IPW 有效的核心假设。 -
可观测数据:
- 可观测:对于所有
n个参与者,我们可以观测到基线协变量W,以及每个访问k的辅助变量Z_k、出席/资格指示器U_k、暴露状态A_k。 - 部分可观测:结局
Y_k和测试完成指示器R_k仅在U_k=1且被采样(R_k=1)的参与者中可观测。对于未被采样的参与者,Y_k是缺失的。 - 想要但观测不到:对于未被采样的参与者,其潜在结局
Y_k是反事实的,无法直接观测。我们只能通过假设采样机制是可忽略的,并用 IPW 来“重建”一个代表全队列的伪样本。
第二步:讲最小内核¶
最简特例:单次采样、二值辅助变量、二值结局
考虑一个极度简化的场景:只有一次访问(K=1),因此我们省略下标 k。我们想估计暴露 A(0/1)对结局 Y(0/1)的均值差 ψ = E[Y|A=1] - E[Y|A=0],但 Y 只在部分人中被测量。
- 设定:
- 全队列有
n人。我们观测到每个人的W和A。 - 有一个二值辅助变量
Z(0/1),例如“是否有症状”。 - 采样规则是:如果
Z=1,则 100% 被选中测量Y;如果Z=0,则只有 10% 被随机选中测量Y。即π^R(Z) = P(R=1|Z) = 1如果Z=1,= 0.1如果Z=0。 -
假设
Z与A和Y都相关(例如,有症状的人更可能有暴露A=1和异常结局Y=1)。 -
问题:如果我们直接计算被选中人群(
R=1)中暴露组和对照组的Y均值,会得到有偏估计。因为Z=1的人被过度代表了,而他们恰好有更高的Y值。 -
核心思路(IPW):给每个被观测到
Y的个体一个权重,这个权重等于其被采样概率的倒数。这样,一个在采样中“稀有”的个体(Z=0,被采样概率低)会被赋予更大的权重,从而在估计中“代表”更多未被采样的同类个体。 -
数学实现:
- 估计采样概率:在本例中,
π^R(Z)是已知的(由设计决定)。在更一般的情况下,需要用逻辑回归等模型从数据中估计P(R=1|Z, W, A)。 - 构造权重:对于每个被观测到
Y的个体i,其权重为w_i = 1 / π^R(Z_i)。 -
构造加权估计量:
- 暴露组(
A=1)的加权均值:µ̂^1 = (Σ_{i: R_i=1, A_i=1} w_i * Y_i) / (Σ_{i: R_i=1, A_i=1} w_i) - 对照组(
A=0)的加权均值:µ̂^0 = (Σ_{i: R_i=1, A_i=0} w_i * Y_i) / (Σ_{i: R_i=1, A_i=0} w_i) - 均值差:
ψ̂ = µ̂^1 - µ̂^0
- 暴露组(
-
为什么成立:在条件可忽略的假设下,加权后的伪样本中,
Z的分布被校正回与全队列一致。因此,基于加权伪样本计算的Y均值是E[Y|A]的一致估计。 -
本文的推广:本文的 RECOVER-Adult 例子就是把这个最小内核推广到了重复访问(
k=1,...,K)、多个辅助变量(Z_k是向量)、多重缺失机制(出席U_k、采样R_k、混杂W)的场景。权重不再是简单的1/π^R,而是多个概率的乘积(g^R_k),以同时校正出席、采样和混杂。其核心数学困难在于如何正确定义和估计这个累积权重,以处理随时间变化的、依赖于历史信息的采样过程。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在 RECOVER Long COVID 观察性队列中,如何对因“辅助变量依赖采样”(tiered testing)而选择性测量的结局(如肺功能、嗅觉测试)进行暴露-结局关联的无偏估计。
- 核心工具/方法:提出一个逆概率加权(IPW)估计框架,通过构造一个累积权重来同时校正由(a)出席/资格、(b)采样/完成、(c)混杂因素带来的多重选择偏倚。针对“暴露在采样前测量”(RECOVER-Adult,重复采样)和“暴露在采样后测量”(RECOVER-Pediatric,单次采样)两种设计给出了不同的权重结构。
- 主要结论:在 RECOVER-Adult 的 UPSIT 嗅觉测试例子中,未加权分析显示 Long COVID 组和对照组的严重嗅觉障碍患病率分别为 24.1% 和 12.9%;而完全加权校正后,估计值分别降至 14.6% 和 8.0%,均值差为 6.3%(95% CI: 1.3%, 11.3%)。这表明忽略采样机制会高估患病率,因为采样设计倾向于测试有症状(触发变量)的个体。
关键设定与假设¶
- 设定:本文考虑两种观察性队列设计:
- RECOVER-Adult(重复采样):参与者有多次访问机会。每次访问时,如果满足资格且被触发变量激活,就可能被采样进行某项测试。暴露(LC状态)在每次访问时都测量。目标是估计时间平均的暴露-结局关联。
- RECOVER-Pediatric(单次采样):参与者基于基线辅助变量被“提升”(promoted)进入纵向随访。暴露和结局都在这次随访中测量。目标是估计横截面的暴露-结局关联。
- 假设:
- 条件可忽略的采样机制:给定用于决定采样的变量(
A, Z, W等),测试完成指示器R与潜在结局Y条件独立。这是 IPW 的核心假设,但本文未明确陈述或讨论其合理性。 - 单调缺失(RECOVER-Adult):
U_k=0 => U_{k+1}=0。即一旦错过一次访问,后续所有访问都视为缺失。这简化了权重的计算,但可能不现实。 - 采样概率已知或可一致估计:在 RECOVER-Pediatric 中,采样概率
π^R由设计已知。在 RECOVER-Adult 中,π^R和π^U需要从数据中估计(如用逻辑回归)。 - 倾向性得分模型正确指定:用于估计
π^A_k(a; W)的模型(如逻辑回归)需要正确指定,以充分控制混杂。 - 相比已有文献的强化/放宽:
- 强化:本文处理了比经典 case-cohort 或单次两相采样更复杂的重复采样和依赖纵向辅助变量的机制。
- 放宽:本文未追求效率,仅使用 IPW,而非双稳健或半参数有效估计。这使得方法更简单、更易实现,但牺牲了在模型误设定下的稳健性。
主要结果¶
- 理论结果:本文没有新的理论定理。其核心理论主张是:在采样概率被正确指定或可一致估计的条件下,IPW 估计量是相合的。这是一个标准结论,作者未给出证明,而是引用了 van der Vaart (1998) 的 M-估计量理论作为方差估计的依据。
- 量化结论(实证):以 RECOVER-Adult 的 UPSIT 测试为例(表2):
- 未加权/未调整:LC 组 24.1% (233/966),非 LC 组 12.9% (175/1356),差值 11.2%。
- 加权(校正采样+缺失):LC 组 15.3%,非 LC 组 8.1%,差值 7.2%。
- 完全加权(校正采样+缺失+混杂):LC 组 14.6%,非 LC 组 8.0%,差值 6.3% (95% CI: 1.3%, 11.3%)。
- 结论:加权后估计的患病率显著降低,且组间差异缩小。这量化了忽略采样偏倚的后果。
证明路线与技术技巧¶
本文是应用方法论文,无严格证明。其“证明”体现在对估计量构造的逻辑论证上。
- 整体路线(以 RECOVER-Adult 为例):
- 定义目标量:定义每个访问
k的调整后均值µ^a_k和均值差ψ_k,以及跨访问的逆方差加权平均ψ。 - 分解选择过程:将个体最终被观测到
Y_k的过程分解为三个步骤:出席并满足资格 (U_k=1)、被采样并完成测试 (R_k=1)、以及暴露状态 (A_k=a)。每一步都有一个条件概率。 - 构造累积权重:计算一个个体在访问
k首次完成测试的累积概率g^R_k,它是所有先前访问的出席概率和未完成概率,以及当前访问的完成概率的乘积。这个权重的倒数用于校正选择偏倚。 - 构造 IPW 估计量:用
1/ĝ^R_k作为权重,对观测到的Y_k进行加权平均,得到µ̂^a_k。同时,用倾向性得分π̂^A_k的倒数来校正混杂。 - 聚合:用逆方差加权法将各访问的
ψ̂_k合并为ψ̂。 -
推断:使用 sandwich 方差估计或 bootstrap 进行推断。
-
关键跳跃点:
- 权重的定义:如何将“出席”、“采样”、“混杂”这三个不同来源的偏倚整合到一个统一的权重中。作者的解法是将概率相乘,构造
g^R_k和π̂^A_k,并在估计量中同时使用它们。这个跳跃的逻辑是:每个选择步骤都引入了偏倚,而 IPW 可以通过对每个步骤的概率取倒数来逐层校正。 -
倾向性得分的加权估计:在 RECOVER-Adult 中,倾向性得分
π^A_k是针对全队列定义的,但只能在那些出席并被采样的子集中拟合。作者指出,必须用1/ĝ^U_k(出席概率的累积)对这个子集进行加权,才能得到全队列的无偏倾向性得分估计。这是一个重要的技术细节,确保了混杂校正的正确性。 -
技术技巧点名:
- 逆概率加权 (IPW):核心工具,用于校正选择偏倚。
- M-估计量 (M-estimation):用于推导 sandwich 方差估计,作为推断的基础。
- Bootstrap:作为方差估计的替代方案。
- 逆方差加权 (Inverse-variance weighting):用于合并多个访问的估计结果。
真实例子与应用¶
- 数据/场景:RECOVER-Adult 队列,具体分析 UPSIT(宾夕法尼亚大学嗅觉识别测试)的结果。暴露是 Long COVID 状态(由 LCRI 指数定义),结局是严重嗅觉障碍(UPSIT ≤ 25)。
- 方法应用:作者按照图3的步骤,依次拟合了出席模型、采样/完成模型和倾向性得分模型,计算了权重,并应用了公式(6)和(7)的估计量。
- 结果:如上所述,加权估计显著改变了患病率估计。
- 例子想说明什么:这个例子旨在验证方法,展示 IPW 如何在实际中校正由“触发变量”驱动的采样偏倚。具体来说,它量化了“因为采样设计倾向于测试有嗅觉丧失症状的人,所以未加权分析会高估嗅觉障碍的患病率”这一直觉。它展示了方法对科学结论的实质性影响。
🔎 结论是否比证明窄¶
- 是。本文的结论(IPW 估计量是相合的)是一个标准结论,其证明依赖于“采样概率被正确指定”这一强假设。然而,作者在讨论中承认了模型误设定的风险,并提出了“双稳健扩展”作为未来工作。这表明,本文严格证明的结论(在正确模型下相合)比其泛泛声称的实用性要窄。在实际应用中,模型几乎总是被误设定的,此时 IPW 估计量的性质(偏倚大小、方差)并未被本文分析。
- 具体语句:作者在方法部分未给出任何定理或引理。在讨论部分,他们写道:“Further advancements, including doubly robust extensions, as well as approaches to address potential loss of data due to monotonization, are expected to further improve efficiency and robustness.” 这直接承认了当前方法的局限性。
四、开放问题(点到为止,扎根具体语句)¶
- 双稳健扩展:如何为本文的复杂重复采样设计构造一个双稳健(DR)估计量,使其在采样模型或结局模型之一正确指定时仍保持一致估计?扎根于:讨论部分 “Further advancements, including doubly robust extensions...”。
- 辅助变量依赖的纵向建模:当暴露和结局的测量时间本身由辅助变量决定(即“事件驱动”采样)时,如何定义和估计因果效应?本文的“时间平均”效应可能掩盖了动态关系。扎根于:讨论部分 “Interest may also be in 1) understanding how an exposure impacts the outcome of a tiered test at a later point in time...”。
- 触发变量本身是结果时的处理:当一个 tiered test 的触发变量依赖于另一个 tiered test 的结果时(如脑部 MRI 的触发依赖于 UPSIT 结果),如何避免由此产生的额外选择偏倚?扎根于:讨论部分 “Further complexity also emerges if auxiliary variables themselves depend on responses to other tiered tests. For example, the trigger for brain MRI depended on evaluation of UPSIT, itself a tiered test.”
- 效率界与最优权重:在本文的重复采样设定下,IPW 估计量的半参数效率界是什么?是否存在比“概率乘积”更优的权重构造方式(如基于有效影响函数的权重)?扎根于:本文未讨论效率,仅使用了 IPW。这是一个自然的理论延伸。
Maintained by 陈星宇 · Homepage · Source on GitHub