Estimation and inference for the population attributable risk in the presence of misclassification¶
作者: Benedict H W Wong, Jooyoung Lee, Donna Spiegelman, Molin Wang
来源: Biostatistics
主题: 流行病学
相关性: 7/10
机构绿灯: Harvard University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxz067
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的核心问题是:在流行病学中,如何估计人群归因危险度(Population Attributable Risk, PAR)——即如果从目标人群中完全消除某个暴露因素,可以预防的疾病病例比例——当该暴露因素存在分类错误(misclassification)时。这是一个典型的“因果参数估计 + 测量误差”问题。PAR 本身是一个成熟的流行病学指标,其估计方法(如基于 logistic 回归的调整后 PAR)已有大量文献。但在暴露变量存在非微分或微分错误分类时,如何对 PAR 进行校正估计与推断,在本文之前是一个明确的方法学空白。本文的成熟度属于“填补一个已知但未被系统处理过的缺口”。
发展脉络(history)¶
本文的 introduction 将相关文献串成了一条清晰的线,大致可分为三个阶段:
-
奠基工作:PAR 的标准化估计与调整后估计
- Bruzzi et al. (1985):提出了基于 logistic 回归的调整后 PAR 估计方法,这是后续几乎所有 PAR 估计工作的基础。作者引用它作为“标准方法”的起点。
- Greenland & Drescher (1993):进一步发展了 PAR 的方差估计,使其能够进行有效的区间估计。作者引用它作为“方差估计的经典方法”。
- Spiegelman et al. (2007):将 PAR 估计推广到部分 PAR(pPAR),即调整多个暴露因素后,单个暴露因素的贡献。作者引用它作为“pPAR 估计的现代标准”。
-
主要进展:处理测量误差的流行病学方法
- Carroll et al. (2006):这是测量误差领域的经典教科书,系统总结了回归校准、SIMEX、似然方法等。作者引用它作为“处理测量误差的通用框架”。
- Lyles et al. (2011):提出了在存在错误分类时,基于似然的 logistic 回归校正方法。作者引用它作为“处理错误分类的似然方法基础”。
- Edwards et al. (2013):将错误分类校正方法扩展到 Cox 比例风险模型。作者引用它作为“错误分类校正的生存分析扩展”。
-
当前 frontier 与本文的位置
- 本文的直接前驱:作者明确指出,没有任何现有工作将错误分类校正方法系统地应用于 PAR 或 pPAR 的估计。所有已有的 PAR 估计方法都假设暴露变量被完美测量。因此,本文的定位是“将错误分类校正的似然框架与 PAR 估计相结合,填补这个缺口”。
- 本文的贡献:作者开发了一个统一的似然框架,同时建模疾病风险模型(logistic)和错误分类机制(基于验证研究),并考虑了主研究/内部验证研究和主研究/外部验证研究两种设计,以及关于可转移性(transportability)的不同假设。这是该子方向上的第一个系统工作。
子线索聚类¶
这些被引文献大致落在两条子线索上:
- 线索一:PAR 的估计与推断(Bruzzi, Greenland, Spiegelman)。这一簇专注于 PAR 和 pPAR 的点估计、方差估计和区间估计,但假设暴露变量被完美测量。这是本文要扩展的“无错误”基线。
- 线索二:错误分类的校正方法(Carroll, Lyles, Edwards)。这一簇专注于在 logistic 回归、Cox 模型等中校正暴露变量的错误分类,但不涉及 PAR 这个特定的因果参数。这是本文要借用的工具。
本文的工作就是将这两条线索合并:用线索二的方法(似然框架)去估计线索一的目标(PAR)。
这个方向在追问的核心问题¶
- 如何识别 PAR? 在完美测量下,PAR 可以通过调整后的患病率比(prevalence ratio)或风险比(risk ratio)来识别。在错误分类下,识别依赖于对错误分类机制(敏感性、特异性)的建模,以及这些参数是否可从验证研究中识别。
- 如何估计 PAR? 在识别后,如何构造一个一致且渐近正态的估计量?本文采用基于似然的 MLE 方法。
- 如何量化不确定性? 如何计算 PAR 估计量的方差?本文通过 Delta 方法和 Fisher 信息矩阵来获得标准误。
- 验证研究设计的影响? 内部验证(验证样本来自主研究)和外部验证(验证样本来自不同人群)对识别和估计有何不同影响?可转移性假设(如敏感性/特异性是否可转移)如何影响推断?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么? 作者将缺口 frame 为“在暴露变量存在错误分类时,PAR 和 pPAR 的估计与推断方法完全缺失”。他们声称这是“public health evaluation methods”中的一个“important existing gap”。他们的论文是“filling”这个缺口。
- 哪些竞争路线被他淡化或回避了?
- 贝叶斯方法:作者完全采用了频率学派似然方法,没有讨论贝叶斯方法(如通过 MCMC 对错误分类参数和 PAR 进行联合后验推断)。这可能是因为贝叶斯方法在流行病学应用中不如似然方法普及,但并非不可行。
- 多重插补(MI):对于测量误差,多重插补也是一种常见策略。作者没有将其作为竞争方法进行比较或讨论。
- 非参数/半参数方法:作者的方法完全基于参数模型(logistic 疾病模型,参数化错误分类模型)。他们没有讨论使用非参数或半参数方法(如基于倾向性评分或 IPW 的 PAR 估计)来处理错误分类的可能性。
- 什么明显该被引 / 该存在、却没出现在 intro 里?
- 关于 PAR 的因果解释:PAR 本质上是一个因果参数(“如果消除暴露,会预防多少病例”)。作者没有引用任何关于 PAR 的因果识别假设(如无未测量混杂、一致性)的文献。这暗示本文更偏向于“统计关联”而非“因果推断”的视角。
- 关于“部分 PAR”的因果解释:当多个暴露因素存在时,pPAR 的因果解释依赖于它们之间没有交互作用或特定的干预顺序。作者没有讨论这些假设。
- 关于“可转移性”的文献:作者提到了“transportability assumptions”,但没有引用因果推断中关于“transportability”或“generalizability”的正式文献(如 Pearl & Bareinboim 的工作)。他们的“transportability”概念更接近于“假设外部验证研究的错误分类参数与主研究相同”,而非因果图意义上的可转移性。
张力¶
未见明显对立引用。所有被引工作都沿着“改进估计方法”这一主线,没有出现彼此矛盾或在略不同条件下得相反结论的情况。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
- \( D \):疾病状态(0 = 未患病,1 = 患病)。这是可观测的。
- \( X \):真实暴露变量(0 = 未暴露,1 = 暴露)。这是潜在/不可观测的(在错误分类下)。
- \( X^* \):观测到的暴露变量(0 = 未暴露,1 = 暴露)。这是可观测的。
- \( C \):协变量向量(如年龄、性别)。这是可观测的。
- \( \pi = P(D=1 | X, C) \):疾病风险模型。本文假设为 logistic 模型:\( \text{logit}(\pi) = \beta_0 + \beta_1 X + \beta_2^T C \)。
- \( \text{Se} = P(X^*=1 | X=1, C) \):敏感性(Sensitivity),即真实暴露者被正确分类的概率。这是需要估计的参数。
- \( \text{Sp} = P(X^*=0 | X=0, C) \):特异性(Specificity),即真实未暴露者被正确分类的概率。这是需要估计的参数。
- \( \text{PVP} = P(X=1 | X^*=1, C) \):阳性预测值(Positive Predictive Value)。
- \( \text{PVN} = P(X=0 | X^*=0, C) \):阴性预测值(Negative Predictive Value)。
- \( \theta = (\beta_0, \beta_1, \beta_2, \text{Se}, \text{Sp}) \):所有待估参数的向量。
- \( \text{PAR} \):人群归因危险度。定义为 \( \text{PAR} = \frac{P(D=1) - P(D=1 | \text{do}(X=0))}{P(D=1)} \)。在无混杂且一致性假设下,可识别为 \( \text{PAR} = 1 - \frac{E[P(D=1|X=0, C)]}{P(D=1)} \)。
- \( \text{pPAR} \):部分人群归因危险度。在调整其他暴露因素后,单个暴露因素的贡献。
-
模型:
- 疾病模型:\( D | X, C \sim \text{Bernoulli}(\pi) \),其中 \( \text{logit}(\pi) = \beta_0 + \beta_1 X + \beta_2^T C \)。
- 错误分类模型:假设错误分类是非微分的(即 \( X^* \) 与 \( D \) 在给定 \( X \) 和 \( C \) 下条件独立),且 \( X^* \) 的分布只依赖于 \( X \) 和 \( C \)。本文考虑了两种参数化方式:
- 直接参数化:直接估计 \( \text{Se} \) 和 \( \text{Sp} \)(可能依赖于 \( C \))。
- 间接参数化:估计 \( \text{PVP} \) 和 \( \text{PVN} \),然后通过贝叶斯公式反推 \( \text{Se} \) 和 \( \text{Sp} \)。这通常更稳定,因为 PVP 和 PVN 是验证研究中可直接观测的。
-
可观测数据:
- 主研究(Main Study):观测到 \( (D, X^*, C) \) 的样本。无法观测到真实暴露 \( X \)。
- 验证研究(Validation Study):观测到 \( (X, X^*, C) \) 的样本。这是校正错误分类的关键,因为它提供了关于 \( \text{Se} \) 和 \( \text{Sp} \) 的信息。
- 内部验证:验证样本是主研究的一个随机子集。此时,验证样本中也有 \( D \) 的信息。
- 外部验证:验证样本来自一个独立于主研究的人群。此时,验证样本中可能没有 \( D \) 的信息。
- 想要但观测不到的量:真实暴露 \( X \) 在主研究中是缺失的。这是整个问题的核心。
第二步:讲最小内核¶
本文的最小内核可以归结为:在二值暴露、二值疾病、无协变量的最简设定下,如何利用一个内部验证研究来校正 PAR 的估计?
-
最简特例:
- 没有协变量 \( C \)。
- 疾病模型:\( \text{logit}(P(D=1|X)) = \beta_0 + \beta_1 X \)。
- 错误分类模型:\( \text{Se} = P(X^*=1|X=1) \),\( \text{Sp} = P(X^*=0|X=0) \),且不依赖于任何其他变量。
- 内部验证研究:主研究有 \( N \) 个个体,观测到 \( (D, X^*) \)。验证研究是主研究的一个随机子集,有 \( n_v \) 个个体,观测到 \( (D, X, X^*) \)。
-
核心思路:
-
构建似然函数:基于所有可观测数据(主研究 + 验证研究)构建联合似然。由于 \( X \) 在验证研究中被观测到,而在主研究中缺失,这是一个典型的缺失数据问题。似然函数可以写成:
\[L(\beta_0, \beta_1, \text{Se}, \text{Sp}, P(X=1)) = \prod_{i \in \text{验证}} P(D_i, X_i, X_i^*) \times \prod_{i \in \text{主研究}} P(D_i, X_i^*)\]其中,\( P(D, X, X^*) = P(D|X) P(X^*|X) P(X) \),而 \( P(D, X^*) = \sum_{x \in \{0,1\}} P(D|X=x) P(X^*|X=x) P(X=x) \)。 -
参数估计:通过最大化这个似然函数,可以得到 \( \beta_0, \beta_1, \text{Se}, \text{Sp}, P(X=1) \) 的 MLE。注意,\( P(X=1) \) 是暴露流行率,也需要估计。
-
计算 PAR:在无协变量的情况下,PAR 的公式简化为:
\[\text{PAR} = 1 - \frac{P(D=1|X=0)}{P(D=1)} = 1 - \frac{\text{expit}(\beta_0)}{\text{expit}(\beta_0) \cdot P(X=0) + \text{expit}(\beta_0 + \beta_1) \cdot P(X=1)}\]其中 \( \text{expit}(a) = e^a / (1+e^a) \)。 -
推断:通过 Delta 方法,利用 MLE 的渐近方差-协方差矩阵(Fisher 信息矩阵的逆),可以计算出 PAR 估计量的渐近方差,从而构造置信区间。
-
-
为什么这个特例抓住了核心:
- 它清晰地展示了如何通过似然函数将验证研究的信息“传递”到主研究,以校正错误分类。
- 它暴露了参数的可识别性:即使没有验证研究,如果错误分类参数(Se, Sp)已知,PAR 也是可识别的。验证研究的作用是估计这些参数。
- 它展示了PAR 估计量是模型参数的复杂非线性函数,因此方差估计需要 Delta 方法。
- 论文的一般情形只是这个特例的“加壳”:加入协变量 \( C \),考虑外部验证(需要可转移性假设),以及扩展到 pPAR。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在流行病学研究中,当暴露变量存在分类错误时,如何对人群归因危险度(PAR)和部分人群归因危险度(pPAR)进行点估计和区间估计。
- 核心工具/方法:采用基于似然的参数估计方法,同时建模疾病风险(logistic 回归)和错误分类机制(敏感性/特异性或阳性/阴性预测值),并支持主研究/内部验证研究和主研究/外部验证研究两种设计。
- 主要结论:通过模拟研究和真实数据分析(HPFS 队列),证明了所提出的方法能够有效校正错误分类导致的 PAR 估计偏倚,且校正后的估计值可能远大于未校正的估计值(在 HPFS 例子中,pPAR 增加了最多 317%)。
关键设定与假设¶
在第二节最小记号的基础上,本文的完整设定如下:
- 疾病模型:\( \text{logit}(P(D=1|X, C)) = \beta_0 + \beta_1 X + \beta_2^T C \)。这是一个标准的参数模型。
- 错误分类模型:
- 假设 1:非微分错误分类(Nondifferential Misclassification):\( X^* \perp D | X, C \)。这是最关键的假设,意味着错误分类不依赖于疾病状态。如果违反(微分错误分类),则似然函数需要修改,且识别性可能丧失。
- 假设 2:错误分类参数化:作者考虑了两种参数化方式:
- 直接参数化:\( \text{Se}(C) = P(X^*=1|X=1, C) \),\( \text{Sp}(C) = P(X^*=0|X=0, C) \)。可以建模为 \( C \) 的 logistic 函数。
- 间接参数化:\( \text{PVP}(C) = P(X=1|X^*=1, C) \),\( \text{PVN}(C) = P(X=0|X^*=0, C) \)。作者推荐这种参数化,因为它更稳定,且验证研究中可直接观测。
- 验证研究设计:
- 内部验证:验证样本是主研究的一个随机子集。此时,似然函数可以联合所有数据(主研究 + 验证)进行最大化。
- 外部验证:验证样本来自一个独立人群。此时,需要可转移性(Transportability)假设。
- 假设 3a(强可转移性):错误分类参数(如 Se, Sp)在外部验证人群和主研究人群中完全相同。
- 假设 3b(弱可转移性):错误分类参数在给定某些协变量后条件可转移。
- 假设 3c(不可转移):错误分类参数完全不同,此时外部验证研究无法提供任何有用信息。
- 相比已有文献的放宽或强化:
- 放宽:本文是第一个将错误分类校正应用于 PAR 估计的,因此它放宽了“暴露变量被完美测量”这一不现实的假设。
- 强化:本文的方法依赖于参数模型假设(logistic 疾病模型,参数化错误分类模型),这比一些非参数或半参数方法更强。此外,非微分错误分类假设也是一个强假设。
主要结果¶
本文的主要结果是方法学上的,而非提出新的理论界。核心结果如下:
- 点估计:通过最大化联合似然函数,得到所有参数(\( \beta, \text{Se}, \text{Sp}, P(X|C) \))的 MLE。然后,将这些 MLE 代入 PAR 或 pPAR 的公式,得到点估计。
- 区间估计:通过 Delta 方法,利用 MLE 的渐近方差-协方差矩阵,计算 PAR 估计量的渐近方差,并构造 Wald 型置信区间。
- 模拟研究:
- 场景:模拟了多种情况,包括不同的错误分类程度(Se, Sp 从 0.6 到 0.9)、不同的暴露流行率、不同的疾病风险(OR 从 1.5 到 3.0),以及内部验证和外部验证设计。
- 核心量化结论:
- 未校正的 PAR 估计存在严重偏倚:当错误分类存在时,忽略它的标准 PAR 估计(假设 \( X^* = X \))会严重低估真实的 PAR。偏倚方向是向零(attenuation bias)。
- 校正后的 PAR 估计几乎无偏:本文提出的似然方法能够有效校正这种偏倚,点估计的偏差接近于 0。
- 方差估计准确:基于 Delta 方法的标准误估计与模拟标准误非常接近,覆盖概率接近名义水平(如 95%)。
- 外部验证的敏感性:当外部验证研究的可转移性假设被违反时(例如,外部验证的 Se 与主研究不同),校正后的 PAR 估计会出现偏倚。偏倚程度取决于可转移性假设被违反的程度。
- 真实例子:
- 数据:健康专业人员随访研究(HPFS),一个大型前瞻性队列。
- 场景:估计高红肉摄入和酒精摄入对结直肠癌发病率的部分 PAR(pPAR)。暴露变量(红肉摄入、酒精摄入)通过食物频率问卷(FFQ)测量,存在分类错误。验证研究是一个子样本,其中暴露变量通过更精确的膳食记录(DR)测量。
- 怎么用:将 FFQ 测量的暴露作为 \( X^* \),DR 测量的暴露作为 \( X \)。使用内部验证设计,应用本文的似然方法。
- 结果:
- 未校正的 pPAR(高红肉摄入):约 5%。
- 校正后的 pPAR(高红肉摄入):约 21%。增加了 317%。
- 未校正的 pPAR(酒精摄入):约 4%。
- 校正后的 pPAR(酒精摄入):约 10%。增加了 150%。
- 这个例子想说明什么:错误分类对 PAR 的偏倚影响可能非常巨大,远远超过对风险比(OR/RR)的影响。因此,在公共卫生决策中,忽略错误分类会严重低估可预防的疾病负担。本文的方法提供了一个实用的校正工具。
证明路线与技术技巧¶
本文是应用型论文,没有复杂的理论证明。其“证明”主要体现在似然函数的构建和 Delta 方法的推导上。
-
整体路线:
- 构建似然:写出基于所有可观测数据的联合似然函数。对于内部验证,这是主研究和验证研究数据的乘积。对于外部验证,这是主研究数据和验证研究数据的乘积,但验证研究数据中不包含疾病信息。
- 参数化:将似然函数中的每个概率(\( P(D|X,C), P(X^*|X,C), P(X|C) \))用参数模型表示。
- 最大化:使用数值优化算法(如 Newton-Raphson)最大化似然函数,得到 MLE。
- 计算 PAR:将 MLE 代入 PAR 的公式。
- 方差估计:计算 MLE 的渐近方差(Fisher 信息矩阵的逆),然后通过 Delta 方法计算 PAR 估计量的渐近方差。
-
关键跳跃点:
- 从“完美测量”到“错误分类”的跳跃:这是本文的核心贡献。关键在于,在似然函数中,对主研究中缺失的真实暴露 \( X \) 进行求和(积分),从而将错误分类模型“整合”进来。
- 从“内部验证”到“外部验证”的跳跃:这引入了可转移性假设。作者需要明确说明,在外部验证下,哪些参数被假设为在两个人群中是相同的,哪些是不同的。这是方法学上的一个关键决策点。
-
技术技巧点名:
- 似然方法(Likelihood-based estimation):核心工具,用于处理缺失数据(真实暴露 \( X \))和联合估计所有参数。
- Delta 方法(Delta method):用于计算 PAR 这个非线性函数的渐近方差。
- Fisher 信息矩阵(Fisher information matrix):用于获得 MLE 的渐近方差。
- 间接参数化(Indirect parameterization):使用 PVP 和 PVN 而非 Se 和 Sp 作为参数,以提高数值稳定性。
🔎 结论是否比证明窄¶
- 是。本文的结论(“校正后的 PAR 估计几乎无偏”)是在参数模型假设和非微分错误分类假设下严格证明的(通过模拟验证)。作者在讨论部分明确承认了这些假设的局限性,并指出如果这些假设被违反,方法可能失效。例如,他们提到“如果错误分类是微分的,我们的方法将产生有偏估计”。因此,结论的适用范围被严格限制在假设成立的场景下。
- 作者没有声称该方法在非参数或半参数设定下有效,也没有声称它对于微分错误分类是稳健的。这是一个诚实的、窄于可能被泛化的结论。
四、开放问题¶
- 放松非微分错误分类假设:本文的核心假设是 \( X^* \perp D | X, C \)。如果错误分类依赖于疾病状态(例如,病例比对照更可能被正确分类),如何识别和估计 PAR?这可能需要工具变量或代理变量方法。扎根于:作者在讨论中明确提到“如果错误分类是微分的,我们的方法将产生有偏估计”。
- 放松参数模型假设:本文假设疾病风险模型是 logistic 的,错误分类模型也是参数化的。能否开发出半参数或非参数的 PAR 估计方法,使其对模型误设定更稳健?例如,使用倾向性评分加权或双重稳健估计。扎根于:作者的方法完全基于参数似然,没有讨论半参数扩展。
- 处理多个暴露因素的联合错误分类:本文考虑了单个暴露因素的错误分类。当多个暴露因素(如红肉和酒精)都存在错误分类时,如何联合校正?错误分类之间可能存在相关性,这会增加复杂性。扎根于:本文的真实例子分别估计了红肉和酒精的 pPAR,但未考虑它们错误分类之间的相关性。
- 因果解释的严谨性:本文的 PAR 定义隐含了因果解释(“如果消除暴露”)。但作者没有讨论实现这种因果解释所需的识别假设(如无未测量混杂、一致性)。如何将本文的方法与正式的因果推断框架(如反事实框架、有向无环图)结合起来,明确 PAR 的因果识别条件?扎根于:本文的 introduction 和讨论均未引用因果推断文献,也未讨论混杂问题。
Maintained by 陈星宇 · Homepage · Source on GitHub