Testing calibration of phenotyping models using positive-only electronic health record data¶
作者: Lingjiao Zhang, Yanyuan Ma, Daniel Herman, Jinbo Chen
来源: Biostatistics
主题: 数理统计 / 假设检验
相关性: 5/10
机构绿灯: University of Pennsylvania(US News 前 50,免分进入精读)
链接: https://doi.org/10.1093/biostatistics/kxab003
一、领域脉络与小综述¶
这个方向是什么¶
本方向解决的核心问题是:在电子健康记录(EHR)数据中,当只有“金标准阳性病例”和大量未标记样本(无金标准阴性对照)时,如何对表型预测模型进行校准检验和区分度评估? 这是一个典型的“正-无标记学习”(Positive-Unlabeled Learning, PU learning)设定下的模型诊断问题。当前成熟度:方法学上已有一些针对PU数据下模型拟合与预测的工作,但校准检验这一模型验证的关键环节几乎空白。
发展脉络(history)¶
- 奠基工作:PU学习的基本设定与估计。Elkan & Noto (2008) 和 du Plessis et al. (2014) 奠定了PU学习的基础,提出了在“标记病例代表所有病例”(selected completely at random, SCAR)假设下估计分类器的方法。这些工作主要关注模型训练,而非模型验证。
- 主要进展:PU数据下的模型评估。Bekker & Davis (2018) 综述了PU学习,但校准检验仍未被系统处理。Jaskie & Spanias (2019) 等讨论了PU数据下的模型性能度量,但多聚焦于区分度(如AUC),校准检验被完全忽略。
- 当前frontier:校准检验的缺失。作者在intro中明确指出:“现有PU学习方法主要关注模型训练和区分度评估,但模型校准检验——即评估预测风险是否与实际事件概率一致——在PU设定下尚未被研究。” 这是本文的直接定位。
- 本文的位置:本文是第一个在PU数据(仅阳性+未标记)下提出校准检验方法的工作。它填补了从“PU模型训练”到“PU模型验证”链条中的关键一环。
子线索聚类¶
这些被引文献大致落在两条子线索上: 1. PU学习理论与方法(Elkan & Noto 2008, du Plessis et al. 2014, Bekker & Davis 2018, Jaskie & Spanias 2019):关注如何在仅有阳性样本和未标记样本时训练分类器,核心假设是SCAR(标记病例是病例总体的随机子集)。 2. 模型校准检验方法(Hosmer-Lemeshow test, calibration belt, calibration slope):这些方法均假设有完整的金标准病例和对照数据。本文将其推广到PU设定。
这个方向在追问的核心问题¶
- 如何定义和检验PU数据下的模型校准? 传统校准检验(如Hosmer-Lemeshow检验)需要病例和对照的真实标签,PU设定下缺少对照标签,无法直接应用。
- 校准斜率的估计:在PU设定下,如何估计校准斜率(即预测风险与真实风险之间的线性关系)?
- 区分度指标的一致估计:在PU设定下,如何一致地估计AUC等区分度指标?
- 代表性假设的稳健性:SCAR假设在EHR数据中是否合理?如果标记病例不代表所有病例(即存在选择偏差),方法是否仍然有效?
当前主流方法与已知瓶颈:主流方法(Hosmer-Lemeshow检验、校准斜率回归)均需要完整标签。瓶颈在于:EHR数据中获取金标准阴性对照的成本极高(需要专家回顾大量病历),而阳性病例相对容易获取。因此,开发仅需阳性样本的校准检验方法具有实际需求。
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
作者把缺口frame成:“现有PU学习方法主要关注模型训练和区分度评估,但模型校准检验在PU设定下尚未被研究。” 这使得本文成为“显然的下一步”——在PU模型训练完成后,自然需要验证其校准性能。作者淡化了SCAR假设的合理性这一关键问题,仅在讨论中提及“如果代表性假设不成立,方法可能产生偏差”。什么明显该被引/该存在、却没出现在intro里?——作者没有引用任何关于PU数据下模型校准的已有工作(因为确实没有),但也没有引用关于SCAR假设检验或放松SCAR假设的PU学习工作(如“positive-unlabeled learning under selection bias”),这可能是作者有意回避的竞争路线——如果SCAR假设不成立,本文方法需要修正。
张力¶
未见明显对立引用。所有被引工作均支持PU学习的基本框架(SCAR假设),本文在此基础上进行扩展。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
- 符号:
- \( D \):疾病状态(1=病例,0=对照)。这是潜在变量,在未标记样本中不可观测。
- \( S \):标记状态(1=被标记为金标准病例,0=未标记)。这是可观测变量。
- \( R = P(D=1|X) \):模型预测的风险(预测概率)。这是已知的(由待检验的模型给出)。
- \( X \):协变量向量。可观测。
- \( \pi = P(S=1|D=1) \):标记概率(在病例中被标记的概率)。未知参数,在SCAR假设下为常数。
- \( \rho = P(D=1) \):总体患病率。未知参数。
- \( n \):总样本量。已知。
- \( n_1 \):标记病例数。已知。
-
\( G \):风险子组(如将预测风险 \( R \) 分为 \( K \) 个区间)。由研究者定义。
-
模型:
- 数据生成机制:总体由病例(\( D=1 \))和对照(\( D=0 \))组成。病例以概率 \( \pi \) 被标记为金标准病例(\( S=1 \)),对照永远不会被标记(\( S=0 \))。标记过程独立于协变量 \( X \) 和预测风险 \( R \)(SCAR假设)。
- 可观测数据:研究者观测到 \( n \) 个样本,其中 \( n_1 \) 个是标记病例(\( S=1 \)),其余 \( n - n_1 \) 个是未标记样本(\( S=0 \))。对于标记病例,我们知道 \( D=1 \);对于未标记样本,\( D \) 未知(可能是病例或对照)。
- 想要但观测不到的量:每个未标记样本的真实疾病状态 \( D \),以及总体患病率 \( \rho \) 和标记概率 \( \pi \)。
第二步:讲最小内核¶
最简特例:假设我们只有一个风险子组(\( K=1 \)),即所有样本的预测风险 \( R \) 相同(例如,模型对所有样本预测风险为 \( p \))。此时,校准检验退化为:检验预测风险 \( p \) 是否等于真实患病率 \( \rho \)。
- 可观测数据:\( n_1 \) 个标记病例,\( n - n_1 \) 个未标记样本。
- 核心思路:在SCAR假设下,标记病例数 \( n_1 \) 服从二项分布 \( \text{Binomial}(n, \pi \rho) \)。因此,\( \pi \rho \) 可被一致估计为 \( \hat{\pi \rho} = n_1 / n \)。但我们需要的是 \( \rho \) 本身,而不是 \( \pi \rho \)。
- 关键想法:利用模型自由估计与模型基估计的差异。模型自由估计:在未标记样本中,病例数无法直接观测,但我们可以用标记病例的分布来“推断”未标记样本中的病例数。具体地,在SCAR假设下,标记病例的协变量分布与所有病例的协变量分布相同。因此,我们可以用标记病例的协变量分布来估计未标记样本中病例的协变量分布,从而得到未标记样本中病例数的模型自由估计。模型基估计:直接用预测风险 \( p \) 乘以未标记样本数,得到未标记样本中病例数的模型基估计。
- 检验统计量:比较模型自由估计的病例数与模型基估计的病例数。如果模型校准良好,两者应接近。在单子组特例下,这个差异的平方(经方差标准化后)渐近服从自由度为1的卡方分布。
- 为什么成立:因为模型自由估计是 \( \rho \) 的一致估计(基于标记病例的分布),而模型基估计是 \( p \) 乘以样本数。如果 \( p = \rho \),两者之差应仅由抽样误差引起,其方差可被估计,从而构造卡方检验。
一般情形:当有 \( K \) 个风险子组时,上述思路推广为:在每个子组内分别进行模型自由与模型基的病例数估计,然后聚合所有子组的差异,构造一个渐近服从自由度为 \( K \) 的卡方分布的统计量。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:在仅有金标准阳性病例和未标记样本(无金标准阴性对照)的EHR数据中,如何检验表型预测模型的校准性能,并估计校准斜率和区分度指标。
- 核心工具/方法:提出一个聚合各风险子组中模型自由估计与模型基估计的病例数差异的统计量(渐近卡方分布),用于校准检验;提出基于标记病例分布和SCAR假设的校准斜率与区分度指标的一致估计方法。
- 主要结论:所提校准检验统计量在SCAR假设下渐近服从卡方分布,校准斜率和区分度指标可被一致估计,模拟和真实数据验证了方法的有效性。
关键设定与假设¶
- SCAR假设(代表性假设):标记病例是所有病例的随机子集,即 \( P(S=1|D=1, X) = P(S=1|D=1) = \pi \)。这是最关键的假设,它保证了标记病例的协变量分布与所有病例的协变量分布相同,从而可以用标记病例来估计病例总体的分布。相比已有文献(如Elkan & Noto 2008),本文采用了相同的假设,但将其应用于模型验证而非模型训练。
- 模型自由估计:基于标记病例的协变量分布,通过逆概率加权(IPW)或直接估计,得到每个风险子组中病例数的模型自由估计。具体地,在子组 \( g \) 中,模型自由估计的病例数为 \( \hat{N}_{g}^{\text{free}} = n_g \times \frac{n_{1,g}}{n_1} \times \frac{n}{n_g} \)?不,更准确地说,作者使用标记病例的分布来估计未标记样本中病例的分布。核心是:在SCAR假设下,标记病例的协变量分布 \( P(X|S=1) \) 等于所有病例的协变量分布 \( P(X|D=1) \)。因此,未标记样本中病例的协变量分布也等于 \( P(X|D=1) \)。于是,未标记样本中属于子组 \( g \) 的病例数可被估计为 \( \hat{N}_{g}^{\text{free}} = n_{1,g} \times \frac{n - n_1}{n_1} \),其中 \( n_{1,g} \) 是标记病例中属于子组 \( g \) 的个数。这是基于“标记病例的分布代表所有病例的分布”这一核心思想。
- 模型基估计:直接用预测风险 \( R \) 的均值乘以样本数。在子组 \( g \) 中,模型基估计的病例数为 \( \hat{N}_{g}^{\text{model}} = \sum_{i \in \text{group } g} R_i \)。
- 相比已有文献放宽或强化了哪些:相比传统校准检验(需要完整标签),本文放宽了对阴性对照标签的需求;相比PU学习中的模型训练工作,本文强化了对模型验证(特别是校准检验)的关注。
主要结果¶
- 定理1(校准检验统计量的渐近分布):在SCAR假设和模型校准(即 \( P(D=1|R=r) = r \))的零假设下,所提统计量 \( T = \sum_{g=1}^K \frac{(\hat{N}_{g}^{\text{free}} - \hat{N}_{g}^{\text{model}})^2}{\hat{V}_g} \) 渐近服从自由度为 \( K \) 的卡方分布,其中 \( \hat{V}_g \) 是差异的方差估计。直觉:如果模型校准,模型自由估计和模型基估计都是真实病例数的一致估计,其差异仅由抽样误差引起,经方差标准化后收敛到标准正态分布,平方和收敛到卡方分布。必要条件:SCAR假设成立,风险子组划分合理(每个子组内样本量足够大),且模型自由估计和模型基估计的方差可被一致估计。解决的技术难点:模型自由估计的方差推导,因为其依赖于标记病例的随机性和未标记样本的随机性,两者相关。
- 定理2(校准斜率的一致估计):校准斜率 \( \beta \)(满足 \( \logit(P(D=1|R)) = \alpha + \beta \logit(R) \))可被一致估计,通过将标记病例的 \( D=1 \) 与未标记样本的 \( D \) 视为缺失数据,利用EM算法或加权最小二乘。直觉:在SCAR假设下,标记病例提供了病例总体的无偏样本,因此可以用标记病例的 \( \logit(R) \) 对 \( \logit(P(D=1|R)) \) 进行回归,但需要校正标记概率 \( \pi \) 的影响。必要条件:SCAR假设,且 \( \logit(R) \) 与 \( \logit(P(D=1|R)) \) 的关系是线性的。
- 定理3(区分度指标的一致估计):AUC等区分度指标可被一致估计,通过将标记病例视为病例,未标记样本视为对照(但需校正标记概率)。直觉:在SCAR假设下,标记病例是病例总体的随机子集,未标记样本是病例和对照的混合。通过估计 \( \pi \) 和 \( \rho \),可以构造AUC的一致估计。
证明路线与技术技巧¶
- 整体路线:
- 建立模型自由估计的渐近正态性:证明 \( \hat{N}_{g}^{\text{free}} \) 是真实病例数 \( N_g \) 的一致估计,并推导其渐近方差。这需要用到M估计理论(因为 \( \hat{N}_{g}^{\text{free}} \) 可视为某个估计方程的解)或Delta方法(因为 \( \hat{N}_{g}^{\text{free}} \) 是样本均值的函数)。
- 建立模型基估计的渐近正态性:证明 \( \hat{N}_{g}^{\text{model}} \) 是 \( N_g \) 的一致估计(在模型校准下),并推导其渐近方差。这相对直接,因为 \( \hat{N}_{g}^{\text{model}} \) 是预测风险的样本均值。
- 推导差异的联合渐近分布:证明 \( (\hat{N}_{g}^{\text{free}} - \hat{N}_{g}^{\text{model}}) \) 的向量渐近服从多元正态分布,均值为0(在零假设下),协方差矩阵可被一致估计。这需要处理两个估计量之间的相关性。
- 构造卡方统计量:将差异向量经协方差矩阵的逆标准化,得到渐近卡方统计量。
- 关键跳跃点:模型自由估计的方差推导是难点。因为 \( \hat{N}_{g}^{\text{free}} \) 依赖于标记病例的分布(随机)和未标记样本的分布(随机),两者相关(因为标记病例是总体的子集)。作者通过将标记过程视为一个随机抽样过程,将 \( \hat{N}_{g}^{\text{free}} \) 表示为两个独立随机变量的函数:标记病例的分布(来自病例总体)和未标记样本的分布(来自总体)。然后利用Delta方法和条件方差公式推导其渐近方差。
- 技术技巧点名:
- M估计理论:用于推导模型自由估计的渐近性质(因为 \( \hat{N}_{g}^{\text{free}} \) 可视为某个估计方程的解)。
- Delta方法:用于推导 \( \hat{N}_{g}^{\text{free}} \) 和 \( \hat{N}_{g}^{\text{model}} \) 的渐近方差。
- 条件方差公式:用于处理标记过程与未标记样本之间的相关性。
- 卡方检验:用于构造最终的检验统计量。
真实例子与应用¶
- 用的什么数据/场景:宾夕法尼亚大学医学中心的EHR数据,用于验证两个原发性醛固酮增多症(PA)风险预测模型的校准性能。PA是一种可治愈的高血压病因,但诊断不足。两个模型分别是:基于临床变量的逻辑回归模型和基于临床变量+生化指标的模型。
- 怎么把本文方法用上去:研究者从EHR中提取了金标准PA病例(通过专家回顾病历确认)和大量未标记患者(未进行PA诊断测试)。将标记病例视为阳性样本,其余视为未标记样本。然后应用本文提出的校准检验统计量,检验两个模型的校准性能。
- 得到什么结果:模拟实验显示,当模型校准良好时,检验统计量的I类错误率接近名义水平;当模型校准不佳时,检验具有较高的功效。在真实数据中,两个PA风险预测模型均通过了校准检验(p值>0.05),表明它们在PU设定下校准良好。
- 这个例子想说明什么:验证本文方法在实际EHR数据中的可行性,并展示其能够对现有模型进行校准诊断,为临床决策提供支持。
🔎 结论是否比证明窄¶
- 结论:作者声称方法适用于“positive-only EHR data”。但证明严格依赖于SCAR假设。在真实EHR数据中,标记病例可能不代表所有病例(例如,病情更重的患者更可能被标记)。作者在讨论中承认:“如果代表性假设不成立,方法可能产生偏差。” 因此,结论的适用范围比证明窄——证明仅在SCAR假设下严格成立,而结论被泛化到“positive-only data”这一更宽泛的设定。
- 具体语句:在讨论部分,作者写道:“Our methods rely on the assumption that the labeled cases are representative of all cases. Violation of this assumption may lead to biased estimates and invalid tests.” 这明确指出了结论与证明之间的差距。
四、开放问题¶
- 放松SCAR假设:本文方法严格依赖于SCAR假设。如何将方法推广到标记概率依赖于协变量 \( X \) 的情形(即 \( P(S=1|D=1, X) \) 不是常数)?这需要引入倾向性评分或工具变量来校正选择偏差。扎根于本文讨论部分:“Future work could relax the representative assumption by modeling the labeling mechanism.”
- 风险子组划分的自适应选择:本文的卡方检验依赖于风险子组的划分(如Hosmer-Lemeshow检验的等分位点)。不同的划分可能导致不同的检验结果。如何自适应地选择最优划分,或构造不依赖于划分的检验统计量(如基于平滑方法的校准检验)?扎根于本文方法部分:“We partition the predicted risk into \( K \) subgroups...”
- 高维协变量下的校准检验:当协变量 \( X \) 的维度很高时,模型自由估计(基于标记病例的分布)可能不稳定。如何在高维设定下进行校准检验?可能需要引入正则化或降维技术。扎根于本文模拟部分:“We considered low-dimensional covariates...”
- 与因果推断中倾向性评分校准的联系:本文的校准检验方法可直接应用于因果推断中倾向性评分的校准验证。在观察性研究中,倾向性评分模型(预测接受处理的概率)的校准性至关重要。如何将本文方法推广到处理分配机制未知的因果推断设定?扎根于本文引言部分:“Model calibration is a crucial step in validating propensity score models...”
Maintained by 陈星宇 · Homepage · Source on GitHub