Non-Invariance in Nested Prediction Models under Selective Predictor Availability¶
作者: Marc Delord
主题: 因果推断
相关性: 6/10
链接: https://arxiv.org/abs/2609.02836
一、领域脉络与小综述¶
这个方向是什么¶
本文研究的根本问题是:当临床预测模型中的一个预测变量(如尿白蛋白/肌酐比 ACR)仅在部分患者(选择性子集)中被测量时,基于该子集开发的模型(扩展模型)能否推广到完整的目标人群? 核心挑战在于,预测变量的选择性测量(selective measurement)会引入选择偏倚,导致模型在目标人群中的表现(如校准度、区分度)与在开发子集中的表现不一致。该方向当前处于从“经验性讨论”向“形式化框架”过渡的阶段——已有大量文献讨论缺失数据、信息性存在(informative presence)和模型泛化性,但缺乏一个统一的、基于因果结构的分解框架来量化选择性测量带来的具体偏倚成分。
发展脉络(history)¶
- 奠基工作:预测模型开发与验证的经典框架。Altman & Royston (2000) [1] 和 Moons et al. (2009) [2] 奠定了预测模型验证的基本概念(内部/外部验证)。Steyerberg et al. (2013) [3](PROGRESS 3)系统化了预测模型研究的流程。Wolff et al. (2019) [4](PROBAST)提供了评估预测模型偏倚风险的工具。这些工作隐含假设:预测变量在目标人群的诊疗点上是可得的(“Their use relies on an implicit assumption that predictors are available at the point of care in the target population [4, 5, 6]”)。这个假设在真实世界数据中经常被违反,但未被形式化处理。
- 主要进展:识别选择性测量问题。Goldstein et al. (2016) [7] 和 Sisk et al. (2021) [11] 系统回顾了电子健康记录(EHR)中的“信息性存在偏倚”(informative presence bias),指出数据缺失与患者健康状况相关。Wells et al. (2013) [12] 讨论了EHR缺失数据的处理策略。这些工作识别了问题,但未将其与预测模型的泛化性直接关联。
- 当前 Frontier:泛化性与可迁移性的形式化。Pearl & Bareinboim (2011) [9] 提出了基于选择图(selection diagrams)的因果可迁移性(transportability)形式化框架,区分了泛化性(generalisability,同一人群不同子集)和可迁移性(transportability,不同人群)。Sperrin et al. (2021) [21] 提出了“靶向验证”(targeted validation)的概念,强调验证应针对模型的目标人群。Ploddi et al. (2024) [22] 对辅助泛化性/可迁移性的方法进行了范围综述。这些工作提供了形式化工具,但未专门处理“预测变量选择性测量”这一特定机制。
- 本文的位置:作者将 Heckman (1979) [18] 的样本选择偏倚框架(视为模型设定误差)引入预测模型领域,首次将选择性测量导致的模型非不变性(non-invariance)分解为三个可解释的成分(遗漏预测变量偏移、残差非不变性、交互项),并建立了与插补偏倚的联系。这是对现有泛化性文献的一个具体化、可操作化的补充。
子线索聚类¶
- 预测模型开发与验证的经典方法([1], [2], [3], [4], [5], [6]):关注模型构建、性能评估(区分度、校准度)、内部/外部验证。主要瓶颈:验证数据集的选择常基于便利性而非目标人群,导致泛化性评估不准确。
- 缺失数据与信息性存在([7], [11], [12], [13]):关注EHR中数据缺失的非随机性及其对模型的影响。主要瓶颈:多聚焦于处理缺失数据(如多重插补),而非分析缺失机制如何改变模型在目标人群中的定义。
- 泛化性与可迁移性的形式化框架([9], [21], [22], [23], [24]):利用因果图、选择图等工具,形式化定义模型在不同人群间的迁移条件。主要瓶颈:框架较为抽象,缺乏针对“预测变量选择性测量”这一具体、常见场景的分解和诊断工具。
这个方向在追问的核心问题¶
- 如何形式化定义“选择性测量”导致的模型偏倚? 现有文献多将其归为“缺失数据问题”或“选择偏倚”,但缺乏一个将偏倚分解为可解释成分的数学框架。
- 如何区分“因遗漏预测变量导致的偏倚”与“因选择机制本身携带的预后信息导致的偏倚”? 前者可通过纳入该变量解决,后者则无法。
- 当选择机制涉及多个路径(如通过模型内变量和模型外变量)时,偏倚结构如何变化? 这对应着碰撞结构(collider structure)下的选择偏倚。
- 常用的插补方法(如基于选择性子集的条件分布插补)在选择性测量下是否有效? 它会引入何种偏倚?
⚠️ 作者的 framing(必须明确标注成“这是作者的说法”)¶
- 作者把缺口 frame 成什么:作者声称,尽管选择性测量已被广泛认识,但其对预测模型泛化性的“full implications have yet to be considered”(全文引言)。作者将本文定位为“formalise how selective predictor measurement induces model non-invariance”,从而“highlighting model generalisability to the intended target population as a central consideration”(引言末段)。作者的核心叙事是:现有文献关注了缺失数据,但未将其与模型泛化性的形式化分解联系起来。
- 哪些竞争路线被他淡化或回避了:
- 多重插补(MI)的现有理论:作者引用了 van Buuren (2018) [19] 的插补教科书,但仅将其作为“使用选择性子集的条件分布”的实例,回避了 MI 在随机缺失(MAR)假设下的理论保证(即若插补模型正确指定,可得到无偏估计)。作者的核心论点是“插补转移了非不变性”,但这在 MAR 下不一定成立——如果选择机制仅依赖于 X(即 MAR),则 P(Z|X, S=1) = P(Z|X, S=0),非不变性消失。作者未明确讨论 MAR 假设与本文框架的关系。
- 逆概率加权(IPW):作者未提及 IPW 作为处理选择性测量的替代方法。IPW 通过为选择概率建模来校正偏倚,是 Heckman 框架的另一种实现。作者选择聚焦于“非不变性分解”而非“校正方法”。
- 什么明显该被引 / 该存在、却没出现在 intro 里?:
- Robins 等人的“G-computation”或“doubly robust”估计:这些方法在处理选择性缺失和因果推断中非常成熟,与 Heckman 的样本选择模型有密切联系。作者仅引用了 Heckman (1979),未引用后续的因果推断文献(如 Hernán & Robins)。
- 关于“collider bias”的近期讨论:作者引用了 Lu et al. (2023) [14] 关于碰撞分层偏倚的评论,但未引用更早的经典文献(如 Hernán et al. 2004 [26] 的“A structural approach to selection bias”),尽管该文在参考文献中出现。这可能是一个疏忽,因为 Hernán et al. (2004) 是碰撞偏倚的奠基性工作。
张力¶
- 未见明显对立引用。被引文献之间没有根本性的矛盾,更多是不同层面的互补:经典验证框架([1]-[6])提供了背景,缺失数据文献([7], [11]-[13])识别了问题,泛化性文献([9], [21]-[24])提供了形式化工具,本文则试图在两者之间建立桥梁。
二、最核心、最简单的例子 / 数学问题¶
第一步:把符号、模型、可观测数据交代清楚¶
-
符号:
Y:结局变量(如是否进展为终末期肾病 ESRD)。X:一组在目标人群中常规可得的预测变量(如年龄、性别、eGFR)。定义限制模型(restricted model)的基础。Z:一个选择性测量的额外预测变量(如尿白蛋白/肌酐比 ACR)。定义扩展模型(extended model)的基础。S:Z是否可得的指示变量。S=1表示Z被观测到(患者被“选择”),S=0表示Z缺失。U:潜在未观测的疾病过程(如 CKD 的严重程度)。W:U的可观测代理变量(如糖尿病诊断记录),可能影响S。P(Y|X, S=1):在选择性子集(S=1)中,给定X时Y的条件分布。P(Y|X):在目标总体(S∈{0,1})中,给定X时Y的条件分布。∆_{X,S} = P(Y|X, S=1) - P(Y|X):限制模型的非不变性(non-invariance),即选择性子集与目标总体之间,给定X时Y的条件分布差异。这是本文要分解的核心对象。δ_{X,Z} = P(Y|X, Z, S=1) - P(Y|X, Z):扩展模型的条件选择偏倚,即给定(X, Z)后,选择性子集与目标总体之间Y的条件分布差异。π_X = P(S=1|X):给定X时Z被观测到的概率。∆_{Z|X} = P(Z|X, S=1) - P(Z|X):预测变量非不变性,即Z的条件分布在选择性子集与目标总体之间的差异。
-
模型:
- 数据生成机制:由有向无环图(DAG)(D1) 描述。
U影响X,W,Y。X和W影响S(是否测量Z)。Z由X和U决定,并影响Y。核心是S是X和W的碰撞子(collider),即S同时受X和W影响。 - 统计模型:未指定参数形式。这是一个非参数/半参数框架,所有推断基于条件分布的比较和分解。作者假设
Y和Z是连续或离散的,但未做分布假设。 - 已知/未知:
X,Z(当S=1时),S,Y是可观测的。U和W是潜在或部分可观测的。P(Y|X, Z, S=0)和P(Z|X, S=0)是不可观测的,因为当S=0时Z缺失。
- 数据生成机制:由有向无环图(DAG)(D1) 描述。
-
可观测数据:
- 可观测:对于每个患者,我们能观测到
(Y, X, S)。如果S=1,还能观测到Z。如果S=0,Z缺失。 - 想要但观测不到:我们想要知道
P(Y|X, Z)(目标总体的扩展模型)和P(Y|X)(目标总体的限制模型)。但P(Y|X, Z)无法直接观测,因为当S=0时Z缺失。P(Y|X)理论上可观测(因为X和Y对所有患者都可得),但作者关注的是其与P(Y|X, S=1)的差异。
- 可观测:对于每个患者,我们能观测到
第二步:讲最小内核¶
最简特例:假设 X 是单变量(如年龄),Z 是二值(如 ACR 是否异常),Y 是二值(如是否发生 ESRD)。选择机制是:医生只在患者年龄大于 65 岁时才测量 ACR。即 S=1 当且仅当 X > 65。这是一个确定性选择,且选择仅依赖于 X(无外部路径 W)。
-
在这个特例下:
- 限制模型:
P(Y|X)。这是基于年龄预测 ESRD 的风险。 - 扩展模型:
P(Y|X, Z)。这是基于年龄和 ACR 预测 ESRD 的风险。 - 选择性子集:
{X > 65}。所有年龄大于 65 的患者都有 ACR 记录。 - 目标总体:所有患者(年龄不限)。
- 限制模型:
-
核心命题:限制模型在目标总体和选择性子集之间是否不变?即
P(Y|X, S=1) = P(Y|X)是否成立?- 对于
X ≤ 65的患者,S=0,P(Y|X, S=1)无定义。所以非不变性只对X > 65有意义。 - 对于
X > 65,S=1是必然事件,所以P(Y|X, S=1) = P(Y|X)自动成立?不。因为P(Y|X)是对所有X > 65的患者(包括那些可能因其他原因未被测量 ACR 的患者,但在本例中所有X>65都被测量了)的平均。由于选择是确定性的,P(Y|X, S=1) = P(Y|X)确实成立。非不变性为零。
- 对于
-
关键洞察:当选择仅依赖于
X时,限制模型在X的每个水平上都是不变的。非不变性只会在选择依赖于X之外的变量(如W)时出现。这就是为什么作者引入W和碰撞结构。 -
更现实的例子:假设选择机制是:医生更倾向于对糖尿病患者(
W=1)测量 ACR,且糖尿病与年龄X相关。那么:- 对于给定的
X,选择性子集(S=1)中糖尿病患者的比例高于目标总体。 - 由于糖尿病本身是 ESRD 的风险因素(即
Y与W相关),即使给定X,选择性子集的患者平均 ESRD 风险也高于目标总体。因此P(Y|X, S=1) ≠ P(Y|X),非不变性出现。 - 这个非不变性可以分解为:
- 遗漏预测变量偏移:因为
Z(ACR)与Y相关(Z̸⊥Y|X),且Z的分布在选择性子集中不同(Z̸⊥S|X),所以遗漏Z导致偏倚。 - 残差非不变性:即使纳入
Z,由于选择机制(糖尿病)本身携带额外的预后信息(S̸⊥Y|X, Z),扩展模型在目标总体中仍可能非不变。 - 交互项:上述两者的乘积。
- 遗漏预测变量偏移:因为
- 对于给定的
-
本文的核心数学贡献:将
∆_{X,S}精确分解为这三个成分,并证明当使用P(Z|X, S=1)来插补缺失的Z时,∆_{X,S}会完整地转移到插补后的扩展模型中,成为不可观测的插补偏倚。
三、这篇论文做了什么¶
三句话¶
- 研究了什么问题:当额外预测变量
Z仅在由S标记的选择性子集中可测时,嵌套预测模型(限制模型Y|X和扩展模型Y|X,Z)的参数在目标总体与选择性子集之间的非不变性(non-invariance)问题。 - 核心工具/方法:基于 Heckman (1979) 的样本选择偏倚框架,利用条件分布积分和代数分解,将限制模型的非不变性
∆_{X,S}分解为三个可解释的成分(遗漏偏移、残差非不变性、交互项),并推广到包含碰撞结构的多路径选择场景。 - 主要结论:限制模型的非不变性可被分解;当选择机制涉及碰撞结构时,非不变性是各路径子群非不变性的加权和;基于选择性子集条件分布
P(Z|X, S=1)的插补会将限制模型的非不变性完整地转移为插补扩展模型的插补偏倚。
关键设定与假设¶
- 设定:目标总体
Ω,选择性子集{S=1} ⊂ Ω。限制模型M_rest: Y ~ X在Ω上定义。扩展模型M_ext: Y ~ X, Z仅在{S=1}上可估计。 - 关键假设:
- A1 (Predictor Invariance):
Z ⊥ S | I,其中I = (X, W)。即给定所有可观测信息后,Z的测量是完全随机的。若此假设成立,则选择性测量不引入偏倚。本文主要关注其违反的情况(¬A1)。 - A2 (Residual Prognostic Information):
Z ̸⊥ Y | X。即Z携带了X之外的预后信息。这是Z作为预测变量有意义的前提。 - A3 (Distributional Generalisability):
P(Y|X, Z, S=1) = P(Y|X, Z)。即扩展模型在目标总体和选择性子集之间不变。这是理想情况,本文主要研究其违反时(即δ_{X,Z} ≠ 0)的后果。 - A4 (Imputation Assumption):
P(Ẑ|X, S=0) = P(Z|X, S=1)。即插补时假设非选择患者的Z分布与选择患者相同。这是标准插补方法的隐含假设。 - A5 (Model Transfer):
P(Y|X, Ẑ, S=0) = P(Y|X, Z, S=1)。即插补后,使用选择性子集中估计的模型来预测非选择患者的结果。
- A1 (Predictor Invariance):
- 相比已有文献:本文的假设比 Pearl & Bareinboim (2011) 的 transportability 框架更具体(聚焦于单一选择性测量变量),但比 Heckman (1979) 的经典样本选择模型更灵活(允许非参数设定和碰撞结构)。
主要结果¶
- 定理 1(非不变性分解):限制模型的非不变性
∆_{X,S}可分解为:∆_{X,S} = ∆^{exp}_{Z|X} + ∆^{res}_{Z,X} + ∆^{int}_{Z|X}其中:∆^{exp}_{Z|X} = ∫ P(Y|X, Z) d∆_{Z|X}:遗漏预测变量偏移。由Z的条件分布在选择子集和目标总体间的差异(∆_{Z|X})驱动,反映了因遗漏Z导致的偏倚。∆^{res}_{Z,X} = ∫ δ_{X,Z} dP(Z|X):边际残差非不变性。由扩展模型的条件选择偏倚δ_{X,Z}驱动,反映了即使纳入Z后仍存在的偏倚(即选择机制本身携带的额外预后信息)。∆^{int}_{Z|X} = ∫ δ_{X,Z} d∆_{Z|X}:交互项。当δ_{X,Z}不恒定时非零。- 直觉:这个分解将“因变量缺失导致的偏倚”与“因选择机制本身导致的偏倚”分离开来。如果选择机制完全由
X和Z解释(即δ_{X,Z}=0),则后两项为零,非不变性完全由遗漏Z导致。
- 定理 2(碰撞结构下的分解):当选择通过两条路径(如
X和W)发生时,S = S_X ∪ S_W,选择性子集被分割为三个互斥子群。总非不变性是各子群非不变性的加权和:∆_{X,S} = π^T ∆_Z,其中π是子群权重向量,∆_Z是子群非不变性向量。- 直觉:碰撞结构使得选择性子集内部异质性更强,不同路径选择的患者具有不同的风险特征,导致非不变性结构更复杂。
- 定理 3(插补偏倚):在假设 A4 和 A5 下,插补后的扩展模型在非选择患者中的预测分布与真实分布之间的差异(插补偏倚)等于限制模型的非不变性:
δ^{imp}_{Z|X} = ∆^{exp}_{Z|X} + ∆^{res}_{Z,X} = ∆_{X,S}(在δ_{X,Z}为常数的近似下)。- 直觉:这是一个负向结果。它表明,当
Z是选择性测量时,简单的条件插补(基于P(Z|X, S=1))不能消除由选择性测量引入的偏倚,反而将其完整地“转移”到了扩展模型中。这个偏倚是不可观测的,因为真实分布P(Y|X, S=0)未知。
- 直觉:这是一个负向结果。它表明,当
证明路线与技术技巧¶
- 整体路线:
- 定义非不变性:将
∆_{X,S}写为两个条件期望之差。 - 积分展开:将两个条件期望分别对
Z积分,得到∫ P(Y|X,Z,S=1) dP(Z|X,S=1)和∫ P(Y|X,Z) dP(Z|X)。 - 添加交叉项:引入两个交叉项
∫ P(Y|X,Z,S=1) dP(Z|X)和∫ P(Y|X,Z) dP(Z|X,S=1),将原式重写为三个差分的和。 - 重新标记:将三个差分分别识别为
∆^{exp},∆^{res},∆^{int},完成分解。 - 碰撞结构推广:将选择性子集按选择路径分割,对每个子群重复上述分解,然后加权平均。
- 插补偏倚推导:写出插补后的预测分布
P̂(Y|X, S=0),利用 A4 和 A5 将其表达为∫ P(Y|X,Z,S=1) dP(Z|X,S=1)。然后与真实分布P(Y|X, S=0)相减,通过类似的代数操作(添加交叉项),最终化简为∆_{X,S}。
- 定义非不变性:将
- 关键跳跃点:
- 从“条件期望之差”到“三个可解释成分”的代数变换:这是整个论文的核心技术步骤。它不是一个复杂的数学技巧,而是一个聪明的重参数化,将看似不可分解的偏倚拆解为有统计意义的成分。难点在于意识到需要添加哪两个交叉项才能得到有意义的分解。
- 将插补偏倚与限制模型非不变性等同:这个结论依赖于 A4 和 A5,以及
δ_{X,Z}为常数的近似。证明的关键在于将插补后的预测分布与P(Y|X, S=1)联系起来,然后利用分解结果。
- 技术技巧点名:
- 条件分布积分与代数分解:这是全文最核心的技巧。通过添加和减去交叉项,将复杂的积分差分解为三个部分。这是 Heckman (1979) 中“样本选择偏倚作为设定误差”思想的直接应用和推广。
- 碰撞结构下的加权平均:将复杂的选择机制分解为互斥子群,然后对各子群分别应用分解,最后加权求和。这是一种模块化的证明策略,将复杂问题简化为多个相同结构的子问题。
- 无具体参数假设:整个证明在非参数层面进行,仅依赖于条件分布的定义和积分运算,不依赖任何参数模型(如线性、logistic)。这使得框架具有广泛的适用性。
真实例子与应用¶
- 数据/场景:伦敦 Lambeth 区 41 家全科诊所的电子健康记录(2005-2021)。目标人群为 eGFR < 60 ml/min/1.73m² 的 CKD 患者。限制模型为三变量 KFRE(年龄、性别、eGFR),扩展模型为四变量 KFRE(增加 ACR)。
S为 ACR 是否可得。 - 方法应用:
- 诊断测试 M5:在 Cox 模型中,将限制模型线性预测器作为偏移项,检验
S及其与线性预测器的交互项是否显著。结果:S的 HR 显著(P<0.001),交互项也显著(P<0.001),表明限制模型非不变性存在且非恒定。 - 诊断测试 M3:用 logistic 回归检验
S与限制模型线性预测器的关联。结果:OR 显著(P<0.001),表明选择性测量通过X发生。 - 诊断测试 M4:在 M3 基础上加入糖尿病(
W)。结果:糖尿病与S显著相关(P<0.001),且X的效应仍显著,表明存在通过W的外部选择路径,支持碰撞结构。
- 诊断测试 M5:在 Cox 模型中,将限制模型线性预测器作为偏移项,检验
- 结果:ACR 仅在 20.8% 的目标人群中可得。选择性子集的患者更年轻、更多男性、eGFR 更低、糖尿病和高血压患病率更高。这些结果与 DAG (D2) 一致:ACR 测量受糖尿病(外部路径)和 eGFR/年龄(内部路径)共同驱动。
- 这个例子想说明什么:验证了理论框架在真实数据中的可操作性。具体展示了:① 限制模型非不变性是可检测的;② 选择性测量通常涉及多条路径(碰撞结构);③ 诊断测试可以揭示选择机制的结构。
🔎 结论是否比证明窄¶
- 是。作者在讨论中声称“non-invariance in the restricted model necessarily implies non-invariance in the extended model and, consequently, selection bias in the extended model”。但证明中,这个结论依赖于同质性假设(
δ_{X,Z}=c,即条件选择偏倚为常数)。当交互项∆^{int}非零时,限制模型的非不变性∆_{X,S}并不完全等于扩展模型的非不变性∆^{res}_{Z,X},而是多了一个交互项。作者在文中承认了这一点(“Neglecting this interaction yields the first-order approximation”),但在讨论中的表述过于绝对。 - 另一个窄化:插补偏倚定理(定理 3)的证明依赖于 A4 和 A5,即插补模型和预测模型都从选择性子集完美转移。在实际中,插补模型可能错误指定(如假设线性而实际非线性),预测模型也可能因过拟合而表现不佳。定理 3 的结论是在理想插补和模型转移下的理论下限,实际偏倚可能更大。
四、开放问题(点到为止,扎根具体语句)¶
-
交互项
∆^{int}的统计推断:作者假设δ_{X,Z}=c以简化分析,但承认“this interaction is expected to be negligible when this condition is approximately satisfied”。要证什么:开发一个检验H0: δ_{X,Z} = c的统计检验,或估计交互项的大小。扎根于:文中“For the remainder of this paper, we will assume homogeneous conditional selection bias, i.e. δ_{X,Z}=c”这一句。 -
非参数/半参数估计与推断:本文提供了分解框架,但未给出
∆^{exp},∆^{res},∆^{int}的估计量和渐近分布。要估什么:在给定(Y, X, S, Z_{obs})的样本下,如何估计这三个成分?需要哪些正则条件?估计量的收敛速度是多少?扎根于:全文未涉及任何估计理论,仅停留在“定义和分解”层面。 -
与 MAR 假设的关系:作者的核心论点“插补转移非不变性”在 MAR 假设下是否仍然成立?如果选择机制仅依赖于
X(即S ⊥ Z | X),则P(Z|X, S=1) = P(Z|X, S=0),非不变性消失。要证什么:明确本文框架与 MAR/MNAR 假设的包含关系。扎根于:作者未讨论 MAR,但引用了 van Buuren (2018) 的插补教科书,该教科书的核心是 MAR 假设下的 MI。 -
扩展到多个选择性测量变量:当有多个
Z变量(如Z1, Z2)以不同的选择机制被测量时,分解框架如何推广?要算什么:嵌套模型的结构会变成多层嵌套,非不变性的分解会涉及更复杂的积分和交叉项。扎根于:本文仅处理单个Z的简单嵌套。
Maintained by 陈星宇 · Homepage · Source on GitHub