跳转至

A Bayesian framework for longitudinal EHR and genetic discovery

作者: Sarah M. Urbut, Yi Ding, Tetsushi Nakao, Satoshi Koyama, Anika Misra et al.
来源: Nature
主题: 其他
相关性: 8/10
机构绿灯: Harvard University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41586-026-10780-5


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于生物医学大数据计算遗传学的交叉领域。核心科学问题是:如何利用大规模、纵向的电子健康记录(EHR)数据,同时建模多种疾病的动态发展过程,并整合个体的遗传信息(多基因风险评分),以发现疾病之间的潜在共享机制、揭示疾病亚型,并改进个体化疾病预测。这个领域目前处于快速发展期,数据量巨大但分析方法相对滞后,传统方法多将每种疾病孤立分析,忽略了疾病间的共病关系和纵向时间信息。
  • 本文的位置:它针对的是纵向多疾病EHR数据的联合建模与遗传发现这一具体问题。之所以现在做这件事,是因为:(1) 大型生物银行(如UK Biobank)积累了海量、长随访期的EHR数据;(2) 多基因风险评分(PRS)的预测能力逐步提升,但尚未被有效整合进疾病动态模型;(3) 现有方法要么是单疾病分析(如标准GWAS),要么是静态的共病网络,无法捕捉疾病随时间变化的动态模式。

二、关键术语扫盲

  1. 电子健康记录 (EHR):医院或诊所系统里记录的患者诊疗数据,包括诊断代码、化验结果、处方、手术记录等。本文主要用诊断代码(PheCode,一种将ICD代码聚合为疾病类别的系统)。
  2. 纵向数据 (Longitudinal data):同一个体在不同时间点重复测量的数据。本文中,每个患者有长达52年的诊断记录,构成一个时间序列。
  3. 多基因风险评分 (PRS):一个数值,衡量个体携带的与某种疾病相关的遗传变异(SNP)的总和。它由大型GWAS结果计算得出,反映个体的遗传易感性。
  4. 全基因组关联研究 (GWAS):一种统计方法,扫描整个基因组,寻找与某个性状(如疾病)显著相关的遗传变异(SNP)。传统GWAS一次只分析一个性状。
  5. 生物银行 (Biobank):大型生物样本库,收集了数十万人的遗传数据、EHR、生活方式问卷等,用于研究基因-环境-疾病的关联。本文用了UK Biobank、Mass General Brigham和All of Us。
  6. 混合概率 (Mixture of probabilities):本文模型的核心设定。不同于传统“概率混合”(先选一个疾病类别,再生成该类别下的诊断),它直接对每个时间点所有疾病的同时发生概率建模,允许一个患者同时属于多个疾病特征(signature),从而正确处理共病。
  7. 疾病特征 (Disease signature):模型学到的、一组在时间上共同出现的疾病模式。例如,一个“心血管特征”可能包含高血压、冠心病、心力衰竭等疾病,它们在时间上倾向于一起出现。
  8. 逆概率加权 (IPW):一种处理选择偏倚的方法。在EHR中,患者就诊频率不同( sicker patients visit more),导致数据有偏。IPW通过给每个观测(一次就诊)赋予一个权重(等于就诊概率的倒数),来“纠正”这种偏倚。
  9. 家族性高胆固醇血症 (FH):一种遗传性疾病,导致血液中胆固醇水平极高,显著增加早发心血管疾病风险。本文用它作为已知生物学知识来验证模型学到的“心血管特征”。
  10. 克隆性造血 (CHIP):一种与年龄相关的血液干细胞突变,增加炎症和心血管疾病风险。本文用它验证“炎症特征”。
  11. PheCode:一种将原始ICD诊断代码(如ICD-10)聚合为更宽泛的疾病类别的系统,例如将“高血压”、“高血压性心脏病”等归为“高血压”这个PheCode。本文使用PheCode作为疾病单位。
  12. Pooled Cohort Equation (PCE) / PREVENT / Gail模型:现有的临床风险预测模型。PCE用于预测10年心血管疾病风险,Gail模型用于预测乳腺癌风险。本文用它们作为基线比较对象。

三、这个领域的人在关心什么

这个领域的研究者(计算遗传学家、生物信息学家、临床流行病学家)在追问一个根本问题:如何从海量、嘈杂、有偏的EHR数据中,提取出关于疾病发生、发展和相互关系的可靠生物学知识,并最终用于个体化医疗?

具体来说,他们关心: - 疾病共病模式:哪些疾病倾向于同时或先后发生?这些模式背后是否有共同的生物学通路(如炎症、代谢紊乱)? - 疾病亚型发现:同一个临床诊断(如“心力衰竭”)是否包含不同的生物学亚型(如“炎症驱动型” vs “压力负荷型”),这些亚型对治疗反应和预后有何不同? - 遗传对疾病动态的影响:个体的遗传风险(PRS)如何影响其疾病轨迹?例如,高心血管PRS的人是否更早出现高血压,然后更快进展到冠心病? - 预测与预防:能否利用纵向EHR和遗传信息,在疾病发生前数年就准确预测个体风险,从而进行早期干预?

当前主流方法与局限: - 单性状GWAS(如标准GWAS):一次只分析一个疾病,忽略了疾病间的遗传相关性,且无法利用纵向信息。本文指出,其基于特征的GWAS发现了单性状分析遗漏的位点。 - 静态共病网络:只分析疾病间的成对相关性,无法捕捉随时间变化的动态模式。 - 标准潜变量模型(如LDA):假设每个患者属于一个疾病类别(“概率混合”),无法处理同时患有多种慢性病的患者。本文的“混合概率”设定是核心创新,绕开了这个局限。 - 现有风险预测模型(PCE, Gail):通常只针对单一疾病,且只使用基线风险因素,不利用纵向疾病史和遗传信息。本文的模型在预测上超越了它们。

四、数据问题

  • 数据来源:三个独立的大型生物银行:UK Biobank(约50万人)、Mass General Brigham(约14万人)、All of Us(约4.3万人)。数据来自医院EHR系统、国家健康服务(NHS)记录、以及研究机构的直接采集。
  • 数据形态纵向、多标签、稀疏的二元矩阵。每个患者有一个时间轴(从出生到随访结束),在每个时间点(以年为单位),有一个二元向量,指示该年是否新诊断了348种PheCode中的每一种。此外,每个患者有一个PRS向量(对应多种疾病)。
  • 维度和量级:总样本量 > 683,000,随访长达52年,涉及348种疾病。数据矩阵非常稀疏(大多数人在大多数年份没有新诊断)。
  • 结构特征
    • 时间结构:疾病诊断有明确的时间顺序(如高血压通常早于冠心病)。
    • 共病结构:多种疾病在时间上倾向于共同出现。
    • 层次结构:PheCode本身有层次(如“心血管疾病”包含“高血压”、“冠心病”等)。
  • Noise & 测量误差
    • 诊断误差:EHR中的诊断代码可能不准确(误诊、漏诊)。
    • 编码差异:不同医院、不同医生对同一疾病的编码习惯不同。
    • 时间不精确:诊断时间记录的是“首次记录时间”,而非疾病真正发生的时间。
    • 非高斯:数据是二元(有/无诊断),不是高斯分布。
  • Selection / Bias / 缺失
    • 选择偏倚:生物银行的参与者通常比一般人群更健康(“健康志愿者效应”)。
    • 就诊偏倚:更健康的个体就诊频率更低,导致其疾病记录更稀疏。本文用IPW处理此问题。
    • 右删失:随访结束或患者死亡后,后续疾病记录缺失。
    • 左截断:出生到首次进入生物银行之间的疾病史可能不完整。
  • 哪些是“漂亮的统计学问题”
    • 纵向多标签建模:如何对高维、稀疏、有依赖结构的二元时间序列进行建模,是一个有挑战性的统计问题。
    • 选择偏倚校正:IPW在EHR数据中的应用,需要处理时变混杂和权重估计的不稳定性。
    • 潜变量模型的可识别性:模型学到的“疾病特征”是否唯一且可解释?这是一个非参数识别问题。
  • 哪些是“纯工程或领域难题”
    • PheCode的聚合与标准化:如何将不同版本的ICD代码映射到统一的PheCode,是数据预处理工程。
    • 计算可扩展性:在68万人、348种疾病、52年数据上拟合一个复杂的贝叶斯模型,需要高效的变分推断或MCMC算法(本文使用变分贝叶斯)。

五、方法与模型问题

  • 分析方法:本文的核心是一个贝叶斯生成式模型,名为ALADYNOULLI。它假设每个患者在每个时间点的疾病诊断是由一组潜在的、随时间变化的“疾病特征” 的激活程度决定的。
    • 模型结构:对于患者 \(i\) 在年龄 \(t\) 是否被诊断为疾病 \(d\),模型假设:
      \[P(\text{诊断}_{i,t,d} = 1) = \sum_{k=1}^{K} \theta_{i,t,k} \times \beta_{k,d}\]
      其中:
      • \(\beta_{k,d}\) 是“特征 \(k\)”对“疾病 \(d\)”的载荷,表示该特征与疾病的关联强度(固定参数)。
      • \(\theta_{i,t,k}\) 是患者 \(i\) 在年龄 \(t\) 对“特征 \(k\)”的激活水平(随时间变化的潜变量)。
      • 关键创新:这是一个混合概率(mixture of probabilities),而不是概率混合(probability of a mixture)。这意味着一个患者可以同时以高概率激活多个特征(例如,同时有心血管特征和炎症特征),从而正确建模共病。
    • 先验设定\(\theta_{i,t,k}\) 被建模为年龄的平滑函数(使用高斯过程或样条),并受患者PRS的影响。\(\beta_{k,d}\) 有稀疏先验(如spike-and-slab),鼓励每个特征只与少数疾病强相关。
  • 关键假设
    • 条件独立性:给定潜变量 \(\theta\) 和载荷 \(\beta\),不同疾病、不同时间点的诊断是条件独立的。这是一个很强的简化假设。
    • 特征数量 \(K\) 固定:模型需要预先指定特征数量(本文设为21)。
    • PRS的线性影响:PRS对潜变量 \(\theta\) 的影响被建模为线性。
  • 推断 / 计算手段变分贝叶斯推断。由于模型复杂,精确后验不可计算,使用变分推断(VI)进行近似。IPW通过给每个观测(患者-年-疾病)赋予权重来实现。
  • 核心结论 + 不确定性量化
    • 结论:模型恢复了21个可复现的、有生物学意义的疾病特征(如心血管、炎症、代谢、癌症等),并发现了疾病亚型。基于特征的GWAS发现了新位点。预测性能优于现有模型。
    • 不确定性量化:论文主要报告了点估计(如特征载荷、GWAS效应量)和通过重采样(如跨队列验证)评估的稳定性。没有系统地量化模型参数的后验不确定性(例如,没有报告载荷 \(\beta\) 或激活水平 \(\theta\) 的置信区间或后验方差)。这是统计学家可能会注意到的缺失。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 评分:4/5 星
    • 理由:文章对核心科学问题(纵向EHR建模、遗传发现)的阐述清晰,术语解释得当(如“混合概率” vs “概率混合”),且用具体生物学例子(FH、CHIP)验证了模型,让外行能理解其价值。但作为Nature论文,它仍有一定领域门槛(如对GWAS、PRS的熟悉度),且方法部分对统计学家来说过于简略(缺乏模型细节和不确定性量化)。它是一篇优秀的入门第二篇,但作为第一篇可能稍显吃力。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性很高。这个问题本身非常有意思:如何从海量、嘈杂、有偏的EHR数据中,自动发现疾病的“自然分类”和动态模式?这类似于在无监督学习中寻找有意义的低维结构,但数据具有复杂的纵向和共病依赖。对于好奇的统计学家,这是一个迷人的应用场景。
    • 方法学空间中等偏上。模型的核心创新(混合概率)在概念上是优雅的,但统计学家会立刻注意到几个口子:
      • 不确定性量化缺失:模型参数(载荷、激活水平)的后验不确定性没有被量化。这是一个直接的统计挑战:如何为这种复杂的贝叶斯模型提供可靠的不确定性度量(例如,通过更精确的MCMC或后验变分推断的校准)?
      • 可识别性问题:潜变量模型(尤其是非负矩阵分解类模型)的旋转不变性/可识别性是一个经典问题。本文通过稀疏先验和生物学验证来缓解,但统计学家可以问:是否存在更严格的识别条件?模型学到的特征是否唯一?
      • 选择偏倚的IPW:IPW在时变设置下的应用,其权重估计的稳定性、对模型误设的敏感性,都是值得深入探讨的统计问题。
      • 纵向依赖建模:模型假设给定潜变量后诊断是条件独立的,这忽略了疾病间的短期动态依赖(如“感染后一周内出现炎症反应”)。更丰富的状态空间模型或图模型可能捕捉到更多信息。
    • 现实相关性很高。EHR数据是统计学家在生物医学、公共卫生、健康经济学等领域都会遇到的典型数据模式:高维、稀疏、纵向、有偏、多标签。本文提出的问题(联合建模、亚型发现、偏倚校正)具有广泛的代表性。
    • 明确结论很有意思,值得留意。虽然方法本身不是统计前沿,但它提出了一个具有挑战性的、现实世界的数据建模问题,并提供了一个优雅的基准解决方案。对于对生物医学大数据感兴趣的统计学家,这是一个很好的案例研究,可以激发关于不确定性量化、可识别性和纵向建模的后续思考。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。您的核心武器(非参数统计、U-统计量、高维渐近、因果推断中的估计理论)与本文的贝叶斯生成式模型和变分推断方法没有直接的技术重叠。您熟悉的逆概率加权概念可以用于理解其偏倚校正策略,但模型本身不涉及您最擅长的理论工具。这是一次拓宽视野的阅读,而非寻找方法迁移点的机会。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述 / 科普
      • 《Nature Reviews Genetics》上的综述:例如,一篇关于“利用电子健康记录进行遗传发现”的综述(如“Electronic health records for genetic discovery” by Denny et al., 2016或类似更新版本)。这类综述会系统介绍EHR数据的特点、挑战和常用分析方法。
      • 《Annual Review of Statistics and Its Application》上的文章:关于“统计方法在生物银行数据中的应用”的综述,会从统计学家视角讨论纵向数据、选择偏倚、多重比较等问题。
    • 关键的奠基或代表论文(从被引文献中选取):
      • UK Biobank的初始描述论文:Bycroft et al., 2018, “The UK Biobank resource with deep phenotyping and genomic data.” 这是理解数据来源和基本特征的必读文献。
      • PheCode系统的原始论文:Wu et al., 2019, “Mapping ICD-10 and ICD-10-CM Codes to PheCodes: Workflow Development and Initial Evaluation.” 了解疾病编码的聚合过程。
      • 关于EHR选择偏倚的经典论文:例如,Goldstein et al., 2016, “Opportunities and challenges in developing risk prediction models with electronic health records data: a systematic review.” 系统讨论了EHR数据中的偏倚问题。
    • 可以动手玩的公开数据集 / 挑战赛
      • UK Biobank:数据可通过申请获取(需伦理批准),是最大的公开资源之一。
      • eICU Collaborative Research Database:一个公开的、去标识化的重症监护EHR数据库,可用于练习纵向数据建模。
      • PhysioNet Challenges:每年都有关于EHR数据(如死亡率预测、心律失常检测)的公开挑战赛,提供数据和基线方法。

七、术语小抄

英文术语 中文 一句话解释
Electronic Health Record (EHR) 电子健康记录 医院系统中记录的患者诊疗数据,如诊断、化验、处方。
Longitudinal Data 纵向数据 同一个体在不同时间点重复测量的数据,如患者多年的诊断记录。
Polygenic Risk Score (PRS) 多基因风险评分 一个数值,衡量个体携带的与某种疾病相关的所有遗传变异的总和。
Genome-Wide Association Study (GWAS) 全基因组关联研究 扫描整个基因组,寻找与某个性状(如疾病)显著相关的遗传变异。
Biobank 生物银行 大型生物样本库,收集了数十万人的遗传、健康、生活方式等数据。
Mixture of Probabilities 混合概率 本文模型的核心设定,允许一个个体同时以高概率属于多个类别,用于建模共病。
Disease Signature 疾病特征 模型学到的、一组在时间上共同出现的疾病模式,代表一个潜在的生物学过程。
Inverse Probability Weighting (IPW) 逆概率加权 一种统计方法,通过给每个观测赋予权重来校正选择偏倚。
PheCode 疾病代码聚合系统 将原始ICD诊断代码聚合为更宽泛的疾病类别的系统。
Variational Inference (VI) 变分推断 一种近似贝叶斯推断方法,通过优化一个简单分布来逼近复杂的后验分布。
Clonal Haematopoiesis of Indeterminate Potential (CHIP) 意义未明的克隆性造血 一种与年龄相关的血液干细胞突变,增加炎症和心血管疾病风险。
Familial Hypercholesterolaemia (FH) 家族性高胆固醇血症 一种遗传性疾病,导致胆固醇极高,显著增加早发心血管疾病风险。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论