A Bayesian framework for longitudinal EHR and genetic discovery¶
作者: Sarah M. Urbut, Yi Ding, Tetsushi Nakao, Satoshi Koyama, Anika Misra et al.
来源: Nature
主题: 其他
相关性: 8/10
机构绿灯: Harvard University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41586-026-10780-5
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于生物医学大数据与计算遗传学的交叉领域。核心科学问题是:如何利用大规模、纵向的电子健康记录(EHR)数据,同时建模多种疾病的动态发展过程,并整合个体的遗传信息(多基因风险评分),以发现疾病之间的潜在共享机制、揭示疾病亚型,并改进个体化疾病预测。这个领域目前处于快速发展期,数据量巨大但分析方法相对滞后,传统方法多将每种疾病孤立分析,忽略了疾病间的共病关系和纵向时间信息。
- 本文的位置:它针对的是纵向多疾病EHR数据的联合建模与遗传发现这一具体问题。之所以现在做这件事,是因为:(1) 大型生物银行(如UK Biobank)积累了海量、长随访期的EHR数据;(2) 多基因风险评分(PRS)的预测能力逐步提升,但尚未被有效整合进疾病动态模型;(3) 现有方法要么是单疾病分析(如标准GWAS),要么是静态的共病网络,无法捕捉疾病随时间变化的动态模式。
二、关键术语扫盲¶
- 电子健康记录 (EHR):医院或诊所系统里记录的患者诊疗数据,包括诊断代码、化验结果、处方、手术记录等。本文主要用诊断代码(PheCode,一种将ICD代码聚合为疾病类别的系统)。
- 纵向数据 (Longitudinal data):同一个体在不同时间点重复测量的数据。本文中,每个患者有长达52年的诊断记录,构成一个时间序列。
- 多基因风险评分 (PRS):一个数值,衡量个体携带的与某种疾病相关的遗传变异(SNP)的总和。它由大型GWAS结果计算得出,反映个体的遗传易感性。
- 全基因组关联研究 (GWAS):一种统计方法,扫描整个基因组,寻找与某个性状(如疾病)显著相关的遗传变异(SNP)。传统GWAS一次只分析一个性状。
- 生物银行 (Biobank):大型生物样本库,收集了数十万人的遗传数据、EHR、生活方式问卷等,用于研究基因-环境-疾病的关联。本文用了UK Biobank、Mass General Brigham和All of Us。
- 混合概率 (Mixture of probabilities):本文模型的核心设定。不同于传统“概率混合”(先选一个疾病类别,再生成该类别下的诊断),它直接对每个时间点所有疾病的同时发生概率建模,允许一个患者同时属于多个疾病特征(signature),从而正确处理共病。
- 疾病特征 (Disease signature):模型学到的、一组在时间上共同出现的疾病模式。例如,一个“心血管特征”可能包含高血压、冠心病、心力衰竭等疾病,它们在时间上倾向于一起出现。
- 逆概率加权 (IPW):一种处理选择偏倚的方法。在EHR中,患者就诊频率不同( sicker patients visit more),导致数据有偏。IPW通过给每个观测(一次就诊)赋予一个权重(等于就诊概率的倒数),来“纠正”这种偏倚。
- 家族性高胆固醇血症 (FH):一种遗传性疾病,导致血液中胆固醇水平极高,显著增加早发心血管疾病风险。本文用它作为已知生物学知识来验证模型学到的“心血管特征”。
- 克隆性造血 (CHIP):一种与年龄相关的血液干细胞突变,增加炎症和心血管疾病风险。本文用它验证“炎症特征”。
- PheCode:一种将原始ICD诊断代码(如ICD-10)聚合为更宽泛的疾病类别的系统,例如将“高血压”、“高血压性心脏病”等归为“高血压”这个PheCode。本文使用PheCode作为疾病单位。
- Pooled Cohort Equation (PCE) / PREVENT / Gail模型:现有的临床风险预测模型。PCE用于预测10年心血管疾病风险,Gail模型用于预测乳腺癌风险。本文用它们作为基线比较对象。
三、这个领域的人在关心什么¶
这个领域的研究者(计算遗传学家、生物信息学家、临床流行病学家)在追问一个根本问题:如何从海量、嘈杂、有偏的EHR数据中,提取出关于疾病发生、发展和相互关系的可靠生物学知识,并最终用于个体化医疗?
具体来说,他们关心: - 疾病共病模式:哪些疾病倾向于同时或先后发生?这些模式背后是否有共同的生物学通路(如炎症、代谢紊乱)? - 疾病亚型发现:同一个临床诊断(如“心力衰竭”)是否包含不同的生物学亚型(如“炎症驱动型” vs “压力负荷型”),这些亚型对治疗反应和预后有何不同? - 遗传对疾病动态的影响:个体的遗传风险(PRS)如何影响其疾病轨迹?例如,高心血管PRS的人是否更早出现高血压,然后更快进展到冠心病? - 预测与预防:能否利用纵向EHR和遗传信息,在疾病发生前数年就准确预测个体风险,从而进行早期干预?
当前主流方法与局限: - 单性状GWAS(如标准GWAS):一次只分析一个疾病,忽略了疾病间的遗传相关性,且无法利用纵向信息。本文指出,其基于特征的GWAS发现了单性状分析遗漏的位点。 - 静态共病网络:只分析疾病间的成对相关性,无法捕捉随时间变化的动态模式。 - 标准潜变量模型(如LDA):假设每个患者属于一个疾病类别(“概率混合”),无法处理同时患有多种慢性病的患者。本文的“混合概率”设定是核心创新,绕开了这个局限。 - 现有风险预测模型(PCE, Gail):通常只针对单一疾病,且只使用基线风险因素,不利用纵向疾病史和遗传信息。本文的模型在预测上超越了它们。
四、数据问题¶
- 数据来源:三个独立的大型生物银行:UK Biobank(约50万人)、Mass General Brigham(约14万人)、All of Us(约4.3万人)。数据来自医院EHR系统、国家健康服务(NHS)记录、以及研究机构的直接采集。
- 数据形态:纵向、多标签、稀疏的二元矩阵。每个患者有一个时间轴(从出生到随访结束),在每个时间点(以年为单位),有一个二元向量,指示该年是否新诊断了348种PheCode中的每一种。此外,每个患者有一个PRS向量(对应多种疾病)。
- 维度和量级:总样本量 > 683,000,随访长达52年,涉及348种疾病。数据矩阵非常稀疏(大多数人在大多数年份没有新诊断)。
- 结构特征:
- 时间结构:疾病诊断有明确的时间顺序(如高血压通常早于冠心病)。
- 共病结构:多种疾病在时间上倾向于共同出现。
- 层次结构:PheCode本身有层次(如“心血管疾病”包含“高血压”、“冠心病”等)。
- Noise & 测量误差:
- 诊断误差:EHR中的诊断代码可能不准确(误诊、漏诊)。
- 编码差异:不同医院、不同医生对同一疾病的编码习惯不同。
- 时间不精确:诊断时间记录的是“首次记录时间”,而非疾病真正发生的时间。
- 非高斯:数据是二元(有/无诊断),不是高斯分布。
- Selection / Bias / 缺失:
- 选择偏倚:生物银行的参与者通常比一般人群更健康(“健康志愿者效应”)。
- 就诊偏倚:更健康的个体就诊频率更低,导致其疾病记录更稀疏。本文用IPW处理此问题。
- 右删失:随访结束或患者死亡后,后续疾病记录缺失。
- 左截断:出生到首次进入生物银行之间的疾病史可能不完整。
- 哪些是“漂亮的统计学问题”:
- 纵向多标签建模:如何对高维、稀疏、有依赖结构的二元时间序列进行建模,是一个有挑战性的统计问题。
- 选择偏倚校正:IPW在EHR数据中的应用,需要处理时变混杂和权重估计的不稳定性。
- 潜变量模型的可识别性:模型学到的“疾病特征”是否唯一且可解释?这是一个非参数识别问题。
- 哪些是“纯工程或领域难题”:
- PheCode的聚合与标准化:如何将不同版本的ICD代码映射到统一的PheCode,是数据预处理工程。
- 计算可扩展性:在68万人、348种疾病、52年数据上拟合一个复杂的贝叶斯模型,需要高效的变分推断或MCMC算法(本文使用变分贝叶斯)。
五、方法与模型问题¶
- 分析方法:本文的核心是一个贝叶斯生成式模型,名为ALADYNOULLI。它假设每个患者在每个时间点的疾病诊断是由一组潜在的、随时间变化的“疾病特征” 的激活程度决定的。
- 模型结构:对于患者 \(i\) 在年龄 \(t\) 是否被诊断为疾病 \(d\),模型假设:
\[P(\text{诊断}_{i,t,d} = 1) = \sum_{k=1}^{K} \theta_{i,t,k} \times \beta_{k,d}\]其中:
- \(\beta_{k,d}\) 是“特征 \(k\)”对“疾病 \(d\)”的载荷,表示该特征与疾病的关联强度(固定参数)。
- \(\theta_{i,t,k}\) 是患者 \(i\) 在年龄 \(t\) 对“特征 \(k\)”的激活水平(随时间变化的潜变量)。
- 关键创新:这是一个混合概率(mixture of probabilities),而不是概率混合(probability of a mixture)。这意味着一个患者可以同时以高概率激活多个特征(例如,同时有心血管特征和炎症特征),从而正确建模共病。
- 先验设定:\(\theta_{i,t,k}\) 被建模为年龄的平滑函数(使用高斯过程或样条),并受患者PRS的影响。\(\beta_{k,d}\) 有稀疏先验(如spike-and-slab),鼓励每个特征只与少数疾病强相关。
- 模型结构:对于患者 \(i\) 在年龄 \(t\) 是否被诊断为疾病 \(d\),模型假设:
- 关键假设:
- 条件独立性:给定潜变量 \(\theta\) 和载荷 \(\beta\),不同疾病、不同时间点的诊断是条件独立的。这是一个很强的简化假设。
- 特征数量 \(K\) 固定:模型需要预先指定特征数量(本文设为21)。
- PRS的线性影响:PRS对潜变量 \(\theta\) 的影响被建模为线性。
- 推断 / 计算手段:变分贝叶斯推断。由于模型复杂,精确后验不可计算,使用变分推断(VI)进行近似。IPW通过给每个观测(患者-年-疾病)赋予权重来实现。
- 核心结论 + 不确定性量化:
- 结论:模型恢复了21个可复现的、有生物学意义的疾病特征(如心血管、炎症、代谢、癌症等),并发现了疾病亚型。基于特征的GWAS发现了新位点。预测性能优于现有模型。
- 不确定性量化:论文主要报告了点估计(如特征载荷、GWAS效应量)和通过重采样(如跨队列验证)评估的稳定性。没有系统地量化模型参数的后验不确定性(例如,没有报告载荷 \(\beta\) 或激活水平 \(\theta\) 的置信区间或后验方差)。这是统计学家可能会注意到的缺失。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:4/5 星
- 理由:文章对核心科学问题(纵向EHR建模、遗传发现)的阐述清晰,术语解释得当(如“混合概率” vs “概率混合”),且用具体生物学例子(FH、CHIP)验证了模型,让外行能理解其价值。但作为Nature论文,它仍有一定领域门槛(如对GWAS、PRS的熟悉度),且方法部分对统计学家来说过于简略(缺乏模型细节和不确定性量化)。它是一篇优秀的入门第二篇,但作为第一篇可能稍显吃力。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:很高。这个问题本身非常有意思:如何从海量、嘈杂、有偏的EHR数据中,自动发现疾病的“自然分类”和动态模式?这类似于在无监督学习中寻找有意义的低维结构,但数据具有复杂的纵向和共病依赖。对于好奇的统计学家,这是一个迷人的应用场景。
- 方法学空间:中等偏上。模型的核心创新(混合概率)在概念上是优雅的,但统计学家会立刻注意到几个口子:
- 不确定性量化缺失:模型参数(载荷、激活水平)的后验不确定性没有被量化。这是一个直接的统计挑战:如何为这种复杂的贝叶斯模型提供可靠的不确定性度量(例如,通过更精确的MCMC或后验变分推断的校准)?
- 可识别性问题:潜变量模型(尤其是非负矩阵分解类模型)的旋转不变性/可识别性是一个经典问题。本文通过稀疏先验和生物学验证来缓解,但统计学家可以问:是否存在更严格的识别条件?模型学到的特征是否唯一?
- 选择偏倚的IPW:IPW在时变设置下的应用,其权重估计的稳定性、对模型误设的敏感性,都是值得深入探讨的统计问题。
- 纵向依赖建模:模型假设给定潜变量后诊断是条件独立的,这忽略了疾病间的短期动态依赖(如“感染后一周内出现炎症反应”)。更丰富的状态空间模型或图模型可能捕捉到更多信息。
- 现实相关性:很高。EHR数据是统计学家在生物医学、公共卫生、健康经济学等领域都会遇到的典型数据模式:高维、稀疏、纵向、有偏、多标签。本文提出的问题(联合建模、亚型发现、偏倚校正)具有广泛的代表性。
- 明确结论:很有意思,值得留意。虽然方法本身不是统计前沿,但它提出了一个具有挑战性的、现实世界的数据建模问题,并提供了一个优雅的基准解决方案。对于对生物医学大数据感兴趣的统计学家,这是一个很好的案例研究,可以激发关于不确定性量化、可识别性和纵向建模的后续思考。
-
武器库匹配度:
- 无明显接口,纯科普阅读。您的核心武器(非参数统计、U-统计量、高维渐近、因果推断中的估计理论)与本文的贝叶斯生成式模型和变分推断方法没有直接的技术重叠。您熟悉的逆概率加权概念可以用于理解其偏倚校正策略,但模型本身不涉及您最擅长的理论工具。这是一次拓宽视野的阅读,而非寻找方法迁移点的机会。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述 / 科普:
- 《Nature Reviews Genetics》上的综述:例如,一篇关于“利用电子健康记录进行遗传发现”的综述(如“Electronic health records for genetic discovery” by Denny et al., 2016或类似更新版本)。这类综述会系统介绍EHR数据的特点、挑战和常用分析方法。
- 《Annual Review of Statistics and Its Application》上的文章:关于“统计方法在生物银行数据中的应用”的综述,会从统计学家视角讨论纵向数据、选择偏倚、多重比较等问题。
- 关键的奠基或代表论文(从被引文献中选取):
- UK Biobank的初始描述论文:Bycroft et al., 2018, “The UK Biobank resource with deep phenotyping and genomic data.” 这是理解数据来源和基本特征的必读文献。
- PheCode系统的原始论文:Wu et al., 2019, “Mapping ICD-10 and ICD-10-CM Codes to PheCodes: Workflow Development and Initial Evaluation.” 了解疾病编码的聚合过程。
- 关于EHR选择偏倚的经典论文:例如,Goldstein et al., 2016, “Opportunities and challenges in developing risk prediction models with electronic health records data: a systematic review.” 系统讨论了EHR数据中的偏倚问题。
- 可以动手玩的公开数据集 / 挑战赛:
- UK Biobank:数据可通过申请获取(需伦理批准),是最大的公开资源之一。
- eICU Collaborative Research Database:一个公开的、去标识化的重症监护EHR数据库,可用于练习纵向数据建模。
- PhysioNet Challenges:每年都有关于EHR数据(如死亡率预测、心律失常检测)的公开挑战赛,提供数据和基线方法。
- 入门综述 / 科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Electronic Health Record (EHR) | 电子健康记录 | 医院系统中记录的患者诊疗数据,如诊断、化验、处方。 |
| Longitudinal Data | 纵向数据 | 同一个体在不同时间点重复测量的数据,如患者多年的诊断记录。 |
| Polygenic Risk Score (PRS) | 多基因风险评分 | 一个数值,衡量个体携带的与某种疾病相关的所有遗传变异的总和。 |
| Genome-Wide Association Study (GWAS) | 全基因组关联研究 | 扫描整个基因组,寻找与某个性状(如疾病)显著相关的遗传变异。 |
| Biobank | 生物银行 | 大型生物样本库,收集了数十万人的遗传、健康、生活方式等数据。 |
| Mixture of Probabilities | 混合概率 | 本文模型的核心设定,允许一个个体同时以高概率属于多个类别,用于建模共病。 |
| Disease Signature | 疾病特征 | 模型学到的、一组在时间上共同出现的疾病模式,代表一个潜在的生物学过程。 |
| Inverse Probability Weighting (IPW) | 逆概率加权 | 一种统计方法,通过给每个观测赋予权重来校正选择偏倚。 |
| PheCode | 疾病代码聚合系统 | 将原始ICD诊断代码聚合为更宽泛的疾病类别的系统。 |
| Variational Inference (VI) | 变分推断 | 一种近似贝叶斯推断方法,通过优化一个简单分布来逼近复杂的后验分布。 |
| Clonal Haematopoiesis of Indeterminate Potential (CHIP) | 意义未明的克隆性造血 | 一种与年龄相关的血液干细胞突变,增加炎症和心血管疾病风险。 |
| Familial Hypercholesterolaemia (FH) | 家族性高胆固醇血症 | 一种遗传性疾病,导致胆固醇极高,显著增加早发心血管疾病风险。 |
Maintained by 陈星宇 · Homepage · Source on GitHub