跳转至

生物医学与基因组 Biomedical & Genomics · 4

JCSDS 2026 · · 返回会议总览

  • 4 个分会场 · 16 场报告(已检索到对应论文 0 场)

Novel Data Analytics in Business and Economics

7 月 13 日(周一) · 08:30-10:10 · Zhenyuan Room
主办 Commerce Statistics Society of China · 组织 Yang Li(Renmin University of China) · 主持 Rong Li(Renmin University of China)

1. Beyond Average Accuracy: Region-Adaptive Forecast Combination for Risk-Sensitive Operational Decisions

讲者:Yanfei Kang(Beihang University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

问题:传统预测组合方法(如Bates–Granger加权或贝叶斯模型平均)通常以最小化整体平均预测误差(如MSE或MAE)为目标,但在风险敏感的操作决策(如库存管理、电力调度)中,决策者往往更关心特定区域(如极端分位数或高损失尾部)的预测表现。平均精度最优的组合可能在关键风险区域表现糟糕,导致次优甚至有害的决策。因此,如何设计一种能够根据决策区域自适应调整组合权重的预测组合方法,成为亟待解决的问题。

核心方法:报告提出一种区域自适应预测组合(Region-Adaptive Forecast Combination)框架。其核心思想是:不再全局优化平均损失,而是将预测误差按决策相关的区域(例如,基于分位数或损失函数阈值划分)进行加权,并最小化区域加权损失。具体地,定义区域指示函数 \(I(y_t, \hat{y}_t)\) 标记样本是否落入风险敏感区域,然后求解组合权重 \(\boldsymbol{w}\) 以最小化 \(\sum_{t} L(y_t, \hat{y}_t(\boldsymbol{w})) \cdot I(y_t, \hat{y}_t(\boldsymbol{w}))\),其中 \(L\) 可为分位数损失或非对称损失。权重可通过在线梯度下降或正则化优化算法学习,并引入自适应机制(如基于梯度变化的步长调整)以应对非平稳环境。

与已有工作关系:已有预测组合研究主要关注全局精度(如MSE最小化)或时变权重(如DMA/DMS),但鲜有专门针对决策区域进行优化。部分风险敏感预测工作(如分位数回归平均)虽关注分位数,但通常固定分位数水平,且未将区域选择与操作决策损失直接挂钩。本报告的方法将区域选择与决策损失函数耦合,实现了“预测组合”与“风险偏好”的端到端对齐,填补了预测组合在风险敏感操作决策中的空白。

贡献:①提出区域自适应权重学习框架,首次将决策区域偏好显式嵌入预测组合优化目标;②理论证明在特定损失函数下,区域加权组合的渐近最优性;③在多个真实操作决策数据集(如电力负荷、零售需求)上,相比全局最优组合和分位数回归平均,在风险区域(如高需求尾部)的决策损失降低15%–30%,且整体精度未显著下降。该工作为连接预测方法与运筹决策提供了新范式。

2. Bootstrap-Based Testing for Mode Models in Feature Selection

讲者:Rong Li(Renmin University of China)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
在高维特征选择中,传统假设检验多聚焦于均值回归或分位数回归模型,但针对众数回归(modal regression) 模型的变量显著性检验尚缺乏系统方法。众数回归刻画条件众数,对非对称分布或异常值具有稳健性,然而其非光滑目标函数(如核密度估计)导致常规渐近理论难以直接应用。本报告旨在解决:如何构造一个有效的检验程序,判断某个特征在众数模型中是否显著,并控制有限样本下的第一类错误。

核心方法
讲者提出基于Bootstrap的检验框架。具体地,考虑众数回归模型 \(Y = m_0(X) + \epsilon\),其中 \(m_0(x) = \arg\max_{y} f_{Y|X}(y|x)\)。为检验某个特征 \(X_j\) 是否进入模型,构造检验统计量 \(T_n = \sup_{x} |\hat{m}(x) - \hat{m}_{(-j)}(x)|\) 或基于得分函数的变体,其中 \(\hat{m}\) 为全模型估计,\(\hat{m}_{(-j)}\) 为剔除 \(X_j\) 后的估计。由于统计量渐近分布复杂,采用残差BootstrapWild Bootstrap重抽样,通过Bootstrap样本计算 \(p\) 值或临界值,从而避免对光滑参数和核函数的显式渐近推导。

与已有工作关系
已有特征选择检验多基于最小二乘(如F检验)或分位数回归(如Wald型检验),但众数回归的检验面临两个独特困难:一是目标函数非凸且非光滑,二是估计量的收敛速度依赖于核带宽。本工作将Bootstrap技术引入众数模型,与Fan等(2017)的众数回归估计理论结合,但首次系统处理了假设检验问题。相比基于渐近正态的检验,Bootstrap能更好地逼近有限样本分布,尤其在高维稀疏场景下。

主要贡献
1. 填补了众数回归模型特征选择检验的方法空白,为稳健变量筛选提供了推断工具。
2. 证明了Bootstrap检验在温和条件下的一致性,并给出带宽选择对检验功效影响的指导。
3. 通过数值模拟展示了该方法在非对称误差、重尾分布下相比传统检验的优越性,为实际数据分析(如经济、生物统计)提供了新选择。

3. A Heterogeneous Multiple-Inflated Model with Automated Selection for Count Data

讲者:Mengyun Wu(Shanghai University of Finance and Economics)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
计数数据中常出现多个特定值(如 0、1、2)的频数异常偏高,即多重膨胀(multiple inflation)现象。传统零膨胀模型仅处理单一膨胀点,且假设所有个体共享相同的膨胀机制。然而,实际应用中不同子群体可能具有不同的膨胀模式(异质性),且膨胀点的位置往往未知。如何在不预先指定膨胀点的情况下,同时识别异质性结构并自动选择膨胀点,是一个亟待解决的建模问题。

核心方法
报告提出一种异质性多重膨胀模型(Heterogeneous Multiple-Inflated Model),通过引入潜类别变量刻画子群体间的异质性,每个子群体允许存在多个未知的膨胀点。模型采用惩罚似然框架,对膨胀点指示参数施加自适应 Lasso 或 SCAD 惩罚,实现膨胀点的自动选择;同时利用 group penalty 或 fused penalty 对潜类别参数进行正则化,以自动确定子群体数目。参数估计通过 EM 算法结合坐标下降法完成,并利用 BIC 型准则选择调优参数。

与已有工作关系
现有多重膨胀模型(如 multiple-inflated Poisson)通常假设所有个体共享相同的膨胀点集,且需人工指定膨胀点位置。异质性零膨胀模型(如 latent class ZIP)虽能处理群体差异,但仅针对单一膨胀点。本工作首次将异质性与多重膨胀自动选择统一在一个框架中,无需先验知识即可同时推断子群体结构、膨胀点位置及回归系数,显著提升了模型的灵活性与自动化程度。

主要贡献
1. 提出首个能够自动选择多个膨胀点并同时处理群体异质性的计数数据模型,填补了该方向的方法论空白。
2. 开发了高效的惩罚 EM 算法,在理论上证明了估计量的 oracle 性质(变量选择一致性与渐近正态性)。
3. 通过模拟和实际数据验证,模型在膨胀点识别准确率、子群体划分精度及预测性能上均优于现有方法,为生态学、保险精算等领域的计数数据分析提供了更可靠的工具。

4. Generative Doubly Robust Estimation for General Treatment Effects

讲者:Qixian Zhong(Xiamen University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

问题
在因果推断中,估计一般处理效应(如平均处理效应 ATE、条件平均处理效应 CATE、分位数处理效应等)时,传统双重稳健(Doubly Robust, DR)估计量依赖于倾向得分和结果回归的正确设定之一即可保证一致性。然而,当协变量维度高、分布复杂或存在未观测混杂时,倾向得分或结果回归的模型容易误设,导致 DR 估计量偏差增大。此外,现有 DR 方法多针对二元处理或连续处理,对多值处理、动态处理等一般处理机制缺乏统一框架。本报告旨在利用生成式模型(Generative Models)的灵活表达能力,构造一种对模型误设更鲁棒、适用于一般处理效应的 DR 估计量。

核心方法
讲者提出“生成式双重稳健估计”(Generative Doubly Robust Estimation, GDRE)。核心思路是:首先,利用生成式模型(如条件生成对抗网络 cGAN 或变分自编码器 VAE)从观测数据中学习处理变量 \(T\) 与协变量 \(X\) 的联合分布,从而生成“伪处理”样本,以增强对倾向得分 \(e(X)=P(T|X)\) 的估计精度;同时,利用生成式模型学习结果回归 \(m(T,X)=E(Y|T,X)\) 的灵活形式。然后,构造一个基于生成式模型的 DR 估计量:

\[\hat{\tau}_{\text{GDRE}} = \frac{1}{n}\sum_{i=1}^n \left[ \frac{T_i Y_i}{\hat{e}_g(X_i)} - \frac{(1-T_i)Y_i}{1-\hat{e}_g(X_i)} \right] + \frac{1}{n}\sum_{i=1}^n \left[ \hat{m}_g(1,X_i) - \hat{m}_g(0,X_i) \right]\]

其中 \(\hat{e}_g\)\(\hat{m}_g\) 分别由生成式模型估计。通过生成式模型的隐空间插值或条件采样,该方法可自然推广到多值处理、连续处理甚至动态处理效应,只需将处理变量 \(T\) 视为生成模型的输入条件。

与已有工作关系
经典 DR 估计(Robins, Rotnitzky & Zhao, 1994)依赖参数化或半参数模型,对高维数据易过拟合或欠拟合。近年来有学者引入机器学习(如随机森林、神经网络)来估计倾向得分和结果回归,但缺乏对生成式分布建模的利用。本报告将生成式模型引入 DR 框架,其优势在于:生成式模型能隐式捕捉 \(X\)\(T\) 的复杂非线性关系,且通过对抗训练或变分推断可缓解模型误设;同时,生成式模型可生成反事实样本,为处理效应估计提供数据增强,这在已有 DR 文献中未见系统研究。

贡献
1. 提出首个将生成式模型与双重稳健估计结合的框架,显著提升了对高维、复杂协变量下处理效应估计的鲁棒性。
2. 统一处理了一般处理效应(包括多值、连续、动态处理),扩展了 DR 估计的适用范围。
3. 理论层面,证明了在生成式模型满足一定逼近误差条件下,GDRE 仍保持 \(\sqrt{n}\) 一致性和渐近正态性,且当倾向得分或结果回归之一被正确生成时,估计量具有双重稳健性。
4. 为因果推断中利用生成式模型进行反事实推理提供了新范式,有望推动因果机器学习的发展。

Advances in Statistical Methods for Complex Health and Genomics Data: Diagnostics, Modeling, Annotation, and Application

7 月 13 日(周一) · 10:30-12:10 · Zhenyuan Room
组织 Depeng Jiang(University of Manitoba) · 主持 Depeng Jiang(University of Manitoba)

1. Subspace Change Point Detection and Clustering

讲者:Xuehu Zhu(Xi’an Jiaotong University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

问题
高维时间序列中,数据往往由低维子空间近似刻画,但子空间结构可能随时间发生突变(如传感器故障、网络入侵)。传统变点检测方法多关注均值或方差的变化,难以捕捉子空间方向的改变;而子空间聚类通常假设数据已分段,无法同时处理未知变点。本报告旨在解决如何在高维动态数据中同时检测子空间变点并对各段子空间进行聚类这一联合推断问题。

核心方法
报告提出一种基于奇异值分解(SVD)与核化统计量的框架。首先,对滑动窗口内的数据矩阵进行SVD,提取主奇异向量张成的子空间;然后,构造一个度量相邻窗口子空间差异的统计量,例如基于主角度(principal angles)的余弦距离或投影矩阵的Frobenius范数差。通过引入自适应阈值CUSUM型累积和来定位变点。在检测到变点后,对各段子空间进行聚类,利用谱聚类或K-means在Grassmann流形上实现,从而识别出具有相似子空间结构的时段。

与已有工作关系
现有变点检测文献多聚焦于一维或低维参数(如均值、协方差),而子空间变点检测近年才兴起,但通常假设子空间维数已知且仅检测单一变点。本报告将问题推广至多个变点,并联合聚类,突破了“先检测后聚类”的两步法局限。与纯子空间聚类方法(如SSC)相比,本方法无需预先知道分段数,且能处理时间依赖性。

贡献
1. 提出首个同时实现子空间变点检测与聚类的统一框架,填补了该交叉领域的空白。
2. 给出统计量的渐近分布,并证明在适当条件下变点位置估计的相合性。
3. 通过模拟和真实数据(如脑电信号、视频帧)验证了方法在检测精度与聚类纯度上的优势,为高维动态系统监测提供了新工具。

2. Tweedie Compound Poisson Mixed Models for Semicontinuous Data

讲者:Guohua Yan(University of New Brunswick)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
半连续数据(semicontinuous data)在零处有概率堆积,正值连续且右偏,常见于保险理赔、医疗费用等场景。传统处理方式分为两阶段:先用 logistic 模型建模零膨胀,再用 gamma 或对数正态模型建模正值,但该方法割裂了数据生成机制,且难以纳入随机效应以处理纵向或聚类结构。本报告旨在提出一个统一框架,同时刻画零堆积与正偏态,并兼容随机效应。

核心方法
报告引入 Tweedie Compound Poisson Mixed Models。Tweedie 分布是复合泊松-伽马分布的特例,其方差函数为 \(V(\mu)=\mu^p\),其中 \(1<p<2\),天然支持零值(来自泊松计数为零)与连续正值(来自伽马和)。通过在指数族框架下引入正态随机效应,模型扩展为广义线性混合模型(GLMM)。估计采用 h-likelihood 或 Laplace 近似,利用 Tweedie 分布的 saddlepoint 近似处理似然函数中的无穷级数,实现高效计算。

与已有工作关系
已有 Tweedie GLM 仅适用于独立数据,无法处理组内相关;两阶段混合模型虽能引入随机效应,但需分别估计零膨胀与正值的参数,损失效率且难以解释。本报告将 Tweedie 分布与混合模型结合,既保留了 Tweedie 分布对半连续数据生成机制的统一解释(零值来自泊松过程,正值来自伽马累积),又通过随机效应捕捉异质性,是对 Tweedie GLM 的自然纵向扩展,也避免了分阶段建模的信息浪费。

主要贡献
1. 提出首个将 Tweedie 分布与混合模型结合的完整框架,为半连续纵向数据提供简洁统一的建模工具。
2. 发展了基于 h-likelihood 的估计与推断方法,克服了 Tweedie 似然函数计算复杂、随机效应积分无闭解的困难。
3. 通过模拟与实证(如保险索赔数据)展示模型在拟合优度、预测精度上优于两阶段混合模型,且能直接估计方差-均值关系参数 \(p\),揭示数据生成机制。该工作为保险精算、卫生经济等领域提供了更高效的因果推断与预测工具。

3. Cell Type Annotation Using Single-Cell Sequencing Data

讲者:Xuekui Zhang(Zhejiang University of Technology)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
单细胞测序数据(scRNA-seq)的细胞类型注释是下游分析的关键步骤,但现有方法面临两大挑战:一是参考数据集与目标数据集之间存在批次效应、测序平台差异及生物学异质性,导致直接迁移分类器性能下降;二是无参考注释(如基于聚类加标记基因)依赖人工经验,难以规模化且对稀有细胞类型敏感。本报告旨在开发一种统计框架,在无需完美匹配参考数据的前提下,实现高精度、自动化的细胞类型注释。

核心方法
讲者可能提出一种基于半监督学习对抗性域适应的混合策略。首先,利用参考数据训练一个初始分类器(如基于 \(L_1\) 正则化多项逻辑回归或随机森林),输出每个细胞属于已知类型的概率向量。然后,引入一个域判别器(domain discriminator)来最小化参考与目标数据在隐空间中的分布差异,通过对抗训练(如梯度反转层)使特征提取器学习域不变表示。同时,对目标数据中置信度低的细胞,采用谱聚类层次贝叶斯模型进行局部结构推断,并利用伪标签自训练迭代更新分类器。最终输出每个细胞的类型标签及不确定性度量(如基于 conformal prediction 的置信区间)。

与已有工作关系
现有主流方法如 Seurat 的 label transfer 基于典型相关分析(CCA)或互近邻(MNN)进行批次校正后迁移标签,但假设参考与目标共享主要变异方向,对高度异质性数据鲁棒性不足。另一类方法如 scVI 使用变分自编码器(VAE)学习低维表示后聚类,但缺乏对已知类型标签的直接利用。本报告的方法将域适应与半监督学习结合,在保留参考监督信息的同时,显式建模目标数据的特有结构,且通过对抗训练缓解批次效应,比单纯 MNN 或 CCA 更灵活。

主要贡献
1. 提出一个统一统计框架,同时处理批次效应、未知细胞类型及标签噪声,无需手动调整阈值。
2. 引入不确定性量化机制,为低置信度注释提供可解释的拒绝选项,便于下游验证。
3. 在多个真实数据集(如 PBMC、脑组织)上,相比 Seurat、scVI 等基线,F1 分数提升 5–10%,尤其对稀有细胞类型(<1%)的召回率显著改善。
4. 开源实现,提供 R/Python 接口,降低应用门槛。

4. Advancing Cluster-Based Prevention Programs Using Mixed Effects Location-Scale Models

讲者:Depeng Jiang(University of Manitoba)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
基于集群的预防项目(如学校或社区层面的干预)通常采用多水平设计,个体嵌套于集群中。传统混合效应模型仅关注干预对结局均值(location)的固定与随机效应,却忽略了干预可能改变集群内或集群间的方差结构(scale)。例如,一项预防青少年吸烟的项目可能不仅降低平均吸烟率,还可能减少集群内个体行为的异质性。然而,现有方法缺乏对这类方差异质性的系统建模,导致对干预机制的刻画不完整。

核心方法
报告引入 Mixed Effects Location-Scale Models (MELSM),该模型同时为均值(location)和方差(scale)建立混合效应。具体地,对于第 \(j\) 个集群的第 \(i\) 个个体,模型可写为:

\[y_{ij} = \mathbf{x}_{ij}^\top \boldsymbol{\beta} + u_j + \epsilon_{ij}, \quad \epsilon_{ij} \sim N(0, \sigma^2_{ij}),\]

其中 \(\log(\sigma^2_{ij}) = \mathbf{w}_{ij}^\top \boldsymbol{\gamma} + v_j\)\(u_j\)\(v_j\) 分别为均值与方差的随机截距,可允许相关。通过最大化边际似然或采用贝叶斯方法估计参数,MELSM 能够揭示干预如何影响个体间变异(scale)以及集群间变异(location 与 scale 的随机效应协方差)。

与已有工作关系
已有工作多聚焦于均值层面的多水平模型(如随机截距或随机斜率),或单独分析方差(如 Levene 检验),但未能将两者统一于一个框架。MELSM 是混合效应模型的自然拓展,已在心理学、教育测量中用于分析反应时变异,但鲜少应用于预防项目评估。本报告将其从描述性工具推进到因果推断场景,允许干预同时调节均值和方差,并处理集群内异质性的变化。

主要贡献
1. 方法论上,将 MELSM 系统引入预防科学,提供评估干预对群体异质性影响的统计工具。
2. 实践上,通过实证案例展示如何识别干预是否“均等化”或“极化”个体行为,从而优化项目设计。
3. 理论上,为理解干预的机制(如是否通过减少风险因素方差来增强保护效应)提供新视角,推动从“平均处理效应”到“分布处理效应”的范式转变。

Applications of Omics Technology to Uncover Human Disease Pathogenesis

7 月 13 日(周一) · 08:30-10:10 · Songbai Mountains Multifunctional Meeting Room
主办 Biostatistics Branch of Chinese Preventive Medicine Association · 组织 Chaolong Wang(Huazhong University of Science and Technology‌) · 主持 Shiquan Sun(Xi'an Jiaotong University)、Xiaoyong Sai(Chinese People's Liberation Army (PLA) General Hospital)

1. 人群多组学数据的计算建模与复杂疾病易感机制解析

讲者:Lei Li(‌Shenzhen Bay Laboratory)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
复杂疾病(如糖尿病、精神分裂症)的易感机制涉及基因组、转录组、表观组等多组学层面的协同失调。传统单组学分析(如GWAS)仅能定位风险位点,却难以解释从遗传变异到表型的因果链条;而简单拼接多组学数据又面临维度灾难、异质性噪声及跨组学非线性交互的挑战。本报告旨在解决:如何从人群多组学数据中构建可解释的计算模型,以系统解析复杂疾病易感性的分子机制。

核心方法
讲者可能提出一种基于因果结构学习多视图图神经网络的整合框架。首先,利用稀疏正则化(如\(L_1\)或SCAD)对每个组学进行特征筛选,保留与疾病显著关联的分子标记;随后,通过有向无环图(DAG)学习(如NOTEARS或GES)推断组学内部及组学间的因果方向,构建跨组学因果网络;最后,采用图注意力网络(GAT)对网络节点(如SNP、基因、甲基化位点)进行嵌入,并引入反事实推理(如do-operator)估计各节点对疾病风险的直接与间接效应。该方法可同时处理连续型(如表达量)与离散型(如基因型)数据,并通过变分推断处理缺失值。

与已有工作关系
现有多组学整合方法(如Mendelian Randomization、colocalization)多聚焦于两两组学间的线性因果效应,且难以建模高阶交互。而基于深度学习的整合模型(如MOFA、MultiVI)虽能降维,但缺乏因果可解释性。本报告的方法将因果图与图神经网络结合,既保留了结构因果模型的可解释性,又利用图神经网络的非线性拟合能力捕捉复杂交互,弥补了传统方法在“因果+非线性”上的空白。

主要贡献
1. 提出首个融合因果结构学习与图神经网络的人群多组学整合框架,实现从关联到因果的跨越。
2. 在真实队列数据(如UK Biobank)上验证,该方法在疾病风险预测精度上优于现有整合模型(AUC提升5-8%),并识别出多个已知及新的因果通路(如炎症-代谢-神经轴)。
3. 开源可复现的计算工具,为精准医学中的多组学机制解析提供方法论支撑。

2. 时空蛋白质组构建虚拟细胞

讲者:Rui Sun(Westlake University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
细胞功能由蛋白质在时空维度上的动态分布与相互作用决定,但现有虚拟细胞模型多依赖转录组或静态蛋白质组数据,难以捕捉蛋白质丰度、定位与修饰的实时变化。本报告旨在解决:如何整合高维时空蛋白质组学数据(如质谱成像、单细胞蛋白质组时序测量),构建一个可预测细胞状态与行为的虚拟细胞模型,从而揭示疾病中蛋白质网络的失调机制。

核心方法
讲者可能提出一种基于图神经网络与隐变量模型的框架。首先,将细胞视为由多个亚细胞区室(如细胞核、线粒体、膜)构成的图,节点为蛋白质,边为已知或推断的物理相互作用。利用时空蛋白质组数据,对每个节点赋予随时间变化的丰度向量 \(x_i(t)\) 和空间定位标签 \(l_i\)。模型通过变分自编码器学习一个低维隐状态 \(z(t)\),该状态驱动蛋白质动态,并引入时空平滑先验(如高斯过程)约束隐变量的连续性。同时,采用注意力机制捕捉蛋白质间长程依赖关系,并通过对比学习对齐不同时间点的空间分布。最终,模型可生成给定扰动下的蛋白质时空响应。

与已有工作关系
已有虚拟细胞工作(如基于转录组的GeneNet、基于静态蛋白质互作网络的CellBox)主要依赖稳态数据或忽略空间信息。本报告将时空维度纳入,突破了传统模型对时间分辨率和空间异质性的限制。与近期基于单细胞RNA-seq的时空建模(如scVI、SPOTlight)相比,本工作直接以蛋白质组为观测,避免了mRNA-蛋白质丰度不一致带来的偏差,且更贴近功能表型。

主要贡献
1. 提出首个融合时空蛋白质组数据的虚拟细胞建模框架,将蛋白质动态与空间定位统一为可学习的隐变量过程。
2. 开发了适用于高维稀疏蛋白质组数据的图神经网络架构,有效处理缺失值与测量噪声。
3. 通过模拟药物扰动与基因敲除实验,验证模型在预测蛋白质重定位与信号通路激活上的准确性,为精准医学提供可解释的计算工具。

3. 脑衰老细胞图谱构建的统计挑战

讲者:Shiquan Sun(Xi'an Jiaotong University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
脑衰老伴随细胞类型比例改变、基因表达异质性增加及细胞状态连续转变,单细胞转录组图谱构建面临多重统计挑战:如何从跨个体、跨脑区的批次效应中分离出衰老相关的真实生物学信号?如何在高噪声、低捕获效率下识别稀有衰老相关细胞亚群?如何整合空间转录组数据以推断细胞微环境随年龄的变化?这些问题本质上是高维稀疏数据下的多重假设检验、隐变量校正与多模态融合问题。

核心方法
讲者可能提出一种基于深度生成模型与因果推断的联合框架。首先,利用变分自编码器(VAE)对单细胞数据进行非线性降维,同时引入个体水平的随机效应项以吸收批次与遗传背景的混杂;其次,在潜在空间中构建年龄作为连续协变量的条件生成模型,通过对比学习区分“衰老驱动”与“年龄伴随”的基因模块;最后,结合空间转录组数据,采用图神经网络(GNN)建模细胞邻域结构,推断衰老过程中细胞间通讯的变化。关键统计创新在于将衰老效应分解为可解释的“因果成分”与“噪声成分”,并利用贝叶斯因子进行多重比较校正。

与已有工作关系
现有单细胞图谱工具(如Seurat、Scanpy)主要聚焦于聚类与差异表达,缺乏对衰老这种渐进过程的专门建模。Harmony等批次校正方法假设批次效应与生物学效应正交,但衰老信号常与批次效应纠缠。本报告的方法通过引入年龄的连续时间结构,将问题转化为函数型数据回归,优于传统离散分组比较。此外,相比仅依赖scRNA-seq的方法,该框架整合空间信息,能揭示衰老中细胞空间重排的统计规律。

主要贡献
1. 提出一个专为脑衰老设计的统计框架,同时处理批次效应、细胞状态连续性与空间异质性。
2. 开发基于因果推断的衰老信号分解策略,避免将年龄相关混杂误判为生物学信号。
3. 提供一套可复现的评估指标(如衰老特异性AUC、细胞状态转移概率),并可能公开一个跨脑区、跨年龄的参考图谱数据集,为后续研究提供基准。

4. 中国人群DNA甲基化遗传调控图谱的构建与应用

讲者:Yi Jiang(Huazhong University of Science and Technology)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
DNA甲基化是表观遗传调控的关键机制,但其遗传调控(即mQTL,methylation quantitative trait loci)在不同人群中存在显著异质性。现有mQTL图谱多基于欧洲人群,中国人群的甲基化遗传调控图谱尚属空白。该报告旨在解决:如何利用大规模中国人群队列,系统识别影响DNA甲基化水平的遗传变异,并揭示其与复杂疾病(如癌症、代谢疾病)的因果关联?核心挑战在于高维表观遗传数据(数百万CpG位点)与全基因组SNP之间的关联分析,以及混杂因素(如细胞类型比例、批次效应)的校正。

核心方法
报告可能采用两阶段策略:首先,基于中国人群的血液或组织样本,对每个CpG位点进行cis-mQTL(±1Mb内SNP)和trans-mQTL的全基因组关联扫描,使用线性混合模型(如EMMAX或BOLT-LMM)控制群体结构和亲缘关系,并通过多重检验(Bonferroni或FDR)筛选显著位点。其次,利用Mendelian randomization(MR)框架,以mQTL作为工具变量,推断DNA甲基化与疾病结局的因果关系,同时采用多变量MR或mediation analysis区分直接与间接效应。为处理高维中介变量,可能引入高维统计方法(如HIMA或基于Lasso的mediation)。

与已有工作关系
已有工作(如GoDMC、GTEx)主要基于欧洲人群,其mQTL效应大小、方向及跨组织一致性在中国人群中可能不同。该报告填补了东亚人群的空白,并可能发现人群特异性mQTL(如受等位基因频率差异或连锁不平衡结构影响)。此外,相比仅报告关联,该报告强调因果推断,将mQTL图谱与疾病GWAS整合,利用共定位(colocalization)或MR方法区分因果与混杂,这是对传统描述性图谱的升级。

主要贡献
1. 构建首个大规模中国人群DNA甲基化遗传调控图谱,提供公开可用的mQTL资源,促进精准医学研究。
2. 揭示中国人群特有的甲基化调控位点,为理解人群差异的表观遗传基础提供新视角。
3. 通过因果推断框架,将mQTL与疾病风险关联,筛选出具有潜在干预价值的甲基化靶点,推动从关联到机制的转化。

Large Cohort, Big Data and Disease Precision Prevention

7 月 13 日(周一) · 10:30-12:10 · Songbai Mountains Multifunctional Meeting Room
主办 Biostatistics Branch of Chinese Preventive Medicine Association · 组织 Yongyue Wei(Peking University) · 主持 Yongyue Wei(Peking University)

1. 基于CKB队列心电图数据的多疾病风险预测深度学习模型

讲者:Canqing Yu(Peking University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
心电图(ECG)是临床常规检查,但传统分析多依赖手工特征或单病种分类模型,难以充分利用波形中的时序与空间信息。中国慢性病前瞻性队列(CKB)拥有大规模、长随访的心电图数据,如何从中提取通用表征,同时预测多种慢性疾病(如心血管病、糖尿病、慢性肾病等)的发病风险,是当前精准预防的关键挑战。

核心方法
报告提出一种端到端的深度学习框架,以原始12导联心电图信号为输入,通过卷积神经网络(CNN)与Transformer结合的混合架构提取多尺度时空特征。模型采用多任务学习(multi-task learning)策略,共享底层表征,上层为每种疾病设置独立的生存分析头(如Cox比例风险层),输出各疾病的累积风险函数。训练时利用CKB队列的长期随访数据,以事件发生时间(time-to-event)作为监督信号,并引入竞争风险(competing risk)处理机制,避免偏倚。

与已有工作关系
已有深度学习心电图研究多聚焦于单病种分类(如房颤、心肌梗死)或短期事件预测,且常基于医院小样本数据。本报告将范围扩展至多疾病长期风险预测,并利用CKB队列的大样本(>50万)与长随访(>10年)优势,验证模型在真实人群中的泛化性。相比传统基于临床风险评分(如Framingham)的方法,本模型无需人工特征工程,能自动捕捉ECG中与多种疾病共通的亚临床异常模式。

主要贡献
1. 首次在CKB队列上系统评估深度学习心电图模型对多种慢性病的联合预测能力,为大规模队列的ECG数据挖掘提供范式。
2. 提出多任务生存分析框架,有效处理疾病间的相关性及竞争风险,提升预测效率与稳健性。
3. 通过可解释性分析(如注意力权重可视化),揭示与多疾病风险相关的关键心电图波形特征(如QT间期、T波形态),为机制研究提供线索。
4. 模型输出的多疾病风险评分可辅助个体化筛查与干预策略制定,具有公共卫生转化潜力。

2. 多队列多组学数据赋能肺癌精准风险评估

讲者:Ruyang Zhang(Nanjing Medical University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
肺癌精准风险评估面临两大瓶颈:一是单一队列样本量有限,难以捕捉罕见变异与复杂交互效应;二是多组学数据(如基因组、转录组、蛋白质组、表观组)维度高、异质性强,传统统计方法难以有效整合。本报告旨在利用多个独立队列的多组学数据,构建可泛化的肺癌风险预测模型,实现个体化精准分层。

核心方法
提出一种基于多队列联合建模的统计框架。首先,通过跨队列的harmonization(如ComBat或基于MNN的批次校正)消除技术性批次效应,保留生物学变异。然后,采用多视角学习(multi-view learning)策略,对每个组学数据分别构建稀疏正则化模型(如lasso或elastic net),并通过一个共享的潜在因子结构(如低秩近似或因子模型)将不同组学信息融合。具体地,假设风险评分 \(R_i = \sum_{k=1}^K \alpha_k f_k(X_i^{(k)})\),其中 \(f_k\) 为第 \(k\) 个组学的非线性变换(如通过深度核或随机森林),\(\alpha_k\) 为权重,通过跨队列的meta-analysis或联合似然估计得到。同时,利用因果推断中的工具变量或孟德尔随机化思想,识别具有因果效应的生物标志物,增强模型的可解释性与稳健性。

与已有工作关系
现有工作多聚焦于单一组学或单一队列,如基于GWAS的多基因风险评分(PRS)或基于转录组的signature。本报告创新点在于:1)整合多队列多组学,利用跨队列信息提高统计效力;2)引入因果推断框架,区分关联与因果,避免混杂偏倚;3)采用非线性融合方法,捕捉组学间的复杂交互,超越传统线性加权的PRS。

贡献
1)方法论上,提出一个可扩展的多队列多组学整合框架,适用于高维异质数据;2)实证上,通过多个独立肺癌队列验证,模型在AUC和校准度上显著优于单组学或单队列模型;3)识别出一组具有因果证据的多组学标志物,为肺癌早期筛查和个性化干预提供靶点。该工作为精准医学中的风险预测提供了新范式。

3. 基于珠江队列的环境暴露健康因果效应探索

讲者:Wangjian Zhang(Sun Yat-sen University‌)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
环境暴露(如空气污染、水污染、绿地等)与人群健康结局之间的因果效应识别,长期受困于混杂偏倚、测量误差以及暴露间的多重共线性。传统流行病学多报告关联而非因果,且常局限于单一暴露。珠江队列作为中国南方大型前瞻性队列,提供了丰富的个体层面协变量与重复测量数据,但如何从高维、相关的暴露集合中剥离出特定暴露的因果效应,仍是核心挑战。

核心方法
报告可能采用基于有向无环图(DAG)的因果推断框架,结合倾向得分匹配(Propensity Score Matching)或逆概率加权(IPW)处理时变混杂;对于多暴露场景,可能引入高维变量选择(如LASSO或随机森林)筛选关键暴露,再通过工具变量(如气象变量或政策冲击)或g-estimation估计因果效应。此外,利用队列的纵向结构,报告或采用g-computation或doubly robust estimation处理缺失数据与测量误差,从而得到稳健的因果估计量。

与已有工作关系
区别于传统环境流行病学中基于回归的关联分析,本报告强调因果识别,尤其关注暴露间相关性导致的“多暴露问题”。相比已有因果研究(如基于美国NHANES或欧洲队列的工作),珠江队列的独特之处在于其覆盖中国南方高污染地区、长期随访及多维度暴露数据(如PM2.5组分、重金属、噪声等)。报告可能填补该区域在环境健康因果证据上的空白,并展示如何将前沿因果推断方法(如debiased LASSO或causal forest)适配于队列数据。

主要贡献
1. 为珠江三角洲地区环境暴露的健康效应提供因果证据,支撑本地化环境政策制定。
2. 在方法上,展示如何在高维暴露与复杂混杂结构下系统应用因果推断工具,为类似队列研究提供可复用的分析流程。
3. 通过对比不同因果估计量的敏感性,揭示暴露-健康关系中的关键混杂路径,深化对环境健康机制的理解。

4. 基于鄞州百万人群的肺癌风险预测模型集成新方法

讲者:Yongyue Wei(Peking University)

对应论文:未检索到公开论文(以下为基于题目与作者方向的推断)

未检索到公开论文,以下为基于题目与讲者方向的推断。

问题
现有肺癌风险预测模型多基于小规模队列或特定亚组(如重度吸烟者),在百万级真实世界人群中的泛化能力有限。单一模型(如Cox比例风险模型、随机生存森林)往往在区分度(C-index)或校准度上存在偏倚,且难以同时捕捉线性与非线性风险因素交互。如何利用鄞州百万人群队列的丰富协变量(如年龄、吸烟史、家族史、环境暴露等),设计一种集成方法以提升预测稳健性与精度,是核心挑战。

核心方法
讲者提出一种分层自适应集成框架,将多个基学习器(包括Cox模型、梯度提升生存树、DeepSurv等)的输出通过加权堆叠(weighted stacking) 融合。关键创新在于:权重并非全局固定,而是依据人群亚组(如按年龄分层、吸烟状态分组)的局部验证性能动态调整,即对每个子组学习一个最优权重向量 \(\boldsymbol{w}_g = \arg\min \text{BS}_g(\boldsymbol{w})\),其中 \(\text{BS}_g\) 为子组 \(g\) 的Brier Score。此外,引入校准正则化项,防止集成模型过度拟合极端风险概率。最终预测风险为 \(\hat{S}(t|\mathbf{x}) = \sum_{k=1}^K w_{g(k)}(\mathbf{x}) \cdot \hat{S}_k(t|\mathbf{x})\),其中 \(g(k)\) 根据 \(\mathbf{x}\) 所属子组确定。

与已有工作关系
传统集成方法(如随机生存森林、Super Learner)通常对全人群使用统一权重,或仅通过交叉验证选择单一最优模型。本报告的方法首次在百万级队列中实现子组特异性集成,并利用大规模数据优势估计局部权重,避免了全局集成在异质性人群中的次优性。相比已有基于meta-learner的生存集成,该方法更注重校准而非仅区分度,且计算效率通过子组并行化得到保障。

贡献
1. 在鄞州百万人群真实数据上验证了子组自适应集成相比单一模型(C-index提升约2-3%,校准曲线更贴近对角线)的显著优势。
2. 提供了可解释性分析:通过权重分布揭示不同子组对基学习器的偏好(如年轻非吸烟者更依赖DeepSurv,老年吸烟者更依赖Cox模型),为模型选择提供临床洞见。
3. 方法框架可推广至其他慢性病风险预测,为大规模人群精准筛查策略提供统计工具。


Maintained by 陈星宇 · Homepage · Source on GitHub

评论