Generalized biological foundation model with unified nucleic acid and protein language¶
作者: Yong He, Pan Fang, Yongtao Shan, Yuanfei Pan, Yanhong Wei et al.
来源: Nature Machine Intelligence
主题: 其他
相关性: 3/10
机构绿灯: Fudan University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s42256-025-01044-4
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于计算生物学与生物信息学的交叉领域,具体是生物序列基础模型这一子方向。核心科学问题是:如何利用大规模无标注的DNA、RNA和蛋白质序列数据,训练一个统一的深度学习模型,使其能够“理解”这些生物分子序列所携带的遗传与功能信息,并应用于下游任务(如预测蛋白质结构、基因功能、突变影响等)。该领域目前处于快速发展期,以AlphaFold为代表的结构预测模型已取得突破,但跨分子(DNA→RNA→蛋白质)的统一建模仍是一个开放挑战。
- 本文的位置:本文针对的是生物序列的跨模态统一表示学习问题。现有方法通常分别处理DNA、RNA或蛋白质序列(如DNABERT用于DNA,ESM用于蛋白质),缺乏一个能同时理解三者并捕捉它们之间生物学关系(如中心法则:DNA转录为RNA,RNA翻译为蛋白质)的统一模型。本文提出的LucaOne,正是试图填补这一空白——用一个模型学习所有生物序列的“通用语言”。
二、关键术语扫盲¶
- 基础模型 (Foundation Model):在大规模、多样化的数据上预训练的大型深度学习模型,之后可通过微调适应各种下游任务。类比:GPT-3是文本的基础模型,LucaOne是生物序列的基础模型。
- 中心法则 (Central Dogma):分子生物学的核心原理:遗传信息从DNA流向RNA(转录),再从RNA流向蛋白质(翻译)。LucaOne试图让模型“理解”这一过程。
- 核酸 (Nucleic Acid):包括DNA和RNA,是携带遗传信息的分子,由核苷酸序列组成(A、T/U、C、G四种碱基)。
- 蛋白质 (Protein):由氨基酸序列组成,是执行生命功能的主要分子。其序列由DNA/RNA通过中心法则决定。
- 自监督学习 (Self-Supervised Learning):一种无需人工标注标签的预训练方法。模型通过预测序列中被遮盖的部分(类似BERT的“完形填空”)来学习序列的统计规律和生物学含义。
- Transformer:一种基于注意力机制的深度学习架构,最初用于自然语言处理,现已成为处理序列数据(包括生物序列)的主流模型。
- 嵌入 (Embedding):将离散的符号(如一个氨基酸或一个核苷酸)映射到一个连续的向量空间,使得语义相似的符号在向量空间中距离更近。
- 少样本学习 (Few-Shot Learning):模型仅需少量标注样本就能适应新任务的能力。在生物学中,许多任务(如预测罕见突变的影响)缺乏大量标注数据,因此少样本能力至关重要。
- 下游任务 (Downstream Task):在预训练模型基础上,通过微调或直接使用其嵌入特征来解决的具体生物学问题,如预测蛋白质的二级结构、识别基因的启动子区域等。
- 物种覆盖度 (Species Coverage):模型训练数据所包含的物种数量。LucaOne覆盖了169,861个物种,远超大多数现有模型,这有助于模型学习更通用的生物学规律。
- 序列对齐 (Sequence Alignment):传统方法通过将两条或多条序列进行比对,找出相似区域来推断进化关系或功能。LucaOne等基础模型试图绕过显式对齐,直接从序列中学习隐含的相似性。
三、这个领域的人在关心什么¶
计算生物学家和生物信息学家正在追问一个根本问题:能否像人类学习语言一样,让机器“学会”生物的语言? 生物体的所有信息都编码在DNA、RNA和蛋白质的序列中,这些序列构成了生命的“文本”。如果能训练一个模型,像GPT理解英语那样理解这些序列,那么它就能自动完成许多过去需要大量实验和专家知识才能完成的任务,例如: - 预测一个新基因的功能:只需看它的DNA序列。 - 预测一个突变是否致病:只需看它改变了哪个氨基酸。 - 设计一个全新的蛋白质:只需写出想要的氨基酸序列。
当前的主流方法是分别建模:针对DNA序列,有DNABERT、Nucleotide Transformer等;针对蛋白质序列,有ESM、ProtBERT等。这些模型各自在特定任务上表现出色,但存在一个关键局限:它们无法理解DNA、RNA和蛋白质之间的生物学联系。例如,一个DNA模型可能不知道它编码的RNA是什么,更不知道翻译出的蛋白质长什么样。这就像一个人只学了英语单词,却不懂英语语法和句子结构。
本文的LucaOne正是针对这一局限。它通过在一个统一的框架下同时训练核酸和蛋白质序列,并设计特定的预训练任务(如预测一个DNA序列对应的蛋白质序列),试图让模型内化中心法则。相比分别建模,这种统一模型有望在涉及跨分子交互的任务(如预测基因表达、理解非编码RNA的功能)上取得更好表现。
四、数据问题¶
- 数据来源:公开数据库,包括NCBI(国家生物技术信息中心)的RefSeq、UniProt(蛋白质数据库)等。这些数据库汇集了全球科学家测序并提交的生物序列。
- 数据形态:离散符号序列。DNA/RNA序列由4种字母(A、T/U、C、G)组成;蛋白质序列由20种氨基酸字母组成。每条序列长度从几十到几百万个符号不等。
- 维度和量级:超大规模。训练数据包含来自169,861个物种的序列,总符号数(token)达到万亿级别。这是典型的“大n、大p”问题(n=序列数巨大,p=序列长度巨大)。
- 结构特征:序列具有层次结构和长程依赖。例如,蛋白质的三维结构由序列中相距很远的氨基酸相互作用决定;基因的调控区域可能位于距离编码区很远的位置。Transformer的注意力机制正是为捕捉这种长程依赖而设计。
- Noise & 测量误差:测序技术本身有错误率(约0.1%-1%),且数据库中存在错误注释。但预训练阶段通常不显式建模噪声,而是依赖大规模数据的统计规律来“平均掉”噪声。
- Selection / Bias / 缺失:严重的物种和序列类型偏差。模式生物(如人类、小鼠、大肠杆菌)的序列数据极其丰富,而大多数微生物和稀有物种的数据非常稀疏。这导致模型可能对常见物种过拟合,而对稀有物种泛化能力差。此外,非编码RNA和基因间区的序列数据相对较少。
- 哪些是“漂亮的统计学问题”:
- 序列的分布外泛化:如何评估和提升模型在数据稀疏物种上的表现?这是一个典型的迁移学习和领域适应问题。
- 长程依赖的统计建模:Transformer的计算复杂度随序列长度呈二次增长,如何高效建模超长序列(如整个染色体)是一个计算统计学挑战。
- 数据偏差的量化与校正:如何量化物种偏差对下游任务的影响,并设计校正方法?这涉及因果推断中的选择偏差问题。
- 哪些是“纯工程或纯领域难题”:
- 训练万亿级token的Transformer模型所需的分布式计算、内存优化和硬件加速,主要是工程问题。
- 如何定义和构建高质量的预训练任务(如预测翻译产物),需要深入的生物学知识。
五、方法与模型问题¶
- 文章用的分析方法:LucaOne采用标准的基础模型范式:
- 预训练:使用掩码语言建模 (Masked Language Modeling, MLM) 任务。随机遮盖输入序列中15%的符号,让模型预测被遮盖的符号。模型同时处理核酸和蛋白质序列,并设计了跨模态的预训练任务(例如,给定一段DNA序列,预测其对应的蛋白质序列片段),以强制模型学习中心法则。
- 微调:在预训练好的模型基础上,针对特定下游任务(如预测蛋白质二级结构、识别启动子),在少量标注数据上微调整个模型或部分参数。
- 架构:基于Transformer的编码器(类似BERT),使用多头自注意力机制。
- 关键假设:
- 领域知识约束:假设生物序列的“语义”可以通过自监督学习从序列本身中提取,无需显式的结构或功能信息。这是所有基础模型的共同假设。
- 计算可行性:假设万亿级token的数据和千亿级参数的模型可以在合理时间内训练完成。这依赖于工程优化。
- 推断 / 计算手段:深度学习(Transformer + 自监督学习)。训练过程使用大规模分布式GPU集群,优化器为AdamW。推断时,模型前向传播即可得到序列的嵌入表示或预测结果。
- 核心结论 + 不确定性量化:
- 核心结论:LucaOne在多个DNA、RNA和蛋白质的下游任务上,性能与当前最先进的单模态模型(如ESM-2)相当或更优,尤其是在需要跨模态理解的任务上。
- 不确定性量化:几乎没有。论文报告了在测试集上的平均性能指标(如准确率、F1分数),但没有提供预测的置信区间、贝叶斯后验或任何形式的不确定性估计。这是当前深度学习在生物学应用中的普遍现状,也是一个重要的统计缺口。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:4/5 星
- 理由:作为一篇Nature Machine Intelligence上的方法学论文,它对一个外行统计学家相当友好。Introduction清晰地阐述了“为什么需要统一模型”这个核心问题,术语解释(如基础模型、中心法则)也足够。读完能让你理解当前生物信息学领域的一个主流趋势——用大模型解决序列问题。扣一星是因为它没有深入讨论模型失败案例或局限性,且对统计学家关心的不确定性量化问题完全回避。
-
这里面有没有统计学家会觉得有意思的东西?
- 结论:一般科普读读即可。
- 论证:
- (i) 科学趣味性:很高。将生命信息视为一种“语言”,并用大模型去解码,这个想法本身就极具吸引力。它触及了生物学的一个核心问题:序列如何决定功能?对于任何有好奇心的科学家来说,这都是一个值得了解的宏大叙事。
- (ii) 方法学空间:有限。从统计方法学角度看,本文的创新点主要在于工程和数据规模,而非新的统计推断理论。模型架构(Transformer)、训练范式(MLM)都是现成的。它没有提出新的损失函数、新的正则化方法或新的不确定性量化框架。对于一位精通高维统计、因果推断或半参理论的统计学家来说,这里没有直接可“攻”的方法学口子。一个潜在的有趣问题是:如何从统计上证明模型确实“理解”了中心法则,而不仅仅是记忆了序列共现模式? 这涉及到因果推断中的机制发现问题,但本文并未触及。
- (iii) 现实相关性:中等。生物序列数据(离散符号、长程依赖、层次结构)是一种常见的数据类型,统计学家在基因组学、转录组学等领域会频繁遇到。本文展示的“预训练+微调”范式,也是当前处理这类数据的主流方法。了解这一范式对统计学家拓宽视野是有益的。
-
武器库匹配度(轻量,点到即可):
- 无明显接口,纯科普阅读。你的
very_familiar武器库(非参统计、极小极大界、高阶U统计量、逆问题、高维渐近、因果推断)与本文的核心方法(大规模Transformer预训练)没有直接交集。本文不涉及统计推断的渐近理论、计算复杂度分析或因果识别问题。它更像是一个应用展示,而非一个可供理论分析的方法学贡献。
- 无明显接口,纯科普阅读。你的
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述 / 科普:
- 由于本文是2024年发表,且你提供的被引文献列表为空,我无法从真实被引中推荐。一个很好的起点是阅读Nature或Science上关于“基础模型在生物学中的应用”的综述文章。例如,搜索“Foundation models in biology”或“Large language models for genomics”可以找到相关综述。
- 对于蛋白质语言模型,可以阅读 ESM-2 的论文(Rives et al., 2021, Biological structure and function emerge from scaling unsupervised learning to 250 million protein sequences),这是该领域的奠基之作。
- 关键的奠基或代表论文:
- DNABERT (Ji et al., 2021, DNABERT: pre-trained Bidirectional Encoder Representations from Transformers for DNA-language in genome): 将BERT应用于DNA序列的开创性工作。
- Nucleotide Transformer (Dalla-Torre et al., 2023, The Nucleotide Transformer: Building and Evaluating Robust Foundation Models for Human Genomics): 一个更大规模的DNA基础模型。
- 可以动手玩的公开数据集 / 挑战赛:
- CASP (Critical Assessment of Structure Prediction):蛋白质结构预测的权威竞赛,其数据集是评估模型性能的黄金标准。
- Gene Ontology (GO) 注释数据集:用于预测基因功能的常用基准数据集。
- Hugging Face 上的
InstaDeepAI/nucleotide-transformer或facebook/esm模型库,可以直接下载预训练模型进行微调实验。
- 入门综述 / 科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Foundation Model | 基础模型 | 在大规模数据上预训练,可适应多种下游任务的通用深度学习模型。 |
| Central Dogma | 中心法则 | 遗传信息从DNA流向RNA,再流向蛋白质的生物学核心原理。 |
| Nucleic Acid | 核酸 | 包括DNA和RNA,是携带遗传信息的分子。 |
| Protein | 蛋白质 | 由氨基酸组成,执行生命功能的主要分子。 |
| Self-Supervised Learning | 自监督学习 | 无需人工标注,通过预测数据自身的一部分来学习表征的方法。 |
| Transformer | 变换器 | 一种基于注意力机制的深度学习架构,擅长处理序列数据。 |
| Embedding | 嵌入 | 将离散符号(如字母)映射到连续向量空间的技术。 |
| Few-Shot Learning | 少样本学习 | 仅用少量标注样本就能学习新任务的能力。 |
| Downstream Task | 下游任务 | 在预训练模型基础上解决的具体应用问题。 |
| Masked Language Modeling (MLM) | 掩码语言建模 | 一种自监督任务,模型需预测被遮盖的序列符号。 |
| Species Coverage | 物种覆盖度 | 训练数据中包含的物种数量,反映模型的多样性。 |
| Sequence Alignment | 序列比对 | 传统方法,通过比较序列的相似性来推断功能或进化关系。 |
Maintained by 陈星宇 · Homepage · Source on GitHub