Open and sustainable AI: challenges, opportunities and the road ahead in the life sciences¶
作者: Gavin Farrell, Eleni Adamidi, Rafael Andrade Buono, Mihail Anton, Omar Abdelghani Attafi et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
链接: 期刊页 · arXiv
一、这篇论文属于什么学科、要解决什么¶
-
学科定位:本文属于生命科学领域的开放科学与可重复性研究,具体聚焦于人工智能(AI)模型在生命科学中的应用生态。这个子领域的核心科学问题是:当AI模型(尤其是深度学习模型)越来越多地被用于蛋白质结构预测、基因组学、药物发现等生命科学任务时,如何确保这些模型的输出是可信任的、可复现的、可复用的,并且环境上是可持续的?目前的成熟度较低——虽然已有大量AI工具和模型被发布,但缺乏统一的社区标准来规范模型报告、数据共享、代码发布和环境足迹,导致“AI方法论危机”日益严重。
-
本文的位置:本文是一篇Perspective(观点)文章,由欧洲生物信息学研究所(ELIXIR)等机构的社区专家撰写。它针对的是当前生命科学AI生态系统中碎片化、缺乏指导路径的问题。为什么现在做?因为AlphaFold等里程碑式成功正在加速AI在生命科学中的采用,但与此同时,大量AI论文因模型描述不透明、数据不可访问、代码不完整而无法被复用,信任正在被侵蚀。本文试图通过社区共识,提供一个结构化的开放与可持续AI(OSAI)实践指南,并映射到超过300个生态系统组件上。
二、关键术语扫盲¶
-
FAIR原则:Findable(可发现)、Accessible(可访问)、Interoperable(可互操作)、Reusable(可复用)——一套指导科学数据管理的原则,强调机器可读性,而不仅仅是人类可读。是本文讨论AI模型可复用性的基础框架。
-
模型卡(Model Card):伴随训练好的机器学习模型发布的短文档,详细说明模型的预期用途、在不同人群/条件下的性能基准、评估过程等。类似于药品说明书,旨在防止模型被误用。
-
数据泄漏(Data Leakage):在机器学习中,当训练数据无意中包含了来自测试集的信息时,会导致模型性能被严重高估。例如,在时间序列预测中,用未来的数据训练模型来预测过去。这是AI可重复性危机的主要来源之一。
-
容器化(Containerization):将软件及其所有依赖(库、配置文件、环境变量)打包成一个可移植的“容器”,确保在不同计算平台上运行结果一致。Singularity是生命科学HPC(高性能计算)中常用的容器技术。
-
工作流(Workflow):将多个分析步骤(如数据预处理、模型训练、评估、可视化)串联成一个可自动执行的流水线。Galaxy平台是生命科学中广泛使用的开源工作流系统。
-
GPU(图形处理单元):最初为图形渲染设计的处理器,因其高度并行的架构,被广泛用于深度学习模型的训练和推理。GPU的能耗是“绿色AI”讨论的核心。
-
碳足迹(Carbon Footprint):AI模型训练过程中消耗的电力所产生的二氧化碳排放量。大型模型(如GPT-4、DeepSeek-R1)的训练碳足迹可达数百吨CO₂,相当于数十辆汽车一年的排放。
-
可重复性(Reproducibility):在科学语境中,指独立的研究团队使用原始作者提供的数据、代码和方法,能够获得相同的结果。在AI中,这要求完整的模型描述、训练数据、超参数和随机种子。
-
可复用性(Reusability):指模型或数据可以被其他研究者用于不同的任务或数据集,而不仅仅是重复原始实验。这要求模型具有清晰的接口、文档和许可协议。
-
TRIPOD+AI:一个用于报告临床预测模型研究的扩展指南,涵盖使用回归或机器学习方法开发的模型。它要求报告模型开发、验证、性能评估等关键信息,以提高透明度和可评估性。
-
CONSORT-AI:用于报告涉及AI干预的临床试验的扩展指南,是CONSORT(临床试验报告统一标准)的AI版本,增加了14个新项目,涵盖AI干预的描述、数据来源、人机交互等。
-
REFORMS清单:一个由跨学科共识产生的32项清单,用于指导基于机器学习的科学研究的进行和报告,旨在减少有效性、可重复性和泛化性方面的失败。
三、这个领域的人在关心什么¶
生命科学领域的研究者正在追问一个根本性问题:我们能否信任AI给出的生物学结论? 这个问题之所以紧迫,是因为AI已经从一个辅助工具变成了核心发现引擎。AlphaFold(Jumper et al., 2021)解决了蛋白质结构预测这个50年难题,OpenFold(Ahdritz et al., 2023)证明了可以从头训练一个与AlphaFold2精度匹配的开源实现,AlphaFold 3(Abramson et al., 2024)进一步将预测范围扩展到蛋白质-核酸-小分子复合物。这些成功带来了“雪球效应”——越来越多的生物学家开始依赖AI模型来指导实验设计、解释数据、甚至撰写论文。但与此同时,Kapoor & Narayanan (2023) 系统性地调查了17个领域中的294篇论文,发现数据泄漏问题普遍存在,有时导致严重高估的结论。Beam et al. (2020) 则专门指出了医疗健康领域ML模型可重复性的独特挑战。
当前的主流方法可以概括为“发布即完成”——研究者训练一个模型,在论文中报告性能指标,然后发布代码和数据(如果幸运的话)。这种做法的已知局限包括:模型描述不透明(缺少训练细节、超参数、随机种子),数据不可访问(“合理请求下提供”往往意味着不提供,Tedersoo et al., 2021),代码仓库不完整(缺少依赖管理、环境配置),以及缺乏对模型适用范围的明确说明(导致模型被用于其设计范围之外的任务)。本文相对这些做法,提出了一个系统性的、基于社区共识的实践指南,覆盖从数据准备到模型发布再到环境可持续性的全生命周期,并提供了超过300个生态系统组件的映射。
四、数据问题¶
- 数据来源:本文不涉及原始数据收集,而是讨论生命科学AI研究中使用的各类公开数据库(如Pfam蛋白质家族数据库、UniProt、PDB等)以及研究者自己生成的数据(如测序数据、成像数据、临床数据)。
- 数据形态:高度多样化——包括蛋白质序列(字符串)、蛋白质结构(3D坐标)、基因表达矩阵(表格)、医学影像(图像)、临床记录(文本/表格)、分子结构(图)等。维度和量级从几千个样本到数百万个序列不等。
- 结构特征:数据具有复杂的层次结构(如蛋白质结构域-家族-超家族)、时空依赖(如时间序列基因表达)、以及图结构(如蛋白质-蛋白质相互作用网络)。
- noise & 测量误差:高度异质——测序数据有泊松噪声,成像数据有高斯噪声,临床数据有报告偏倚。噪声通常不是独立同分布的,而是具有批次效应、平台效应等结构。
- selection / bias / 缺失:严重的选择偏倚——大多数公开数据集偏向于研究充分的生物体(如人类、小鼠、大肠杆菌),对稀有物种或非模式生物覆盖不足。缺失数据普遍存在(如蛋白质结构数据库中只有一小部分已知序列有实验解析的结构)。
- 哪些是“漂亮的统计学问题”:数据泄漏的检测与校正(Kapoor & Narayanan的八类泄漏分类法是一个很好的统计问题框架)、批次效应的建模与校正、缺失数据下的模型评估、以及跨数据集泛化性能的量化。哪些是“纯工程或纯领域难题”:容器化部署、工作流编排、GPU资源调度、以及FAIR原则的机器可执行实现——这些更多是软件工程和基础设施问题。
五、方法与模型问题¶
- 文章用的分析方法:本文不是一篇方法论文,而是一篇社区共识指南。其“方法”是:通过ELIXIR社区内的专家讨论,识别出AI生态系统中的关键组件(数据、模型、代码、基础设施、政策),然后为每个组件制定开放和可持续的实践建议。这些建议被组织成一个OSAI生态系统地图,包含超过300个条目。
- 关键假设:假设社区共识能够转化为可操作的标准;假设研究者有动力和资源去遵循这些建议(如发布完整代码、进行环境足迹审计)。
- 推断 / 计算手段:无。本文不涉及任何统计推断或计算模型。
- 核心结论 + 不确定性量化:核心结论是“开放和可持续的AI实践需要从数据准备到模型发布的全生命周期管理,并且可以通过社区共识来指导”。不确定性完全没有被量化——这是一篇观点文章,不是实证研究。
六、对统计学家的判断¶
- 这篇文章作为科普读物质量如何?
- 评分:3/5星
-
理由:文章清晰地阐述了生命科学AI领域面临的信任危机和可持续性挑战,并提供了一个结构化的生态系统地图。但作为科普入门,它过于偏向社区倡议和政策建议,缺乏对具体AI方法(如AlphaFold如何工作、数据泄漏如何发生)的深入解释。一个统计学家读完能了解“这个领域在吵什么”,但不会理解“这个领域在做什么科学”。更好的入门读物可能是Kapoor & Narayanan (2023) 的“Leakage and the reproducibility crisis”或Heil et al. (2021) 的“Reproducibility standards for machine learning in the life sciences”。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:中等。问题本身(AI模型的可重复性和可持续性)是重要的,但本文的讨论停留在“应该做什么”的层面,而不是“如何做”或“为什么难做”。一个统计学家可能更关心:为什么数据泄漏如此普遍?为什么模型报告如此不透明?这些问题的统计根源是什么?本文没有深入。
- 方法学空间:有限。本文不提出任何新的统计方法或模型。它引用的关键问题(如数据泄漏、模型卡、FAIR原则)确实有统计维度,但本文没有展开。例如,Kapoor & Narayanan的八类泄漏分类法本身就是一个有趣的统计问题——如何形式化地定义和检测不同类型的泄漏?但本文只是引用,没有贡献。
- 现实相关性:中等。统计学家在与其他领域合作时,确实会遇到数据不可访问、代码不完整、模型描述不透明的问题。本文提供的OSAI生态系统地图可以作为“检查清单”使用,但不会提供新的分析工具。
-
明确结论:一般科普读读即可。本文对于了解生命科学AI生态的“政治”和“政策”层面有价值,但对于寻找方法学问题的统计学家来说,内容过于浅显和倡议导向。不如直接读它引用的那些更具体的论文(如Kapoor & Narayanan 2023, Heil et al. 2021)。
-
武器库匹配度:无明显接口,纯科普阅读。本文不涉及任何统计建模、推断或计算问题。武器库中的nonparametric statistics、minimax bounds、causal inference、high-dimensional asymptotics等工具均无法直接应用。软件开发经验可能有助于理解容器化和工作流的概念,但这不是一个方法学问题。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述/科普:
- Kapoor, S., & Narayanan, A. (2023). Leakage and the reproducibility crisis in machine-learning-based science. Patterns. —— 系统性地调查了ML-based science中的17个领域、294篇论文的数据泄漏问题,并提出了八类泄漏分类法。比本文更具体、更有统计味道。
- Heil, B. J., Hoffman, M. M., Markowetz, F., Lee, S.-I., Greene, C. S., & Hicks, S. C. (2021). Reproducibility standards for machine learning in the life sciences. Nature Methods. —— 提出了基于数据、模型和代码发布、编程最佳实践和工作流自动化的可重复性标准。是本文的直接前驱。
- 关键奠基/代表论文:
- Mitchell, M., Wu, S., Zaldivar, A., Barnes, P., Vasserman, L., Hutchinson, B., Spitzer, E., Raji, I. D., & Gebru, T. (2018). Model Cards for Model Reporting. Proceedings of the Conference on Fairness, Accountability, and Transparency. —— 提出了模型卡框架,是本文讨论的模型报告标准的基础。
- Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. —— FAIR原则的原始论文,是本文讨论的数据可复用性的基础。
- 可动手玩的数据集/挑战赛:无直接对应的公开数据集。但可以关注CASP(Critical Assessment of Structure Prediction) 竞赛(Kryshtafovych et al., 2023),它提供了蛋白质结构预测的标准化评估框架,是理解AI模型评估和可重复性的好起点。
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| FAIR Principles | FAIR原则 | 可发现、可访问、可互操作、可复用的数据管理原则,强调机器可读性 |
| Model Card | 模型卡 | 伴随ML模型发布的短文档,说明预期用途、性能基准和限制 |
| Data Leakage | 数据泄漏 | 训练数据无意中包含测试集信息,导致模型性能被严重高估 |
| Containerization | 容器化 | 将软件及其依赖打包成可移植的容器,确保跨平台运行一致性 |
| Workflow | 工作流 | 将多个分析步骤串联成可自动执行的流水线 |
| GPU | 图形处理单元 | 用于深度学习的高度并行处理器,也是AI碳足迹的主要来源 |
| Carbon Footprint | 碳足迹 | AI模型训练产生的CO₂排放量 |
| Reproducibility | 可重复性 | 独立团队使用原始数据/代码/方法能获得相同结果 |
| Reusability | 可复用性 | 模型/数据可被用于不同任务或数据集 |
| TRIPOD+AI | TRIPOD+AI | 临床预测模型(含ML)的报告指南 |
| CONSORT-AI | CONSORT-AI | 涉及AI干预的临床试验报告指南 |
| REFORMS | REFORMS清单 | 基于ML的科学研究的32项报告与实施建议 |
| Singularity | Singularity | 生命科学HPC中常用的容器技术 |
| Galaxy | Galaxy平台 | 生命科学中广泛使用的开源工作流系统 |
| CASP | 蛋白质结构预测关键评估 | 每两年一次的蛋白质结构预测社区竞赛,提供标准化评估框架 |
Maintained by 陈星宇 · Homepage · Source on GitHub