跳转至

Open and sustainable AI: challenges, opportunities and the road ahead in the life sciences

作者: Gavin Farrell, Eleni Adamidi, Rafael Andrade Buono, Mihail Anton, Omar Abdelghani Attafi et al.
来源: Nature Methods
主题: 其他
相关性: 6/10
链接: 期刊页 · arXiv


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于生命科学领域的开放科学与可重复性研究,具体聚焦于人工智能(AI)模型在生命科学中的应用生态。这个子领域的核心科学问题是:当AI模型(尤其是深度学习模型)越来越多地被用于蛋白质结构预测、基因组学、药物发现等生命科学任务时,如何确保这些模型的输出是可信任的、可复现的、可复用的,并且环境上是可持续的?目前的成熟度较低——虽然已有大量AI工具和模型被发布,但缺乏统一的社区标准来规范模型报告、数据共享、代码发布和环境足迹,导致“AI方法论危机”日益严重。

  • 本文的位置:本文是一篇Perspective(观点)文章,由欧洲生物信息学研究所(ELIXIR)等机构的社区专家撰写。它针对的是当前生命科学AI生态系统中碎片化、缺乏指导路径的问题。为什么现在做?因为AlphaFold等里程碑式成功正在加速AI在生命科学中的采用,但与此同时,大量AI论文因模型描述不透明、数据不可访问、代码不完整而无法被复用,信任正在被侵蚀。本文试图通过社区共识,提供一个结构化的开放与可持续AI(OSAI)实践指南,并映射到超过300个生态系统组件上。

二、关键术语扫盲

  1. FAIR原则:Findable(可发现)、Accessible(可访问)、Interoperable(可互操作)、Reusable(可复用)——一套指导科学数据管理的原则,强调机器可读性,而不仅仅是人类可读。是本文讨论AI模型可复用性的基础框架。

  2. 模型卡(Model Card):伴随训练好的机器学习模型发布的短文档,详细说明模型的预期用途、在不同人群/条件下的性能基准、评估过程等。类似于药品说明书,旨在防止模型被误用。

  3. 数据泄漏(Data Leakage):在机器学习中,当训练数据无意中包含了来自测试集的信息时,会导致模型性能被严重高估。例如,在时间序列预测中,用未来的数据训练模型来预测过去。这是AI可重复性危机的主要来源之一。

  4. 容器化(Containerization):将软件及其所有依赖(库、配置文件、环境变量)打包成一个可移植的“容器”,确保在不同计算平台上运行结果一致。Singularity是生命科学HPC(高性能计算)中常用的容器技术。

  5. 工作流(Workflow):将多个分析步骤(如数据预处理、模型训练、评估、可视化)串联成一个可自动执行的流水线。Galaxy平台是生命科学中广泛使用的开源工作流系统。

  6. GPU(图形处理单元):最初为图形渲染设计的处理器,因其高度并行的架构,被广泛用于深度学习模型的训练和推理。GPU的能耗是“绿色AI”讨论的核心。

  7. 碳足迹(Carbon Footprint):AI模型训练过程中消耗的电力所产生的二氧化碳排放量。大型模型(如GPT-4、DeepSeek-R1)的训练碳足迹可达数百吨CO₂,相当于数十辆汽车一年的排放。

  8. 可重复性(Reproducibility):在科学语境中,指独立的研究团队使用原始作者提供的数据、代码和方法,能够获得相同的结果。在AI中,这要求完整的模型描述、训练数据、超参数和随机种子。

  9. 可复用性(Reusability):指模型或数据可以被其他研究者用于不同的任务或数据集,而不仅仅是重复原始实验。这要求模型具有清晰的接口、文档和许可协议。

  10. TRIPOD+AI:一个用于报告临床预测模型研究的扩展指南,涵盖使用回归或机器学习方法开发的模型。它要求报告模型开发、验证、性能评估等关键信息,以提高透明度和可评估性。

  11. CONSORT-AI:用于报告涉及AI干预的临床试验的扩展指南,是CONSORT(临床试验报告统一标准)的AI版本,增加了14个新项目,涵盖AI干预的描述、数据来源、人机交互等。

  12. REFORMS清单:一个由跨学科共识产生的32项清单,用于指导基于机器学习的科学研究的进行和报告,旨在减少有效性、可重复性和泛化性方面的失败。

三、这个领域的人在关心什么

生命科学领域的研究者正在追问一个根本性问题:我们能否信任AI给出的生物学结论? 这个问题之所以紧迫,是因为AI已经从一个辅助工具变成了核心发现引擎。AlphaFold(Jumper et al., 2021)解决了蛋白质结构预测这个50年难题,OpenFold(Ahdritz et al., 2023)证明了可以从头训练一个与AlphaFold2精度匹配的开源实现,AlphaFold 3(Abramson et al., 2024)进一步将预测范围扩展到蛋白质-核酸-小分子复合物。这些成功带来了“雪球效应”——越来越多的生物学家开始依赖AI模型来指导实验设计、解释数据、甚至撰写论文。但与此同时,Kapoor & Narayanan (2023) 系统性地调查了17个领域中的294篇论文,发现数据泄漏问题普遍存在,有时导致严重高估的结论。Beam et al. (2020) 则专门指出了医疗健康领域ML模型可重复性的独特挑战。

当前的主流方法可以概括为“发布即完成”——研究者训练一个模型,在论文中报告性能指标,然后发布代码和数据(如果幸运的话)。这种做法的已知局限包括:模型描述不透明(缺少训练细节、超参数、随机种子),数据不可访问(“合理请求下提供”往往意味着不提供,Tedersoo et al., 2021),代码仓库不完整(缺少依赖管理、环境配置),以及缺乏对模型适用范围的明确说明(导致模型被用于其设计范围之外的任务)。本文相对这些做法,提出了一个系统性的、基于社区共识的实践指南,覆盖从数据准备到模型发布再到环境可持续性的全生命周期,并提供了超过300个生态系统组件的映射。

四、数据问题

  • 数据来源:本文不涉及原始数据收集,而是讨论生命科学AI研究中使用的各类公开数据库(如Pfam蛋白质家族数据库、UniProt、PDB等)以及研究者自己生成的数据(如测序数据、成像数据、临床数据)。
  • 数据形态:高度多样化——包括蛋白质序列(字符串)、蛋白质结构(3D坐标)、基因表达矩阵(表格)、医学影像(图像)、临床记录(文本/表格)、分子结构(图)等。维度和量级从几千个样本到数百万个序列不等。
  • 结构特征:数据具有复杂的层次结构(如蛋白质结构域-家族-超家族)、时空依赖(如时间序列基因表达)、以及图结构(如蛋白质-蛋白质相互作用网络)。
  • noise & 测量误差:高度异质——测序数据有泊松噪声,成像数据有高斯噪声,临床数据有报告偏倚。噪声通常不是独立同分布的,而是具有批次效应、平台效应等结构。
  • selection / bias / 缺失:严重的选择偏倚——大多数公开数据集偏向于研究充分的生物体(如人类、小鼠、大肠杆菌),对稀有物种或非模式生物覆盖不足。缺失数据普遍存在(如蛋白质结构数据库中只有一小部分已知序列有实验解析的结构)。
  • 哪些是“漂亮的统计学问题”:数据泄漏的检测与校正(Kapoor & Narayanan的八类泄漏分类法是一个很好的统计问题框架)、批次效应的建模与校正、缺失数据下的模型评估、以及跨数据集泛化性能的量化。哪些是“纯工程或纯领域难题”:容器化部署、工作流编排、GPU资源调度、以及FAIR原则的机器可执行实现——这些更多是软件工程和基础设施问题。

五、方法与模型问题

  • 文章用的分析方法:本文不是一篇方法论文,而是一篇社区共识指南。其“方法”是:通过ELIXIR社区内的专家讨论,识别出AI生态系统中的关键组件(数据、模型、代码、基础设施、政策),然后为每个组件制定开放和可持续的实践建议。这些建议被组织成一个OSAI生态系统地图,包含超过300个条目。
  • 关键假设:假设社区共识能够转化为可操作的标准;假设研究者有动力和资源去遵循这些建议(如发布完整代码、进行环境足迹审计)。
  • 推断 / 计算手段:无。本文不涉及任何统计推断或计算模型。
  • 核心结论 + 不确定性量化:核心结论是“开放和可持续的AI实践需要从数据准备到模型发布的全生命周期管理,并且可以通过社区共识来指导”。不确定性完全没有被量化——这是一篇观点文章,不是实证研究。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?
  2. 评分:3/5星
  3. 理由:文章清晰地阐述了生命科学AI领域面临的信任危机和可持续性挑战,并提供了一个结构化的生态系统地图。但作为科普入门,它过于偏向社区倡议和政策建议,缺乏对具体AI方法(如AlphaFold如何工作、数据泄漏如何发生)的深入解释。一个统计学家读完能了解“这个领域在吵什么”,但不会理解“这个领域在做什么科学”。更好的入门读物可能是Kapoor & Narayanan (2023) 的“Leakage and the reproducibility crisis”或Heil et al. (2021) 的“Reproducibility standards for machine learning in the life sciences”。

  4. 这里面有没有统计学家会觉得有意思的东西?

  5. 科学趣味性:中等。问题本身(AI模型的可重复性和可持续性)是重要的,但本文的讨论停留在“应该做什么”的层面,而不是“如何做”或“为什么难做”。一个统计学家可能更关心:为什么数据泄漏如此普遍?为什么模型报告如此不透明?这些问题的统计根源是什么?本文没有深入。
  6. 方法学空间:有限。本文不提出任何新的统计方法或模型。它引用的关键问题(如数据泄漏、模型卡、FAIR原则)确实有统计维度,但本文没有展开。例如,Kapoor & Narayanan的八类泄漏分类法本身就是一个有趣的统计问题——如何形式化地定义和检测不同类型的泄漏?但本文只是引用,没有贡献。
  7. 现实相关性:中等。统计学家在与其他领域合作时,确实会遇到数据不可访问、代码不完整、模型描述不透明的问题。本文提供的OSAI生态系统地图可以作为“检查清单”使用,但不会提供新的分析工具。
  8. 明确结论一般科普读读即可。本文对于了解生命科学AI生态的“政治”和“政策”层面有价值,但对于寻找方法学问题的统计学家来说,内容过于浅显和倡议导向。不如直接读它引用的那些更具体的论文(如Kapoor & Narayanan 2023, Heil et al. 2021)。

  9. 武器库匹配度无明显接口,纯科普阅读。本文不涉及任何统计建模、推断或计算问题。武器库中的nonparametric statistics、minimax bounds、causal inference、high-dimensional asymptotics等工具均无法直接应用。软件开发经验可能有助于理解容器化和工作流的概念,但这不是一个方法学问题。

  10. 如果想进一步了解这个话题,下一步读什么?

  11. 入门综述/科普
    • Kapoor, S., & Narayanan, A. (2023). Leakage and the reproducibility crisis in machine-learning-based science. Patterns. —— 系统性地调查了ML-based science中的17个领域、294篇论文的数据泄漏问题,并提出了八类泄漏分类法。比本文更具体、更有统计味道。
    • Heil, B. J., Hoffman, M. M., Markowetz, F., Lee, S.-I., Greene, C. S., & Hicks, S. C. (2021). Reproducibility standards for machine learning in the life sciences. Nature Methods. —— 提出了基于数据、模型和代码发布、编程最佳实践和工作流自动化的可重复性标准。是本文的直接前驱。
  12. 关键奠基/代表论文
    • Mitchell, M., Wu, S., Zaldivar, A., Barnes, P., Vasserman, L., Hutchinson, B., Spitzer, E., Raji, I. D., & Gebru, T. (2018). Model Cards for Model Reporting. Proceedings of the Conference on Fairness, Accountability, and Transparency. —— 提出了模型卡框架,是本文讨论的模型报告标准的基础。
    • Wilkinson, M. D., Dumontier, M., Aalbersberg, I. J., et al. (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data. —— FAIR原则的原始论文,是本文讨论的数据可复用性的基础。
  13. 可动手玩的数据集/挑战赛:无直接对应的公开数据集。但可以关注CASP(Critical Assessment of Structure Prediction) 竞赛(Kryshtafovych et al., 2023),它提供了蛋白质结构预测的标准化评估框架,是理解AI模型评估和可重复性的好起点。

七、术语小抄

英文术语 中文 一句话解释
FAIR Principles FAIR原则 可发现、可访问、可互操作、可复用的数据管理原则,强调机器可读性
Model Card 模型卡 伴随ML模型发布的短文档,说明预期用途、性能基准和限制
Data Leakage 数据泄漏 训练数据无意中包含测试集信息,导致模型性能被严重高估
Containerization 容器化 将软件及其依赖打包成可移植的容器,确保跨平台运行一致性
Workflow 工作流 将多个分析步骤串联成可自动执行的流水线
GPU 图形处理单元 用于深度学习的高度并行处理器,也是AI碳足迹的主要来源
Carbon Footprint 碳足迹 AI模型训练产生的CO₂排放量
Reproducibility 可重复性 独立团队使用原始数据/代码/方法能获得相同结果
Reusability 可复用性 模型/数据可被用于不同任务或数据集
TRIPOD+AI TRIPOD+AI 临床预测模型(含ML)的报告指南
CONSORT-AI CONSORT-AI 涉及AI干预的临床试验报告指南
REFORMS REFORMS清单 基于ML的科学研究的32项报告与实施建议
Singularity Singularity 生命科学HPC中常用的容器技术
Galaxy Galaxy平台 生命科学中广泛使用的开源工作流系统
CASP 蛋白质结构预测关键评估 每两年一次的蛋白质结构预测社区竞赛,提供标准化评估框架

Maintained by 陈星宇 · Homepage · Source on GitHub

评论