跳转至

De novo L-(+)-tartaric acid biosynthesis in multi-modular engineered yeasts

作者: Xuan Zhou, Jiaheng Hou, Zikai Wang, Zhendong Li, Yang Li et al.
来源: Nature Communications
主题: 其他
相关性: 1/10
机构绿灯: Peking University(US News 前 50,免分进入精读)
链接: https://doi.org/10.1038/s41467-026-76119-w


一、这篇论文属于什么学科、要解决什么

  • 学科定位:本文属于合成生物学代谢工程的交叉领域。合成生物学的核心科学问题是:如何通过重新设计和构建生物系统(主要是微生物的代谢网络),来生产人类需要的化合物(药物、材料、燃料、食品添加剂等)。代谢工程则是其核心工具,通过基因编辑等手段,有目的地改造微生物的代谢通路,使其像一座微型工厂一样高效生产目标产物。这个领域目前处于“从实验室走向工业应用”的成熟阶段,但每一条新产物的合成路径都需要从头发现和优化,过程高度定制化,缺乏通用规则。
  • 本文的位置:本文针对的是L-(+)-酒石酸(L-TA) 的绿色生物合成问题。L-TA是一种高价值的食品添加剂和手性药物中间体,目前主要从葡萄酿酒副产物中提取或化学合成,前者受限于原料供应,后者不环保。本文的目标是在酿酒酵母中从头(de novo,即从简单的碳源如葡萄糖开始)构建一条完整的L-TA生物合成途径,实现其可持续生产。之所以现在能做,是因为基因组测序和酶功能预测工具(如AlphaFold)的进步,使得从海量生物数据中“挖掘”出催化特定反应的酶成为可能。

二、关键术语扫盲

  1. L-(+)-酒石酸 (L-TA):一种手性有机酸,是葡萄酒中“酸味”的主要来源,也用作食品酸味剂和药物合成原料。手性意味着它有左右两种镜像结构,只有L-(+)-型是天然存在且有生物活性的。
  2. 酿酒酵母 (Saccharomyces cerevisiae):一种单细胞真菌,俗称面包酵母或啤酒酵母。它是合成生物学中最常用的“底盘细胞”之一,因为其遗传背景清楚、易于操作、生长快、安全性高(GRAS,一般认为安全)。
  3. 从头生物合成 (De novo biosynthesis):指微生物从最简单的碳源(如葡萄糖)开始,通过一系列酶促反应,最终合成目标产物。这需要构建一条完整的、从起始原料到终产物的代谢通路。
  4. 代谢通路 (Metabolic pathway):细胞内一系列连续的化学反应,每个反应由特定的酶催化,前一个反应的产物是后一个反应的底物,像一条流水线。
  5. 酶 (Enzyme):生物催化剂,能极大地加速特定化学反应。本文的核心就是寻找和改造能催化L-TA合成关键步骤的酶。
  6. 转酮醇酶 (Transketolase, TK):一种在细胞代谢中负责转移酮基的酶。本文发现它意外地能催化L-TA合成途径中的第一步反应。
  7. 琥珀酸半醛脱氢酶 (Succinate semialdehyde dehydrogenase, SSDH):一种通常参与神经递质代谢的酶。本文发现它意外地能催化L-TA合成途径中的第二步反应。
  8. 5-酮-D-葡萄糖酸 (5-KGA):L-TA生物合成途径的直接前体。本文首先在酵母中构建了从葡萄糖合成5-KGA的模块。
  9. 酶委员会特异性催化混合优化器 (ECHO):本文开发的一个计算工具,用于从海量候选酶中筛选出性能最好的TK和SSDH。它整合了酶的氨基酸序列、底物分子结构和酶活性口袋的三维结构信息,进行多模态学习。
  10. 辅因子工程 (Cofactor engineering):许多酶在催化反应时需要“帮手”分子,即辅因子(如NADPH)。辅因子工程就是通过改造微生物自身的代谢,使其能提供足够且正确形式的辅因子,以支持目标酶的高效工作。
  11. 半理性蛋白质工程 (Semi-rational protein engineering):一种改造酶的方法。它不像“定向进化”那样完全随机突变,而是基于对酶结构和功能的理解,有目的地对关键位点(如活性口袋附近的氨基酸)进行突变,以提高其活性或稳定性。
  12. 滴度 (Titer):在生物发酵工程中,指单位体积发酵液中目标产物的浓度(本文为mg/L)。这是衡量生产效率的核心指标。

三、这个领域的人在关心什么

合成生物学和代谢工程的研究者,核心追问是:如何让微生物高效、稳定、低成本地生产我们想要的任何东西? 这不仅仅是找到一个能产目标产物的酶,而是一个系统工程。他们关心: - 路径发现:目标化合物在自然界中是否存在已知的生物合成途径?如果不存在,如何从海量的基因组和酶数据库中“挖掘”出能催化所需反应的酶?这就像在没有地图的情况下,从无数可能的化学反应中找出一条可行的路。 - 路径优化:找到路径后,如何让这条“流水线”跑得更快、更稳?这包括:提高关键酶的活性(蛋白质工程)、平衡各步骤的代谢流量(避免中间产物堆积或短缺)、解决辅因子供应问题(辅因子工程)、减少副产物的生成。 - 底盘细胞适配:如何让宿主细胞(如酵母)适应新的代谢负担,并最大化地将碳源和能量导向目标产物,而不是用于自身生长?这涉及全局代谢网络的调控。

当前主流方法与局限:传统方法依赖于在模式生物(如大肠杆菌、酵母)中异源表达已知的酶,然后通过“试错法”进行优化。例如,早期的工作(如DeLoache et al., 2015在《Nature Chemical Biology》上发表的关于在酵母中合成阿片类药物的开创性工作)展示了路径构建的可能性,但过程极其繁琐,成功率低。对于L-TA这种没有已知完整合成路径的化合物,传统方法几乎无从下手。本文的贡献在于,它提出了一种计算驱动的路径发现和优化工作流(ECHO),将酶挖掘从“大海捞针”式的随机筛选,转变为有明确指导的、基于多模态信息的智能筛选,绕开了传统方法中需要大量实验试错的局限。

四、数据问题

  • 数据来源:数据主要来自公共生物信息数据库(如UniProt、PDB、KEGG)和实验室实验。前者提供了海量的酶序列、结构和功能注释数据;后者提供了通过基因编辑构建的酵母菌株的发酵实验数据。
  • 数据形态
    • 序列数据:氨基酸序列(字符串)。
    • 结构数据:蛋白质的三维结构坐标(点云/网格),来自X射线晶体学或AlphaFold预测。
    • 底物分子数据:小分子(如5-KGA、L-TA)的化学结构(图/SMILES字符串)。
    • 实验数据:时间序列(发酵过程中产物浓度随时间变化)、表格(不同工程菌株的滴度、产量、生长速率等)。
  • 结构特征:蛋白质结构数据具有复杂的三维几何结构层次结构(一级序列→二级结构→三级结构→四级结构)。底物分子是图结构。实验数据是典型的多变量表格
  • Noise & 测量误差:实验数据(如滴度)的噪声主要来自生物变异(不同批次发酵、不同克隆之间的差异)和测量误差(HPLC等分析仪器的精度)。通常假设为独立同分布的高斯噪声,但异方差性可能存在(低浓度时相对误差更大)。
  • Selection / Bias / 缺失
    • 选择偏差:在酶挖掘阶段,数据库本身存在偏差(研究得多的生物体,其酶被注释得更充分)。ECHO模型训练时,使用的“高性能”酶对数据可能来自文献中报道的成功案例,存在发表偏倚
    • 缺失数据:许多酶的实验表征数据(如动力学参数Km, kcat)是缺失的。ECHO模型正是为了在缺乏这些昂贵实验数据的情况下,仅用序列和结构信息进行预测。
  • 哪些是“漂亮的统计学问题”,哪些是“纯工程难题”
    • 漂亮的统计学问题多模态数据融合(序列、结构、底物图)的建模问题;小样本/零样本学习(预测从未被实验表征过的酶的活性);不确定性量化(预测的酶活性有多可靠?)。这些是统计/机器学习方法可以大展拳手的领域。
    • 纯工程难题:具体的基因编辑操作(如CRISPR-Cas9的效率和脱靶)、发酵过程的工艺优化(pH、温度、溶氧控制)、代谢通量的动力学建模(常微分方程组)。这些更多是分子生物学和化学工程的问题。

五、方法与模型问题

  • 分析方法:本文的核心方法是ECHO,一个多模态深度学习模型。它不直接预测酶活性,而是用于排序:给定一个目标反应(如5-KGA → L-TA),它从候选酶库中为TK和SSDH分别打分,推荐最有可能的高性能配对。
    • 输入:TK或SSDH的氨基酸序列(通过预训练语言模型如ESM-1b提取特征)、底物5-KGA的分子图(通过图神经网络提取特征)、酶活性口袋的三维结构(通过3D卷积神经网络提取特征)。
    • 输出:一个“催化兼容性”分数。
    • 训练:使用已知的、能催化类似反应的酶对作为正样本,随机配对的酶作为负样本,进行对比学习。
  • 关键假设
    • 领域知识约束:假设催化反应类型(由酶委员会编号EC number定义)相似的酶,其序列-结构-底物关系具有可迁移性。这是ECHO模型设计的生物学基础。
    • 计算可行性:假设预训练的蛋白质语言模型和3D结构编码器能够提取足够有信息量的特征,并且计算成本是可接受的。
  • 推断/计算手段深度学习(PyTorch等框架)、预训练模型(ESM-1b)、图神经网络3D卷积神经网络。模型训练后,用于对大量候选酶进行排序
  • 核心结论与不确定性量化
    • 核心结论:成功在酵母中实现了L-TA的从头合成,最高滴度6.59 mg/L。证明了ECHO工作流在发现和优化新合成路径上的有效性。
    • 不确定性量化几乎没有。论文报告了实验的均值±标准差(通常来自3个生物学重复),但没有对模型预测(ECHO的分数)进行任何不确定性量化。例如,没有给出预测分数的置信区间,也没有分析模型在哪些类型的酶上预测可能不可靠。这是本文在统计严谨性上的一个明显短板。

六、对统计学家的判断

  1. 这篇文章作为科普读物质量如何?

    • 打分:4/5 星
    • 理由:对合成生物学外行来说,本文的Introduction和Results部分写得相当清晰,能让人理解“为什么要做”、“做了什么”和“怎么做的”。关键术语(如TK, SSDH, 辅因子)在上下文中解释得足够。它很好地展示了一个现代合成生物学项目的完整流程:从计算挖掘到实验验证再到工程优化。缺点是ECHO模型的技术细节(多模态融合架构)对非AI背景的读者可能有些晦涩,但跳过这部分不影响理解核心故事。总的来说,是一篇不错的入门级科普文章。
  2. 这里面有没有统计学家会觉得有意思的东西?

    • 科学趣味性很高。这个问题本身非常有意思:如何从零开始,在微生物中“无中生有”地制造一种有价值的化学品?这就像是在问“如何设计一个全新的微型工厂”,充满了工程学的智慧和生物学的奇妙。对于好奇的统计学家来说,了解这种“生命编程”的思维方式本身就是一种享受。
    • 方法学空间有,但未被本文充分挖掘。本文的核心方法学贡献是ECHO,一个多模态酶筛选模型。这背后是一个典型的多模态学习小样本/零样本预测问题。统计学家会立刻想到:
      • 不确定性量化:模型给出的排序分数有多可靠?能否为每个预测给出一个置信度?这直接关系到实验资源(昂贵的基因编辑和发酵)的分配。贝叶斯深度学习或共形预测在这里有巨大的应用空间。
      • 因果推断:模型学到的关联是“序列A + 结构B → 高活性”,但这是因果关系吗?能否通过干预(如定点突变)来验证模型学到的特征确实是决定活性的关键因素?这可以看作一个因果发现与验证的问题。
      • 实验设计:如何主动选择下一个要实验验证的酶对,以最大化信息增益,从而快速迭代优化模型?这是一个贝叶斯优化自适应实验设计问题。
      • 高维/函数型数据:蛋白质序列和结构是高维的、非欧几里得的数据。如何为这类数据设计有效的统计模型和假设检验,本身就是一个活跃的研究领域。
    • 现实相关性中等。这种“预测-验证-优化”的范式在生物技术、材料科学、药物发现中非常普遍。统计学家在别处(如化学信息学、计算生物学)也会遇到类似的多模态、小样本预测问题。因此,本文所揭示的方法学缺口(缺乏UQ、缺乏因果验证、缺乏主动学习)具有跨领域的普遍性。
    • 明确结论很有意思值得留意。虽然本文本身在统计上很“朴素”,但它清晰地揭示了一个真实世界中的、对统计方法有强烈需求的科学问题。它不是一个统计方法论文,但为统计学家提供了一个绝佳的“问题游乐场”。
  3. 武器库匹配度

    • 无明显接口,纯科普阅读。本文的核心是深度学习模型和分子生物学实验,与研究者熟悉的 nonparametric statisticsminimax boundshigher-order U-statisticscausal inference 等工具没有直接的技术接口。虽然可以想象用因果推断来理解酶突变对活性的影响,但这需要大量的领域知识来构建结构因果模型,远非现有工具的直接应用。因此,本文的价值在于科普,而非提供可迁移的方法。
  4. 如果想进一步了解这个话题,下一步读什么?

    • 入门综述/科普
      • 《Synthetic Biology: A Primer》 (Baldwin et al., 2012):一本经典的入门教材,系统介绍了合成生物学的概念、工具和伦理问题。
      • 《Life as a Geek: The Story of Synthetic Biology》 (一篇《Nature》的专题文章或类似科普文章):寻找一篇面向大众的、介绍合成生物学历史和愿景的深度报道。
    • 关键的奠基或代表论文
      • DeLoache, W. C., et al. (2015). "An enzyme-coupled biosensor enables (S)-reticuline production in yeast from glucose." Nature Chemical Biology, 11(7), 465-471.来自被引文献)这篇是合成生物学领域的里程碑式工作,展示了在酵母中从葡萄糖合成复杂植物天然产物(阿片类药物前体)的完整路径,是理解“路径构建”的必读文献。
      • Galanie, S., et al. (2015). "Complete biosynthesis of opioids in yeast." Science, 349(6252), 1095-1100.来自被引文献)与上一篇同期,但更进了一步,实现了从糖到阿片类药物的完整生物合成,是领域内另一座高峰。
    • 可以动手玩的公开数据集/挑战赛
      • The Critical Assessment of Protein Structure Prediction (CASP):虽然主要是结构预测,但其数据集和评估框架是理解蛋白质计算问题的好起点。
      • Enzyme Commission (EC) number prediction tasks on platforms like Kaggle:搜索“EC number prediction”或“enzyme function prediction”,可以找到一些公开的序列-功能数据集,可以尝试用统计/机器学习方法复现或改进。

七、术语小抄

英文术语 中文 一句话解释
De novo biosynthesis 从头生物合成 微生物从最简单的碳源(如葡萄糖)开始,合成目标产物。
Metabolic pathway 代谢通路 细胞内一系列由酶催化的连续化学反应,像一条生产流水线。
Enzyme 生物催化剂,能极大地加速特定的化学反应。
Transketolase (TK) 转酮醇酶 一种酶,本文发现它能催化L-TA合成途径的第一步。
Succinate semialdehyde dehydrogenase (SSDH) 琥珀酸半醛脱氢酶 一种酶,本文发现它能催化L-TA合成途径的第二步。
5-Keto-D-gluconic acid (5-KGA) 5-酮-D-葡萄糖酸 L-TA生物合成途径的直接前体物质。
ECHO 酶委员会特异性催化混合优化器 本文开发的计算工具,用于从海量候选酶中筛选出性能最好的酶对。
Cofactor engineering 辅因子工程 改造微生物的代谢,以确保关键酶有足够的“帮手”分子(辅因子)可用。
Semi-rational protein engineering 半理性蛋白质工程 基于对酶结构的理解,有目的地突变其关键氨基酸以提高性能。
Titer 滴度 单位体积发酵液中目标产物的浓度,衡量生产效率的核心指标。
Chassis cell 底盘细胞 作为“生产工厂”的微生物宿主,如本文中的酿酒酵母。
Heterologous expression 异源表达 将一个物种的基因放到另一个物种(如酵母)中去表达和生产蛋白质。
Active site / Pocket 活性位点/口袋 酶分子上直接与底物结合并发生催化反应的三维结构区域。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论