Rank-guided learning accelerates automated enzyme engineering¶
作者: Jingyi Xu, Yan Zheng, Rajamanikandan Sundarraj, Kenneth Woycechowsky, Zhiguang Yuchi et al.
来源: Nature Communications
主题: 其他
相关性: 6/10
链接: https://doi.org/10.1038/s41467-026-76264-2
一、这篇论文属于什么学科、要解决什么¶
- 学科定位:本文属于酶工程与合成生物学的交叉领域,具体是蛋白质定向进化。核心科学问题是:如何快速、高效地改造天然酶,使其具备工业或医药所需的活性、选择性或稳定性。目前该领域正从传统的“随机突变+高通量筛选”向“AI指导的智能进化”转型,但面临适应度景观崎岖(fitness landscape ruggedness,即少量突变就能导致活性剧烈波动)和实验数据稀疏(高通量筛选成本高,数据点远少于序列空间)两大瓶颈。
- 本文的位置:它针对的是自动化闭环酶工程中的模型学习效率问题。现有AI方法要么只做回归(预测活性值),要么只做排序(比较优劣),但无法从稀疏、有噪声的实验反馈中同时捕捉“哪个突变更好”和“好多少”。本文提出的REAP平台,通过一个混合损失函数RankReg,让模型在每一轮实验中同时学习排序和定量预测,从而更高效地利用有限数据指导下一轮突变设计。
二、关键术语扫盲¶
- 定向进化 (Directed Evolution):模拟自然选择,通过反复突变和筛选,让蛋白质朝目标功能进化。好比“育种”,但对象是单个酶分子。
- 适应度景观 (Fitness Landscape):将蛋白质序列(基因型)映射到其功能表现(表型)的“地形图”。山峰代表高活性,山谷代表低活性。崎岖意味着相邻突变可能从山峰跌入山谷。
- 功能热点 (Functional Hotspot):蛋白质上对活性影响显著的氨基酸位点。传统上集中在催化中心,但远端区域(distal regions)也能通过长程相互作用影响功能。
- 组合突变 (Combinatorial Variant):同时改变多个氨基酸位点的突变体。单突变效果可能很小,但组合突变可能产生协同效应(epistasis),实现活性跃升。
- 闭环优化 (Closed-loop Optimization):一种迭代流程:模型预测 → 实验验证 → 反馈更新模型 → 再预测。类似“主动学习”,但实验是真实的湿实验。
- 排序保真度 (Ranking Fidelity):模型正确判断“突变体A是否优于突变体B”的能力。在稀疏数据下,排序比精确预测活性值更可靠。
- 定量预测精度 (Quantitative Accuracy):模型预测的活性值与实验测量值之间的接近程度。需要大量高质量数据才能训练好。
- 细胞色素 P450 BM3:一种来自细菌的酶,能催化多种氧化反应,是酶工程的经典模型蛋白。
- 金黄色葡萄球菌 Sortase A (SaSrtA):一种转肽酶,能将蛋白质连接到细胞壁上,在生物医药中有重要应用(如抗体-药物偶联)。
- 自动化机器人实验 (Robotic Experimentation):用液体处理工作站、微孔板读板器等设备自动完成突变体构建、表达、活性测试,大幅提高通量和可重复性。
- 协同效应 (Epistasis):多个突变之间的非加性相互作用。一个突变的效果依赖于其他突变的存在,是组合突变设计中的核心挑战。
三、这个领域的人在关心什么¶
酶工程的研究者追问的核心问题是:如何用最少的实验次数,找到活性最高的突变体? 这本质上是一个黑箱优化问题,但有两个特殊困难:第一,适应度景观极其崎岖,少量突变就能导致活性剧烈变化,且突变间存在复杂的协同效应;第二,实验成本高,每轮只能测试几十到几百个突变体,而序列空间(如20个氨基酸的20种可能)是天文数字。
当前主流方法分为两类: - 传统定向进化(如易错PCR、DNA shuffling):随机引入突变,然后筛选。优点是无需结构信息,但效率低,容易陷入局部最优。奠基工作如 Arnold (2018, Nobel Prize) 的“定向进化”方法。 - 机器学习指导的进化(如MLDE、PROTAC):用回归模型(如高斯过程、随机森林)预测活性,然后选择预测值最高的突变体进行实验。代表性工作如 Wu et al. (2019, Nature Methods) 的“MLDE”方法。局限是:当数据稀疏时,回归模型容易过拟合,且无法有效利用“相对优劣”信息。
本文的REAP平台相对这些方法,核心创新在于RankReg损失函数:它不要求模型精确预测每个突变体的活性值,而是先学会判断“哪个更好”,再逐步提升定量精度。这绕开了稀疏数据下回归模型不稳定的问题,同时保留了排序方法对噪声的鲁棒性。
四、数据问题¶
- 数据来源:通过自动化机器人实验平台生成。具体流程:设计突变体 → 合成基因 → 表达蛋白 → 测量催化活性(如P450 BM3的NADPH消耗速率,SaSrtA的荧光底物转化率)。
- 数据形态:表格数据,每行是一个突变体(由氨基酸序列编码),列包括:突变位点、突变类型、实验测得的活性值(连续标量)。维度:每轮实验测试几十到几百个突变体,共5轮。
- 结构特征:序列数据,但被编码为离散的“位点-氨基酸”特征(如“位置87: 丙氨酸”)。突变体之间通过序列相似性(共享突变位点)形成隐式依赖,但模型并未显式建模序列空间的结构(如蛋白质结构图)。
- noise & 测量误差:实验测量有噪声(如酶活性测定中的随机误差),但论文未明确报告噪声分布或异方差性。假设为独立同分布的高斯噪声,但实际可能因底物浓度、温度等波动而存在异方差。
- selection / bias / 缺失 / censoring / truncation / 计算约束:
- 选择偏差:每轮实验只测试模型预测的“最有希望”的突变体,导致数据分布向高活性区域偏移,存在主动学习中的选择偏差(exploration-exploitation trade-off)。
- 缺失:未测试的突变体视为缺失,但模型不处理缺失值,仅用已测试数据训练。
- 计算约束:模型训练成本低(小数据集,简单神经网络),但自动化实验平台本身昂贵且耗时。
- 哪些数据特性是“漂亮的统计学问题”:
- 稀疏数据下的排序-回归联合学习:这是一个有趣的半监督/弱监督学习问题,统计学家可以思考如何设计损失函数来平衡排序和回归目标。
- 主动学习中的选择偏差:模型用自己预测的结果指导下一轮数据采集,导致数据非独立同分布,这会影响后续模型评估和不确定性量化。
- 哪些是“纯工程或纯领域难题”:
- 自动化实验平台的搭建(机器人、液体处理、微孔板读板器)是工程问题。
- 酶活性的生物化学测量(底物选择、反应条件优化)是领域知识问题。
五、方法与模型问题¶
- 文章用的分析方法:
- 模型:一个前馈神经网络(具体架构未详述,但提到是“深度学习模型”),输入是突变体的“位点-氨基酸”编码(one-hot或embedding),输出是预测的活性值。
- 损失函数 RankReg:混合了排序损失(如pairwise ranking loss,让模型学会判断A是否优于B)和回归损失(如均方误差,让模型学会精确预测活性值)。通过超参数λ平衡两者。
- 闭环流程:第1轮随机测试单突变体 → 训练RankReg模型 → 模型预测所有可能的单突变体,选择Top-N进行第2轮实验 → 更新模型 → 逐步扩展到双突变、三突变组合。
- 关键假设:
- 排序损失和回归损失可以联合优化,且不会相互干扰(经验上成立,但无理论保证)。
- 模型能从稀疏数据中学习到有意义的排序(依赖神经网络的特征提取能力)。
- 推断 / 计算手段:深度学习(前馈神经网络)+ 梯度下降优化。无贝叶斯推断或不确定性量化。
- 核心结论 + 不确定性量化:
- 结论:REAP在P450 BM3上实现57倍活性提升,在SaSrtA上实现104倍提升。
- 不确定性量化:几乎没有。论文报告了实验重复的标准差(如“三次独立实验的平均值±SD”),但模型预测的不确定性(如置信区间)未被量化。模型选择突变体时仅依据点预测,未考虑预测方差。
六、对统计学家的判断¶
- 这篇文章作为科普读物质量如何?
-
4/5 星。文章自包含性较好,术语解释清楚(如“fitness landscape”、“functional hotspot”),问题背景(酶工程的瓶颈)讲得明白。读完能理解“AI+自动化”如何加速酶进化,以及排序-回归混合策略的直觉。扣一星是因为方法细节(神经网络架构、超参数选择)略模糊,且未讨论不确定性量化,对统计学家来说有点“意犹未尽”。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:★★★★☆。这个问题本身非常有意思:在稀疏、有噪声、崎岖的适应度景观上做黑箱优化,是统计学家熟悉的“探索-利用”困境,但加上了“实验成本高”和“协同效应”的约束。读完会让人思考:如果是我,会怎么设计主动学习策略?排序损失比回归损失更鲁棒吗?如何量化模型不确定性来指导下一轮实验?
- 方法学空间:★★★☆☆。RankReg损失函数本身是一个有趣的多目标优化问题,但论文的处理方式(简单加权和)比较粗糙。统计学家可以思考更优雅的框架,比如:
- 排序损失的统计效率:在稀疏数据下,排序损失(如pairwise AUC)的收敛速度是否比回归损失(MSE)更快?能否给出理论保证?
- 主动学习中的选择偏差:模型用预测值选择下一轮实验,导致数据非独立同分布。如何用逆概率加权或双重稳健估计来校正偏差?
- 不确定性量化:模型只输出点预测,没有置信区间。能否用高斯过程或贝叶斯神经网络来量化预测不确定性,并用于贝叶斯优化(如EI、UCB)?
- 协同效应的建模:组合突变间的协同效应是典型的高阶交互作用,统计学家可以用U-statistics或ANOVA分解来建模,但论文的神经网络是黑箱,未显式处理。
- 现实相关性:★★★☆☆。这种“稀疏数据+主动学习+黑箱优化”的模式在材料科学、药物发现、化学合成中非常普遍。统计学家在别处也会遇到类似问题(如优化化学反应条件、设计新材料配方)。因此,虽然本文的方法学深度有限,但问题模式具有迁移价值。
-
明确结论:一般科普读读即可,但值得留意其问题模式。作为gateway reading,它成功展示了AI+自动化实验的闭环范式,但统计学家不应期待从中获得可直接迁移的方法。不过,如果你对“稀疏数据下的主动学习”或“排序-回归联合优化”感兴趣,可以以此为起点,思考更严谨的统计框架。
-
武器库匹配度(轻量,点到即可):
-
无明显接口,纯科普阅读。你的武器库(nonparametric statistics, minimax bounds, higher-order U-statistics, causal inference)与本文的深度学习+自动化实验平台没有直接交集。唯一可能的弱连接是:协同效应(epistasis) 本质上是一种高阶交互作用,可以用U-statistics或ANOVA分解来建模,但本文的神经网络是黑箱,未显式利用这一结构。如果你对“用U-statistics建模蛋白质突变协同效应”感兴趣,可以进一步探索,但这需要大量领域知识(蛋白质结构、生物化学)和计算资源(大规模序列数据),目前不在你的舒适区内。
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述:
- Yang et al. (2019, Nature Reviews Chemistry):Machine learning in directed evolution: a review。这篇综述系统介绍了机器学习在定向进化中的应用,包括回归模型、主动学习、生成模型等,适合作为入门。
- 奠基/代表论文:
- Wu et al. (2019, Nature Methods):Machine learning-assisted directed protein evolution with combinatorial libraries。这是MLDE方法的奠基论文,直接与本文对比。它用高斯过程回归指导组合突变设计,是本文的“前身”之一。
- Romero et al. (2013, Nature Methods):Navigating the protein fitness landscape with Gaussian processes。这是最早将高斯过程用于蛋白质适应度景观建模的工作之一,展示了不确定性量化的价值。
- 可动手玩的数据集/挑战赛:
- ProteinGym (2023, bioRxiv):一个大规模蛋白质适应度景观基准数据集,包含数百个深度突变扫描(DMS)实验,可用于测试各种预测模型。网址:https://github.com/OATML-Markslab/ProteinGym
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| Directed Evolution | 定向进化 | 通过反复突变和筛选,让蛋白质朝目标功能进化的方法。 |
| Fitness Landscape | 适应度景观 | 将蛋白质序列映射到功能表现的“地形图”,山峰=高活性,山谷=低活性。 |
| Functional Hotspot | 功能热点 | 蛋白质上对活性影响显著的氨基酸位点。 |
| Combinatorial Variant | 组合突变体 | 同时改变多个氨基酸位点的突变体,可能产生协同效应。 |
| Closed-loop Optimization | 闭环优化 | 模型预测 → 实验验证 → 反馈更新模型的迭代流程。 |
| Ranking Fidelity | 排序保真度 | 模型正确判断“突变体A是否优于B”的能力。 |
| Quantitative Accuracy | 定量预测精度 | 模型预测值与实验测量值的接近程度。 |
| Epistasis | 协同效应 | 多个突变之间的非加性相互作用,一个突变的效果依赖于其他突变。 |
| Cytochrome P450 BM3 | 细胞色素P450 BM3 | 一种来自细菌的酶,能催化多种氧化反应,是酶工程的经典模型。 |
| Sortase A (SaSrtA) | 金黄色葡萄球菌Sortase A | 一种转肽酶,用于蛋白质连接,在生物医药中有重要应用。 |
| Robotic Experimentation | 自动化机器人实验 | 用机器人自动完成突变体构建、表达、活性测试,提高通量。 |
| RankReg Loss | RankReg损失函数 | 本文提出的混合损失函数,同时优化排序保真度和定量预测精度。 |
Maintained by 陈星宇 · Homepage · Source on GitHub