Structure and evolution-guided design of minimal RNA-guided nucleases¶
作者: Petr Skopintsev, Isabel Esain-Garcia, Evan C. DeTurk, Peter H. Yoon, Zehan Zhou et al.
来源: Science
主题: 其他
相关性: 3/10
机构绿灯: University of California, Berkeley(US News 前 50,免分进入精读)
链接: https://doi.org/10.1126/science.aed6123
一、这篇论文属于什么学科、要解决什么¶
-
学科定位:本文属于合成生物学与蛋白质工程的交叉领域,具体是RNA引导的核酸酶设计。这个子领域的核心科学问题是:如何创造或改造自然界中存在的、能够被RNA引导去切割特定DNA序列的蛋白质(核酸酶),以用于基因组编辑(如CRISPR)。目前的成熟度是:我们已经能利用自然界已有的CRISPR-Cas系统(如Cas9、Cas12)进行编辑,但天然酶存在分子量过大、递送困难、脱靶效应等问题。因此,领域的前沿是设计出更小、更高效、更特异的非天然核酸酶。
-
本文的位置:它针对的是如何系统性地设计出功能强大的、与天然酶序列差异巨大的小型核酸酶这一具体问题。为什么现在做?因为近年来AI辅助的蛋白质结构预测(如AlphaFold)和逆折叠模型(从结构反推序列)取得了突破,使得在计算机上“凭空”设计蛋白质成为可能。本文正是利用这些工具,结合进化信息,尝试创造一种名为TnpB的微型核酸酶的多样化变体,并验证其活性。
二、关键术语扫盲¶
- RNA引导的核酸酶 (RNA-guided nuclease):一种蛋白质,它需要结合一段特定的RNA分子(称为“引导RNA”)。这个RNA像GPS一样,指引蛋白质去找到并切割与之序列匹配的DNA。CRISPR-Cas系统就是最著名的例子。
- TnpB:一种非常小的、与CRISPR-Cas12类似的RNA引导核酸酶,被认为是现代CRISPR-Cas12系统的祖先。它体积小,但功能完整,是设计更小基因编辑工具的绝佳起点。
- CRISPR-Cas系统:细菌的一种免疫系统。Cas蛋白(核酸酶)在CRISPR RNA(crRNA)的引导下,切割入侵病毒的DNA。科学家将其改造为强大的基因编辑工具。
- 逆折叠模型 (Inverse Folding Model):一种AI模型。传统的蛋白质结构预测是从序列预测结构;逆折叠模型则反过来,给定一个目标蛋白质的三维结构,预测出最可能折叠成这个结构的氨基酸序列。它相当于一个“结构到序列”的翻译器。
- 进化信息约束 (Evolution-informed residue constraints):在蛋白质漫长的进化过程中,某些氨基酸位置非常保守(几乎不变),因为它们对功能至关重要。本文利用这些信息,在AI设计时“锁定”这些关键位置,只允许在其他位置进行变异,以确保设计出的变体仍有活性。
- 高通量筛选 (High-throughput screening):一种自动化实验技术,可以同时测试成千上万种不同的蛋白质变体(例如,在细菌中表达它们,看它们是否能切割DNA),快速找出表现最好的那些。
- 冷冻电镜 (Cryo-EM):一种强大的成像技术,可以将蛋白质等生物大分子快速冷冻,然后用电子束拍摄其三维结构。本文用它来解析新设计的蛋白质变体与RNA、DNA结合时的精细结构,验证设计是否成功。
- 基因组编辑 (Genome editing):在活细胞中,对DNA序列进行精确的插入、删除或替换。CRISPR-Cas系统是目前最主流的工具。
- 引导RNA (Guide RNA, gRNA):一段人工设计的RNA分子,其序列与目标DNA序列互补。它负责将核酸酶“引导”到正确的切割位置。
- 原间隔序列邻近基序 (Protospacer Adjacent Motif, PAM):一段短的DNA序列,是许多RNA引导核酸酶(如Cas9、Cas12)识别和切割DNA所必需的“定位信号”。不同的核酸酶识别不同的PAM序列,这限制了它们能编辑的基因组位置。
- 蛋白质设计空间 (Designable protein space):理论上所有可能的蛋白质序列所构成的巨大空间。绝大多数序列没有功能。本文的目标是探索并扩大这个空间中“有功能”的那一小部分。
三、这个领域的人在关心什么¶
这个领域的研究者,核心追问是:我们能否像工程师设计电路一样,理性地设计出具有特定功能的蛋白质? 具体到基因组编辑,他们关心的是如何获得更优的“基因剪刀”: - 更小:小尺寸的酶更容易通过病毒载体(如AAV)递送到人体细胞中,用于基因治疗。 - 更精准:减少脱靶切割,避免意外修改非目标基因。 - 更通用:能够识别更多样的PAM序列,从而能编辑基因组中更多的位置。 - 更高效:在细胞内的切割效率更高。
当前主流方法和已知局限: - 主流方法1:挖掘自然界新酶。通过宏基因组学从环境样本(如土壤、海洋)中寻找新的、具有不同特性的CRISPR-Cas系统。局限:受限于自然进化,找到的酶往往与已知酶相似,很难突破现有性能瓶颈。 - 主流方法2:定向进化。在实验室中对已知酶进行随机突变,然后筛选出性能更好的变体。局限:通常只能产生与原始酶序列差异很小的变体,探索的设计空间非常有限。 - 本文的方法:结合AI逆折叠模型和进化约束,直接从结构出发“设计”序列,可以产生与天然酶序列差异巨大的变体(序列相似性低至~40%),极大地扩展了可探索的设计空间。它绕开了“依赖自然进化”和“只能做微小改动”的局限。
四、数据问题¶
- 数据来源:
- 结构数据:来自蛋白质数据库(PDB),特别是TnpB与RNA、DNA复合物的冷冻电镜结构。
- 序列数据:来自公共数据库(如NCBI)中所有已知的TnpB同源序列,用于提取进化信息约束。
- 实验数据:由作者自己产生,包括高通量筛选的活性数据(细菌存活率/荧光信号)、以及后续验证的编辑效率数据(通过Sanger测序或二代测序获得)。
- 数据形态:
- 结构数据:三维原子坐标(点云)。
- 序列数据:离散的字符串(氨基酸序列)。
- 筛选数据:表格数据,每一行是一个蛋白质变体,列包括其序列、在不同条件下的活性得分(连续值或分类值)。
- 验证数据:测序结果(文本或序列比对文件)。
- 结构特征:蛋白质结构具有复杂的层次结构(一级序列→二级结构→三级结构→四级结构)和几何约束(键长、键角、空间位阻)。序列数据具有进化上的相关性(系统发育树)。
- Noise & 测量误差:
- 高通量筛选:噪声较大,可能来自细胞生长状态的差异、质粒拷贝数波动、测量仪器的误差等。通常假设噪声是独立的,但可能不是高斯分布(例如,计数数据可能服从泊松分布)。
- 编辑效率验证:测序本身有误差,但通常较小。更主要的误差来自生物学重复之间的变异。
- Selection / Bias / 缺失:
- 筛选:存在选择偏差。只有那些在筛选条件下(如抗生素压力)能存活的细菌才会被检测到,这相当于一个截断(truncation)过程。活性低的变体根本不会被观察到。
- 结构数据:冷冻电镜解析的结构是蛋白质的一个或多个优势构象,不代表其在溶液中的所有动态行为。
- 哪些是“漂亮的统计学问题”:
- 高通量筛选数据的建模:如何处理截断数据?如何从有噪声的、非线性的筛选结果中,推断出每个变体的“真实”活性?这是一个逆问题。
- 序列-活性关系的建模:如何从高维、离散的序列空间(20^N种可能)中,学习一个能预测活性的函数?这涉及到高维统计和组合优化。
- 实验设计:如何智能地选择下一轮要测试的变体,以最大化信息获取或找到最优解?这是一个贝叶斯优化或自适应实验设计问题。
- 哪些是“纯工程或领域难题”:如何设计高效的逆折叠模型、如何优化冷冻电镜的数据采集和处理流程、如何构建高通量筛选的遗传回路。这些是生物信息学、结构生物学和合成生物学的核心问题,统计学家通常不直接介入。
五、方法与模型问题¶
- 分析方法重述:
- 设计阶段:作者首先用冷冻电镜解析了TnpB与RNA、DNA的复合物结构。然后,他们使用一个逆折叠模型(基于图神经网络),以这个结构为输入,生成成千上万种可能的氨基酸序列。同时,他们利用所有已知TnpB序列的进化信息,识别出对结构和功能至关重要的“保守位点”,并在AI生成序列时将这些位点“锁定”为天然序列,只允许在其他位置变异。
- 筛选阶段:将AI生成的序列变体(SynTnpBs)克隆到质粒上,在大肠杆菌中进行高通量筛选。筛选系统被设计成:如果SynTnpB能切割目标DNA,细菌就能存活(或发出荧光)。通过测序存活细菌中的质粒,他们就能知道哪些变体是有活性的。
- 验证阶段:将筛选出的最优变体在细菌、植物(拟南芥)和人类细胞(HEK293T)中测试其基因组编辑效率。最后,用冷冻电镜解析了其中一个最“离经叛道”的变体的三维结构,以理解其工作原理。
- 关键假设:
- 结构保守性假设:设计的变体必须能折叠成与天然TnpB相同的三维结构。这是逆折叠模型工作的前提。
- 进化约束的有效性:进化上保守的位点确实对功能至关重要,锁定它们不会扼杀所有活性。
- 筛选模型的保真度:在大肠杆菌中的筛选结果,能预测其在植物和人类细胞中的活性。
- 推断/计算手段:
- AI模型:逆折叠模型(深度学习)。
- 高通量筛选:本质上是一个大规模的、基于生存的功能选择实验。
- 结构解析:冷冻电镜(计算图像处理与三维重构)。
- 核心结论的不确定性量化:几乎没有。论文报告了编辑效率的均值和标准差(来自生物学重复),但没有对筛选结果进行统计建模,也没有量化“AI模型预测”的不确定性。结论的可靠性主要依赖于实验验证(在多个物种中重复、用冷冻电镜确认结构)。
六、对统计学家的判断¶
-
这篇文章作为科普读物质量如何?
- 评分:4/5 星
- 理由:文章本身是Science上的研究论文,不是科普文章,因此对完全外行的统计学家来说,自包含性一般。它假设读者对CRISPR、蛋白质结构、高通量筛选等概念有基本了解。不过,其引言和结果部分清晰地阐述了“为什么要设计新酶”和“我们是怎么做的”这两个核心问题,读完后能对合成生物学和AI辅助蛋白质设计的前沿有一个非常直观的认识。作为一篇深度科普,它需要读者花点功夫去理解术语,但回报是能真正领略到该领域的研究范式和雄心。
-
这里面有没有统计学家会觉得有意思的东西?
- 科学趣味性:非常高。这个问题本身——能否像工程师一样设计生命分子——是21世纪最激动人心的科学问题之一。对于任何有好奇心的科学家来说,了解如何用AI和进化信息来创造自然界不存在的、功能强大的蛋白质,本身就是一种享受。这属于“值得了解”的范畴。
- 方法学空间:有,但很隐蔽。从统计学的角度看,这篇文章的方法论核心是一个大规模、有噪声、带截断的“黑箱”优化问题。具体来说:
- 问题:在20^N(N≈400)的序列空间中,找到能折叠成目标结构并具有高活性的序列。
- 现有方法:作者用了一个AI模型(逆折叠)来生成候选,然后用一个非常粗糙的筛选(存活/不存活)来过滤。这相当于一个两步法:先降维(用结构约束),再暴力筛选。
- 统计挑战:
- 实验设计:如何设计下一轮筛选?是随机测试AI生成的新变体,还是基于上一轮结果进行“进化”(如定向进化)?这是一个典型的多臂老虎机或贝叶斯优化问题,但状态空间是离散且巨大的。
- 噪声建模:高通量筛选的“存活”信号是二元的,但背后是连续、有噪声的活性值。如何从这种截断的、二元的观测中,更有效地推断出连续活性?这涉及到潜变量模型和EM算法。
- 序列-活性映射:能否建立一个更精细的统计模型(如高斯过程),将序列特征(如氨基酸的理化性质、进化保守性)映射到活性,从而指导更智能的搜索?这比单纯用AI生成+实验筛选要高效得多。
- 现实相关性:高。这种“设计-筛选-验证”的范式在合成生物学、药物发现、材料科学中非常普遍。统计学家在实验设计、高通量数据分析、贝叶斯优化方面的工具,可以直接应用于此类问题,提升发现效率。
- 明确结论:很有意思,值得留意。虽然文章本身没有使用复杂的统计方法,但它揭示了一个对统计学家而言肥沃的问题土壤。它不是一个纯领域文章,因为它提出的问题模式(从高维离散空间中搜索最优解)具有跨学科的普遍性。
-
武器库匹配度:
- 无明显接口,纯科普阅读。你的
very_familiar武器库(非参数统计、高维渐近、因果推断等)与本文的核心方法(逆折叠模型、冷冻电镜)没有直接的技术重叠。虽然高通量筛选数据可以应用非参数方法或软件工具进行分析,但这并非本文的亮点,且属于“可以但没必要”的层面。本文的价值在于拓宽科学视野,而非提供可迁移的方法。
- 无明显接口,纯科普阅读。你的
-
如果想进一步了解这个话题,下一步读什么?
- 入门综述/科普:
- 可以阅读Nature Reviews Molecular Cell Biology上关于“CRISPR-Cas系统多样性与工程化”的综述,例如
"Evolution and classification of the CRISPR–Cas systems"(Makarova et al., 2020) 或类似文章,以建立更全面的背景知识。 - 关于AI蛋白质设计,可以阅读
"The coming of age of de novo protein design"(Nature, 2016) 或更近期的综述。
- 可以阅读Nature Reviews Molecular Cell Biology上关于“CRISPR-Cas系统多样性与工程化”的综述,例如
- 关键奠基/代表论文:
- TnpB的发现:本文的起点是TnpB的发现。奠基论文是
"TnpB is a transposon-encoded RNA-guided nuclease"(Altae-Tran et al., Science, 2021)。这篇论文首次揭示了TnpB的功能,是理解本文工作的基础。 - 逆折叠模型:本文使用的逆折叠模型很可能基于
"Protein sequence design by explicit energy landscape optimization"(Norn et al., Nature, 2021) 或"Robust deep learning–based protein sequence design using ProteinMPNN"(Dauparas et al., Science, 2022)。后者(ProteinMPNN)是当前非常主流和高效的逆折叠模型。
- TnpB的发现:本文的起点是TnpB的发现。奠基论文是
- 可动手玩的数据集/挑战赛:
- 蛋白质设计领域有一个著名的公开挑战赛:CASP (Critical Assessment of Structure Prediction)。虽然它主要关注结构预测,但其“设计”赛道(CASP15开始有)提供了公开的数据集和评估标准。
- 可以关注 ProteinMPNN 的GitHub仓库,它提供了预训练模型和示例代码,可以让你亲身体验“从结构到序列”的设计过程。
- 入门综述/科普:
七、术语小抄¶
| 英文术语 | 中文 | 一句话解释 |
|---|---|---|
| RNA-guided nuclease | RNA引导的核酸酶 | 一种需要RNA分子指引才能切割特定DNA的蛋白质。 |
| TnpB | TnpB | 一种非常小的、被认为是CRISPR-Cas12祖先的RNA引导核酸酶。 |
| CRISPR-Cas system | CRISPR-Cas系统 | 细菌的免疫系统,已被改造为强大的基因编辑工具。 |
| Inverse folding model | 逆折叠模型 | 给定蛋白质三维结构,预测其氨基酸序列的AI模型。 |
| Evolution-informed constraints | 进化信息约束 | 利用蛋白质在进化中保守的位点来指导设计,确保功能。 |
| High-throughput screening | 高通量筛选 | 自动化、大规模地测试成千上万种蛋白质变体的活性。 |
| Cryo-electron microscopy (Cryo-EM) | 冷冻电镜 | 一种用于解析生物大分子三维结构的技术。 |
| Genome editing | 基因组编辑 | 在活细胞中对DNA进行精确修改。 |
| Guide RNA (gRNA) | 引导RNA | 一段人工设计的RNA,负责将核酸酶带到目标DNA位置。 |
| Protospacer Adjacent Motif (PAM) | 原间隔序列邻近基序 | 核酸酶识别DNA所需的短“定位信号”序列。 |
| Protein design space | 蛋白质设计空间 | 所有可能的蛋白质序列构成的巨大、稀疏的空间。 |
| Macroevolutionary divergence | 宏观进化分歧 | 指新设计的蛋白质与天然蛋白质在序列上差异巨大,如同跨越了漫长的进化时间。 |
Maintained by 陈星宇 · Homepage · Source on GitHub