跳转至

Nat. Methods — Vol 22 Issue 11 · 2026-08-01

  • 共 13 篇 · Nature Methods
  • 目录核对 ⚠️ 疑似漏 19 篇(对照 OpenAlex 32 篇):10.1038/s41592-025-02737-9、10.1038/s41592-025-02778-0、10.1038/s41592-025-02822-z、10.1038/s41592-025-02820-1、10.1038/s41592-025-02863-4 等

本期导览

自动生成:归纳本期主要主题与脉络,不打分、不排名

这一期《Nature Methods》整体聚焦于单细胞基因组学与生物图像分析的方法学创新,涵盖深度生成模型、拓扑数据分析、对比学习、生物物理建模、基因组注释与序列设计等方向。13篇论文可归纳为三条主线:单细胞数据建模与异质性分析(MrVI、PHLOWER、CytoTRACE 2、scooby、Monod)、细胞追踪与分割(CELLECT、u-Segment3D、细胞追踪误差预测)、以及高通量实验平台与基因组工具(nELISA、SegmentNT、gReLU、Cyclone)。此外,有一篇多模态整合基准测试(Multitask benchmarking)作为评估性工作。

在单细胞数据建模主线中,MrVI 利用变分自编码器从单细胞分辨率学习样本级异质性,无需预定义细胞类型即可实现患者分层与药物扰动分析;PHLOWER 则通过 Hodge 分解在单纯复形上推断多分支分化轨迹,将拓扑数据分析引入细胞命运推断;CytoTRACE 2 以可解释神经网络预测发育潜能,输出连续分数并识别关键基因模块;scooby 将 bulk 多组学预测模型适配到单细胞,通过微调解码器实现细胞特异性序列-表达映射;Monod 则从随机转录动力学出发,将生物噪声视为信息源,通过似然与矩估计拟合两态模型。这些方法在工具上各有侧重,但共同挑战在于从高维、稀疏、异质的单细胞数据中提取可解释的生物信号。

细胞追踪与分割主线中,CELLECT 采用对比嵌入学习实现跨模态泛化的大规模 3D 追踪,在生发中心 B 细胞动态中验证;u-Segment3D 将 2D 分割结果通过图论优化提升为 3D 共识分割,无需训练数据;细胞追踪误差预测论文则结合神经网络与统计物理配分函数,为追踪步骤分配误差概率,实现不确定性量化。这三篇均涉及从时序或空间数据中重建细胞行为,但误差预测工作因引入概率图模型与不确定性量化,与统计方法关联更紧密。

对于因果推断与半参数效率方向的研究者,本期直接相关论文较少,但 MrVI 的样本级异质性建模与 Monod 的随机过程似然推断可视为因果推断中潜在结果框架的变体应用。高维数据分析方面,Multitask benchmarking 提供了多模态整合的评估框架,而 scooby 与 SegmentNT 涉及序列-表达的高维映射。若优先阅读,建议关注 MrVI(样本级异质性建模)、Monod(随机动力学模型)、PHLOWER(拓扑数据分析)、以及细胞追踪误差预测(概率图模型与不确定性量化)。

其他 (other, 13 篇)

1. 10.1038/s41592-025-02808-x — Deep generative modeling of sample-level heterogeneity in single-cell genomics

  • 作者: Pierre Boyeau, Justin Hong, Adam Gayoso, Martin Kim, José L. McFaline-Figueroa, Michael I. Jordan et al.
  • 期刊/来源: Nature Methods
  • 机构: University of California, Berkeley · Columbia University Irving Medical Center · Columbia University · Weizmann Institute of Science
  • 分类: vol 22 · issue 11 · pp 2264-2274
  • 相关性 7/10 · novelty: application
  • 摘要: 本文提出 MrVI,一个用于单细胞基因组学队列研究的深度生成模型,旨在解决样本级异质性分析中的两个核心问题:样本分层和组间差异分析。模型基于变分自编码器框架,无需预先定义细胞类型或状态,直接从单细胞分辨率数据中学习样本间的异质性。MrVI 在 COVID-19 和炎症性肠病队列中识别出仅在特定细胞亚群中体现的临床相关患者分层,这是传统基于平均表达的分析无法发现的。在大规模药物扰动研究中,MrVI 能从头识别具有相似生化性质的小分子组,并评估它们对细胞组成和基因表达的影响。该方法作为开源软件在 scvi-tools.org 发布。作为 Nature Methods 上的方法学论文,本文对统计学家而言是了解单细胞基因组学数据分析挑战和深度生成模型应用的入门读物,但方法本身(变分自编码器)与您的主要兴趣方向(因果推断、高维统计、U-统计量)无直接技术重叠。
  • 关键技术: deep generative model, variational autoencoder, single-cell genomics, cohort-level analysis, sample stratification
  • 为什么对您有用: 本文属于 general science 范畴(Nature Methods),作为 gateway reading 值得一读:(a) 对单细胞基因组学外行友好,清晰阐述了队列研究的设计和数据挑战;(b) 有真实的数据和建模维度(单细胞数据的噪声、稀疏性、批次效应),统计学家能理解其推断问题;(c) 科学问题本身有趣——从单细胞分辨率发现临床分层。但武器库中无深度生成模型(VAE)的专门工具,且方法不涉及您熟悉的因果推断或高维统计框架,属于暂不可做的方向——仅适合作为拓宽视野的阅读材料。

2. 10.1038/s41592-025-02845-6 — Cell tracking with accurate error prediction

  • 作者: Max A. Betjes, Rutger N. U. Kok, Sander J. Tans, Jeroen S. van Zon
  • 期刊/来源: Nature Methods
  • 机构: Institute for Atomic and Molecular Physics · University Medical Center Utrecht · Delft University of Technology
  • 分类: vol 22 · issue 11 · pp 2400-2410
  • 相关性 7/10 · novelty: application
  • 摘要: 本文提出了一种结合神经网络与统计物理的细胞追踪算法,核心创新在于能为追踪结果中的每一步分配误差概率(类似p值),从而量化追踪的不确定性。该方法通过统计物理中的配分函数概念,将追踪问题转化为概率图模型,利用神经网络提取特征并计算每条轨迹的后验概率。与现有方法相比,该算法无需人工校正即可实现全自动分析,仅需对低置信度步骤进行人工干预。实验在多个肠道类器官的数千个细胞上验证了其有效性,能够自动分析细胞周期和分化事件。对您而言,这是一篇Nature Methods上的方法学论文,属于跨学科科普阅读范畴,展示了统计物理思想在生物图像分析中的实际应用,但方法论上(概率图模型、不确定性量化)与您的主要研究兴趣(因果推断、高维统计)无直接技术重叠。作为入门级阅读,本文清晰阐述了数据(时间序列显微图像)和模型(概率图+神经网络)的构建,适合了解生物成像领域的统计挑战。
  • 关键技术: probabilistic graphical models, partition function, neural networks, uncertainty quantification, cell tracking
  • 为什么对您有用: 本文属于Nature Methods上的方法学论文,适合作为跨学科科普阅读。它展示了统计物理(配分函数)与深度学习结合解决实际生物成像问题,但方法论(概率图模型、不确定性量化)与您的主要兴趣(因果推断、高维统计)无直接技术迁移点。武器库中'软件工程'和'非参数统计'可辅助理解其概率建模思路,但核心机器(细胞追踪的图模型推理)不在您的技术栈中,属于暂不可做的方向。不过,作为一篇清晰的数据+模型入门读物,值得花时间阅读全文以拓宽视野。

3. 10.1038/s41592-025-02870-5 — PHLOWER leverages single-cell multimodal data to infer complex, multi-branching cell differentiation trajectories

  • 作者: Mingbo Cheng, Jitske Jansen, Katharina C. Reimer, Vincent P. Grande, James S. Nagai, Zhijian Li et al.
  • 期刊/来源: Nature Methods
  • 机构: RWTH Aachen University · Broad Institute · Massachusetts General Hospital · Center for Cancer Research · Erasmus MC · Erasmus University Rotterdam
  • 分类: vol 22 · issue 11 · pp 2328-2336
  • 相关性 6/10 · novelty: application
  • 摘要: 本文提出 PHLOWER 方法,利用 Hodge 分解的调和分量在单纯复形上推断单细胞多模态数据中的复杂多分支分化轨迹。方法将细胞分化视为单纯复形上的流,通过 Hodge Laplacian 分解提取调和嵌入,从而自然表示分化树结构。在模拟多分支树和真实肾脏类器官多模态/空间单细胞数据上,PHLOWER 在推断复杂树和识别调控脱靶细胞的转录因子方面均优于现有方法。该方法本质上是拓扑数据分析与计算几何的结合,而非统计推断或因果方法。对您而言,这是一篇 Nature Methods 的 gateway reading,展示了拓扑工具在生物数据建模中的应用,但方法学核心(Hodge 分解、单纯复形)不在您的技术武器库中,且与您的 primary interests 无直接连接。
  • 关键技术: Hodge decomposition, simplicial complex, Hodge Laplacian, trajectory inference, single-cell multimodal data
  • 为什么对您有用: 本文属于 general science gateway reading(Nature Methods),作为多学科旗舰期刊的入门读物,它清晰阐述了单细胞分化轨迹推断的科学问题与数据挑战,但方法学核心(Hodge 分解、单纯复形)与您的 primary interests(因果推断、高维统计、U-统计量)无直接交集。您的武器库中缺乏拓扑数据分析工具,因此暂不可做 follow-up。不过,本文可作为了解拓扑方法在生物数据中应用的广度阅读,值得花时间读全文以拓宽视野。

4. 10.1038/s41592-025-02856-3 — Multitask benchmarking of single-cell multimodal omics integration methods

  • 作者: Chunlei Liu, Sichang Ding, Hani Jieun Kim, Siqu Long, Di Xiao, Shila Ghazanfar et al.
  • 期刊/来源: Nature Methods
  • 机构: The University of Sydney · Children's Medical Research Institute · UNSW Sydney · Garvan Institute of Medical Research · The Kinghorn Cancer Centre
  • 分类: vol 22 · issue 11 · pp 2449-2460
  • 相关性 6/10 · novelty: application
  • 摘要: 本文对单细胞多模态组学数据整合方法进行了系统的分类、评估和基准测试。研究涵盖了降维、批次校正、细胞类型分类与聚类、插补、特征选择和空间配准等多个任务。通过在不同模态和批次组合下评估方法性能,为研究者选择最合适的整合方法提供了指导。该工作采用注册报告(Registered Report)形式,确保了评估流程的透明性和可重复性。对您而言,这是一篇高质量的应用基准研究,展示了复杂高维数据整合的评估框架,但方法学创新有限,主要贡献在于系统性的比较和实用指南。
  • 关键技术: single-cell multimodal integration, benchmarking, dimension reduction, batch correction, imputation, spatial registration
  • 为什么对您有用: 本文属于 general science 范畴(Nature Methods),作为 gateway reading 可了解单细胞组学数据整合的现状与挑战。武器库中的非参数统计和高维渐近知识可帮助理解其评估指标的设计,但本文不涉及新方法或理论,暂不可做 follow-up。

5. 10.1038/s41592-025-02832-x — Monod: model-based discovery and integration through fitting stochastic transcriptional dynamics to single-cell sequencing data

  • 作者: Gennady Gorin, Tara Chari, Maria Carilli, John J. Vastola, Lior Pachter
  • 期刊/来源: Nature Methods
  • 机构: Broad Institute · California Institute of Technology · Harvard University
  • 分类: vol 22 · issue 11 · pp 2286-2300
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出Monod,一个基于生物物理模型(两态转录模型、延迟反应模型等)的Python包,用于分析单细胞RNA测序数据中的新生RNA和成熟RNA计数。核心思路是:不依赖降维或噪声去除,而是直接利用数据的随机性和多模态性(新生/成熟RNA),通过似然函数或矩估计拟合随机转录动力学模型,从而区分生物变异与技术噪声。方法上,Monod支持多种模型选择(如Poisson、负二项、延迟模型),并利用数值优化(如L-BFGS-B)进行参数推断。主要理论贡献在于:将转录随机性视为信息源而非噪声,通过模型比较(如似然比检验)识别转录调控机制(如burst频率或大小的变化)。实证部分展示了在多个数据集(如小鼠胚胎、人类细胞系)上,Monod能发现传统平均表达分析无法检测的转录调制,并统一不同测序技术(如10x Genomics、Smart-seq2)的数据。对您而言,这是一篇Nature Methods的方法学论文,属于跨学科入门读物,展示了统计模型(随机过程、似然推断)在生物数据中的创新应用,但方法学新颖性有限(主要是现有模型的整合与软件实现)。
  • 关键技术: stochastic transcriptional models, two-state model, likelihood-based inference, method of moments, model comparison via likelihood ratio test, numerical optimization (L-BFGS-B)
  • 为什么对您有用: 本文属于Nature Methods的跨学科方法学论文,适合作为gateway reading:它清晰阐述了单细胞数据中的统计推断问题(随机过程建模、似然估计),对统计学家友好,不假设深度生物学背景。您的武器库中'非参数统计'和'高维渐近'虽不直接适用,但'软件工程'经验可帮助您快速理解Monod的代码结构。不过,本文的方法学核心(随机转录模型)与您的primary interests(因果推断、高维统计)无直接连接,且缺乏新的理论贡献,因此暂不可做——它更适合作为拓宽视野的入门读物,而非直接研究起点。

6. 10.1038/s41592-025-02887-w — Universal consensus 3D segmentation of cells from 2D segmented stacks

  • 作者: Felix Y. Zhou, Zach Marin, Clarence Yapp, Qiongjing Zou, Benjamin A. Nanes, Stephan Daetwyler et al.
  • 期刊/来源: Nature Methods
  • 机构: Southwestern Medical Center · The University of Texas Southwestern Medical Center · University of Vienna · Max Perutz Labs · Harvard University · Center for Systems Biology · University of Oxford · The University of Texas at Austin 等
  • 分类: vol 22 · issue 11 · pp 2386-2399
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出 u-Segment3D,一种无需训练数据即可将 2D 细胞分割结果提升为 3D 共识分割的理论与工具箱。核心挑战在于 3D 细胞分割需要密集标注 2D 切片,成本极高且存在歧义。方法基于图论和优化,将 2D 实例掩膜通过跨切片关联与一致性约束转化为 3D 实例分割,兼容任意基于像素的 2D 分割方法。在 11 个真实数据集(>70,000 个细胞)上验证,涵盖单细胞、细胞聚集体和组织,性能与原生 3D 分割相当,在细胞拥挤和形态复杂时甚至更优。本文属于应用导向的方法学贡献,无新统计理论,但展示了生物图像分析中从 2D 到 3D 的实用计算策略。对您而言,这是一篇 Nature Methods 的 gateway reading,可作为了解计算生物学中图像分割 pipeline 的入门材料,但与方法学兴趣无直接关联。
  • 关键技术: 2D-to-3D segmentation, consensus instance segmentation, graph-based optimization, pixel-based instance masks
  • 为什么对您有用: 本文属于 general science 范畴(Nature Methods),作为 gateway reading 可读性高:问题动机清晰(3D 分割标注成本高),方法框架自包含,数据规模大且多样。但武器库中无直接可攻的技术口子——核心是图像处理 pipeline 而非统计推断或计算复杂度问题。暂不可做:缺乏统计模型或计算复杂度分析,属于纯应用工具。

7. 10.1038/s41592-025-02857-2 — Improved reconstruction of single-cell developmental potential with CytoTRACE 2

  • 作者: Minji Kang, Gunsagar S. Gulati, Erin L. Brown, Zhen Qi, Susanna Avagyan, Jose Juan Almagro Armenteros et al.
  • 期刊/来源: Nature Methods
  • 机构: California Institute for Regenerative Medicine · Stanford University · Dana-Farber Cancer Institute · Oslo University Hospital · University of Oslo · Mayo Clinic · Mayo Clinic in Arizona · Institute for Stem Cell Biology and Regenerative Medicine 等
  • 分类: vol 22 · issue 11 · pp 2258-2263
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出 CytoTRACE 2,一个基于可解释深度学习的框架,用于从单细胞 RNA 测序数据预测细胞的绝对发育潜能(developmental potential)。该框架通过整合基因表达特征和细胞状态信息,输出一个连续的潜能分数,从而重建细胞分化层级。在多种平台和组织类型的数据集上,CytoTRACE 2 在预测发育层级方面优于先前的方法(如原始 CytoTRACE)。方法核心是使用一个可解释的神经网络模型,该模型能够识别与细胞多能性相关的关键基因模块,并输出具有生物学可解释性的预测。实验结果表明,该方法能够精细地映射单细胞分化轨迹,并扩展了对细胞潜能的理解。对您而言,这是一篇 Nature Methods 上的方法学论文,作为 gateway reading 可以了解单细胞数据分析中的关键统计问题(如潜变量建模、预测评分构建),但方法本身(深度学习框架)与您的核心统计兴趣(因果推断、高维理论)无直接技术重叠。
  • 关键技术: interpretable deep learning, single-cell RNA sequencing, developmental potential prediction, gene module identification
  • 为什么对您有用: 本文属于 general science(Nature Methods)范畴,作为 gateway reading 适合了解单细胞领域的数据分析挑战。武器库中的非参数统计和软件工程经验可帮助理解其预测框架的构建,但核心方法(深度学习)不在您的技术核心中,且无直接可迁移的统计理论问题。暂不可做:缺乏与因果推断或高维统计的直接连接,且深度学习可解释性工具不在您的武器库中。

8. 10.1038/s41592-025-02854-5 — scooby: modeling multimodal genomic profiles from DNA sequence at single-cell resolution

  • 作者: Johannes C. Hingerl, Laura D. Martens, Alexander Karollus, Trevor Manz, Jason D. Buenrostro, Fabian J. Theis et al.
  • 期刊/来源: Nature Methods
  • 机构: Munich Center for Machine Learning · Technical University of Munich · Helmholtz Zentrum München · Harvard University · Broad Institute
  • 分类: vol 22 · issue 11 · pp 2275-2285
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出 scooby 框架,用于从 DNA 序列以单细胞分辨率建模多模态基因组图谱(RNA-seq 覆盖度和 ATAC-seq 插入片段)。核心思路是将预训练的 bulk 多组学预测模型 Borzoi 作为主干,并附加一个细胞特异性解码器,从而将 bulk 水平的序列-表达关系适配到单细胞异质性场景。方法上,scooby 不依赖从头训练大规模模型,而是通过微调解码器参数实现细胞层面的预测,显著降低了计算成本。实验表明,scooby 能准确回放留出基因的细胞特异性表达水平,并识别调控因子及其推定靶基因。此外,该方法可解析 bulk eQTL 在单细胞层面的效应,区分其对染色质可及性和基因表达的影响。本文属于 Nature Methods 上的方法学贡献,数据结构和建模问题清晰,但统计方法论本身(预训练+微调)较为常规,无新理论或推断框架。对您而言,这是一篇不错的跨领域入门读物,展示了单细胞多组学数据与序列模型的结合方式,但武器库中无直接可攻的方法学口子。
  • 关键技术: pretrained deep learning model, single-cell multimodal profiling, cell-specific decoder, transfer learning for genomics, eQTL resolution at single-cell level
  • 为什么对您有用: 本文属于 general science / Nature Methods 的 gateway reading。作为统计学家,本文清晰展示了单细胞多组学数据(RNA + ATAC)的结构和建模挑战,适合作为进入该领域的入门读物。武器库中 very_familiar 的软件开发和 high-dimensional asymptotics 无法直接迁移到本文的深度学习预训练框架,但 moderately_familiar 的 M-estimation 理论可用于分析微调阶段的收敛性——不过本文未涉及此类理论分析。总体而言,本文值得花时间读全文以了解单细胞数据结构和建模范式,但暂不可做 follow-up 工作,因为核心机器(大规模预训练模型、基因组序列编码)不在武器库中。

9. 10.1038/s41592-025-02886-x — CELLECT: contrastive embedding learning for large-scale efficient cell tracking

  • 作者: Hongyu Zhou, Seonghoon Kim, Zhifeng Zhao, Jiaqi Fan, Wen Huang, Xinghua Sui et al.
  • 期刊/来源: Nature Methods
  • 机构: Chinese Institute for Brain Research · Tsinghua University · Sun Yat-sen University · Anhui University · Peking University · McGovern Institute for Brain Research
  • 分类: vol 22 · issue 11 · pp 2411-2422
  • 相关性 5/10 · novelty: application
  • 摘要: 本文提出 CELLECT,一种基于对比嵌入学习的大规模高效细胞追踪方法。在 Cell Tracking Challenge 的秀丽隐杆线虫数据集上验证,仅需在单一公共数据集上预训练即可跨成像模态和物种泛化。核心机制是通过对比学习学习多样化细胞结构的潜在嵌入表示,从而在追踪时无需逐帧重训练。结合双光子成像,CELLECT 实现了小鼠淋巴结生发中心形成过程中大规模 B 细胞(含频繁分裂)的实时 3D 追踪、小鼠脾脏中细胞-细菌相互作用的定量识别,以及强非刚性运动下神经信号的高保真提取。本文属于 Nature Methods 上的方法学贡献,数据维度(大规模 3D 时序成像)和追踪效率是亮点。对您而言,这是一篇不错的跨领域入门读物,展示了计算机视觉方法在生物成像数据分析中的实际应用,但统计方法学新颖性有限。
  • 关键技术: contrastive learning, embedding learning, cell tracking, two-photon imaging, transfer learning
  • 为什么对您有用: 本文属于 general science 范畴的 gateway reading。作为 Nature Methods 上的方法学文章,它清晰阐述了大规模 3D 时序成像数据的结构(噪声、尺度、缺失)和模型(对比嵌入学习),对统计学家友好。您的武器库(非参数统计、高维渐近)虽不能直接攻其方法,但可作为了解生物成像数据分析问题的入门材料,值得花时间读全文以拓宽视野。

10. 10.1038/s41592-025-02861-6 — nELISA: a high-throughput, high-plex platform enables quantitative profiling of the inflammatory secretome

  • 作者: Milad Dagher, Grant Ongo, Nathaniel Robichaud, Jinglin Kong, Woojong Rho, Ivan Teahulos et al.
  • 期刊/来源: Nature Methods
  • 机构: Genome Canada · Applied Bio-nomics (Canada) · McGill University · Broad Institute · McGill Genome Centre
  • 分类: vol 22 · issue 11 · pp 2375-2385
  • 相关性 4/10 · novelty: application
  • 摘要: 本文介绍 nELISA,一种高通量、高多重、高保真的蛋白质定量平台。核心技术是:用 DNA 寡核苷酸将抗体对预组装到光谱编码微珠上,通过置换介导检测实现空间分离,从而消除非同源抗体间的试剂驱动交叉反应。该平台可同时测量蛋白质浓度及其翻译后修饰,炎症面板含 191 个靶标,灵敏度低至 0.1 pg/mL,动态范围跨越 7 个数量级。作者用 nELISA 对 PBMC 进行大规模炎症分泌组扰动筛选,一周内测量 7,392 个样本,生成约 140 万蛋白质数据点,发现了 447 个显著的细胞因子响应。该平台在通量上显著超越现有高多重免疫分析,适用于药物发现中的表型筛选。作为 Nature Methods 的技术方法论文,本文对统计学家而言是了解现代高通量蛋白质组学数据生成流程的入门读物,但方法学 novelty 在于实验工程而非统计推断。
  • 关键技术: DNA-oligo antibody pre-assembly, displacement-mediated detection, spectrally encoded microparticles, flow cytometry readout, high-plex immunoassay
  • 为什么对您有用: 本文属于 general science 范畴的 gateway reading。作为 Nature Methods 的技术方法论文,(a) 对统计学家友好——实验原理和流程描述清晰,不依赖深奥的领域术语;(b) 阐明了高通量蛋白质组学数据生成的核心挑战(交叉反应、通量瓶颈、动态范围),这是统计学家理解后续数据分析(如多重比较、归一化、差异表达)的基础;(c) 数据维度(191 靶标 × 7392 样本)和噪声结构(流式细胞术的计数噪声、批次效应)是值得统计学家关注的真实问题。武器库中的非参数统计和软件工程经验足以支撑理解该平台的数据结构,但本文不涉及新统计方法,属于值得花时间读全文的入门级读物。

11. 10.1038/s41592-025-02881-2 — Annotating the genome at single-nucleotide resolution with DNA foundation models

  • 作者: Bernardo P. de Almeida, Hugo Dalla-Torre, Guillaume Richard, Christopher Blum, Lorenz Hexemer, Maxence Gélard et al.
  • 期刊/来源: Nature Methods
  • 机构: BioNTech (Germany) · University of Copenhagen · Institute on Taxation and Economic Policy
  • 分类: vol 22 · issue 11 · pp 2301-2315
  • 相关性 4/10 · novelty: application
  • 摘要: 本文提出一种基于DNA基础模型(Nucleotide Transformer)的基因组注释方法SegmentNT,将基因组注释问题建模为实例分割任务,实现单核苷酸分辨率的基因和调控元件识别。该方法利用自监督预训练的DNA基础模型,通过微调实现对14种不同基因和调控元件的分割,可处理长达50kb的DNA序列。SegmentNT在基因注释、剪接位点和调控元件检测上达到当前最优性能,并支持将序列上下文扩展至500kb(通过Enformer和Borzoi模型)。模型在人类基因组上训练后能泛化到其他物种,多物种版本在未见物种上表现良好。本文属于应用导向的方法学工作,核心贡献在于将预训练基础模型迁移到基因组注释任务,而非提出新的统计理论或方法。对您而言,本文作为Nature Methods上的通用科学阅读,展示了大规模预训练模型在生物序列分析中的前沿应用,但方法论上不涉及因果推断、高维统计或半参效率理论等您的主要兴趣方向。
  • 关键技术: DNA foundation models, instance segmentation, Nucleotide Transformer, transfer learning, genome annotation
  • 为什么对您有用: 本文属于general science(Nature Methods)的gateway reading。作为数据科学统计学家,本文展示了预训练模型在生物序列分析中的典型应用范式,但方法论上不涉及您的主要兴趣方向(因果推断、高维统计、半参效率等)。武器库中的工具(非参数统计、高维渐近)与此文无直接接口。本文适合作为拓宽视野的入门读物,但无需深入阅读全文。

12. 10.1038/s41592-025-02868-z — gReLU: a comprehensive framework for DNA sequence modeling and design

  • 作者: Avantika Lal, Laura Gunsalus, Surag Nair, Tommaso Biancalani, Gokcen Eraslan
  • 期刊/来源: Nature Methods
  • 机构: Gene Therapy Laboratory
  • 分类: vol 22 · issue 11 · pp 2253-2257
  • 相关性 4/10 · novelty: application
  • 摘要: 本文介绍 gReLU,一个用于 DNA 序列建模与设计的综合软件框架。该框架整合了数据预处理、模型训练、超参数调优、评估、解释、变异效应预测以及新型调控元件设计等完整流程。gReLU 附带一个模型动物园,包含多个预训练的最先进模型,用户可直接下载、应用或微调。该框架旨在降低深度学习在 DNA 序列分析中的使用门槛,并促进不同研究组之间模型与软件的可互操作性。文章展示了 gReLU 在预测组织与细胞类型特异性序列活性、推导顺式调控规则等任务上的实用性。作为 Nature Methods 上的方法学工具,本文对统计计算和软件工程有参考价值,但核心贡献在于生物信息学工具而非统计方法创新。对于您而言,这是一篇 gateway reading,展示了深度学习在基因组学中的典型应用流程,但方法学新颖性有限。
  • 关键技术: deep learning for DNA sequences, model zoo, fine-tuning, variant effect prediction, synthetic regulatory element design
  • 为什么对您有用: 本文属于 general science / Nature Methods 的 gateway reading。作为统计计算方向的 outsider,本文提供了一个清晰的深度学习在基因组学中的应用案例,数据侧(DNA 序列、变异效应)和模型侧(预训练模型、微调)的 exposition 对非生物信息学背景的统计学家较为友好。武器库中的 'software development' 可直接用于理解其框架设计,但核心机器(基因组学深度学习)不在武器库内,属于暂不可做范畴。值得花时间读全文以拓宽视野,但无需深入跟进。

13. 10.1038/s41592-025-02860-7 — A portable poison exon for small-molecule control of mammalian gene expression

  • 作者: Qian Hou, Maxim Oleynikov, Xiaohan Mei, Linghao Dong, Timo Hagen, Samie R. Jaffrey
  • 期刊/来源: Nature Methods
  • 机构: Cornell University · Tri-Institutional PhD Program in Chemical Biology
  • 分类: vol 22 · issue 11 · pp 2337-2348
  • 相关性 1/10 · novelty: application
  • 摘要: 本文介绍 Cyclone(acyclovir-controlled poison exon),一种基于阿昔洛韦调控的毒外显子(poison exon)表达控制盒。Cyclone 是一个可插入几乎任何基因的“内含子-毒外显子-内含子”元件,在阿昔洛韦处理下该元件被完全剪接移除,恢复天然转录本。该系统实现约 295 倍激活倍数、可逆调控、极低背景表达,且无需改变基因序列或内源调控元件。Pac-Cyclone 版本进一步简化了内源基因调控细胞系的构建。作者还展示了 Cyclone 的可编程性,可用于构建多种配体控制的遗传回路。本文是分子生物学工具开发,不涉及统计方法或数据分析。作为 Nature Methods 论文,它提供了清晰的生物学问题和实验设计,适合作为基因调控技术的入门阅读。
  • 关键技术: poison exon, small-molecule control, alternative splicing, acyclovir, genetic circuits
  • 为什么对您有用: 本文属于 general science 范畴(Nature Methods),作为 gateway reading 对统计学家有价值:(a) 文章对分子生物学背景的读者友好,不依赖深奥领域术语;(b) 清晰阐述了基因调控工具开发的大问题;(c) 数据维度主要是分子生物学实验,无复杂统计推断问题。武器库中无直接可攻工具,暂不可做——核心机器是分子生物学实验技术,非统计方法。适合作为跨学科广度阅读,但不值得深入方法学分析。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论