跳转至

NMI — Vol 8 Issue 1 · 2026-08-01

  • 共 7 篇 · Nature Machine Intelligence
  • 目录核对 ⚠️ 疑似漏 7 篇(对照 OpenAlex 15 篇):10.1038/s42256-025-01162-z、10.1038/s42256-025-01161-0、10.1038/s42256-025-01163-y、10.1038/s42256-025-01167-8、10.1038/s42256-025-01175-8 等

本期导览

自动生成:归纳本期主要主题与脉络,不打分、不排名

这一期共7篇论文,主题分布较散,大致可归为三条主线:深度学习在生物医学与化学中的应用(药物响应预测、单细胞模型微调、蛋白质-配体对接)、生成模型与信号处理(心血管信号生成、几何定理发现)、以及统计计算与算法优化(量子电路T门计数优化)。此外,还有一篇关于大语言模型在实验室安全中的评估,属于应用基准测试。

最突出的主线是深度学习在生物医学与化学中的应用,覆盖三篇。XPert(Modelling drug-induced cellular perturbation responses)用生物学先验引导的双分支Transformer预测药物诱导的细胞转录扰动,通过分离扰动前/后状态并建模基因网络,在冷细胞泛化任务上显著提升Pearson相关系数,并支持多剂量-多时间点预测与患者特异性响应迁移。scPEFT(Harnessing the power of single-cell large language models)聚焦单细胞大语言模型的参数高效微调,仅更新少量适配器参数即可适配特定任务,减少超96%参数量并缓解灾难性遗忘,在疾病特异性与跨物种任务上优于全参数微调。Assessing the potential of deep learning for protein–ligand docking则系统评估了深度学习在蛋白质-配体对接中的表现,引入PoseBench基准测试,发现共折叠方法整体优于传统方法,但AlphaFold 3等在处理新构象时仍有挑战,且部分方法对输入MSA敏感。

第二条主线是生成模型与信号处理,包含两篇。UniCardio(Versatile cardiovascular signal generation)用扩散Transformer统一处理多模态心血管信号的降噪、插补与跨模态翻译,通过持续学习适应变化的模态组合,在信号恢复和翻译任务上优于近期基线,生成的信号在异常检测中与真实信号性能相当。TongGeometry(Proposing and solving olympiad geometry)则用引导树搜索的神经符号系统发现和证明奥林匹克几何定理,建立了包含67亿个定理的库,其中41亿个具有几何对称性,已有三个定理被选入地区竞赛,在IMO-AG-30上超越人类顶尖选手平均水平。

第三条主线是统计计算与算法优化,仅一篇。Reusability report: Optimizing T count in general quantum circuits将量子电路T门计数优化转化为张量分解任务,通过强化学习训练通用智能体(5-8量子比特),无需为每类电路重新训练即可削减T门数,性能优于现有方法,展示了张量分解在非传统优化问题中的潜力。

与因果推断方向最贴近的是XPert(药物响应预测中的扰动效应分离)和scPEFT(单细胞模型中的条件特异性解释);与半参数/非参方向无直接关联;与高维/随机矩阵方向无直接关联;与假设检验方向无直接关联;与计算方法方向最贴近的是TongGeometry(树搜索与神经符号系统)和UniCardio(扩散Transformer)。

统计计算 / 算法 (stat_computing, 1 篇)

1. 10.1038/s42256-025-01166-9 · arXiv — Reusability report: Optimizing T count in general quantum circuits with AlphaTensor-Quantum

  • 作者: Remmy Zen, Maximilian Nägele, Florian Marquardt
  • 期刊/来源: Nature Machine Intelligence
  • 分类: vol 8 · issue 1 · pp 113-117
  • 相关性 3/10 · novelty: application
  • 摘要: 本文报告了 AlphaTensor-Quantum 方法的可复现性验证与扩展。原方法将量子电路 T 门计数优化问题转化为张量分解任务,通过强化学习训练专用智能体,但需为每类电路重新训练。本工作训练了一个通用智能体(5-8 量子比特电路),无需针对新电路重新训练即可实现 T 门数削减,且性能优于现有方法。实验表明,变量子比特数训练的通用智能体优于固定量子比特数训练的专用智能体。该方法的核心是张量分解与强化学习的结合,属于统计计算与算法优化交叉方向。对您而言,本文是统计计算领域的一个有趣应用案例,展示了张量分解在非传统优化问题中的潜力,但方法学 novelty 有限,主要是工程扩展。
  • 关键技术: tensor decomposition, reinforcement learning, quantum circuit optimization, T-count reduction, AlphaTensor
  • 为什么对您有用: 本文属于统计计算(stat_computing)的 gateway reading,展示了张量分解在量子电路优化中的应用。您的武器库中 'software development' 和 'computation of higher-order U-statistics (treewidth / tensor contraction / einsum)' 与本文的张量分解核心直接相关,但本文是 RL 驱动的优化而非统计推断,属于 '暂不可做' 方向——核心机器(强化学习、量子计算)不在武器库中。作为入门读物,本文 exposition 清晰,适合了解张量分解在非统计领域的应用,但无需深入阅读全文。

其他 (other, 6 篇)

1. 10.1038/s42256-025-01165-w — Modelling drug-induced cellular perturbation responses with a biologically informed dual-branch transformer

  • 作者: Yue Guo, Hao Zhang, Haitao Hu, Jialu Wu, Ji Cao, Chang-Yu Hsieh et al.
  • 期刊/来源: Nature Machine Intelligence
  • 机构: Zhejiang University · Ministry of Education of the People's Republic of China · Zhejiang Lab · Hangzhou City University
  • 分类: vol 8 · issue 1 · pp 96-112
  • 相关性 3/10 · novelty: application
  • 摘要: 本文提出 XPert,一个生物学先验引导的双分支 Transformer 模型,用于预测药物诱导的细胞转录扰动响应。模型将扰动前与扰动后的细胞状态分别编码,从而分离内在转录模式与药物触发的调控变化。通过上下文感知的基因网络建模,XPert 克服了基于变分自编码器方法的过度去噪问题,在冷细胞泛化任务中 Pearson 相关系数提升 36.7%,均方误差降低 78.2%。模型支持多剂量-多时间点预测,可解析药效动力学轨迹并揭示药物作用的关键分子事件。通过从大规模临床前筛选到临床场景的知识迁移,XPert 在患者特异性响应预测上提升达 15.04%。本文属于 Nature Machine Intelligence 上的方法学贡献,作为跨学科入门读物,清晰阐述了数据结构和建模挑战,但方法本身与您的核心统计兴趣(因果推断、高维统计、U-统计量等)无直接技术关联。
  • 关键技术: dual-branch transformer, context-aware gene network modeling, knowledge transfer, transcriptional response prediction, pharmacodynamic trajectory modeling
  • 为什么对您有用: 本文属于 Nature Machine Intelligence 上的通用科学入门读物,对您作为统计学家而言:(1) 清晰阐述了药物扰动转录组数据的结构(基因表达矩阵、剂量-时间维度、细胞异质性)和建模挑战(去噪与信号分离的权衡),适合作为进入计算生物学方向的入门材料;(2) 武器库中的非参数统计和软件工程经验可帮助理解其模型架构,但核心机器(Transformer 注意力机制、基因网络先验嵌入)不在您的技术武器库中,属于暂不可做方向;(3) 值得花时间读全文以拓宽跨学科视野,但无需深入方法学细节。

2. 10.1038/s42256-025-01147-y · arXiv — Versatile cardiovascular signal generation with a unified diffusion transformer

  • 作者: Zehua Chen, Yuyang Miao, Liyuan Wang, Luyun Fan, Danilo P. Mandic, Jun Zhu
  • 期刊/来源: Nature Machine Intelligence
  • 分类: vol 8 · issue 1 · pp 6-19
  • 相关性 3/10 · novelty: application
  • 摘要: 本文提出 UniCardio,一个基于扩散 Transformer 的统一生成框架,用于处理多模态心血管信号(PPG、ECG、血压等)的降噪、插补和跨模态翻译。核心创新包括专门设计的模型架构以管理多种信号模态,以及持续学习范式以应对变化的模态组合。在信号恢复和翻译任务上,UniCardio 显著优于近期任务特定基线。生成的信号在异常健康状态检测和生命体征估计中达到与真实信号相当的性能,且在未见过的领域保持鲁棒性。该方法为 AI 辅助医疗提供了实用且鲁棒的框架。对您而言,这是一篇 Nature Machine Intelligence 上的方法学论文,属于 general science 的 gateway reading,展示了生成式 AI 在生物医学信号处理中的前沿应用。
  • 关键技术: diffusion transformer, multimodal signal generation, continual learning, signal denoising, cross-modal translation
  • 为什么对您有用: 本文属于 general science 范畴的 gateway reading,适合作为了解生成式 AI 在生物医学信号处理中应用的入门读物。文章清晰阐述了数据模态、噪声结构和生成任务,统计学家能从中看到信号恢复与插补的统计建模问题。武器库中的非参数统计和逆问题知识可帮助理解其生成机制,但核心机器(扩散模型、Transformer)不在当前武器库中,属于暂不可做方向。
  • 作者: Chi Zhang, Jiajun Song, Siyu Li, Yitao Liang, Yuxi Ma, Wei Wang et al.
  • 期刊/来源: Nature Machine Intelligence
  • 分类: vol 8 · issue 1 · pp 84-95
  • 相关性 2/10 · novelty: application
  • 摘要: 本文提出 TongGeometry,一个基于引导树搜索的神经符号系统,能够同时发现和证明奥林匹克级别的几何定理。系统在相同计算预算下建立了包含 67 亿个需要辅助构造的几何定理库,其中 41 亿个具有几何对称性。已有三个由 TongGeometry 发现的定理被选入地区数学奥林匹克竞赛,包括中国国家集训队选拔考试和美国顶级民间奥林匹克竞赛。在 IMO-AG-30 基准测试中,TongGeometry 解决了所有国际数学奥林匹克几何问题,在该数据集上超越了人类顶尖选手的平均水平。系统仅需消费级计算资源,并在更广泛的奥林匹克级别问题上超越了现有最优方法。本文展示了 AI 系统在数学发现与求解方面的双重能力,对 AI 辅助数学研究和教育具有启示意义。作为一篇 Nature Machine Intelligence 上的多学科旗舰论文,本文为统计学家提供了了解 AI 在符号推理与组合搜索领域前沿进展的入门读物。
  • 关键技术: guided tree search, neuro-symbolic system, large language model fine-tuning, auxiliary construction, geometric symmetry discovery
  • 为什么对您有用: 本文属于 general science 多学科旗舰期刊的 gateway reading。作为统计学家,本文展示了 AI 在符号推理与组合搜索领域的前沿进展,其引导树搜索与神经符号方法对理解统计计算中的搜索与优化问题有启发意义。武器库中的软件开发和逆问题经验可帮助理解系统的计算架构,但核心的符号推理与 LLM 微调技术不在当前武器库中,属于暂不可做的方向。本文适合作为拓宽视野的入门读物,值得花时间阅读全文了解 AI 辅助数学推理的最新进展。

4. 10.1038/s42256-025-01170-z — Harnessing the power of single-cell large language models with parameter-efficient fine-tuning using scPEFT

  • 作者: Fei He, Ruixin Fei, Jordan E. Krull, Yang Yu, Xinyu Zhang, Xianyu Wang et al.
  • 期刊/来源: Nature Machine Intelligence
  • 机构: University of Missouri · The Ohio State University Comprehensive Cancer Center – Arthur G. James Cancer Hospital and Richard J. Solove Research Institute · The Ohio State University
  • 分类: vol 8 · issue 1 · pp 118-133
  • 相关性 2/10 · novelty: application
  • 摘要: 本文提出 scPEFT,一个针对单细胞大语言模型(scLLM)的参数高效微调框架。核心思路是在冻结预训练骨干模型参数的前提下,仅更新少量可学习的低维适配器(adapter)参数,从而利用有限的自定义数据将 scLLM 适配到特定任务。该方法将需调参量减少超过 96%,GPU 内存占用降低一半以上,有效缓解了灾难性遗忘问题,显著降低了资源门槛。在疾病特异性、跨物种和低表征细胞群体等任务上,scPEFT 全面优于零样本预测和传统全参数微调。通过注意力机制分析,scPEFT 识别出与特定细胞状态相关的 COVID 相关基因,并发现了独特的血细胞亚群,展示了条件特异性解释能力。本文属于 Nature Machine Intelligence 上的方法学贡献,但核心是深度学习/生物信息学应用,与您的主要统计兴趣(因果推断、高维、U-统计量等)无直接方法学关联。作为跨学科科普阅读,本文清晰阐述了单细胞数据分析的挑战和微调策略的实用性,适合作为了解计算生物学前沿的入门材料。
  • 关键技术: parameter-efficient fine-tuning, adapter modules, single-cell large language models, attention mechanism analysis
  • 为什么对您有用: 本文属于 general science 范畴的 gateway reading。作为 Nature Machine Intelligence 上的方法学文章,它清晰阐述了单细胞数据建模的挑战(数据规模大、任务特异性强、资源受限)和参数高效微调的策略,对想了解计算生物学前沿的统计学家是好的入门读物。您的武器库(非参数统计、高维渐近)虽不能直接攻这篇论文的方法,但 scLLM 中的注意力机制与高维协方差结构有潜在联系,可作为中期兴趣拓展的入口。暂不可做:核心机器(大规模 Transformer 微调、单细胞数据预处理流程)不在武器库中。

5. 10.1038/s42256-025-01160-1 · arXiv — Assessing the potential of deep learning for protein–ligand docking

  • 作者: Alex Morehead, Nabin Giri, Jian Liu, Pawan Neupane, Jianlin Cheng
  • 期刊/来源: Nature Machine Intelligence
  • 分类: vol 8 · issue 1 · pp 32-41
  • 相关性 2/10 · novelty: application
  • 摘要: 本文系统评估了深度学习在蛋白质-配体对接任务中的实际表现。研究引入PoseBench基准测试,涵盖三个现实场景:使用预测的apo蛋白结构进行对接、同时结合多个辅因子配体、以及无先验结合口袋信息。基准包含主配体和多配体数据集,后者为首次引入深度学习社区。实验发现:深度学习共折叠方法整体优于传统对接和深度学习基线算法,但AlphaFold 3等流行方法在处理新蛋白质-配体结合构象时仍面临挑战;某些共折叠方法对输入的多序列比对高度敏感,而其他方法则不然;深度学习方法在预测新或多配体蛋白靶标时难以平衡结构准确性和化学特异性。本文是Nature Machine Intelligence上的方法评估工作,对您作为统计学家而言,可作为了解计算生物学中结构预测与对接问题的入门读物,但方法论上无直接可迁移的统计技术。
  • 关键技术: protein-ligand docking, deep learning cofolding, AlphaFold 3, benchmark dataset, apo-to-holo prediction
  • 为什么对您有用: 本文属于general science(Nature Machine Intelligence)范畴,作为gateway reading: (a) 对计算生物学外行的统计学家而言,文章清晰解释了蛋白质-配体对接的问题设定和评估框架,不依赖深度领域术语,可读性好; (b) 阐明了更大的科学问题——药物发现和酶设计中结构预测的实际瓶颈; (c) 数据层面(预测结构vs实验结构、多配体场景)和模型层面(深度学习共折叠方法)有明确的建模维度,统计学家能理解其不确定性来源; (d) 科学兴趣广泛,值得花时间阅读全文以拓宽视野。武器库方面:本文不涉及研究者擅长的统计理论或计算工具,属于暂不可做范畴——核心机器(蛋白质结构预测的深度学习架构和生物物理建模)不在武器库中。

6. 10.1038/s42256-025-01152-1 — Benchmarking large language models on safety risks in scientific laboratories

  • 作者: Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh et al.
  • 期刊/来源: Nature Machine Intelligence
  • 机构: University of Notre Dame · IBM (United States)
  • 分类: vol 8 · issue 1 · pp 20-31
  • 相关性 1/10 · novelty: application
  • 摘要: 本文关注大语言模型(LLM)和视觉语言模型(VLM)在科学实验室安全风险中的可靠性问题。作者构建了 LabSafety Bench 基准测试,包含 765 道多选题和 404 个真实实验室场景(共 3128 个开放任务),评估模型在危险识别、风险评估和后果预测三个维度的表现。对 19 个先进模型的评测显示,所有模型在危险识别任务上的准确率均未超过 70%;闭源模型在结构化评估中表现较好,但在开放推理任务中并无明显优势。研究指出,当前模型远未达到实验室安全操作所需的可靠性,亟需专门的安全评估框架。本文属于应用评估类工作,方法学 novelty 有限,但对您作为统计学家而言,可作为了解 AI 在安全关键场景中应用现状的入门读物。
  • 关键技术: benchmark design, multiple-choice evaluation, open-ended reasoning, hazard identification, risk assessment
  • 为什么对您有用: 本文属于 Nature Machine Intelligence 上的通用科学论文,作为 gateway reading 值得关注:(1) 文章对实验室安全场景的建模(危险识别、风险评估、后果预测)有清晰的数据结构描述(多选题 + 开放任务),适合作为统计学家进入 AI 安全评估领域的入门读物;(2) 您的武器库中非参数统计和软件工程经验可用于设计更严谨的评估指标(如校准曲线、不确定性量化),但本文本身不涉及您熟悉的统计方法;(3) 值得花时间读全文以了解当前 LLM 在安全关键任务中的能力边界,但无需深入技术细节。

Maintained by 陈星宇 · Homepage · Source on GitHub

评论