NMI — Vol 8 Issue 5 · 2026-08-01¶
- 共 10 篇 · Nature Machine Intelligence
- 目录核对 ⚠️ 疑似漏 8 篇(对照 OpenAlex 19 篇):10.1038/s42256-026-01223-x、10.1038/s42256-026-01224-w、10.1038/s42256-026-01225-9、10.1038/s42256-026-01236-6、10.1038/s42256-026-01241-9 等
本期导览¶
自动生成:归纳本期主要主题与脉络,不打分、不排名。
这一期《Nature Machine Intelligence》第8卷第5期的10篇论文,整体上呈现出两条清晰的主线:一是生成式与基础模型在分子与蛋白质领域的应用,二是机器学习在物理模拟与材料科学中的新范式。此外,还有一篇关于AI视觉的认知启发研究,以及一篇软体机器人工程实现。具体来看,分子与蛋白质方向占据了半数篇幅,包括蛋白质语言模型的可解释性综述(Towards the explainability of protein language models)、免疫肿瘤药物靶点发现系统MIDAS(Immunotherapy drug target identification...)、肽抗生素优化方法ApexGO(A generative artificial intelligence approach...)、合成分子生成模型CoCoGraph(A collaborative constrained graph diffusion model...),以及天然产物预训练基础模型NaFM(Pretraining a foundation model...)。物理模拟与材料科学方向则包括自由边界问题神经算子FBNO(Deep neural operator for free boundary problems)、机器学习原子间势的柏拉图表示(Platonic representation of foundation machine learning interatomic potentials),以及无力的分子动力学模拟框架TrajCast(Force-free molecular dynamics through autoregressive equivariant networks)。其余两篇分别涉及章鱼启发软体机械臂(Peripheral control enabled by distributed sensing...)和人类发育视觉训练(Adopting a human developmental visual diet...)。
在分子与蛋白质生成模型这条主线上,本期集中展示了多种生成式AI策略:ApexGO将Transformer变分自编码器与贝叶斯优化结合,在潜空间中对肽序列进行高效编辑以提升抗菌活性,实验验证了高命中率;CoCoGraph则通过内置化合价约束和协作图信息融合,在保证化学有效性的前提下生成合成分子,参数效率显著优于现有模型。这两篇都强调生成结果的可实验验证性,但切入角度不同——前者聚焦优化现有分子,后者关注从头生成。NaFM则转向预训练基础模型,通过对比学习和掩码图学习捕获天然产物的骨架进化信息,在分类学和虚拟筛选任务中取得领先。相比之下,MIDAS是多模态图神经网络在靶点发现中的系统集成,其统计创新有限但工程贡献明确。蛋白质语言模型综述为该领域提供了系统性的可解释性框架,将XAI角色分为五类,并指出当前仅评估者角色被广泛采用,这为后续方法设计提供了分类学基础。
在物理模拟与材料科学方向,本期有三篇方法学论文。FBNO利用拓扑共轭性同时学习流映射和同胚映射,解决了自由边界PDE在未知域上的求解问题,理论上有逼近定理保证,数值实验涵盖相变和多物理系统。TrajCast将分子动力学模拟重构为自回归序列预测任务,用等变图网络直接更新位置和速度,摆脱了传统数值积分的时间步长限制,在多种系统上实现30倍步长加速。柏拉图表示研究则跨模型比较了七种原子间势的潜在表示,发现它们收敛于共享统计空间,并利用表示偏差作为无标签异常检测指标。这三篇的共同点是利用神经网络的结构先验(等变性、拓扑共轭、共享表示)来突破传统数值方法的瓶颈,但各自针对的问题域(自由边界、分子动力学、材料表示)差异较大。
对于因果推断与统计方向的研究者,本期直接相关的论文较少,但以下两篇值得关注:蛋白质语言模型综述中关于可解释性角色的分类框架(评估者、多任务者等)可迁移至其他模型的可解释性研究;柏拉图表示中利用潜在空间偏差作为无标签异常度量的思路,与统计中的异常检测和模型诊断有潜在联系。若对生成模型与贝叶斯优化感兴趣,ApexGO中贝叶斯优化与潜空间结合的框架可作为应用案例参考。其余论文多为应用导向或工程实现,统计方法论创新有限。
其他 (other, 10 篇)¶
1. 10.1038/s42256-026-01232-w · arXiv — Towards the explainability of protein language models¶
- 作者: Andrea Hunklinger, Noelia Ferruz
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 649-662
- 相关性 5/10 · novelty:
survey - 摘要: 本文是一篇关于蛋白质语言模型(pLM)可解释性(XAI)的综述。作者将蛋白质AI建模的工作流划分为四个信息上下文:训练序列、输入提示、模型架构和输入-输出对,并针对每个上下文梳理了现有的XAI方法与应用。从已发表研究中提炼出XAI在蛋白质研究中可能扮演的五种角色:评估者、多任务者、工程师、教练和教师,但目前仅评估者角色被广泛采用。文章指出,这些分类和角色不仅适用于pLM,也可推广到其他模型架构。最后讨论了未来关键应用领域,包括安全性、可信度和偏差等风险,并呼吁建立社区基准、开源工具、领域特定可视化及湿实验验证以推动蛋白质AI的可解释性。作为一篇Nature Machine Intelligence上的综述,本文对统计学家而言是了解蛋白质AI领域可解释性现状的入门读物,但方法学上无新贡献。
- 关键技术:
explainable AI (XAI),protein language models (pLMs),attention visualization,probing classifiers,feature attribution methods - 为什么对您有用: 本文属于general science(Nature Machine Intelligence)的gateway reading。作为一篇综述,它清晰介绍了蛋白质语言模型的可解释性现状,对统计学家友好,不假设领域知识。但本文不涉及研究者核心兴趣中的因果推断、高维统计或计算复杂性理论,且无新方法学贡献,因此仅适合作为拓宽科学视野的入门读物,不值得投入全文时间。
2. 10.1038/s42256-026-01233-9 — Deep neural operator for free boundary problems¶
- 作者: Zongjia Long, Qi Zhou, Aiqing Zhu, Dong Dai, Yiqun Liu
- 期刊/来源: Nature Machine Intelligence
- 机构: South China University of Technology · National University of Singapore · Sun Yat-sen University
- 分类: vol 8 · issue 5 · pp 806-817
- 相关性 4/10 · novelty:
new_method - 摘要: 本文提出自由边界神经算子(FBNO),用于求解定义在未知域上的自由边界偏微分方程问题。传统数值方法受限于固定网格,而现有神经算子也仅能处理预定义域。FBNO 利用动力系统之间的拓扑共轭性,同时学习共轭系统的流映射和连接原问题的同胚映射,从而无需先验几何信息即可在演化域上进行预测。作者给出了逼近定理保证方法的理论可行性。数值实验涵盖相变、非凸几何和多物理系统,展示了精度和速度的提升。对您而言,这是一篇 Nature Machine Intelligence 上的方法学论文,作为跨学科科普阅读可了解神经算子前沿,但核心工具(拓扑共轭、PDE 求解)与您的武器库交集有限,暂不可做。
- 关键技术:
neural operator,topological conjugacy,free boundary problem,partial differential equations,flow map approximation - 为什么对您有用: 本文属于 general science 范畴(Nature Machine Intelligence),作为 gateway reading 可了解神经算子方法在 PDE 求解中的最新进展。但核心机制(拓扑共轭、PDE 理论)与您的技术武器库(非参数统计、U-统计量、因果推断)无直接交集,且缺乏可迁移的统计推断或计算复杂性视角。暂不可做——缺 PDE 求解和动力系统背景。
3. 10.1038/s42256-026-01201-3 — Immunotherapy drug target identification using machine learning and patient-derived tumour explant validation¶
- 作者: Marcellus Augustine, Nuno Rocha Nene, Hongchang Fu, Christopher L. Pinder, Lorena Ligammari, Alexander P. Simpson et al.
- 期刊/来源: Nature Machine Intelligence
- 机构: The Francis Crick Institute · Cancer Research UK · London Cancer · Immunité et Cancer · CRUK Lung Cancer Centre of Excellence · University College London · Royal Marsden NHS Foundation Trust · Cancer Research UK Manchester Institute 等
- 分类: vol 8 · issue 5 · pp 670-689
- 相关性 4/10 · novelty:
application - 摘要: 本文提出 MIDAS,一个基于多模态图神经网络的免疫肿瘤药物靶点发现系统。MIDAS 整合基因相互作用、多组学患者数据、免疫细胞生物学、抗原处理、疾病关联及遗传扰动表型后果等多模态信息。在时间切片数据上泛化良好,性能优于 OpenTargets 等基线方法,且能排序已批准靶点高于临床开发中靶点。模型可解释性分析揭示其依赖自身免疫、调控网络和免疫肿瘤通路。实验验证了 oncostatin M–oncostatin M 受体信号通路作为靶点的功能,在患者来源外植体中减少功能障碍性 CD8+ T 细胞并降低 CCL4 水平。本文是应用导向的方法学贡献,但统计方法论创新有限,主要贡献在于系统集成与生物学验证。
- 关键技术:
multimodal graph neural network,multi-omic data integration,patient-derived tumour explant validation,interpretability analysis - 为什么对您有用: 本文属于 Nature Machine Intelligence 的通用科学阅读范畴,作为入门级读物,它清晰阐述了免疫肿瘤药物靶点发现的科学问题与数据模态(多组学、基因相互作用),但统计方法论(图神经网络)不在研究者武器库的核心范围内,且缺乏与 primary interests(因果推断、高维统计、U-统计量)的直接连接。作为 gateway reading,本文适合快速浏览以拓宽视野,但无需深入精读。
4. 10.1038/s42256-026-01237-5 — A generative artificial intelligence approach for peptide antibiotic optimization¶
- 作者: Marcelo D. T. Torres, Yimeng Zeng, Fangping Wan, Natalie Maus, Jacob Gardner, Cesar de la Fuente-Nunez
- 期刊/来源: Nature Machine Intelligence
- 机构: University of the Arts · Translational Therapeutics (United States) · Penn Center for AIDS Research · University of Pennsylvania · Philadelphia University
- 分类: vol 8 · issue 5 · pp 841-856
- 相关性 4/10 · novelty:
application - 摘要: 本文提出一种名为ApexGO的生成式人工智能方法,用于优化现有肽类抗生素的抗菌活性。该方法结合了Transformer变分自编码器(将肽序列嵌入连续潜空间)与贝叶斯优化(高效提议序列编辑以提升抗菌效力),区别于传统从零筛选或广谱生成的方法。以10种肽为模板,ApexGO生成了具有增强抗菌特性的优化衍生物,并合成了100种化合物进行体外表征(包括抗菌活性、作用机制、二级结构和细胞毒性)。实验结果显示,ApexGO对革兰氏阴性病原体的真实命中率达85%,活性提升成功率达72%,优于此前报道的抗生素发现与优化方法。在两种鲍曼不动杆菌感染的小鼠模型中,AI优化分子的抗感染活性优于模板对照,且与或超过最后防线抗生素相当。本文是Nature Machine Intelligence上的方法学应用论文,对您作为统计学家而言,可作为了解生成式AI在分子优化中应用范式的入门读物,但核心方法(VAE+贝叶斯优化)与您的主要研究兴趣(因果推断、高维统计、U统计量等)无直接技术重叠。
- 关键技术:
transformer variational autoencoder,Bayesian optimization,latent space embedding,peptide sequence optimization - 为什么对您有用: 本文属于general science(Nature Machine Intelligence)范畴的gateway reading。作为入门读物:(a) 对领域外读者较为友好,清晰阐述了问题设定和方法流程;(b) 阐明了抗生素耐药性的科学背景和ApexGO的定位;(c) 数据维度(序列、活性、结构)和建模(潜空间、黑箱优化)有一定统计趣味,但方法本身(VAE+贝叶斯优化)并非您武器库中的核心工具。总体而言,本文适合作为跨学科广度阅读,但不涉及您primary interests中的任何子方向,也无直接可迁移的方法学问题。
5. 10.1038/s42256-026-01229-5 · arXiv — A collaborative constrained graph diffusion model for the generation of realistic synthetic molecules¶
- 作者: Manuel Ruiz-Botella, Marta Sales-Pardo, Roger Guimerà
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 749-763
- 相关性 4/10 · novelty:
application - 摘要: 本文提出 CoCoGraph,一种协作约束图扩散模型,用于生成化学上保证有效的合成分子。模型通过内置约束(如化合价规则)和协作机制(多通道图信息融合),在标准分子生成基准上超越现有方法,且参数数量少一个数量级。对 36 种化学性质的分析表明,CoCoGraph 生成的分子分布比当前模型更接近真实分子。作者构建了 820 万个合成分子数据库,并通过有机化学专家的图灵测试评估生成分子的合理性。该工作主要贡献在分子生成领域,属于应用导向的方法创新。
- 关键技术:
graph diffusion model,constrained generation,collaborative mechanism,molecular validity guarantee - 为什么对您有用: 本文属于 Nature Machine Intelligence 的通用科学论文,适合作为跨领域入门阅读。对于统计计算研究者,文中图扩散模型的生成机制和约束优化思路有一定启发性,但核心方法(图神经网络、扩散过程)不在研究者主要武器库中,且与因果推断、高维统计等方向无直接关联。作为科普性阅读可了解分子生成领域的基本问题,但无需深入技术细节。
6. 10.1038/s42256-026-01226-8 · arXiv — Pretraining a foundation model for small-molecule natural products¶
- 作者: Yuheng Ding, Bo Qiang, Shaoning Li, Yiran Zhou, Jie Yu, Qi Li et al.
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 777-788
- 相关性 4/10 · novelty:
application - 摘要: 本文提出一个针对小分子天然产物(natural products)的预训练基础模型 NaFM。天然产物作为微生物、动物或植物的代谢产物,具有多样的生物活性,对药物发现至关重要。现有深度学习方法多采用针对特定下游任务的监督学习范式,缺乏泛化性且性能提升空间有限。NaFM 采用专为天然产物设计的预训练策略,结合对比学习和掩码图学习目标,强调分子骨架的进化信息并捕获侧链信息。在分类学分类、基因挖掘和虚拟筛选等下游任务中,NaFM 达到了最先进的结果。本文还通过细粒度分析展示了模型捕获进化信息的能力,并应用于虚拟筛选以识别潜在药物候选物。
- 关键技术:
contrastive learning,masked graph learning,foundation model,molecular scaffold,virtual screening - 为什么对您有用: 本文属于 Nature Machine Intelligence 的综合科学论文,作为 gateway reading 对统计学家友好:问题背景清晰(天然产物药物发现),数据侧(分子图结构、分类标签)和模型侧(对比学习、掩码图学习)都有明确阐述。武器库中的非参数统计和软件工程经验可帮助理解其图神经网络架构,但核心方法(预训练基础模型)与主要兴趣方向(因果推断、高维统计等)无直接技术连接。作为跨学科阅读值得浏览,但无需深入跟进。
7. 10.1038/s42256-026-01230-y — Peripheral control enabled by distributed sensing in an octopus-inspired soft robotic arm for autonomous underwater grasping¶
- 作者: Emanuela Del Dottore, Romina Adhami, Ebrahim Shahabi, Emanuele Solfiti, Michele Martini, Stefano Mariani et al.
- 期刊/来源: Nature Machine Intelligence
- 机构: Italian Institute of Technology
- 分类: vol 8 · issue 5 · pp 708-721
- 相关性 3/10 · novelty:
application - 摘要: 本文受章鱼触手分布式感知与控制的生物模型启发,设计了一种肌腱驱动的软体机械臂。每个仿生吸盘集成了LED和光电晶体管作为光电子机械传感器,通过光反射检测接触力(灵敏度~400 mV/N,量程0–2 N)和方向(误差<18°),在干湿环境中均能稳定工作。系统采用分层行为控制架构:吸盘层实现局部反射,全局层协调自主抓取。实验表明,该机械臂能可靠检测接触事件、估计力与方向,并推断物体相对位置,实现非结构化环境下的自适应抓取。本文是工程实现与系统集成的工作,无新统计方法或理论贡献。
- 关键技术:
optoelectronic mechanosensor,tendon-driven soft robot,hierarchical behaviour-based control,distributed sensing - 为什么对您有用: 本文属于Nature Machine Intelligence的通用科学阅读范畴,作为gateway reading: (a) 对机器人领域外行友好,术语解释清晰,适合入门; (b) 阐明了更大的科学问题——生物启发软体机器人的感知-控制闭环; (c) 数据/建模维度弱——传感器标定和抓取实验是工程测试,无统计推断或不确定性量化问题; (d) 科学趣味性中等。武器库无法直接攻入此方向(缺软体机器人控制与传感硬件知识),暂不可做。
8. 10.1038/s42256-026-01235-7 · arXiv — Platonic representation of foundation machine learning interatomic potentials¶
- 作者: Zhenzhu Li, Aron Walsh
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 830-840
- 相关性 3/10 · novelty:
application - 摘要: 本文研究七种不同架构的机器学习原子间势(MLIP)的潜在表示是否收敛于一个共享的统计表示空间。通过将各模型的嵌入投影到一组原子锚点上,作者统一了等变、非等变、保守和非保守架构的潜在空间,并保留了化学周期性和结构不变量。该统一框架支持跨模型最优传输、可解释的嵌入算术以及表示偏差的检测。此外,潜在空间中的偏离程度可作为无真实标签的异常结构度量,并预示物理预测的失败。结果表明,柏拉图表示假设为材料科学中基础模型的可互操作、可比较和可解释提供了一条实用路径。作为Nature Machine Intelligence上的多学科旗舰论文,本文对统计学家而言是了解机器学习在材料科学中应用的良好入门读物,但方法学上无直接可迁移的新统计理论或方法。
- 关键技术:
platonic representation hypothesis,latent space alignment,optimal transport,embedding arithmetic,foundation model interoperability - 为什么对您有用: 本文属于general science(Nature Machine Intelligence)范畴,作为gateway reading,其清晰阐述了材料科学中MLIP的表示学习问题,并展示了跨模型潜在空间对齐的统计方法。研究者作为统计计算和软件开发的专家,可从中了解机器学习在科学模拟中的前沿应用,但武器库中的工具(如高维统计、U统计量)与本文核心方法无直接交集,暂不可做后续工作。
9. 10.1038/s42256-026-01227-7 · arXiv — Force-free molecular dynamics through autoregressive equivariant networks¶
- 作者: Fabian L. Thiemann, Thiago Reschützegger, Massimiliano Esposito, Tseden Taddese, Juan D. Olarte-Plata, Fausto Martelli
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 764-776
- 相关性 3/10 · novelty:
new_method - 摘要: 本文提出TrajCast,一种基于自回归等变消息传递网络的分子动力学模拟框架,直接更新原子位置和速度,摆脱传统数值积分的时间步长限制。该方法将模拟视为序列预测任务,利用等变图神经网络学习状态转移映射,无需显式计算原子间力。在多种系统(小分子、晶体、液体)上,TrajCast在结构、动力学和能量性质上与参考MD模拟高度一致。零样本泛化测试表明,它能推广到训练数据未覆盖的相空间区域,在亚稳态平衡和非平衡状态下产生物理合理的系综。时间步长可达传统MD的30倍,对4000+原子固体每天生成超过15纳秒轨迹。对您而言,这是一篇Nature Machine Intelligence上的方法学论文,属于general science gateway reading,展示了机器学习如何替代传统数值模拟范式,但核心工具(等变图网络、自回归预测)与您的统计武器库交集有限,作为跨学科阅读了解前沿应用有价值。
- 关键技术:
autoregressive equivariant message-passing networks,force-free molecular dynamics,zero-shot generalization,sequence prediction for trajectory generation - 为什么对您有用: 本文属于general science gateway reading,适合作为跨学科入门读物:它清晰阐述了分子动力学模拟的计算瓶颈(小时间步长限制),以及如何用机器学习替代传统数值积分,数据侧(原子坐标、速度序列)和模型侧(等变图网络、自回归预测)的设定对统计学家友好。但核心机器(等变图神经网络、分子动力学领域知识)不在您的武器库中,属于暂不可做方向——您无法直接迁移方法,但可作为了解ML在物理模拟中前沿应用的优质阅读材料。
10. 10.1038/s42256-026-01228-6 · arXiv — Adopting a human developmental visual diet yields robust and shape-based AI vision¶
- 作者: Zejin Lu, Sushrut Thorat, Radoslaw M. Cichy, Tim C. Kietzmann
- 期刊/来源: Nature Machine Intelligence
- 分类: vol 8 · issue 5 · pp 735-748
- 相关性 3/10 · novelty:
application - 摘要: 本文研究如何通过模拟人类视觉发育过程来提升AI视觉系统的鲁棒性和形状感知能力。作者将数十年的人类视觉发展研究(包括视觉锐度、对比敏感度和颜色感知的发育轨迹)量化为一个“发育性视觉训练集”,用于指导AI模型的学习过程。该方法不依赖模型规模的扩大或数据量的增加,而是通过调整训练数据的呈现顺序和内容来引导模型学习。实验表明,采用这种人类发育式训练策略的模型在形状信息依赖、抽象形状识别、图像失真鲁棒性和对抗攻击防御等所有测试指标上均优于标准训练模型。该工作属于Nature Machine Intelligence上的跨学科研究,展示了认知科学与AI的交叉价值。对您而言,这是一篇优秀的科普级入门读物,清晰阐述了视觉发育的量化方法和AI训练的结合点,但方法论上不涉及您核心关注的统计推断或计算复杂度理论。
- 关键技术:
developmental curriculum learning,visual acuity modeling,contrast sensitivity function,shape bias evaluation,adversarial robustness testing - 为什么对您有用: 本文属于Nature Machine Intelligence上的跨学科研究,作为gateway reading价值较高:(1) 清晰阐述了人类视觉发育的量化方法(锐度、对比度、颜色)及其如何转化为AI训练策略,适合作为认知科学与AI交叉领域的入门读物;(2) 武器库中无直接可攻工具——该文核心是认知科学实验设计和深度学习训练策略,不涉及您熟悉的统计推断或计算复杂度分析,属于暂不可做方向;(3) 值得花时间读全文以拓宽视野,但无需深入跟进方法论细节。
Maintained by 陈星宇 · Homepage · Source on GitHub