这幅插图展示了Evo 2如何学习所有生物共享的遗传语言,从猛犸象到细菌。图片来源:Arc Institute
DNA基础模型Evo 2已发表于《自然》期刊。该模型基于整个生命之树中超过10万个物种的DNA进行训练,能够识别不同生物间基因序列的模式,而实验研究人员需要数年时间才能发现这些模式。该机器学习模型可以准确识别人类基因中的致病突变,并能够设计与简单细菌基因组长度相当的新基因组。
开放获取工具与可视化
Evo 2由Arc研究所和英伟达的科学家开发,并汇聚了斯坦福大学、加州大学伯克利分校和加州大学旧金山分校的合作者。该模型的代码已在Arc研究所的GitHub上公开,并集成到英伟达BioNeMo框架中,作为Arc研究所与英伟达合作加速科学研究的一部分。
Arc研究所还与人工智能研究实验室Goodfire合作,开发了一个机制可解释性可视化工具,用于揭示模型学习识别基因组序列中的关键生物学特征和模式。Evo团队已共享其训练数据、训练和推理代码以及模型权重,使其成为迄今为止规模最大、完全开源的人工智能模型。
扩展生物训练数据
Evo 2在其前身Evo 1的基础上进行了扩展,后者完全基于单细胞基因组训练。Evo 2是生物学领域迄今为止最大的人工智能模型,基于来自超过12.8万个全基因组以及宏基因组数据的9.3万亿个核苷酸(构成DNA或RNA的基本单元)进行训练。
除了扩增的细菌、古细菌和噬菌体基因组集合外,Evo 2还包含了来自人类、植物以及其他真核生物(单细胞和多细胞物种)的信息。
“Evo 1和Evo 2的开发代表了新兴生成生物学领域的关键时刻,这些模型使机器能够以核苷酸的语言进行阅读、编写和思考。”Arc研究所联合创始人、核心研究员、加州大学伯克利分校生物工程助理教授与德布院士研究员、论文共同资深作者帕特里克·许(Patrick Hsu)表示,“Evo 2对生命之树具有通才式的理解,可用于多种任务,从预测致病突变到设计人工生命的潜在编码。我们期待研究社区在这些基础模型之上构建更多成果。”
学习进化写下的模式
进化将生物信息编码在DNA和RNA中,形成了Evo 2能够检测和利用的模式。
“正如世界在用于训练大型语言模型的互联网语言上留下了印记,进化也在生物序列上留下了印记,”共同资深作者、斯坦福大学化学工程助理教授、迪特·施瓦茨基金会斯坦福数据科学教职研究员、Arc研究所创新研究员布莱恩·希(Brian Hie)说,“这些经过数百万年精细调整的模式包含了分子如何运作和相互作用的信号。”
高性能基础设施与架构
Evo 2在英伟达DGX Cloud AI平台(通过亚马逊云服务)上训练了数月,使用了超过2000块英伟达H100 GPU,并得到了英伟达研究人员和工程师的合作支持。
该模型可以一次性处理长达100万个核苷酸的遗传序列,从而理解基因组中远距离部分之间的关系。
实现这一技术壮举需要研究团队重新构想人工智能模型如何快速摄取并推断如此大规模的数据。由此产生的人工智能架构称为StripedHyena 2,使Evo 2能够以比Evo 1多30倍的数据进行训练,并且一次推理的核苷酸数量是Evo 1的八倍以上。
在疾病和合成生物学中的应用
该模型已展现出足够的通用性,能够识别影响蛋白质功能和生物体适应度的遗传变化。例如,在与乳腺癌相关基因BRCA1变体的测试中,Evo 2在预测哪些突变是良性的、哪些是潜在致病性方面取得了超过90%的准确率。
这类洞察可以通过发现人类疾病的遗传原因并加速新药开发,节省进行细胞或动物实验所需的无数小时和研究经费。
自其预印本发布一年以来,研究人员已将该模型应用于一系列科学问题,从预测阿尔茨海默病患者的遗传疾病风险,到评估家养动物物种中的变异效应。
Arc研究所的研究人员还利用Evo 2设计了功能性合成噬菌体,展示了治疗抗生素耐药细菌的潜在应用。
未来可能性与靶向治疗
除了遗传分析,Evo 2还可用于设计新的生物工具或治疗方法。“如果你想要一种仅在神经元中激活以避免副作用的基因疗法,或者仅在肝细胞中激活,你可以设计一个仅在特定细胞中可及的遗传元件。”共同作者、计算生物学家哈尼·古达尔齐(Hani Goodarzi)表示。他是Arc研究所核心研究员、加州大学旧金山分校生物化学与生物物理学副教授。“这种精确控制有助于开发更具靶向性、副作用更少的治疗方法。”
研究团队设想可以以Evo 2为基础构建更具体的人工智能模型。“粗略地说,你可以将这个模型几乎视为一个操作系统内核——你可以在此基础上构建各种不同的应用程序。”Arc研究所首席技术官戴夫·伯克(Dave Burke)说,他也是论文的作者之一。“从预测单个DNA突变如何影响蛋白质功能,到设计在不同细胞类型中表现不同的遗传元件,随着我们继续完善模型,研究人员开始以创造性的方式使用它,我们预计将看到Evo 2带来甚至我们还无法想象的益处。”
伦理、安全与全球影响
考虑到潜在的伦理和安全风险,科学家们从Evo 2的基础数据集中排除了感染人类和其他复杂生物的病原体,并确保模型不会返回关于这些病原体的有效答案。共同作者、斯坦福大学医学教授蒂娜·埃尔南德斯-布萨德(Tina Hernandez-Boussard)及其实验室成员协助团队实施负责任的技术开发与部署。
“Evo 2从根本上推进了我们对生物系统的理解。”英伟达数字生物学总监安东尼·科斯塔(Anthony Costa)表示。“通过以独特的架构和迄今为止同类最大的集成数据集克服了生物基础模型先前在规模上的限制,Evo 2在已知生物学上的泛化能力超过了任何现有模型——通过广泛发布这些能力,Arc研究所为全球科学家提供了一个新的伙伴,以解决人类最紧迫的健康和疾病挑战。”
出版信息
Patrick Hsu, Genome modelling and design across all domains of life with Evo 2, Nature (2026). DOI: 10.1038/s41586-026-10176-5
期刊信息:Nature
关键概念
基因工程生物 人科物种 分子进化 基因组 生物信息学
提供方
Arc Institute
【全文结束】

