Evo 2人工智能模型解码所有生命领域的遗传密码Evo 2 AI Models Genetic Code for All Life Domains | Mirage News

环球医讯 / AI与医疗健康来源:www.miragenews.com美国 - 英语2026-09-13 05:46:51 - 阅读时长5分钟 - 2267字
DNA基础模型Evo 2在《自然》杂志正式发表,该模型基于10万余种物种的DNA训练而成,能够识别跨物种的基因序列模式,高精度预测人类基因中的致病突变,并可设计结构简单的细菌基因组。Evo 2由Arc研究所、英伟达及多所大学共同开发,是目前规模最大、完全开源的人工智能模型,未来可应用于疾病诊断、基因疗法及合成生物学等领域。
Evo2人工智能基因突变疾病风险致病突变乳腺癌阿尔茨海默病药物开发基因疗法健康
Evo 2人工智能模型解码所有生命领域的遗传密码

DNA基础模型Evo 2于2025年2月首次作为预印本发布,现已正式发表在《自然》杂志上。Evo 2基于整个生命之树中超过10万个物种的DNA进行训练,能够识别不同生物间基因序列的模式,而实验研究人员需要数年时间才能发现这些模式。该机器学习模型可以准确识别人类基因中导致疾病的突变,并能设计出与简单细菌基因组长度相当的新基因组。

Evo 2由Arc研究所和英伟达的科学家开发,并汇聚了斯坦福大学、加州大学伯克利分校和加州大学旧金山分校的合作者。该模型的代码可从Arc的GitHub公开获取,并已集成到英伟达BioNeMo框架中,这是Arc研究所与英伟达合作加速科学研究的一部分。Arc研究所还与人工智能研究实验室Goodfire合作,开发了一个机制可解释性可视化工具,该工具能够揭示模型在基因组序列中学习识别的关键生物学特征和模式。Evo团队分享了其训练数据、训练和推理代码以及模型权重,使其成为迄今为止规模最大、完全开源的人工智能模型。

在其前身Evo 1(完全基于单细胞基因组训练)的基础上,Evo 2是目前生物学领域最大的人工智能模型,基于超过9.3万亿个核苷酸(构成DNA或RNA的基本单元)进行训练,这些数据来自超过12.8万个全基因组以及宏基因组数据。除了扩展的细菌、古菌和噬菌体基因组集合外,Evo 2还包含了来自人类、植物以及其他真核生物域中单细胞和多细胞物种的信息。

Arc研究所联合创始人、核心研究员、加州大学伯克利分校生物工程助理教授兼Deb Faculty Fellow帕特里克·许(Patrick Hsu)表示:“我们开发Evo 1和Evo 2代表了新兴的生成生物学领域的一个关键时刻,因为这些模型使机器能够阅读、书写和思考核苷酸的语言。Evo 2对生命之树有着通用性的理解,可用于多种任务,从预测致病突变到设计人工生命的潜在代码。我们很期待看到研究界在这些基础模型上构建什么。”

进化已将生物信息编码在DNA和RNA中,形成了Evo 2能够检测和利用的模式。共同资深作者、斯坦福大学化学工程助理教授、迪特·施瓦茨基金会斯坦福数据科学教职研究员、Arc研究所创新研究员布莱恩·希(Brian Hie)表示:“就像世界在用于训练大语言模型的互联网语言上留下了印记一样,进化也在生物序列上留下了印记。这些经过数百万年精炼的模式,包含了关于分子如何工作和相互作用的信息。”

Evo 2在通过亚马逊云服务(AWS)运行的英伟达DGX Cloud AI平台上训练了数月,使用了超过2000块英伟达H100 GPU,并与英伟达研究人员和工程师合作进行了增强。该模型可以一次处理长达100万个核苷酸的基因序列,使其能够理解基因组中遥远部分之间的关系。实现这一技术壮举需要研究团队重新构想一个人工智能模型如何快速摄取并推断如此规模的数据。由此产生的人工智能架构称为StripedHyena 2,使得Evo 2能够使用比Evo 1多30倍的数据进行训练,并一次推理超过8倍的核苷酸。

该模型已经展现出足够的通用性,能够识别影响蛋白质功能和生物体适应度的遗传变化。例如,在与乳腺癌相关基因BRCA1的变异测试中,Evo 2在预测哪些突变是良性的、哪些是潜在致病性的方面,准确率超过90%。通过发现人类疾病的遗传原因并加速新药的开发,像这样的见解可以节省进行细胞或动物实验所需的无数时间和研究经费。

自预印本发布以来的一年里,研究人员已将Evo 2应用于一系列科学问题,从预测阿尔茨海默病患者的遗传疾病风险,到家畜物种的变异效应评估。Arc研究人员还使用Evo 2设计了功能性合成噬菌体,展示了治疗抗生素耐药细菌的潜在应用。

除了基因分析,Evo 2还可用于设计新的生物工具或治疗方法。共同作者、计算生物学家、Arc核心研究员、加州大学旧金山分校生物化学与生物物理学副教授哈尼·古达齐(Hani Goodarzi)表示:“如果你有一种基因疗法,你想让它只在神经元中启动以避免副作用,或者只在肝细胞中启动,你可以设计一个只在那些特定细胞中可及的遗传元件。这种精确控制有助于开发更具靶向性的治疗方法,且副作用更少。”

研究团队设想,可以以Evo 2为基础构建更特定的人工智能模型。Arc的首席技术官、论文合著者戴夫·伯克(Dave Burke)表示:“从某种意义上说,你可以将模型想象成一个操作系统内核——你可以在此基础上构建所有这些不同的应用程序。从预测单个DNA突变如何影响蛋白质功能,到设计在不同细胞类型中表现不同的遗传元件,随着我们不断完善模型以及研究人员开始创造性地使用它,我们预计会看到Evo 2带来我们甚至尚未想象到的有益用途。”

考虑到潜在的伦理和安全风险,科学家们从Evo 2的基础数据集中排除了感染人类和其他复杂生物的病原体,并确保模型不会对这些病原体的查询返回有效的答案。共同作者、斯坦福大学医学教授蒂娜·埃尔南德斯-布萨德(Tina Hernandez-Boussard)及其实验室成员协助团队负责任地开发和部署这项技术。

英伟达数字生物学总监安东尼·科斯塔(Anthony Costa)表示:“Evo 2从根本上推进了我们对生物系统的理解。通过其独特的架构和同类最大的集成数据集克服了生物基础模型以往规模上的限制,Evo 2在已知生物学上的泛化能力超越了迄今为止的任何其他模型——通过广泛发布这些能力,Arc研究所为全世界的科学家提供了一个新的合作伙伴,共同解决人类最紧迫的健康和疾病挑战。”

【全文结束】