人工智能正在帮助科学家像阅读语言一样解读基因行为,揭示基因如何聚集、转换角色并塑造疾病。西奈山(Mount Sinai)开发的新模型从海量数据集中学习,预测缺失的关联,聚焦罕见基因,并预示更快的生物医学发现。
人工智能已经改变了计算机理解人类语言的方式。如今,西奈山伊坎医学院(Icahn School of Medicine at Mount Sinai)的科学家正利用类似思路来破解生物学中最大的谜题之一:基因在人体细胞内如何协同工作。
在一项新研究中,研究人员推出了一种基因集基础模型(Gene Set Foundation Model,GSFM),旨在学习数百万生物数据集中基因之间的关系。该系统受ChatGPT等大型语言模型的启发——这些模型通过学习词语在语境中获得含义。不过,这个新AI不是研究句子,而是研究基因集。
结果是一个能预测基因如何相互作用、识别理解不足的基因,甚至提示潜在疾病靶点的系统。研究人员认为,该模型最终可能改进药物发现、诊断以及对人类疾病的理解。
“基因很少单独行动。相反,它们参与多种生物过程,根据在细胞中活跃的位置和时间形成不同的分子组合。单个基因在不同环境中可以扮演不同角色,就像同一个词在不同句子中可以有不同含义,”西奈山生物信息学中心主任、药理学科学教授阿维·马亚扬(Avi Ma'ayan)博士说。
“正如现代语言模型通过语境学习词语的含义,我们询问AI是否也能以同样的方式学习基因的‘含义’。我们的GSFM正是为此设计的。”
教AI理解生物学
人体细胞含有数千个基因,但这些基因很少孤立工作。它们形成网络、通路和分子团队,根据细胞类型、疾病或环境而变化。
科学家花费数十年试图理解这些关系。传统实验可以揭示基因功能,但往往需要多年的实验室工作。新AI模型旨在通过直接从大量生物数据中学习模式来加速这一过程。
为了构建系统,研究人员从已发表的研究和转录组数据集中收集了超过100万个基因集。这些基因集来自两个主要资源:Rummagene和RummaGEO。
Rummagene从已发表的科学论文中提取基因列表。RummaGEO从存储在Gene Expression Omnibus数据库中的RNA测序研究生成基因集。这些数据集共同覆盖了数千种疾病、组织和实验条件。
合并后的资源包含超过62.6万组过滤后的基因集,涵盖近9.7万个基因。研究人员随后使用类似拼图的策略训练AI:模型接收不完整的基因集,必须预测缺失的基因。
随着时间的推移,系统学会了隐藏的生物模式。反复一同出现的基因在模型的内部表示中建立了关联。
将基因转化为生物语言
GSFM背后的概念与语言AI高度相似。大型语言模型学习到在相似语境中出现的词语往往共享相关的含义。例如,“医生”和“医院”经常同时出现。
基因行为类似。某些基因在免疫反应、癌症生长或组织修复中反复一同出现。通过学习这些模式,AI创建称为嵌入(embeddings)的数学表示,捕捉基因之间的关系。
“细胞内基因的组织方式仍然是生物学中未解决的主要问题之一。GSFM通过从数百万源自已发表研究和基因表达数据集的基因分组中学习,帮助解决这一问题,”马亚扬博士说。
与早期主要依赖单细胞基因表达数据的生物AI系统不同,GSFM直接从跨多种研究方法收集的基因集中学习。这种更广泛的训练使系统能够将来自疾病、分子研究和不同生物条件的信息整合到一个统一框架中。
研究人员在开发过程中测试了几种AI架构。令人惊讶的是,一个相对简单的去噪自编码器(denoising autoencoder)胜过了更复杂的系统,如变分自编码器和基于Transformer的方法。
最终模型使用256维的隐藏层,在经过大约50次训练周期后达到最佳性能。
超越现有生物模型
为了测试系统,科学家将GSFM与几种著名的生物AI工具和基因数据库进行了基准测试。他们评估了模型准确预测已知生物通路和疾病过程中缺失基因的能力。
模型使用主要生物数据库进行测试,包括KEGG通路、基因本体生物过程(Gene Ontology Biological Processes)、GWAS Catalog和ChEA转录因子数据集。
在这些测试中,研究人员将已知基因集分成两半。一半展示给AI,另一半隐藏。模型随后尝试预测缺失的基因。
GSFM在多个基准测试中始终优于竞争方法。它还成功预测了基因-基因关系和疾病关联,这些后来在后续研究中得到实验证实。
研究人员使用AUROC分数(一种用于评估预测准确性的常见统计方法)来衡量性能。基于Rummagene数据训练的GSFM取得了最强的总体结果。
该系统还超越了包括Geneformer和scGPT在内的几个著名模型,这些模型此前在数千万单细胞数据集上训练。
科学家认为GSFM的优势来自其训练数据的多样性。模型不是专注于一种生物数据类型,而是从许多不同的实验背景中学习。
预测疾病基因和药物靶点
该AI模型不仅能预测缺失基因。研究人员表示,它还能识别理解不足的基因,提示与疾病相关的通路,并揭示潜在的药物靶点。
一个主要应用是基因集富集分析——一种广泛使用的方法,帮助科学家解释实验中的基因列表。GSFM改善了这项任务的性能,比以往工具更准确地识别出有生物学意义的模式。
团队还将该系统应用于蛋白质-蛋白质相互作用预测和基因-疾病关联研究。在一次演示中,研究人员测试了模型对铁死亡(ferroptosis)——一种与铁和脂质损伤相关的细胞死亡类型——的表现。
使用已知的铁死亡基因集,GSFM预测了可能参与该过程的其他基因。排名靠前的几个预测后来与科学文献中的发现相符。
一个例子是PLIN2基因,最近研究将其与少突胶质细胞中的铁死亡联系起来。AI在广泛确认前就将其识别为候选基因。
这类预测可以帮助研究人员优先安排实验室实验,并比以前更快地揭示生物机制。
计算需求更小,科学更快
尽管在庞大的生物数据集上训练,GSFM在计算上仍然高效。研究人员表示,训练数据仅需约1GB存储空间,模型在标准硬件上训练耗时约30分钟。
这使得该系统比一些需要昂贵计算集群的大规模AI模型更容易获得。
研究人员还公开了该模型。科学家可以探索预测结果、分析基因集并访问可下载的基准数据。源代码和预训练模型权重可通过GitHub和HuggingFace平台获取。
展望未来
西奈山团队计划通过将模型与其他AI系统结合来扩展它。未来的一个目标是将GSFM与能生成基因功能通俗解释的语言模型相连接。
另一个方向是将其与专注于药物的AI系统结合,以预测药物如何与细胞相互作用。
研究人员认为,这类生物AI最终可能帮助指导精准医学——即根据个体基因特征定制治疗方案。
这项工作也突显了科学界的一个更广泛趋势:曾为人类语言设计的AI系统正越来越多地被应用于生物学、化学和医学。
随着生物医学数据集快速增长,像GSFM这样的工具可能会帮助科学家发现人类单靠自身无法识别的复杂模式。
研究的实际意义
这项研究可能通过帮助科学家无需多年实验室测试就能识别基因功能,从而显著加快生物发现。研究人员可以利用该模型更快地揭示疾病通路,识别新的生物标志物,并优先选择有前景的药物靶点进行进一步研究。
该系统还可能改进科学家对大型组学数据集(包括基因组学、蛋白质组学和转录组学研究)的分析。对这些数据集更好的解读可能支持更早的疾病检测和更个性化的治疗。
由于GSFM整合了来自多种生物条件的数据,它可能帮助研究人员发现以前难以检测的疾病之间的隐藏关联。未来,将GSFM与专注于药物的AI系统结合,可以改善对疗法如何与人体细胞相互作用的预测,从而加速新药开发。
研究结果已在线发表于《Patterns》期刊。
【全文结束】

