摘要
现代人工智能(AI)方法通过从大规模异构生物数据集中学习疾病机制和药物作用,为药理学提供了新的机遇。一个核心挑战是开发能够联合整合不同生物医学模态的模型。我们提出了MAMMAL(分子对齐多模态架构与语言模型),这是一种用于跨模态学习的基础模型,旨在解决与药物发现任务相关的挑战。MAMMAL在20亿个样本上进行了预训练,这些样本涵盖了蛋白质和抗体序列、小分子以及基因表达谱,并支持对跨模态输入的分类、回归和生成任务。在覆盖药物发现流程多个阶段的11个基准测试中,经过微调的MAMMAL在9个任务上达到了最先进水平,在2个任务上表现出具有竞争力的结果。在抗体-抗原结合基准测试中,经过微调的MAMMAL预测分数显著优于作为结合可能性参考代理的AlphaFold3置信度分数,在七个抗原靶标中有五个表现更佳。MAMMAL框架和预训练模型已公开提供,以支持开放和协作研究。
引言
尽管在理解健康和疾病方面取得了重大进展,但许多复杂的生物过程仍然知之甚少。人工智能的最新进展提出了这样的前景:长期存在的健康挑战可能通过基于AI的方法得到解决,而且临床试验中药物的高失败率(约90%的候选药物未能获得监管批准)可以得到改善。在过去的一个世纪中,将生物发现转化为有效疗法的过程已经成熟。药物发现过程遵循一个多步骤的流程,从识别与疾病相关的蛋白质开始,进展到寻找能够有效靶向这些蛋白质的化合物,并最终优化候选药物以满足严格的疗效和安全性标准。这一过程既昂贵又耗时,需要大量的实验室测定来测量药物-靶点相互作用、表征细胞反应以及验证治疗的安全性和有效性。
治疗方式从稳定、易于制造且适合口服给药的小分子,到提供高特异性的生物治疗剂(如工程化抗体)不等,后者需要更复杂的制造和递送方式。加速药物发现并提高其各步骤的预测准确性已成为生物医学研究的核心焦点,旨在简化靶点识别、药物设计和测试。分析基因表达谱,特别是来自单细胞RNA测序(scRNA-seq)的数据,已成为区分与疾病相关的细胞群体和表征药物诱导的细胞反应的关键方法。这些分析支持靶点识别、机制理解以及在不同细胞环境中药物效果的评估。同时,生成模型越来越多地应用于药物设计,使新型候选分子的合成成为可能,以供进一步评估。由于测量药物结合亲和力的高通量筛选测定既昂贵又难以扩展,准确预测药物-靶点相互作用可以显著增强药物设计,提高疗效和精确度。总的来说,在流程早期阶段对结合亲和力、毒性和疗效进行预测建模,可以减少对昂贵的后期测试的依赖,最终节省药物开发的时间和资源。
为药物发现开发预测性和生成性AI模型的一个核心挑战是确定不同的生物医学模态和实体应如何表示并作为模型输入和输出进行组合。对于以交互为中心的任务(例如预测小分子药物是否会与特定蛋白质靶点结合),这一挑战尤为突出。尽管基于序列的分子(例如SMILES)和蛋白质表示已显示出相当大的成功,但将转录组数据表示为序列的方法最近才被探索,导致了一系列新兴方法。
在这项工作中,我们介绍了一个跨领域基础模型,该模型在一个统一的序列框架内表示小分子、蛋白质和转录组数据。我们提出了MAMMAL(分子对齐多模态架构与语言模型),旨在解决AI驱动的药物发现中的核心挑战。我们的主要贡献是:(1)一种新颖的多对齐框架,使用灵活的结构化提示语法整合分子、蛋白质和基因表达输入,使复杂多实体交互(如药物-靶点结合)的建模成为可能;(2)专为药物发现设计的架构,通过连续投影将数值自然地纳入其嵌入空间。这提高了亲和力预测和结构整合等任务的精确度,同时支持预测和生成目标;以及(3)一个大规模预训练模型,在去噪、填充和与结合相关的任务上训练了超过20亿个样本。在涵盖药物发现流程多个阶段的11个基准测试中,经过微调的MAMMAL在9个任务上达到了最先进水平。该模型和预训练权重已在Hugging Face平台上公开提供,名称为ibm/biomed.omics.bl.sm.ma-ted-458m,为推进多模态生物医学建模研究提供了一个平台。
结果
评估
为评估ibm/biomed.omics.bl.sm.ma-ted-458m的性能和泛化能力,我们选择了一组多样化的现有基准测试,涵盖药物发现流程的多种任务类型和阶段,优先选择那些具有明确定义划分的基准测试。我们通过微调评估策略来评估模型质量,将预训练模型适应每个基准测试并与专门的最先进(SOTA)模型进行比较。评估方法学和微调协议,以及每个基准测试的详细描述(包括背景、对药物发现的意义、先前模型和数据统计),在下面的小节中提供。表1总结了各任务的性能,并在图1E中进行了可视化,代表性编码器-解码器示例在补充表S1中提供。
AlphaFold(其开发为2024年诺贝尔化学奖做出了贡献)彻底改变了蛋白质结构预测。其扩展版本AlphaFold-Multimer实现了对抗体-抗原复合物的建模,而AlphaFold 3(AF3)进一步提高了准确性并增加了对核酸/小分子的支持。受AF3报告进展的启发,我们评估了它在治疗性抗体和纳米抗体复合物上的性能(第2.10小节)。比较分析表明,MAMMAL在七个靶标中的五个靶标上比AF3具有更好的分类性能(表2)。
评估方法
我们汇编了一个包含11个基准测试的综合集,涵盖多个数据领域和任务类型,包括分类、回归和生成,以及单实体、多实体和多领域任务。这些基准测试解决了药物发现过程的关键阶段:识别靶向细胞类型(细胞类型)和推进精准医学(癌症-药物反应1-3);预测药物疗效(BBBP)和安全性(ClinTox);预测小分子药物与靶向蛋白质的结合亲和力(DTI);预测生物药物(PPI)的相互作用;以及设计新的药物,如靶向特定蛋白质的抗体(Ab Infilling)。
为实现与先前工作的公平直接比较,基准测试选择优先考虑具有预定义训练、验证和测试划分或具有已建立划分策略的数据集。对于每个基准测试,我们遵循原始基准测试或SOTA参考中使用的数据划分和评估指标。当明确的训练—验证—测试划分可用时,ibm/biomed.omics.bl.sm.ma-ted-458m在训练集上进行微调,使用验证集选择最佳检查点,并在测试集上报告最终性能。对于使用交叉验证评估的基准测试,我们采用与相应先前工作相同的协议。除非另有说明,否则通过使用三个不同随机种子训练模型并在保留的测试集上计算其性能的标准差来估计标准误差。每个基准测试的详细描述、微调程序和评估协议与相应结果一起提供。对于DTI基准测试,性能使用归一化均方根误差(NRMSE)报告,定义为均方根误差除以测试标签的标准差。对MAMMAL和报告的SOTA结果应用相同的归一化,产生低于1的值,并在图1(E)中与其他性能指标一起进行联合可视化。当相对改进(计算为|SOTA - MAMMAL|/SOTA)超过1%时,我们认为MAMMAL优于现有最先进技术。
细胞类型注释
细胞类型预测使研究人员能够区分不同的细胞群体,例如与各种疾病相关的细胞群体。它对于理解疾病或药物如何影响不同细胞类型也至关重要。近年来,已经开发了多种用于此任务的方法,包括基于标记基因的方法、基于相关性的技术以及使用分类进行的注释。最近的基于Transformer和大规模基础模型的进展已在这一领域显示出改进的性能。
此任务的输入是单细胞基因表达数据。我们使用的基准测试基于Zheng68k数据集,该数据集由人外周血单核细胞组成,由于涉及的细胞类型相似性,被广泛用于评估细胞类型注释性能。该数据集包含68,579个跨越11种细胞类型的细胞,最初包含32,738个基因,去除非表达基因后留下20,387个基因用于基准测试。预处理包括表达值的归一化、对数转换,随后进行分箱。与之前方法类似,我们的模型使用按表达水平排序的表达基因名称的排序列表作为输入。要预测的标签以细胞本体格式"CL:NNNNNN"提供(见补充表S1)。
遵循先前工作,我们采用5折交叉验证策略来微调和评估ibm/biomed.omics.bl.sm.ma-ted-458m,确保各折中细胞类型的比例相似,并使用准确率和宏F1分数评估性能。MAMMAL在准确率和F1分数方面均优于先前的最先进性能(表1和补充表S2中的详细结果),F1分数提高了7.5%。
BBBP和ClinTox
为确保安全有效药物的开发,候选药物必须满足与疗效和安全性相关的严格标准。在本研究中,我们从MoleculeNet中选择了两个相关基准测试,这是一个广泛用于评估小分子药物性质机器学习模型的基准测试套件:BBBP和ClinTox。BBBP基准测试侧重于预测药物穿透血脑屏障的能力,这对靶向中枢神经系统的药物至关重要。ClinTox基准测试包含两个相关任务:(1)预测临床毒性试验中的失败,以及(2)预测FDA批准状态。ClinTox的整体性能报告为这两个任务的平均性能。
MoLFormer,一种为分子嵌入训练的模型,在11亿个SMILES序列上进行了训练,在BBBP和ClinTox基准测试上都达到了最先进的性能。在我们的研究中,我们采用了先前工作提供的基准测试,这些基准测试提供了预定义的训练、验证和测试划分。MAMMAL在两个基准测试上都超过了MoLFormer(表1),BBBP的AUROC平均得分为0.957,ClinTox为0.986,分别比最先进技术提高了2.2%和4%。
癌症-药物反应
在细胞水平上识别药物反应是新药开发中的关键步骤。两个支持这一努力的关键公共数据库,特别是在癌症药物开发中,是癌症细胞系百科全书(CCLE)和癌症药物敏感性基因组学(GDSC)。CCLE为约1000个癌症细胞系提供多组学谱,而GDSC提供了这些细胞系对数百种药物的药物反应数据,通常使用半最大抑制浓度(IC50)测量。值得注意的计算模型解决了这一任务。
对于我们的研究,我们使用了GDSC数据库的三个子集:GDSC1和GDSC2,通过治疗数据通用标准(TDC)提供,在本文中分别称为癌症-药物反应1和癌症-药物反应2;以及在先前工作中发布的子集,称为癌症-药物反应3。总结细胞系、药物和细胞-药物对数量的数据统计表在补充表S3中提供。我们对癌症-药物反应1和2使用了TDC提供的随机划分,而对于癌症-药物反应3,我们遵循了先前工作中概述的划分方法,保留5%的数据用于测试集,根据与癌症细胞系相关的TCGA通路进行分层。
在微调过程中,我们仅使用基因表达谱和药物的SMILES表示,如补充表S1中的示例提示所示。与细胞类型注释的输入格式类似,基因表达谱以按表达水平排序的基因名称的排序列表提供。对于预测连续IC50值,MAMMAL在回归模式下使用,利用其对浮点标量预测的内置支持。我们的模型在癌症-药物反应1和2基准测试上优于当前SOTA模型(表1),Pearson相关值提高了3.4%。此外,它在癌症-药物反应3基准测试上产生与SOTA相当的结果,略有0.5%的改进。
为进一步评估MAMMAL对新化合物的预测能力,我们评估了四种不在GDSC训练数据中的药物的药物反应预测:Carfilzomib、Nintedanib、Infigratinib和Vemurafenib。Tanimoto相似性分析证实,这四种药物中有三种(Carfilzomib、Nintedanib和Infigratinib)在训练集中没有结构相似的化合物(Tanimoto系数<0.7),而Vemurafenib与GDSC中存在的BRAF抑制剂PLX-4720具有中等相似性(0.82)。我们使用与GDSC相同的测定协议进行实验验证:使用CellTiter-Glo在72小时药物孵育后测量细胞活力,并使用Prism(GraphPad)确定IC50值。实验测量显示,所有测试细胞系中均保持一致的效力排序:Carfilzomib(效力最强),其次是Nintedanib、Infigratinib和Vemurafenib(效力最弱)。MAMMAL预测重现了测试细胞系的精确排序。当扩展到GDSC中的所有805个细胞系时,该模型在约90-95%的情况下保持了这种相对排序,表明预测的效力差异在很大程度上与细胞系无关。
值得注意的是,Carfilzomib是一种蛋白酶体抑制剂,仅获准用于血液恶性肿瘤(多发性骨髓瘤),在实体瘤细胞中疗效有限。该模型将Carfilzomib预测为跨各种实体瘤细胞系的最有效药物,与我们的实验观察结果一致,并表明可能有更广泛的应用范围,值得进一步研究。
抗体填充
抗体是由免疫系统产生的用于中和外来抗原的蛋白质家族,由于其对靶向分子的高特异性和强结合能力,特别受到关注。这些特性使它们成为治疗药物的关键类别,推动了大量的研究努力,致力于设计新的基于抗体的药物候选物。抗原结合片段(Fabs)是与抗原结合的抗体片段。它由轻链和重链的各一个恒定域和一个可变域组成。每个可变区进一步分为四个框架(FR)区域和三个互补决定区(CDRs)。虽然FR区域通常是保守的,但CDRs在氨基酸组成上表现出显著变化,通常是结合靶向抗原亲和力的主要决定因素。在为特定抗原设计新型抗体时,典型方法是探索可能产生具有高靶向抗原结合亲和力的新功能抗体的替代CDRs。
最近,已开发了几种深度学习方法用于靶向抗体设计,将CDR预测框架化为"填充"任务。这些模型使用抗原和抗体FR区域的氨基酸序列预测缺失的CDR区域,由"MASK"令牌表示。虽然先前的方法通常依赖于结构数据,但这些信息稀缺且难以获取。相比之下,我们针对靶向抗体设计任务对MAMMAL进行微调,仅使用抗原的序列数据和抗体FR区域的序列。
靶向抗体设计任务基准测试基于SAbDab数据集。遵循先前工作中的数据处理,我们过滤掉缺失CDR的样本以进行直接比较,即使MAMMAL支持包含缺失CDR的样本。与先前工作一致,我们将数据集随机划分为训练、验证和测试折叠,同时确保具有相似重链第三CDR(CDRH3)子序列的样本保留在同一折叠中。MAMMAL在所有被掩码CDR上展示了卓越的氨基酸恢复率(AAR),定义为正确预测的残基比例(表1;详细结果在补充表S4中提供)。值得注意的是,在变化最大的CDRH3区域,它表现出19%的显著改进。
T细胞受体-表位结合
T细胞受体(TCR)与主要组织相容性复合物呈递的免疫原性肽(表位)结合是适应性免疫系统中的关键机制,对抗原识别和触发免疫反应至关重要。TCR库表现出相当大的多样性,由α链和β链组成,共同使T细胞能够识别各种表位。β链尤其重要,因为它对T细胞早期发育至关重要,并具有更大的变异性,增强了TCR有效识别各种病原体的能力。然而,由于TCR序列的巨大变异性,理解TCR与表位之间的特定相互作用仍然是一个重大挑战。仅从序列数据准确预测TCR-肽结合将通过提供对患者免疫状态和疾病历史的更深入了解来推进免疫学。这种能力具有潜在的应用,包括个性化免疫治疗、早期诊断和治疗癌症和自身免疫障碍等疾病。用于模拟TCR-肽相互作用的体外工具可以促进对治疗性T细胞功效的研究并评估交叉反应风险,为精准医学提供机会。
我们使用Weber基准测试(包括47,182个TCR β链-表位对)评估了模型在仅从序列数据预测TCR-表位结合的任务上的性能。该数据集涵盖192个不同的表位,包括23,139个独特的TCR β链序列,50%的对作为阴性样本,通过随机将TCR序列与它们已知不结合的表位配对创建。该数据集还包括每个TCR β链的CDR3子序列,即该链中最具可变性的区域。我们使用10折交叉验证。折叠在先前工作中已预定义。微调涉及三个并发任务:TCR β链掩码填充和两个分类任务:(i)TCR β链-表位结合预测和(ii)TCR β链-CDR3表位结合预测。这里,我们仅报告TCR β链-表位结合预测任务的性能。我们的模型达到平均AUROC为0.879(表1),比SOTA提高了2%,这一改进在统计上是显著的,因为我们的结果落在SOTA的置信区间之外。
蛋白质-蛋白质相互作用 - ΔΔG预测
药物设计中的一个重要因素是结合亲和力,通常通过平衡解离常数KD测量,通过方程与吉布斯自由能ΔG相关:
ΔG=kT ln(KD)
其中k是玻尔兹曼常数,T是温度。
将突变引入蛋白质-蛋白质复合物的影响通常通过相对于参考(野生型)复合物的结合自由能变化来量化。这种突变诱导效应由吉布斯自由能差捕获,定义为:
ΔΔG=ΔG突变体-ΔG野生型
通过减去野生型自由能,ΔΔG隔离了突变本身的能量贡献。因此,ΔΔG提供了突变是否稳定或破坏结合的直接度量,是研究突变对蛋白质-蛋白质相互作用影响的标准目标。
SKEMPI数据集提供了在蛋白质数据银行中具有已知结构的蛋白质-蛋白质复合物突变的实验测量热力学参数变化,包括ΔG和动力学速率常数。该数据集被广泛用于评估预测突变诱导结合亲和力变化的方法,特别是ΔΔG。我们采用作为基准测试的SKEMPI子集,包含1131个单点突变(S1131)。按照惯例,我们在该子集上报告10折交叉验证性能。我们模型的输入仅包含野生型和突变复合物的氨基酸序列,没有结构信息。利用MAMMAL对连续值输出的支持,我们将ΔΔG预测公式化为回归任务。性能结果在表1中报告。我们的模型达到平均Pearson相关为0.852,大大超过了先前仅基于序列的最先进技术(0.663),并且与基于结构的方法相比仍具有竞争力,仅比报告的最佳性能0.866低1.6%。
药物-靶点相互作用
预测药物-靶点结合亲和力在药物发现的早期阶段起着关键作用。传统上,结合亲和力通过高通量筛选实验测量,虽然准确,但由于资源密集且扩展性有限,难以评估大量药物候选物。在此任务中,我们专注于使用pKD(解离常数的负对数)预测结合亲和力,反映小分子(药物)与蛋白质(靶点)之间相互作用的强度。我们利用PEER(蛋白质序列理解)基准测试进行DTI预测。该基准测试利用BindingDB数据集的数据,具有特定的测试划分,保留四个蛋白质类别——雌激素受体、G蛋白偶联受体、离子通道和受体酪氨酸激酶——以评估对未见类别的泛化性能。
对于模型微调,我们进行了超参数优化,选择初始学习率为0.0004,无dropout和无权重衰减。我们根据训练集的均值和标准差对pKD值进行标准化。对于评估,我们将预测值转换回原始比例。我们的模型达到平均NRMSE为0.906(表1),比先前工作报告的SOTA有3.8%的显著改进。
抗体-抗原结合预测
准确预测抗原-抗体结合可以增强治疗性抗体的设计和优化,从而提高疗效和特异性。我们将人表皮生长因子受体2(HER2)数据集作为预测抗体-抗原结合的基准测试。HER2是某些类型乳腺癌和胃癌的关键靶点。该数据集包括临床批准的治疗性抗体曲妥珠单抗的变体及其对HER2抗原的相应亲和力。该数据集包含8,935个结合和25,114个不结合的曲妥珠单抗CDR H3突变体,每个最多有10个突变,经过去重和移除标记为结合和不结合的样本后。
为了与SOTA进行最准确的比较,HER2数据集被划分为训练(70%)、验证(15%)和测试(15%)集。为了增加稳健性,训练集进一步分为5个折叠。报告的结果来自在不同训练折叠上训练的5个模型,并在测试集上评估。
微调涉及将目标抗原序列和整个重链可变区域作为输入,并预测与目标序列的结合。我们的模型达到平均AUROC为0.928(表1),略优于SOTA,后者结合了结构数据,而我们的模型没有。
AlphaFold 3和MAMMAL在预测抗体-抗原和纳米抗体-抗原结合方面的比较
准确预测抗体-抗原和纳米抗体-抗原相互作用对于评估治疗功效和指导蛋白质工程至关重要。虽然AlphaFold 3(AF3)并非专门设计为二元蛋白质-蛋白质相互作用(PPI)分类器,但结合可能性可以从预测的蛋白质-蛋白质复合物计算的结构衍生置信度分数(如预测的模板建模(pTM)和界面预测的模板建模(ipTM))推断。这些置信度分数源自结构预测,而非分类目标。最近的研究表明这些分数与真实结合事件相关。
因此,我们进行了AF3衍生置信度分数与微调MAMMAL模型之间的探索性比较,用于区分结合者与非结合者。我们强调,AF3提供详细的3D结构假设,而MAMMAL是仅序列模型,产生概率性结合预测;比较旨在评估结合预测的相对判别能力,而非将底层建模方法等同起来。
首先,我们评估了HER2的细胞外域(ECD),这是一个具有实验验证结合表位的特征明确的治疗性抗原。我们使用第2.9小节中描述的HER2特异性MAMMAL模型。由于AF3的计算需求和有限可用性,HER2基准测试测试集被下采样为60个示例,包括30个结合者和30个非结合者。HER2特异性MAMMAL模型表现出强大的判别性能,达到AUROC为0.88。相比之下,AF3在结合者和非结合者之间没有表现出有意义的分离(AUROC = 0.45),两种模型之间的性能差异非常显著(DeLong检验,P = 1.5 × 10^-6)。结构分析进一步揭示,AF3预测的结合位点在结合者和非结合者之间无法区分,并且偏离了FDA批准抗体曲妥珠单抗和帕妥珠单抗的已知表位(图2a)。MAMMAL(预训练和微调)和AF3的扩展比较在补充表S5中提供。这包括几种AF3置信度分数变体,使用ipTM-和pTM-基于评分,以及仅重链和重+轻链输入配置。
接下来,我们在六个结构多样的抗原靶标上评估纳米抗体结合:白蛋白、甘露糖受体(CD206)、表皮生长因子受体(EGFR)、甲状腺素结合球蛋白(TBG)、肿瘤坏死因子α(TNFα)和冯维勒布兰德因子(VWF)。结合纳米抗体从SAbDab-nano、专利和专有数据集中收集。非结合者由在噬菌体展示文库筛选中实验确认为非结合的纳米抗体以及针对无关抗原的纳米抗体组成。从总共668个纳米抗体-抗原对(131个结合者和537个非结合者)中,我们选择了475个序列(64个结合者和411个非结合者)用于MAMMAL微调,并保留193个序列(67个结合者和126个非结合者)用于保留评估。单个MAMMAL模型在包括所有靶标上的结合者和非结合者的训练数据上进行微调,随后在对应于每个靶标的测试子集上分别评估,性能与在相同样本上计算的AF3置信度分数进行比较。测试集统计和每个靶标的MAMMAL和AF3性能在表2中总结。MAMMAL和AF2的其他性能指标在补充表S6–S7中提供。如图所示,MAMMAL在较大的靶标上显著优于AF3:白蛋白、CD206、EGFR和VWF。相比之下,AF3在较小的TBG靶标上表现更好,预测结构的分析揭示了结合者和非结合者之间不同的结合位点(图2b和补充图S4)。对于最小的蛋白质TNFα,两种模型表现出可比的性能。
讨论
生物医学基础模型的最新进展已在细胞和分子生物学中实现了实质性的但主要是领域特定的进展。专业模型类别——包括基于RNA表达的模型、蛋白质语言模型和用于小分子-蛋白质相互作用建模的框架——提供了对生物系统的越来越详细的表示。这些努力共同表明了集成框架(如提议的AI赋能的"虚拟细胞")的可行性。然而,实现这一愿景需要能够在可扩展和统一表示中一致地对齐异质生物模态的方法。
MAMMAL通过将各种生物任务重新构建为序列到序列问题并引入针对药物发现应用的设计选择,推进了这一目标。其多领域语法和可扩展的分词器允许异质生物输入和输出在一个共享的序列表示中表达。数值值集成的实现保留了定量精度,避免了离散化通常导致的信息损失,促进了生物化学和药理学测量的整合。MAMMAL还支持编码器仅和编码器-解码器配置,提供了架构灵活性,以解决药物发现流程中遇到的广泛预测和生成任务。在多个领域和阶段上微调模型的强性能突显了这一统一框架在已建立的体外基准测试中的实际效用。
除了基准测试评估,MAMMAL还在真实环境中进行了评估,其中它准确预测了四种药物(包括Carfilzomib,一种仅获准用于血液恶性肿瘤的蛋白酶体抑制剂)在实体瘤细胞系中的相对效力排序。使用与GDSC相同的CellTiter-Glo测定协议进行湿实验室验证确认了预测排序。这一结果展示了该模型推广到新化合物和识别可能用于超出当前批准适应症的再利用药物的能力。同时,MAMMAL已被用于与学术和行业合作者的联合研究,包括一项支持其预测抗流感血凝素蛋白抗体活性能力的已发表研究。目前正在进行涉及MAMMAL指导预测的前瞻性湿实验室验证的其他合作研究,进一步在多样化的生物和治疗环境中评估该框架。
我们还评估了MAMMAL用于抗体结合者与非结合者识别,并将其与AlphaFold 3(AF3)进行了比较,后者最近被探索为通过预测界面估计结合可能性的代理。微调MAMMAL在七个抗原中的六个抗原上实现了稳健的判别性能——包括灵活、糖基化和多域靶标,如CD206、EGFR、HER2、白蛋白和VWF——AUROC范围从0.83到1.00。相比之下,以零样本方式应用的AF3对大多数靶标表现出有限的区分结合者与非结合者的能力(AUROC ≤ 0.59),仅在刚性球状抗原TBG上表现良好,并在TNFα上与MAMMAL匹配。这些限制可能反映了AF3对真实阳性PDB复合物的偏见,缺乏明确的负面监督,以及对单一静态构象的依赖。因此,AF3在包含异质或内在无序区域(IDRs)的蛋白质上表现不佳,这些区域约占人类蛋白质组的30-40%,已知对基于结构的模型构成挑战,包括IDR丰富的治疗靶标,如EGFR和HER2。相比之下,蛋白质语言模型(PLMs)如MAMMAL更好地捕获IDRs的统计特性,与观察到的PLM方法在IDR相关基准测试上表现良好的观察一致。这些因素共同可能导致MAMMAL在跨治疗相关靶标进行结合者识别时的改进稳健性。
基于文本的大型语言模型在理解和推理人类语言方面表现出色,并通过在PubMed摘要和全文文章上进行预训练而适应生物医学领域。然而,这些模型主要在非结构化文本上运行,不明确表示结构化生物模态。在与BioMedLM的比较中,MAMMAL在涉及蛋白质和基因表达数据的任务上优于仅文本模型,突显了语言仅预训练对位于自然语言之外的生物数据(如蛋白质序列和基因表达测量)的局限性。除了基于文本的LLM外,先前的工作包括图神经网络,它们对分子、蛋白质和生物系统拓扑进行编码,并可以直接表示知识图。虽然基于序列的表示可以隐式捕获三维结构的某些方面,但显式建模3D信息可以进一步提高性能,激励输入或生成结构表示的序列模型。最近,扩散模型已成为在连续原子坐标空间中直接建模分子和蛋白质的强大方法。相比之下,MAMMAL采用了解耦任务定义与架构设计的统一序列到序列抽象。一个关键的开放挑战是如何将这种简单性和灵活性与专用模型(特别是擅长高保真结构生成的扩散架构)的表现力结合起来。
代理工作流程的日益采用——利用LLM和专用代理来自动化和加速发现过程——标志着生物医学研究实践的更广泛转变。微调MAMMAL模型自然地融入这一范式,提供模块化、任务特定的组件,支持可扩展和高效的发现工作流程。生物医学模型之间的公平和有意义的比较需要具有可访问数据集、可重现数据划分和明确评估协议的基准测试。虽然我们使用的基准测试满足这些标准并涵盖药物发现流程的多个阶段,但我们的评估限于那些公开报告这些任务结果的模型,因此最先进技术性能的声明应在这一范围内解释。继续开发开放基准测试和模型对于推进稳健和可泛化的药物发现方法至关重要。我们邀请社区在此基准测试套件下评估他们自己的模型,并在新数据集和任务上探索MAMMAL。
方法
MAMMAL架构
MAMMAL架构基于Vaswani等人引入的Transformer架构,并从T5框架中汲取灵感,同时在其基础上引入了几个关键修改。这种设计将任务概念化为统一模型内的序列到序列问题,引入了三个关键特征:
- 针对表示和生成任务优化:用于药物发现的生物医学模型必须执行多种任务,从令牌级或提示级表示到需要强大生成能力的任务。MAMMAL旨在联合优化这些多样化任务,使模型能够从药物发现流程的多个阶段学习。这种集体学习由共享编码器促进,该编码器弥合了药物发现中不同AI应用之间的差距。具体来说,MAMMAL支持编码器仅和编码器-解码器自回归模式。编码器仅模式擅长表示密集任务,如分类和回归,而编码器-解码器模式更适合生成任务。通过在这两种模式之间共享编码器堆栈权重,MAMMAL促进了高效的多任务训练,参数更新通过梯度累积在所有任务上进行。
- 灵活的多领域结构化提示:药物发现任务通常需要描述由多个实体组成的分子复合物的提示。这些提示可能还包括与整个复合物或特定内部实体相关的属性,以提高预测准确性。为了解决这个问题,MAMMAL采用了模块化分词器,通过为每个实体类型分配不同的子分词器来实现多领域结构化提示。与自由文本提示相比,结构化提示提供了一致且明确的输入数据表示,捕获实体之间的关系和属性,并促进训练。虽然MAMMAL主要关注结构化输入,但将自由文本作为额外数据源纳入代表了一个自然的扩展。
- 数值值集成:MAMMAL的一个显著创新是它对数值值(例如2、3.14、10,000.1)作为输入和输出的原生支持。数值数据对于建模药物发现任务至关重要,并允许直接表示重要属性。这种能力扩展了MAMMAL可以处理的任务范围,例如结合亲和力预测和蛋白质折叠。许多生物医学大型语言模型要么缺乏对数值数据的支持,要么采用有限的解决方案(如分箱)或依赖基于数字的表示,这可能会使输入长度膨胀。MAMMAL通过投影层将连续数值值直接集成到其嵌入空间中。所得嵌入与输入令牌嵌入对齐,确保数值数据的简单、高效和有效利用。
实体表示
MAMMAL支持的每个实体领域都使用了以下选定的表示方法:
- 小分子:使用SMILES序列(简化分子线性输入系统)表示。例如,对乙酰氨基酚表示为CC(=O)NC1=CC=C(O)C=C1。
- 基因表达:表示为基因名称的有序列表,按对数归一化和分箱表达值的降序排序。在平局情况下,基因按字母顺序排序。这种表示适用于单细胞和批量RNA表达数据。
- 蛋白质:表示为串联的氨基酸链,保留原始源数据顺序。此表示仅包含序列数据,无结构信息。
- 抗体:表示方式与蛋白质类似,使用串联的氨基酸序列。每条链前缀有一个表示其类型(重链或轻链)的令牌。
提示语法
提示语法围绕模块化分词器架构构建,该架构规定了分子数据的解释和编码方式。在其核心,分词器定义了一个使用特殊标签的通用语法,这些标签代表分子实体、序列、属性和跨越不同分子系统的相互作用。它通过将输入序列的不同部分委托给专门的子分词器来支持多领域输入,每个子分词器负责处理特定的数据类型或模态。
所有子分词器在主分词器的伞下运行,并共享对一组特殊令牌的访问,例如〈EOS〉,确保跨域的一致性。在这些子分词器中,指定的数字子分词器用于处理连续值。与将数值值标记化为离散令牌不同,此子分词器通过学习的投影层直接将它们投影到模型的嵌入空间中。
提示语法统一应用于模型的输入和输出。它还被设计为可扩展的:新的标签可以引入到各个子分词器或添加到共享令牌集中,而不会破坏现有功能。得益于这种模块化结构,对特定领域子分词器或令牌词汇的更新保持向后兼容性,确保新训练和先前部署的模型之间的互操作性。
预训练
MAMMAL被设计为一个全面的基础模型,能够跨越多个领域并容纳各种实体。它旨在支持从表示聚焦到生成聚焦的各种任务类型。为实现这一目标,MAMMAL在多个任务上同时训练。预训练在来自六个数据集的20亿个样本上进行,所有这些数据集都是公开可用的,涵盖三个不同领域内的七个任务。表3总结了这些任务,详细说明了相关领域、实体类型和特定数据集。预训练的更多细节在补充信息中提供。
数据可用性
本研究中使用的所有数据集均可公开获取。
- 细胞类型:Zheng68k数据集从10x Genomics网站获取。
- BBBP和ClinTox:基准测试从GitHub获取,指向IBM提供的数据。
- 癌症-药物反应1和2:GDSC1和GDSC2基准测试通过TDC库获取。
- 癌症-药物反应3:基准测试从DeepCDR的GitHub仓库获取。
- DTI:此基准测试由先前工作发布,可在TorchDrug网站获取。
- Ab Infilling:此数据取自先前工作,提供了公开可用的SAbDab数据库的预处理子集。
- PPI ΔΔG:SKEMPI S1131数据集从BindProfX网站获取。
- TCR Bind:Weber TCR结合数据集从TDC网站获取。
- Antibody-Antigen Bind:HER2抗体-抗原结合数据集从原始论文的GitHub仓库获取。
- 预训练:ibm/biomed.omics.bl.sm.ma-ted-458m在OAS、UniProt、Zinc、PubChem、STRING和CELLxGENE上进行了预训练。补充信息描述了应用的预处理步骤。
代码可用性
模型架构、微调框架和端到端示例在GitHub上公开提供。该GitHub仓库提供了与模型一起工作的全面资源,包括设置说明、微调指南和多种下游任务的推理工作流程。预训练模型权重和相关分词器托管在Hugging Face模型中心,可通过指定链接获取。此外,选定的微调模型检查点和分词器可通过特定URL获取,并可通过Hugging Face Space交互式探索。
【全文结束】

