人工智能与机器学习技术驱动的现代药物发现与开发Artificial Intelligence and Machine Learning Technology Driven Modern Drug Discovery and Development

环球医讯 / AI与医疗健康来源:www.mdpi.com印度 - 英语2026-09-09 09:11:38 - 阅读时长22分钟 - 10907字
本文全面综述了人工智能(AI)和机器学习(ML)技术,特别是深度学习(DL)在药物发现与开发各阶段的应用,包括靶点识别、虚拟筛选、先导化合物优化、ADME/T预测、化学合成规划等,并讨论了AI在制药产品生命周期、临床试验、市场分析中的作用,以及当前面临的挑战和未来前景。AI有望显著缩短研发周期、降低成本,但需解决数据整合、技能短缺等问题。
人工智能机器学习药物发现健康深度学习蛋白质药物靶点虚拟筛选药物再利用毒性预测
人工智能与机器学习技术驱动的现代药物发现与开发

药物的发现和进步可以被视为最终相关的转化科学努力,它增加了人类的脆弱性和幸福感。但推进一种新药是一个非常复杂、昂贵且漫长的过程,通常花费约26亿美元,平均耗时12年。削减开支和加快新药发现的方法促使制药行业进行了艰苦而引人注目的头脑风暴。人工智能(AI),特别是深度学习(DL)组件的参与,得益于分类大数据、显著增强的计算能力和云存储在所有领域的应用。AI已经为计算机辅助药物发现注入了活力。机器学习(ML),尤其是DL,在许多科学专业中的不受限制的采用,以及计算硬件和软件的技术改进,加上问题的各个方面,维持了这一进展。ML算法已广泛用于计算机辅助药物发现。DL方法,例如包含多个隐藏处理层的人工神经网络(ANN),最近由于其能够从输入数据中自动提取特征,以及获得非线性输入输出相关性的能力而复兴。DL方法的这些特征增强了依赖于人工设计的分子描述符的传统ML技术。早期关于AI在药物发现中实用性的犹豫大部分已经开始消融,从而推进了药物化学。AI结合现代实验技术知识,预计将以前所未有的迅速、经济且引人注目的方式激发对新药和改进药物的追求。DL辅助方法刚刚开始启动一些药物发现中的关键问题。许多技术进步,如“消息传递范式”、“空间对称保持网络”、“混合从头设计”和其他巧妙的ML范例,必将变得普遍广泛,并有助于剖析许多最大、最有趣的问题。开放数据分配和模型增强将在利用AI的药物发现进步中发挥决定性作用。本综述将讨论AI的即将到来的应用,以改进和加强药物发现操作。

  1. 引言

药物的研究和开发过程包括药物靶点识别、靶点验证、命中到先导化合物的转化、先导化合物优化、临床前分子确定、临床前评估以及临床试验。将一种新处方药推向市场,平均税前支出近26亿美元,需要大约10至15年。然而,考虑到巨大的财务风险,在药物发现和开发过程中,新药分子的预测临床批准实现频率仅为13%,且最终失败的可能性相当高。计算机辅助药物设计技术的进步已被誉为改变这种暗淡前景的最有资源的方法,它依赖于开发过程中的谨慎导航。药物发现的方法论以及相关的计算机辅助药物设计方法可以在专著“计算机辅助药物设计”中找到。计算方法确保在推测水平上系统评估分子属性(如物理化学性质、选择性、副作用、生物活性和药代动力学参数),同时生成具有令人满意属性的优化分子。此外,具有多目标优化的计算方法可用于降低临床前先导分子的失败频率。在药物设计视角下,AI(人工智能)调用使用计算机软件程序,评估、学习和揭示制药相关的大数据,以揭示新的药物分子,通过以高度统一和机械化的方式整合机器学习(ML)的进展。源于ML方案的进步以及化学和药理学信息的增长,AI范式已在药物设计领域为数据驱动的计算过程开辟了一席之地。与传统方法相比,ML辅助方法作为AI的一个分支,并不依赖于复杂且已建立的物理化学原理的理论进展,而是更加强调将庞大的生物医学大数据转化为新的启示和可持续的专业知识。与ML同义的典型算法包括:逻辑回归(LR)、朴素贝叶斯分类(NBC)、k最近邻(KNN)、多元线性回归(MLR)、支持向量机(SVM)、概率神经网络(PNN)、二元核判别(BKD)、线性判别分析(LDA)、随机森林(RF)、人工神经网络(ANN)、偏最小二乘法(PLS)、主成分分析(PCA)等。当今,AI技术,特别是深度学习(DL)范式,在药物设计中展现出巨大的潜力,因为其令人印象深刻的泛化能力和特征提取能力。传统的ML方法使用手动设计的属性,而DL方法可以以自动化方式从输入信息中学习特征,通过多层属性提取,将简单属性重组为复杂特征。此外,DL方法通常比传统ML技术表现出更少的泛化误差,这有助于它们在某些标准或竞争性评估上获得更有益的输出。例如,George Dahl的团队通过实施AI技术,特别是DL算法,赢得了默克分子活性挑战赛。由于上述便利,DL技术作为一种数据挖掘方法在药物设计领域显示出巨大的前景。DL范式通常包括深度神经网络(DNN)、卷积神经网络(CNN)、循环神经网络(RNN)、自编码器和受限玻尔兹曼机(RBM)。DL算法的简要评论可以在其他地方找到,更全面的DL方法论介绍在专著“深度学习”中。本综述向读者介绍与药物设计领域相关的AI模型,并特别关注DL算法在新药发现和开发中的实施。药物发现、药物设计主题和AI方法总结在Figure 2和Figure 3中。此外,本综述还介绍了与药物设计方案相关的ML蓝图,包括分子描述的方法、低数据迁移学习、交叉验证策略以及训练深度神经网络(DNN)的技巧。最后,本综述总结了AI在药物设计领域的应用,并提供了AI在药物发现和进展中前景的未来展望。

1.1. 人工智能:值得思考的事实

过去几年,制药领域的数据数字化急剧增加。但这种数字化是为了响应积累、调查和利用该专业知识剖析复杂临床问题的需求。这鼓励了AI的使用,因为它可以处理大量数据并增强自动化。AI采用了一种技术驱动的方法,调用多种尖端工具和网络模拟人类智能。同时,它不会引起取代人类身体存在的恐惧。AI利用能够解释输入数据,然后通过输入数据训练以实现自主结果来达到特定目标的软件和系统。正如本综述所指出,其在制药领域的使用已逐步增加。根据麦肯锡全球研究所,AI导向自动化的快速进展可能会彻底改变社会工作文化。

1.2. AI:网络和工具

AI涉及多种方法领域,如知识描述、解决方案探索、推理,而AI本身是ML的一个公理范例。ML利用能够检测数据集群中趋势的算法逻辑,这些数据可以进一步分类。ML的一个实体是深度学习(DL),它调用人工神经网络(ANN)。这些网络包括一组相互通信的精细计算组件,使用“感知器”,类似于人类神经组织中的神经元,模拟人类中枢神经系统中电兴奋的传递。ANN由一组节点组成,每个节点接受一个不同的输入,最终将输入转换为输出,可以是单链接或多链接,利用算法解码问题。ANN包括多种类型,如多层感知器(MLP)网络、循环神经网络(RNN)和卷积神经网络(CNN),使用监督或无监督训练操作。此类MLP网络具有模式检测、优化设施、过程确定和控制等用途,通常使用单向监督训练算法训练,并可用作通用模式分类器(UPC)。RNN是具有闭环的网络系统,具有存储和存储数据的能力,如玻尔兹曼常数和Hopfield网络。CNN是一组动态机制,利用局部连接,每个由其拓扑结构决定,在图像和视频信号处理、生物系统模拟、处理复杂中枢神经元活动、模式识别和精细信号处理中具有用途。高度复杂的方案包括Kohonen网络、径向基函数(RBF)网络、学习向量量化(LVQ)网络、反向传播网络(CPN)和自适应线性神经元或后来的自适应线性元素(ADALINE)网络。基于AI的方法领域实例在Figure 2中描述。根据构成AI范式基本框架的互连,已经设计了各种算法。这种采用AI方案的先进工具的一个实例是IBM的Watson超级计算机。该计算基础设施旨在支持对患者临床数据及其与

1.2. AI:网络和工具(续)

这种计算基础设施旨在支持对患者临床数据及其与巨大数据库间相互关系的审查,最终确定癌症的干预方式。该设施还可用于疾病的快速揭示。其效用通过其在60秒内识别乳腺癌的能力得到证实。

  1. 人工智能在药物设计中的未来应用

药物设计和开发是制药公司和化学科学家的一个重要研究领域。一个分子要具有成为药物靶点的潜力,必须是“可成药的”。在后基因组时代,药物发现已转向将新的设计原理应用于分子,或采用新的策略来结合、调节或降解具有挑战性的生物靶点,以开发未来的创新药物。传统上,制药行业一直专注于开发具有已知靶点(可成药靶点)的口服生物可利用小分子。基于II期药物的物理化学特征,1997年提出了利平斯基五规则(Ro5)。Ro5预测,当氢键供体超过5个、氢键受体超过10个、分子量大于500道尔顿且计算所得LogP大于5时,药物更可能出现较差的吸收或渗透。自那以后,Ro5一直作为在药物发现过程中设计可开发分子的指南。尽管发现与已建立的“可成药”靶点相互作用的小分子Ro5化合物的努力卓有成效,但对创新以开发转化性药物的需求日益增长。因此,识别和验证新型生物靶点已成为药物发现早期阶段的关键焦点。超越Ro5的分子模式,通过非传统作用模式的小分子包括双功能Ro5小分子、肽/拟肽和寡核苷酸。基于碳水化合物的药物发现是药物化学中一个新兴的研究领域。生物活性碳水化合物为药物开发开辟了新的来源。已有超过170种基于碳水化合物的药物成功获批,用作抗凝血剂、抗肿瘤剂、抗糖尿病剂、抗生素、抗病毒剂和疫苗。然而,大多数碳水化合物可成药性低。迫切需要提高碳水化合物可成药性的新方法和策略。脂质对生命至关重要。它们储存能量,构成细胞膜,充当信号分子,并修饰蛋白质。在脂质研究的漫长历史中,许多针对脂质受体和负责脂质代谢和功能的酶的药物已被开发并应用于多种疾病。脂质信号通路和脂质信号蛋白提供了广泛的成药靶点。然而,已获批药物的绝大多数靶点是蛋白质。一个可成药的蛋白质是拥有有利于与小分子药物样分子(无论是内源性还是外源性)相互作用的折叠的蛋白质,因此它包含一个结合位点。这些结合位点应具有某些属性,能够实现与药物样分子的高亲和力位点特异性结合。与所有药物靶点一样,一个潜在的蛋白质药物靶点必须与疾病过程相关联。目前,对于现代药物作用的蛋白质数量以及潜在可成药蛋白质的数量都缺乏了解。开发高效、先进的系统,以最大效率和最小风险靶向递送治疗剂,给化学和生物科学家带来了巨大挑战。全球的研究人员采用传统的计算方法,如虚拟筛选和分子对接,来识别和表征蛋白质-蛋白质以及药物-蛋白质相互作用。但这些方法不精确、不准确。此外,来自基因组学、蛋白质组学、微阵列数据和临床试验的复杂大数据也给药物发现管线带来了障碍。人工智能和机器学习技术是创新方法,在药物发现和开发中发挥着关键作用。本综述的这一部分提供了关于人工神经网络(ANN)和深度学习(DL)算法如何现代化阐明蛋白质结构和功能、揭示命中化合物、命中化合物到先导化合物优化算法方案以及ADME/T性质计算机评估的技术的关键见解。ML和DL算法已在多个药物发现过程中得到实施,例如肽合成、基于结构的虚拟筛选、基于配体的虚拟筛选、毒性预测、药物监测和释放、药效团建模、定量构效关系、药物重定位、多药理学和物理化学活性。过去的证据加强了AI和DL在该领域的实施。此外,新颖的数据挖掘、整理和管理技术为最近开发的建模算法提供了关键支持。总之,AI和DL的进步为合理的药物设计和发现过程提供了绝佳的机会,这个过程最终将影响人类。

2.1. 蛋白质的结构和功能

2.1.1. 从序列预测蛋白质折叠(预测目标蛋白质的3D结构)

大多数疾病与功能失调的蛋白质有关。通过审查蛋白质结构,可以采用基于结构的药物设计方案来为目标蛋白产生活性小分子化合物。但计算蛋白质的三维(3D)结构目前需要大量的时间和资金,因此编写软件代码来预测蛋白质的3D结构是有益的。尽管几乎所有蛋白质的序列数据都是可访问的,但仍然无法精确地从头预测它们的3D结构。最近,由于令人印象深刻的属性提取能力,DL方法继续被用于预测二级结构、骨架扭转角和残基接触。例如,能够融合一维(1D)和二维(2D)的DL方法“组合神经网络(CNN)”来预测残基接触,在“第12届蛋白质结构预测技术关键评估社区广泛实验(CASP12)”中击败了其他方法。DL的架构可以通过属性提取完美地学习序列和结构之间的联系。目前,准确预测蛋白质的3D结构仍然是一个未实现的目标。因此,DL方法在推进该领域的发展方面显示出巨大的潜力。

2.1.2. 预测蛋白质-蛋白质相互作用

蛋白质-蛋白质相互作用(PPI)对各种生物系统至关重要,可能与许多疾病有关。一个PPI数据库,即“检索相互作用基因/蛋白质的搜索工具(STRING)”数据库,存储了通过文献整理从实验和生物信息学方案导入的近14亿个PPI。此外,STRING还存储了从以下方面收集的计算预测相互作用:

  • 科学文献的文本挖掘,
  • 从基因组属性估计的相互作用,以及
  • 从模式生物传递的相互作用,取决于同源性。

所有估计/导入的相互作用都根据“京都基因与基因组百科全书(KEGG)”评论的功能关联的共同参考进行衡量。

PPI界面被表示为由多个残基组成的蛋白质-蛋白质关联位点。它有潜力引领一组新的药物靶点,这些靶点与传统药物靶点如离子通道、G蛋白偶联受体(GPCR)、激酶和核受体形成对比。例如,在PPI抑制剂数据库(iPPI-DB)中记录了18个PPI家族中的1756种非肽抑制剂。作为一个新的靶点组,PPI将扩展靶点空间并促进小分子化合物的开发。与传统方法相比,靶向PPI可能会减少不良反应,因为它增强了调节作用的生物特异性。例如,化合物DC_AC50可以通过与铜转移机制结合来阻断细胞内铜离子的移动,并有选择性地抑制肿瘤细胞增殖,而不影响正常体细胞活力。

为了实现基于蛋白质-蛋白质复合物结构的药物设计概念,必须审查PPI界面。遗憾的是,在很多情况下,精确的PPI信息是稀缺的,从而产生了许多预测PPI界面的计算方案。基于模板的方法简单且高度可靠,因为PPI接口的属性得以保留。例如,“eFindSite”,一个用于PPI界面预测的Web服务器,利用模板依赖、残基依赖和序列依赖的决定因素来促进“支持向量机(SVM)”和“朴素贝叶斯分类器(NBC)”范式。根据互补性原理,当两个相互作用蛋白质的结构可用时,可以利用蛋白质-蛋白质对接过程来预测PPI界面。在这些方法中,棘手的问题是如何预测两个无关联蛋白质相互结合时的构象变化。DL方法可以提取最相关的序列属性来预测PPI界面,这体现了与其他ML技术如SVM相比的显著改进。

考虑到界面可观的埋藏表面积区域,寻找界面上的可成药位点或区域是必要的。可检测的热点可能代表可成药的位点,因为它提供了大量的结合自由能。“片段对接和直接耦合分析(FD-DCA)”已被用于识别可成药的PPI位点。研究人员最初设计了一个名为“iFitDock”的片段对接软件包,可用于寻找位于PPI界面中的可成药热点。随后,小热点被捆绑起来以建立候选结合位点。最终,依赖于进化保守水平的评分函数被用于识别优化的蛋白质-蛋白质结合位点。总的来说,位于PPI界面中的热点已成为有希望的药物靶点,值得开发计算途径来确定热点并设计针对PPI界面的小分子调节剂。

2.1.3. 预测药物-蛋白质相互作用

药物-蛋白质相互作用(DPI)在治疗实体的成功中起着至关重要的作用。预测药物-受体或药物-蛋白质关联对于理解其有效性和成功、实现药物再利用以及防止多药理学是必要的。许多AI方法在精确预测配体-蛋白质相互作用方面卓有成效,确保了增强的治疗效果。已经报道了一种利用SVM方法的模型描述,该模型基于约15,000种蛋白质-配体相互作用进行训练,这些相互作用基于主要蛋白质序列和小化合物的结构特征,以识别九种新分子及其与四个关键靶标的相互作用。

一个研究小组利用两种RF范式来预测可能的DPI,这归因于药理学和化学信息的融合,并针对熟悉的算法(如SVM)进行了验证,具有高灵敏度和特异性。此外,此类方法能够预测药物-靶标相互作用,这可以进一步扩展到捕获靶标-疾病以及靶标-靶标相互作用,从而加速药物发现机制。也有文献报道采用“合成少数过采样技术(SMOST)”和“邻域清理规则(NCR)”来收集精炼数据,用于后续的iDrugTarget开发。这是一个四个子预测器(iDrug-Chl, iDrug-Enz, iDrug-GPCR, 和 iDrug-NR)的合并,用于分别确定药物与离子通道、酶、G蛋白偶联受体(GPCR)和核受体(NR)之间的关联。通过与现有预测器的靶标-刀切法测试进行相关性分析,前者在预测精度和一致性方面均优于后者。

AI预测药物-靶标关联的能力也已被用于促进现有药物的再利用和避免多药理学。再利用一种已有药物,使其可以直接进入II期临床试验。此类策略削减了财务支出,因为重新引入一种已有药物花费约840万美元,而引入一种新药实体则花费约4130万美元。“关联性内疚”方法可用于预测药物与疾病之间的创新性相互作用,这是一种基于知识或计算引导的交互网络。对于计算驱动的网络,ML方法被广泛使用,它采用如SVM、NN、逻辑回归以及DL等方法。基于逻辑回归的算法,如“PREDICT”、“SPACE”以及其他ML技术,在药物再利用时会考虑疾病与疾病、药物与药物之间的相似性、目标化合物的可比性、化学结构以及基因表达概况。

细胞网络引导的DL技术(“deepDTnet”)已被审查用于预测拓扑替康的治疗效用,该药目前用作拓扑异构酶阻断剂。它还可以通过阻断人维甲酸受体相关孤儿受体γt(ROR-γt)来治疗多发性硬化症。该软件包目前受一项临时美国专利保护。自组织映射(SOM)是ML的无监督细分,并用于药物再利用。SOM采用配体依赖性途径,通过训练算法处理指定数量的具有感知生物活性的分子,来确定一组药物化合物的新脱靶点,该算法随后用于调查各种药物。在现代实践中,深度神经网络(DNN)已被用于重新利用已上市的具有抗流感病毒、SARS-CoV、HIV活性的药物,以及恰好是3C样蛋白酶阻断剂的药物。为此,考虑了扩展连通性指纹(ECFP)、功能类指纹(FCFP)和Ghose-Crippen辛醇-水分配系数(ALogP)来训练AI算法。根据结果,确定了13个筛选出的分子可根据其细胞毒性和病毒阻断活性进行进一步开发。

药物-蛋白质关联也可以预测多药理学发生的可能性,即一种药物化合物与多种受体结合导致脱靶不良反应的倾向。AI可以基于多药理学原理设计新化合物,并促进更安全药物化合物的开发。像SOM这样的AI算法,结合可访问的巨大数据库,可用于将多个分子与许多靶点和脱靶点连接起来。贝叶斯分类器和Schoof-Elkies-Atkin(SEA)算法可用于提供药物药理学属性与其可行靶点之间的联系。

一个研究小组确定了“KinomeX”的效用,这是一个AI驱动的在线算法工具,利用DNN根据其化学结构识别激酶的多药理学。该软件包使用DNN,该DNN使用从超过300种激酶中优化出来的约14,000个生物活性数据点进行训练。因此,这在分析药物对激酶家族和特定激酶亚家族的整体特异性方面具有实际意义,从而有助于设计新的化学改构体。该研究小组使用NVP-BHG712作为原型分子来预测其主要靶点及其脱靶点,并具有合理的精度。一个明显的例子是Cyclica的基于云的蛋白质组筛选AI方案,名为“Ligand Express”。它可用于识别可以与特定小化合物(其分子属性包含在SMILE字符串中)结合的受体,并产生在靶和脱靶关联。这有助于理解药物分子的可能不良反应。

2.1.4. 从头药物设计

在过去几年中,从头药物设计方法已被广泛用于设计药物化合物。传统的从头药物设计方法已被新兴的DL范式所取代,前者存在合成途径复杂和预测创新化合物生物效应麻烦的缺点。计算机引导的化合物设计也可以提供数百万种可以产生的化学结构,并预测它们的多种可变途径。

“Chematica程序”的起源和进步,现在更名为“Synthia”,有能力将一组公理编码到机器中,并针对八个药物学上不可或缺的靶点提出可行的合成途径。从提高产量和削减支出的角度来看,Synthia已证实了其效率。该程序非常适合为专利产品提供替代合成蓝图,并被认为在产生尚未被制成的分子方面是有益的。从类似的角度来看,DNN强调有机化学的规则以及逆合成,在“蒙特卡洛树搜索(MTCS)”和符号AI的帮助下,辅助反应预测以及药物设计和解析的机制,这比传统方法要灵活得多。

一个研究小组完善了一个框架,在该框架中,一个刚性的正向反应蓝图被应用于一组反应物,以产生具有令人信服反应速率的化学上可行的产物。ML被用来根据NNs提供的分数分析主要产物。一个基于强化学习(RL)的DNN框架,称为“强化对抗神经计算机(RANC)”,被用于小有机分子的从头设计。该系统使用以SMILES字符串表征的化合物进行训练。然后,它产生了具有预定化学描述符(关于MW, logP, 和拓扑极表面积(TPSA))的化合物。RANC针对另一个不同的平台ORGANIC进行了测试,其中RANC在产生独特结构方面表现更好,且没有显著衰减其结构的长度。

RNN也依赖于“长短期记忆(LSTM)”,与从ChEMBL数据库收集并以SMILES字符串形式引入的化合物相关联。该模型被用于为虚拟筛选(VS)产生多样化的化合物库。该方法旨在为特定靶点寻求创新化合物,如5-HT2A受体、金黄色葡萄球菌以及恶性疟原虫靶点。

已有文献记载了用于从头药物合成的强化学习结构进化(RLSE)程序,该程序通过利用生成性和预测性DNN来进化新分子。为此,生成范式提供了更多基于堆栈内存的SMILE字符串的独家分子,而预测方法则用于预测所产生分子的属性。目前正在努力利用生成式AI范式来设计类视黄醇X和PPAR激动剂化合物,这些化合物具有预期的治疗效果,而无需令人困惑的调节。已经成功产生了五种分子,其中四种在细胞测定中显示出令人信服的调节作用,因此强调了生成式AI在新化合物产生中的效用。AI在化合物从头建模中的表现对制药行业可能是有益的,因为它具有多种好处,例如为在线学习和同时优化先前学习的数据提供条件,为化合物提出可行的合成途径,从而带来快速的先导构想和进展。

2.2. 命中化合物发现

2.2.1. 药物再利用

药物再利用,也称为药物重定位,被解释为识别已批准药物创新性治疗应用的方法,这可以缩短药物开发的时间和风险。药物再利用是可行的,因为许多药物可能具有多个靶点,并且这些靶点可能引发其多种作用,这体现了药物-疾病关联的高度异质性。例如,已被批准用于治疗2型糖尿病的二甲双胍,可能会延长寿命。

药物和疾病是与药物再利用相关的两个基本组成部分。其他辅助方面也与药物再利用相关,如药物的靶点和疾病的基因。由于关联的多样性,网络分析可用于描绘这些方面之间的关系。出于药物设计的目的,存在九种有意义的网络类型:基因调控、代谢、蛋白质-蛋白质、药物-靶点、药物-药物、药物-疾病、靶点-疾病、药物-不良反应和疾病-疾病网络。网络依赖方案的基本假设是,类似的药物通常具有可比较的靶点或活性。单例网络中包含的数据是受限且部分的,因此合并多个网络以生成用于重定位一种药物的联合网络是必要的。具体来说,将药物再利用与药物靶点预测结合起来至关重要,因为靶点可以被视为从药物到疾病的连接。DTINet,一种通过网络扩散算法和降维方法协调多个网络信息的多样化网络,用于预测新的靶点和治疗领域。例如,这种方法提出阿仑膦酸钠、氯丙酰胺和替米沙坦可能具有新的环加氧酶阻断作用。这些活性随后通过评估促炎成分的产生得到了实验证实,因此这三种分子为预防炎症提供了高保真度的命中化合物。

2.2.2. 虚拟筛选(VS)

虚拟筛选意味着应用算法和软件从内部化合物集或商业化学库中识别生物活性分子(命中化合物),这提供了一种高效的方案来揭示新颖的命中化合物,并在药物开发的早期阶段剔除具有不利骨架的分子。虚拟筛选方法包括基于对接、基于药效团、相似性搜索和ML方案。广义上讲,这些方法可以分为两种类型的虚拟筛选:基于结构和基于配体。当目标蛋白的3D结构可用时,分子对接已被广泛应用。尽管已经建立了许多成功实施对接辅助虚拟筛选的例子,但该技术仍存在明显的缺点。例如,对接的评分函数由于不完全考虑溶剂化和熵的方面,无法精确预测结合亲和力,而蛋白质的柔性使问题更加复杂。此外,由于大多数对接方法只考虑结合亲和力,而忽略了其他参数,如驻留时间,因此对接分数不是药物效力的最佳指标,并且对接相关VS的假阳性率很高。

与对接相关的虚拟筛选方案相反,基于配体的虚拟筛选方法不依赖于3D蛋白质结构数据。它们试图将分子属性(描述符)与生物活性类别相关联。在这种情况下,ML算法如SVM已经常用于虚拟筛选,这已显示出显著的成功率(预测已知命中化合物的比率)并同时降低了假阳性命中率(预测命中中的假阳性)。最近,由于其令人难以置信的分类能力、强大的特征提取能力和小的泛化误差,DL方法已在VS中进行了测试。例如,通用数据库中活性部位的稀少存在通常会消耗VS中大量的搜索时间。为了解决这一障碍,基于自然语言与简化分子输入线性输入规范(SMILES)之间相似性的LSTM网络方案被实施,以产生目标分子库,其中包含与训练化合物可比较的化合物。由循环神经网络(RNN)产生的新分子库可以用ML算法如深度神经网络(DNN)和梯度`

2.2.3. 活动评分

如前所述,分子对接的一个基本属性就是评分函数,它被设计用来评估药物样分子对相关靶点的结合倾向。由于强大的非线性映射能力,ML相关的评分通过有效提取多种属性(如几何属性、化学特性以及物理力场特征)展现出改进的方法执行能力。此类评分可被视为数据驱动的黑箱范式,因为它们直接从实验信息中预测结合亲和力或配体-蛋白质结合关联,并绕过了与对接相关的复杂物理功能的考虑。诸如随机森林(RF)和支持向量机(SVM)等ML算法可用于增强评分函数的性能。例如,一个SVM范式记录了来自对接算法“eHiTS”的特定能量项与实验结合亲和力信息之间的非线性关联,而不是使用能量项的线性加和接受度,展现出增强的筛选能力和评分能力。Wang和Zhang记载了一种ΔvinaRF参数化校正方法,该方法融合了RF和AutoDock评分函数,与GlideScore XP相比展现出令人钦佩的性能。近来,由于卷积神经网络(CNN)在图像处理领域的卓越表现,一些研究人员已尝试利用CNN从蛋白质-配体相互作用图像中提取属性,以预测蛋白质-配体亲和力。一个研究小组使用3D图像CNN算法来预测配体-蛋白质结合倾向,该数据表明,预测的结合倾向与数据集内的实验信息有可接受的相关性。DL的真正能力在于其掌握从元素和原始面貌中提取复杂和深奥属性的能力。因此,描绘化合物蛋白质复合物的基本方面,如原子类型、原子电荷、原子距离和氨基酸类型,至关重要。Deep VS,一种基于CNN的算法方案,可以从关键特征(原子参考系)中掌握深奥的属性,并且它在“接收器操作特性曲线下面积(AUCROC)”和富集因子方面,在有用诱饵目录(DUD)上优于传统的对接算法,如内部坐标力学(ICM)和GLIDE SP。原则上,CNN方法通过提取蛋白质-配体关联图像中的特征来预测结合倾向,这非常类似于一个知识依赖的评分函数,并具有增强的预测能力。

【全文结束】