使用神经网络进行药物发现Drug Discovery With Neural Networks | by Amine | The Startup | Medium

环球医讯 / AI与医疗健康来源:medium.com美国 - 英语2026-08-19 06:38:46 - 阅读时长9分钟 - 4188字
本文总结了Kaggle上作用机制(MoA)预测竞赛,介绍了如何使用深度学习算法预测新药的作用机制。文章详细解释了竞赛数据集,包括基因表达特征和细胞活力特征,以及206个作用机制目标。作者比较了多种深度学习模型在多标签预测任务中的表现,并重点介绍了多层感知机、TabNet和DeepInsight CNN三种架构,展示了深度学习在药物发现领域的应用前景,为加速新药研发提供了创新思路。
药物发现药物作用机制基因表达细胞活力人工智能制药神经网络连接性图谱L1000检测PRISM检测药理研究
使用神经网络进行药物发现

发现新药一直是一个耗时数年的漫长过程。随着人工智能的最新进展和生物数据库中研究数据的积累,药物发现过程和研究速度比以往任何时候都快。哈佛大学创新与科学实验室的研究人员正在开展连接性图谱项目[1],旨在通过改进药物作用机制(MoA)预测算法来推进药物开发。这一挑战作为Kaggle竞赛[2]启动,目的是构建机器学习模型来预测未知药物的作用机制。

1- 数据集:

我们首先了解竞赛的数据集:我们有一个数据集,以基因表达和细胞活力数据为特征,206个作用机制(MoA)为目标。

1–1 基因表达特征:

![图1. 概述 (1) 人类细胞经药物处理。(2) 基因表达和细胞活力测量。(3) 数据输入神经网络。(4) 神经网络预测药物是否具有作用机制。[作者提供]](

该数据集中测量了772个基因的基因表达。

![图2. 基因表达检测:基因表达检测经历一系列步骤,从细胞系选择、药物处理、孵育到mRNA提取和部分基因定量。[作者提供]](

![图3. 5个基因分布:g-1、g-2、g-3、g-400和g-771(共772个基因)。[作者提供]](

基因表达是使用L1000检测测量的。您可以在这个连接性图谱网页上了解更多关于这项新技术的信息,以及研究论文:"下一代连接性图谱:L1000平台和第一个1,000,000个特征,"《细胞》,2017年。[3]

为简化起见,这里只解释了一种实验条件。实际上,一种药物在不同剂量(低和高)和不同处理时间(24小时、48小时和72小时)下进行了多次分析。

1-2 细胞活力特征:

除了772个基因的基因表达数据外,还提供了100个细胞系的细胞活力数据,细胞活力检测基于PRISM(混合物中相对抑制同时分析)。[4]

![图4. 细胞活力检测:细胞混合并用药物处理,孵育,计算每个细胞系的死亡细胞数。[作者提供]](

![图5. 5个细胞系的细胞活力分布(共100个)。[作者提供]](

细胞活力评估基于PRISM。您可以在连接性图谱网页和研究论文:"通过系统活力分析发现非肿瘤学药物的抗癌潜力"中了解这项新技术的更多信息。

与代表100个细胞系混合的基因表达值不同,细胞活力值是按细胞系区分的,换句话说:

  • 基因-1值是100个细胞系中基因-1表达的平均值,如图2步骤4所示。
  • 细胞-1值是属于细胞系1的细胞活力,如图4所示。

到目前为止,我们已经了解了药物处理后的基因表达特征和细胞活力特征。缺失的唯一环节是药物的作用机制,这也是我们需要预测的目标。

1-3 目标:药物作用机制(MoA)

在药理学中,"作用机制"(MoA)一词指的是药物物质产生其药理作用的特定生化相互作用。[5]

让我们简化这个定义,例如,阿司匹林减少疼痛和炎症,所以阿司匹林的作用机制:

  • MoA功能:减少疼痛和炎症
  • MoA生化功能:涉及对环氧化酶酶的不可逆抑制,因此抑制前列腺素和血栓素的产生,从而减少疼痛和炎症

这种功能或作用机制只是阿司匹林可能具有的多种作用机制之一,因此一种药物可以具有多种作用机制。这使得药物作用机制预测成为一个多标签问题。我们为每种药物提供了206个MoA目标,标记为(0:无作用机制,1:有作用机制)。下表显示了4个目标(共提供206个目标)。

  • sig_id:包含经药物-X处理的100个细胞系混合物的样本。(步骤1)
  • 5-alpha_reductase_inhibitor, 11-beta-hsd1_inhibitor, acat_inhibitor…是目标作用机制

![表1. 206个标记目标中的4个MoA目标示例(0:无作用机制)和(1:有作用机制)。](

让我们看第一行:

  • sig_id: 'id_d00440fe6' 是100个细胞系的混合物(见步骤1),它用药物X处理(见步骤2),这种药物X没有'5-alpha_reductase_inhibitor'的作用机制,因此标记为0,但它具有'acat_inhibitor'的作用机制,因此标记为1。

问题陈述: 100个细胞系用药物处理。收集基因表达和细胞活力数据以了解该药物的生物活性。任务是基于基因表达和细胞活力特征预测新药物的作用机制。(见图1)

您可以在我的Kaggle笔记本中了解更多关于竞赛数据以及特征交互(基因、细胞和药物)的信息:[药物MoA分类:探索性数据分析](

2- 药物作用机制预测:

我们到达了分析中最令人兴奋的部分,即基于基因表达和细胞活力特征预测新药物的作用机制。

虽然深度学习在计算机视觉和自然语言处理任务中占据主导地位,但基于树的算法(随机森林、决策树等)和梯度提升机(XGBoost、LGBM、CatBoost等)仍然是处理表格数据的首选方法。然而,这里的情况并非如此,深度学习算法的表现优于梯度提升机。为什么会这样?因为我们有一个多标签问题,需要预测206个目标。浅层机器学习算法不支持多标签任务,换句话说,它们没有利用206个目标之间的相关性和共现性来提高预测准确性。

为了更好地理解,让我们比较岭回归、LGBM、XGBoost和3种深度学习模型在此次竞赛中的表现。

![图6. Kaggle上MoA预测竞赛中的模型性能。红色为浅层机器学习模型,绿色为深度学习模型。[作者提供]](

这些分数是近似的,要更好地了解这些模型的表现,您可以查看在Kaggle上训练它们的笔记本:[岭回归](

从上图中得出的结论是浅层机器学习模型和深度学习模型之间的差距。深度学习模型在此竞赛中表现更好,因为它们能够从206个目标连接中提取信息。

浅层机器学习模型和神经网络之间的分数差异对于对数损失这样的指标来说可能看起来很小。我想指出的是,神经网络从目标相关性中提取信号,这就是它们在这种情况下表现更好的原因,然而,该数据集中206个目标之间的相关性非常差(图7),大多数目标的相关性为0,只有13对目标的相关性为+0.3,因此没有太多信号可以提取,因此,如果目标之间联系更紧密,对数损失分数的差异会大得多。

![图7. 热图:206个目标之间的相关性。[作者提供]](

在下一节中,我想谈谈3种在具有多标签目标的表格数据上表现非常好的深度学习架构。

2–1. 多层感知机:

MLP或简单的前馈神经网络,最简单的神经网络架构,包含4个密集层(前两层有2048个神经元,后两层有1048个神经元),以及dropout、批归一化层和ReLU激活函数,表现得异常出色。

![图8. 4个全连接层神经网络架构。每个块由批归一化、dropout、密集层和ReLU激活函数组成。[作者提供]](

使用此模型获得的分数非常有竞争力,使用了Adam优化器、Reduce on plateau调度器和包含sigmoid激活的二元交叉熵BCE With Logits损失函数。

代码:4层[MLP代码GitHub仓库](

2–2 TabNet:

TabNet于2019年由Google Cloud AI在论文《TabNet:可解释的表格学习注意力》中介绍。它是一种用于表格数据的深度学习模型。TabNet结合了神经网络和基于树的算法的特性: [6]

  • 它具有神经网络的强大功能,能够拟合和学习具有大量参数的复杂函数。
  • 它具有类似于基于树的算法的特征选择机制。它还在特征选择中使用注意力机制。

![图9. TabNet架构。来源:

TabNet的PyTorch实现由dreamquark-ai在他们的[tabnet GitHub仓库](

代码:[GitHub仓库中的TabNet代码](

2–3 DeepInsight CNN:

[DeepInsight是一种将非图像数据转换为图像以用于卷积神经网络架构的方法]( Peng通过他的[图像转换教程](

将表格数据转换为图像数据首先通过在特征矩阵中分配特征开始,特征的位置取决于特征的相似性,因此我们最终得到一个具有多个簇的特征矩阵,在每个簇中,相似和高度相关的特征被分组在一起(下图)。

![图10. DeepInsight流程。(a)将特征向量转换为特征矩阵。(b)将特征向量转换为图像像素。来源:

这种方法在基因表达数据中的强大之处在于将相似基因排列成簇,这使得差异更容易获取,并允许比单独处理元素更稳健地识别隐藏机制。将这些特征矩阵图像输入CNN有助于利用卷积和池化层的力量捕捉基因组数据中的微小变化。

为了更好地了解[DeepInsight转换](

![图11. 表示用两种不同药物处理的两个样本的转换基因表达和细胞活力数据的特征矩阵。[作者提供]](

这两张图像之间的差异很明显,用具有活性蛋白酶体抑制剂的药物处理的样本与用具有DNA抑制剂的药物处理的样本相比,具有不同的特征分布和相关性。这使得预训练的卷积神经网络能够学习其他输入表格数据的模型无法捕捉的模式。

使用DeepInsight转换图像训练预训练的efficientNet B3和B4模型取得了有竞争力的结果,而且更重要的是,它通过学习仅在图像中可访问的新模式,为最终与其他神经网络模型的集成提供了巨大的提升。

代码:[GitHub仓库中的图像转换+efficientNet B4代码](

结论:

除了本文提到的模型外,其他模型在此次竞赛中也表现良好,处理具有表格数据和多标签目标的问题,如LSTM和GRU等序列模型。人工智能的进步正使我们能够解决表格数据问题,使用CNN和RNN的集成。

参考文献:

  1. 连接性图谱项目:
  2. MoA预测竞赛:
  3. L1000检测:Subramanian等人。"下一代连接性图谱:L1000平台和第一个1,000,000个特征,"《细胞》,2017年,
  4. PRISM:Corsello等人。"通过系统活力分析发现非肿瘤学药物的抗癌潜力,"《自然癌症》,2020年,
  5. MoA定义:
  6. TabNet:
  7. DeepInsight:
  8. DeepInsight转换教程:
  9. MoA GitHub仓库:

图表、图形和插图由:

  • 图表
  • 生物插图
  • 图形:使用Python的matplotlib库制作。

【全文结束】