药物发现的最早期阶段受限于一个简单约束:可能的类药分子数量远超任何制药实验室能够测试的范围。一项发表于《基于推理的智能系统国际期刊》的新深度学习系统,为加快研究速度并打破行业瓶颈提供了可能。
将一款新药推向市场通常需要十多年,并不可避免地在研发、测试、法规合规及营销上花费数十亿美元。其中很大一部分投资用于识别能与生物靶标结合的化合物。这些靶标通常是参与疾病的蛋白质,无论是病原体中的蛋白质还是人体内与疾病相关的蛋白质。
所谓的计算机模拟虚拟筛选,几十年来一直使用计算机模型预测来自候选分子库的哪些分子可能适合体外(实验室)测试,并最终进行体内(动物,然后人类)测试。
然而,现有方法分为两类。第一类是基于受体的方法,例如分子对接,模拟分子如何嵌入蛋白质的三维结合位点,并估算它们之间形成键的强度。这种方法的准确性依赖于高质量的蛋白质结构和简化的评分公式。
第二类是基于配体的方法,它利用预定义的化学特征或描述符,寻找与已知活性分子相似的化合物。
这些技术计算效率高,并成功促成了当今市场上的许多药物。然而,它们严重依赖先验知识和专家假设。
在这两种情况下,人工设计的规则限制了可捕获的化学复杂性。深度学习系统的出现开辟了新途径。
深度学习是一种机器学习形式,使用多层神经网络直接从原始数据中检测模式。它可以将候选药物分子视为图,其中原子为节点,化学键为边。图神经网络会根据每个原子的邻居更新其表示,使模型能够学习微妙的结构关系。
关键的是,这种方法除了图之外还使用了另一个信息通道:它处理候选药物的SMILES字符串。SMILES字符串是基于文本的分子化学结构唯一表示。
通过同时使用结构表示和序列表示,研究人员能够显著提升性能。在标准公共基准测试中,该模型获得了0.889的评分(1为完美评分)。该评分衡量系统区分活性与非活性药物候选物的能力。评分1为理想预测,0.5则相当于随机猜测。令人难以置信的是,该系统能在15分钟内筛选100万个分子,比传统方法快80%。
更多信息:
Chuyue Zhang, 基于深度学习的药物分子虚拟筛选系统,《基于推理的智能系统国际期刊》(2026). DOI: 10.1504/ijris.2026.151726
图片来源:Edward Jenner from Pexels
提供:Inderscience
【全文结束】

