英国主导的OpenBind计划已达到一个重要里程碑,发布了首个公开可用的数据集和预测性人工智能模型,这是利用人工智能加速新药发现的开创性一步。
此次发布展示了工程化生产AI就绪数据不仅可行,而且对于科学领域的AI工具发展至关重要,这些领域都苦于缺乏数据。通过OpenBind此次发布,高质量、标准化的实验数据以及新训练的预测模型OpenBind v1将免费向全球研究人员开放,可立即用于治疗发现,并推动下一代AI模型的发展。
尽管人工智能在蛋白质结构预测方面带来了预测准确性的飞跃,但其在药物发现领域的影响仍然有限,主要受限于全球范围内缺乏可靠实验数据来原子级详细测量药物发现分子如何与疾病相关蛋白质结合。OpenBind旨在填补这一关键空白。
由钻石光源(Diamond Light Source)领导的这一合作项目,由结构生物学家和AI专家组成,在其基础阶段得到了科学、创新与技术部(DSIT)的支持,是首个以工业规模公开、持续地生成这些关键数据集,并专门为AI设计的倡议。
此次首次发布表明,OpenBind的流程现已投入运行,仅在七个月内就生成了800个高质量测量数据——在过去,生成和发布如此大规模的数据集需要数年时间。
这种集成操作结合了自动化化学、可靠的结合测量以及钻石光源XChem片段筛选设施的高通量晶体学,配合工程化的数据发布流程和使用英国Isambard-AI计算集群进行的AI模型训练。
这为药物发现的变革性进步奠定了基础,未来计划发布针对全球健康挑战的数据批次,如新冠疫情、疟疾、登革热、寨卡病毒和癌症,这些领域新疗法的快速开发仍然至关重要。
哥伦比亚大学的Mohammed Alquraishi教授表示:"AlphaFold2通过利用蛋白质数据库(PDB)中数十年的蛋白质结构实验数据,彻底改变了蛋白质结构预测。目前尚不存在针对蛋白质-药物复合物的等效数据集,但OpenBind旨在创建它,并在此过程中创建下一代用于模拟药物与蛋白质相互作用的计算工具。"
初始数据集也反映了该倡议早期实验周期的宝贵经验。标准化工作流程、强大的元数据实践和高度自动化已被证明对确保AI所需的持续性和可重复性至关重要,同时也凸显了进一步简化数据处理和提高发布频率的机会。
牛津大学的Fergus Imrie博士表示:"高质量的实验数据对于开发新的和改进的AI模型至关重要,此次首次数据发布表明OpenBind现在已经奠定了这一基础。我们正在使AI能够提高模型性能并指导未来实验,帮助加速发现过程。"
"这些早期周期的经验教训已经帮助我们提高了流程的速度、一致性和可重复性,随着OpenBind的发展,这些将至关重要。"
钻石光源的主要光束线科学家Frank von Delft教授表示:"如果没有我们联盟成员和运营团队的贡献,我们不可能取得如此快速的进展。他们的专业知识和承诺使我们能够达到这一雄心勃勃的里程碑。我们现在将实施从这一基础阶段获得的经验教训,以扩大长期运营,将AI数据的高量生产与积极的发现项目联系起来。"
以此为基础,OpenBind将扩展到包括更多靶点、更大化学系列和更深层次的数据集,同时包括社区盲测挑战,以验证新生成实验数据的AI模型。最终,OpenBind旨在创建一个全球性的开放数据引擎,能够支持更快、更准确和更公平的治疗药物的开发。
【全文结束】

