由英国主导的OpenBind倡议已达到一个重要里程碑,发布了其首个公开可用的数据集和预测性人工智能模型,这是利用人工智能加速新药研发的开创性一步。此次发布展示了工程化生产适合AI使用的数据不仅是可行的,而且对于发展科学领域的AI工具至关重要,因为这些领域都面临着数据匮乏的问题。通过OpenBind此次发布,高质量、标准化的实验数据以及新训练的预测模型OpenBind v1,现在可免费提供给全球研究人员,立即用于治疗发现并推动下一代AI模型的发展。
尽管人工智能在蛋白质结构预测准确性方面带来了质的飞跃,但其在药物研发领域的影响一直较为有限,主要受限于全球范围内可靠实验数据的短缺,这些数据需要以原子级精度测量药物分子如何与疾病相关蛋白质结合。OpenBind旨在填补这一关键缺口。该倡议由Diamond Light Source领导,由结构生物学家和AI专家组成的合作团队——在创始阶段得到英国科学、创新与技术部(DSIT)的支持——是首个以工业规模、开放且持续地生成这些专为AI设计的关键数据集的倡议。
此次首次发布证明OpenBind的管道现已投入运行,仅在七个月内就生成了800项高质量测量数据——在过去,如此大规模的数据集需要数年时间才能生成和发布。这一综合操作结合了自动化化学、稳健的结合测量以及Diamond的XChem片段筛选设施的高通量晶体学,配合工程化的数据发布流程和使用英国Isambard-AI计算集群进行的AI模型训练。它为药物研发的变革性进展奠定了基础,未来计划的数据批次将针对COVID-19、疟疾、登革热、寨卡病毒和癌症等全球健康挑战,这些领域对快速开发新治疗方法至关重要。
哥伦比亚大学的Mohammed Alquraishi教授表示:"AlphaFold2通过利用蛋白质数据库(PDB)中数十年的蛋白质结构实验数据,彻底改变了蛋白质结构预测。目前蛋白质-药物复合物尚无此类数据集,但OpenBind旨在创建它,并在此过程中创建下一代计算工具,用于模拟药物与蛋白质之间的相互作用。"
初始数据集也反映了该倡议早期实验周期的宝贵经验。标准化工作流程、强大的元数据实践和高度自动化已被证明对于确保AI所需的连贯性和可重复性至关重要,同时也突显了进一步简化数据处理和发布频率的机会。
牛津大学的Fergus Imrie博士表示:"高质量的实验数据对于开发新的和改进的AI模型至关重要,而此次首次数据发布表明OpenBind现在已经奠定了这一基础。我们正在使AI能够提高模型性能并指导未来实验,帮助加速发现。这些早期周期的经验教训已经帮助我们提高管道的速度、一致性和可重复性,这在OpenBind不断壮大的过程中至关重要。"
Diamond Light Source首席光束线科学家Frank von Delft教授表示:"如果没有我们联盟成员和运营团队的贡献,我们不可能取得如此快速的进展。他们的专业知识和承诺使我们达到了这一雄心勃勃的里程碑。我们现在将实施这一基础阶段的经验教训,扩大长期运营规模,将AI数据的大规模生产与积极的发现项目联系起来。"
在此基础上,OpenBind将扩展以包含更多靶点、更大的化学系列和更深入的数据集,同时开展社区盲测挑战,以验证针对新生成实验数据的AI模型。最终,OpenBind旨在创建一个全球性的开放数据引擎,能够支持开发更快、更准确和更公平的治疗方法。
【全文结束】

