开发新药物可能需要进行数千次化学实验,以确定安全、有效且价格合理的药物配方。
该过程缓慢且劳动密集,许多反应依赖于难以获取的金属,这些金属作为必需的催化剂。
虽然人工智能正在帮助加速药物发现过程,但它只能从现有数据中学习,而在化学反应方面,训练强大AI工具所需的大规模高质量数据集并不存在。
这就是密歇根大学药学院蒂姆·塞尔纳克及其团队的用武之地。
他们创建了一个包含50,000多个精心设计的化学实验的开放获取数据库,测试了数千种原料和条件的组合,以更好地了解形成碳氮键的反应——这是许多药物的基本构建模块。
塞尔纳克表示,该数据库是有史以来最大的化学反应数据集合,也是可能发展成更大规模化学反应条件库的开端,这些数据将为AI系统提供支持。
摘要。图片来源:《美国化学会志》(2026)。DOI: 10.1021/jacs.6c05959
构建平台历时十年
"构建能够实现这一目标的平台已经花了十多年时间,但这仍然只是触及表面,"药学院药物化学副教授塞尔纳克表示。
这些数据通过开放反应数据库免费提供给科学家。
"我们对其他科学家能够从这个新数据集中发现的内容感到兴奋。这里有大量的数据可供挖掘,"塞尔纳克说。
向研究人员和AI系统提供更多的反应数据,可以帮助快速有效地识别有前景的药物制造方法。它还可以帮助科学家找到基于在药物制造中使用的贵金属的昂贵或难以获取的催化剂的替代品。
"管道中最新的药物正在提高化学合成的复杂性标准。同时,贵金属和其他关键反应组件的供应链正被暴露为风险,"塞尔纳克说。"需要像这样的大数据集来构建预测模型,从而更快地制造出更好的药物。"
镍和铜展现出潜力
除了分享所有数据外,发表在《美国化学会志》上的这项研究还比较了不同催化剂——特别是钯、镍和铜——在相似条件下的表现。这一点很重要,因为钯是药物合成中许多反应的首选催化剂,但钯的供应仅由少数几个国家控制。
然而,研究发现,某些反应使用镍催化剂表现同样良好,有些甚至可以使用铜催化剂,而铜可以在全球范围内获取。该数据库使研究人员能够更轻松、更快地比较催化剂和反应。
"一个关键的发现是,大规模系统设计的反应数据集可以揭示仅从传统范围研究中难以看到的模式,"塞尔纳克说。"例如,我从未预料到称为芳炔的高度反应性中间分子能在如此低的温度下形成,但当我们看到它出现数百次时,很难忽视。这对合成不使用贵金属催化剂的药物来说是一个令人兴奋的可能性。"
出版详情:杰亚布拉塔·达斯等,《包含50,688个反应的数据集揭示碳-氮偶联中的通用配体和机制多样性》,《美国化学会志》(2026)。DOI: 10.1021/jacs.6c05959
期刊信息:《美国化学会志》
提供方:密歇根大学
【全文结束】

