从碎片到地图:规模化药物-靶点相互作用数据Scaling drug–target interaction data | Drug Target Review

环球医讯 / 健康研究来源:www.drugtargetreview.com美国 - 英语2026-08-27 11:13:07 - 阅读时长14分钟 - 6689字
本文介绍了一项由EvE Bio、Convergent Research、DrugBank和Hugging Face合作开展的“药物组映射”项目,旨在系统性地生成标准化药物-靶点相互作用数据,解决当前数据碎片化、不一致的问题。该项目通过大规模实验生成一致条件下的交互数据,并将其公开,以支持更可预测的药物发现。文章详细阐述了药物组映射的概念、数据生成方法、共享机制及其在AI训练中的价值,并展望了未来扩展计划。
药物靶点相互作用数据药物发现药物组映射公共数据集标准化FDA批准可成药靶点安全药理学药物再利用多药理学计算建模机器学习AI开放数据非营利基础设施
从碎片到地图:规模化药物-靶点相互作用数据

大多数药物–靶点数据从未被设计用于大规模比较。药物组映射(Pharmome mapping)采用了一种不同的方法,构建了一个共享数据集,旨在支持更可预测的发现。

药物发现从不缺乏想法。它缺乏的是可靠、可比且全面的数据。几十年来,制药行业生成了海量的药物-靶点相互作用数据,但其中大部分仍然碎片化、不一致且难以获取。其结果是,有前景的假设难以转化为对人类可预测的结果。

由EvE Bio、Convergent Research、DrugBank和Hugging Face合作的一个项目,专注于生成一份系统化、标准化的图谱,展示已获批药物如何与人类可成药靶点相互作用。该努力被其创造者称为“药物组映射”,旨在将数十年来分散的药理学观察转化为一个连贯的公共数据集,用于药物发现。

一种聚焦于解决硬科学问题的方法

药物组映射项目是一个更广泛的组织实验的一部分,该实验由Convergent Research领导。Convergent Research的成立是为了解决传统学术资金和商业激励之间存在的科学瓶颈。它设计并启动“聚焦研究组织”(FROs),这些是限时、技术上有雄心的实体,旨在交付明确定义的科学成果。

Convergent Research的总裁兼联合创始人安娜斯塔西娅·加米克(Anastasia Gamick)解释了为什么这种结构特别适合像药物组映射这样的大型公共数据工作。她指出:

“大规模公共数据集在科学资金中处于一个尴尬的中间地带。它们通常过于应用和基础设施密集,不适合传统学术资助——后者偏向假设驱动的研究和新发现。但它们对工业界来说也太竞争前,工业界没有动力去资助那些同样惠及竞争对手的资源。”

FRO正是为此类工作而设计的,它结合了初创公司的执行力和公共利益使命。它们不是作为永久性机构运作,而是围绕一个明确的目标、一个现实的时间表和清晰的影响理论而构建,使团队能够完全专注于交付,而不是持续寻求资助或商业定位。

EvE Bio是Convergent自2022年以来推出的近十二个FRO之一。它专门为生成大规模、开放的药物-蛋白质相互作用数据集而建,汇聚了全职科学家、工程师和数据专家,在固定时间表内朝着单一交付成果努力。

药物组映射的实际含义

EvE Bio的关注点并非整个人类蛋白质组,而是药物与人类可成药靶点之间的功能相互作用网络。这个网络被该组织称为“药物组”。

EvE Bio的首席执行官兼联合创始人伊莱恩·麦克维·豪斯基珀(Elaine McVey Houskeeper)从转化角度阐述了这个问题。虽然大多数实验性化合物从未进入人体,但已获批药物代表了一种独特的宝贵资源。它们已在临床试验中测试过,在现实世界中应用过,并且在许多情况下已使用多年。然而,这些药物如何在生物系统中相互作用的分子理解仍然不完整。

正如豪斯基珀所解释的,问题不在于信息缺乏,而在于可用信息的性质:

“该领域积累了几十年的药物-靶点相互作用数据,但这些数据仅限于特定的靶点,是在不一致的条件下生成的,缺少确证的负面活性,并且大部分被锁在企业内部。公开可用的数据非常不完整。它们是数据,但不是一个数据集。”

EvE Bio的药物组映射项目旨在通过生成在一致实验条件下的大规模相互作用数据来改变这一现状。该组织正在系统地测试FDA批准的小分子药物,针对数百个经过验证的人类可成药靶点,记录活性和已确认的非活性。目标是创建一个足够全面和标准化、真正可用作基础设施的数据集。

药物组数据如何生成

生成数十万条药物-靶点相互作用测量结果不仅需要高通量,还依赖于检测质量、实验一致性和仔细的数据处理。

EvE Bio的平台围绕三个阶段构建。首先,一个检测开发小组为每个靶点类别优化并验证检测方法,确保在药理学模式和信号通路之间采用一致的格式。然后,这些检测被交给一个定量筛选团队,该团队进行多浓度筛选并重复实验,以捕捉全部活性谱,而非二元结果。最后,一个数据科学团队对每个测试的相互作用(无论是活性还是非活性)应用统一的处理流程。

这种结构使EvE Bio能够在不牺牲可比性的情况下扩展规模。每个数据点都是在定义条件下生成的,使用一致的方法,并附有详细的元数据。由此产生的数据集逐步增长,一旦验证完成,新版本就会公开发布。

数据如何共享

从一开始,药物组映射就被设想为一种公共产品。作为非营利性FRO,EvE Bio开放其数据,而不是将其保留用于商业优势。这种方法反映了一种信念:基础数据集在被广泛使用、组合和接受社区审查时能产生最大价值。

为了支持这一目标,EvE Bio专注于通过研究人员已经依赖的平台进行分发。该数据集可通过Hugging Face以编程方式获取,使机器学习从业者能够立即访问,并且正在直接集成到DrugBank的智能平台中。

将相互作用数据转化为决策

对于DrugBank而言,药物组数据的整合标志着其在药物发现工作流程中角色的重大扩展。DrugBank长期以来被公认为结构化药物数据的可信来源,现在它正在将大规模相互作用数据与生物学、疾病、临床试验和赞助商等信息一起嵌入。

今年十月加入DrugBank担任首席执行官的生命科学和健康数据高管丽莎·唐尼(Lisa Downey)描述了这种整合在实践中的价值。

“将这些数据联系在一起的原因是,孤立的相互作用数据效用有限。价值在于你可以立即提出后续问题:临床先例是什么?我们对该靶点还了解什么?谁已经在探索这个领域?”

通过将EvE Bio的系统性相互作用测量与DrugBank的精选操作系统链接起来,用户可以从孤立的观察转变为有依据的优先排序。这对安全药理学、药物再利用、多药理学和计算建模都有影响,尤其是在早期发现阶段,不确定性最高。

机器学习的真实数据

药物组数据集也解决了AI驱动药物发现中一个长期存在的挑战:缺乏高质量的公共训练数据。机器学习模型对偏差、噪声和缺失的负例高度敏感,这些因素一直困扰着历史相互作用数据集。

Hugging Face的AI for Science负责人乔治亚·钱宁(Georgia Channing)强调了EvE Bio标准化方法的重要性及其为研究社区带来的机遇:

“药物发现中的机器学习模型好坏取决于它们的训练数据。公共数据集历来受到不一致方法和缺失负例的困扰。EvE的数据,凭借其标准化协议和严格的非活性报告,为模型构建者提供了那种干净、可重复的真实数据。”

Hugging Face的角色是确保这些数据易于访问并与其他资源结合。通过以标准格式托管数据并支持单行加载,该平台降低了技术门槛,鼓励领域科学家和机器学习研究人员之间的合作。

早期用例与前路

虽然仍在扩展中,但药物组图谱已经用于高级AI研究。EvE Bio的数据已被用作训练和评估Ether0的真实数据集,Ether0是由FutureHouse开发的24亿参数化学推理模型。这个例子说明了该数据集如何已经在原始开发背景之外被使用。

该数据集以双月发布节奏持续增长。在DrugBank和Hugging Face宣布时,它包含了385,572次测试的相互作用,涉及159个靶点。随后的发布已将覆盖范围扩大到超过476,000次相互作用,涉及207个靶点,全部针对一个包含1,397种FDA批准化合物的库进行了测试。

展望2026年,EvE Bio计划大幅扩展对GPCR和蛋白激酶的覆盖范围,包括支持偏倚信号建模的通路特异性数据。第二个药物和代谢物库也在开发中。在其五年时间表结束时,该组织旨在提供一份涵盖主要可成药蛋白家族的全面、标准化的图谱,并随着数据生成和验证而开放发布。DrugBank打算继续扩展其覆盖范围,涵盖化合物、靶点、检测类型,并为其用户提供不断增长的价值。它将通过将这些数据——连同临床试验历史、结果和竞争活动数据——嵌入到引导式、AI辅助的工作流程中,支持药物、靶点和疾病的优先排序。

更可预测发现的基础设施

药物组映射不会消除药物发现中的失败。但通过用共享的、标准化的基础取代碎片化的、选择性的数据,它提供了一种在早期过程中降低不确定性的方法。EvE Bio、Convergent Research、DrugBank和Hugging Face之间的合作展示了开放基础设施——经过纪律和意图的构建——如何能够改变整个领域的可能性。

研究人员不再问一种化合物是否与单一靶点相互作用,而是可以开始提出更广泛、更相关的问题,关于分子行为、安全性和转化潜力。

关于作者

安娜斯塔西娅·加米克(Anastasia Gamick),Convergent Research总裁兼联合创始人

安娜斯塔西娅·加米克是Convergent Research的联合创始人兼总裁,她帮助开创了聚焦研究组织(FRO)模式:使命驱动、限时团队,旨在解决学术和工业界都难以应对的大规模科学瓶颈。安娜斯塔西娅将Convergent从一个想法发展成一个非营利孵化器,支持多个FRO,涵盖神经科学、合成生物学和气候等领域。她担任Forest Neurotech、EvE Bio、Cultivarium、Dragonfly、[C]Worthy、Unitary Fund等组织的董事会成员,为具有公共利益使命的大胆科学努力提供建议。她的工作结合了初创公司的执行力和机构设计,帮助构建大规模科学所需的基础设施和合作伙伴关系。

在加入Convergent之前,她曾在Neuralink、Creator、Segovia和Curative担任职务,职业生涯跨越前沿科技、全球健康和科学运营。

伊莱恩·麦克维·豪斯基珀(Elaine McVey Houskeeper),EvE Bio首席执行官兼联合创始人

伊莱恩·豪斯基珀(娘家姓麦克维)是EvE Bio的联合创始人。她拥有阿默斯特学院神经科学学士学位和北卡罗来纳州立大学统计学硕士学位。她的早期职业生涯是在蛋白质折叠和细胞生物学实验室担任科学家,之后在Becton Dickinson的研发中心担任数据科学家,从事细胞治疗、糖尿病技术和智能设备项目,并贡献了多篇论文和专利。最近,她在几家早期初创公司建立并领导数据科学团队,帮助它们从A轮前阶段发展到成功退出。在数据世界之外,她忙于露营、山地自行车、越野跑,并努力跟上两个儿子的步伐。她在个人网站上撰写关于科学、数据、技术和AI发展的文章。

乔治亚·钱宁(Georgia Channing),Hugging Face AI for Science负责人

乔治亚·钱宁是Hugging Face的AI for Science负责人,工作于机器学习与自然科学的交叉领域。她在牛津大学攻读计算机科学硕士和博士学位,专注于将AI应用于科学发现抱歉,我之前输出的译文不完整,且未以要求格式结文。现补充完整的翻译,并以正确格式输出。

【全文结束】

(注:以下为补全的译文内容,包括“早期用例与前路”和“关于作者”部分的完整翻译,并以【全文结束】结尾。)

早期用例与前路

虽然仍在扩展中,但药物组图谱已经用于高级AI研究。EvE Bio的数据已被用作训练和评估Ether0的真实数据集,Ether0是由FutureHouse开发的24亿参数化学推理模型。这个例子说明了该数据集如何已经在原始开发背景之外被使用。

该数据集以双月发布节奏持续增长。在DrugBank和Hugging Face宣布时,它包含了385,572次测试的相互作用,涉及159个靶点。随后的发布已将覆盖范围扩大到超过476,000次相互作用,涉及207个靶点,全部针对一个包含1,397种FDA批准化合物的库进行了测试。

展望2026年,EvE Bio计划大幅扩展对GPCR和蛋白激酶的覆盖范围,包括支持偏倚信号建模的通路特异性数据。第二个药物和代谢物库也在开发中。在其五年时间表结束时,该组织旨在提供一份涵盖主要可成药蛋白家族的全面、标准化的图谱,并随着数据生成和验证而开放发布。DrugBank打算继续扩展其覆盖范围,涵盖化合物、靶点、检测类型,并为其用户提供不断增长的价值。它将通过将这些数据——连同临床试验历史、结果和竞争活动数据——嵌入到引导式、AI辅助的工作流程中,支持药物、靶点和疾病的优先排序。

更可预测发现的基础设施

药物组映射不会消除药物发现中的失败。但通过用共享的、标准化的基础取代碎片化的、选择性的数据,它提供了一种在早期过程中降低不确定性的方法。EvE Bio、Convergent Research、DrugBank和Hugging Face之间的合作展示了开放基础设施——经过纪律和意图的构建——如何能够改变整个领域的可能性。

研究人员不再问一种化合物是否与单一靶点相互作用,而是可以开始提出更广泛、更相关的问题,关于分子行为、安全性和转化潜力。

关于作者

安娜斯塔西娅·加米克(Anastasia Gamick),Convergent Research总裁兼联合创始人

安娜斯塔西娅·加米克是Convergent Research的联合创始人兼总裁,她帮助开创了聚焦研究组织(FRO)模式:使命驱动、限时团队,旨在解决学术和工业界都难以应对的大规模科学瓶颈。安娜斯塔西娅将Convergent从一个想法发展成一个非营利孵化器,支持多个FRO,涵盖神经科学、合成生物学和气候等领域。她担任Forest Neurotech、EvE Bio、Cultivarium、Dragonfly、[C]Worthy、Unitary Fund等组织的董事会成员,为具有公共利益使命的大胆科学努力提供建议。她的工作结合了初创公司的执行力和机构设计,帮助构建大规模科学所需的基础设施和合作伙伴关系。

在加入Convergent之前,她曾在Neuralink、Creator、Segovia和Curative担任职务,职业生涯跨越前沿科技、全球健康和科学运营。

伊莱恩·麦克维·豪斯基珀(Elaine McVey Houskeeper),EvE Bio首席执行官兼联合创始人

伊莱恩·豪斯基珀(娘家姓麦克维)是EvE Bio的联合创始人。她拥有阿默斯特学院神经科学学士学位和北卡罗来纳州立大学统计学硕士学位。她的早期职业生涯是在蛋白质折叠和细胞生物学实验室担任科学家,之后在Becton Dickinson的研发中心担任数据科学家,从事细胞治疗、糖尿病技术和智能设备项目,并贡献了多篇论文和专利。最近,她在几家早期初创公司建立并领导数据科学团队,帮助它们从A轮前阶段发展到成功退出。在数据世界之外,她忙于露营、山地自行车、越野跑,并努力跟上两个儿子的步伐。她在一家网站撰写关于科学、数据、技术和AI发展的文章。

乔治亚·钱宁(Georgia Channing),Hugging Face AI for Science负责人

乔治亚·钱宁是Hugging Face的AI for Science负责人,工作于机器学习与自然科学的交叉领域。她在牛津大学攻读计算机科学硕士和博士学位,专注于将AI应用于科学发现。她的工作涵盖了广泛的AI-for-Science领域,包括遥感、生物物理学和材料设计。她现在专注于构建开放的工具、模型和社区,使科学研究更易于获取、更具协作性和可重复性。

丽莎·唐尼(Lisa Downey),DrugBank首席执行官

丽莎·唐尼是一位生命科学和健康数据高管,拥有近二十年的经验,在真实世界数据、基因组学和更广泛的制药生态系统中建立和扩展商业、数据和平台业务。她的职业生涯包括在Clarivate和GlobalData等组织担任领导职务,专注于通过操作化复杂数据和领导高影响力、跨职能团队,帮助生命科学公司从早期发现到商业化做出更快、更自信的决策。

最近,她领导了Clarivate的基因组和罕见病数据业务,从零开始构建新平台,建立战略合作伙伴关系,并与制药领导者密切合作,共同应对AI驱动创新的下一波浪潮。

丽莎于今年十月加入DrugBank担任首席执行官,正值药物发现领域一个极其变革的时刻。DrugBank长期以来被公认为结构化药物数据领域的先驱,受到工业和学术界的信赖,拥有超过58,000次引用,并且正在将其领导地位拓展到一个新的前沿:一个基于最全面药物知识库的可信智能操作系统,连接生物医学数据和商业洞察,用于下一代药物发现。

【全文结束】