人工智能在药物发现中的真正价值可能在于选择正确的实验AI’s real value in drug discovery may be choosing the right experiment | Article | Drug Target Review

环球医讯 / AI与医疗健康来源:www.drugtargetreview.com英国 - 英语2026-07-19 21:24:19 - 阅读时长6分钟 - 2890字
人工智能在药物发现中的真正价值不在于替代传统方法,而在于精准选择下一步实验。楫鹬研究公司创始人尼克·林奇博士指出,AI应作为补充工具丰富已验证的基础科学知识,而非凭空创造真相。其核心价值在于提供"方向性价值",即识别既能推进当前项目又能丰富未来数据空间的高信息量实验,避免盲目追求数据量。药物发现领域的AI应用应聚焦于多参数优化,帮助科学家在高维数据空间中导航,同时需警惕"暗数据"导致的系统性偏差。
药物发现人工智能FAIR数据实验选择多参数优化生命科学数据靶点信息合成可行性
人工智能在药物发现中的真正价值可能在于选择正确的实验

人工智能在药物发现中的前景往往在你越接近它时越显得遥不可及。当你部署一个工具时,它今天可能并未如预期般工作,但总有人安慰你说明天就会见效。然而当明天到来时,目标又再次远去了。

这被称为"兔子问题"。任何经历过新技术炒作周期(包括FAIR数据)的人都会立即认出这种模式。

尼克·林奇博士(Dr Nick Lynch)已经历过数个这样的周期。他在阿斯利康工作了13年,是皮斯托亚联盟(Pistoia Alliance)的联合创始人,并参与了FAIRPlus项目,该项目开发了FAIR指南(FAIR Cookbook),帮助组织机构掌握使数据可发现、可访问、可互操作和可重用(FAIR)的方法。自2014年以来,他一直经营着楫鹬研究公司(Curlew Research),这是一家专注于生命科学领域数据和信息学战略的咨询公司。他的基本立场值得明确陈述,因为它框定了接下来的所有讨论:

"FAIR实际上是一个过程……我们有时可能会过度承诺所能实现的目标,但同时也低估了所需的精力,特别是变革管理、成本和时间。我认为所有这些也可能适用于人工智能。"

这是一个警告。接下来的对话是关于人工智能真正能够发挥作用的地方,这比大多数营销宣传所暗示的更为具体、更为严谨。

数据问题没有改变;数据类型改变了

将人工智能视为解决旧问题的新答案是很诱人的。林奇谨慎地将两者分开。数据量不断增加、实验密度和维度提高,以及药物发现界都在"从同一套全球靶点中捕鱼"的挑战已有数十年历史。廉价的基因组学、云存储和数据湖本应多年前就解决这些问题。

过去几年真正的新事物更为有限:大规模处理非结构化数据、文本、文献、图像、PubMed内容等的能力。林奇极力避免让大型语言模型(LLM)的热潮抹去之前的一切:

"不要忘记,机器学习/人工智能在药物发现中已经存在数十年……从计算角度看,这是一个渐进过程,更传统的机器学习方法仍然扮演着重要角色。"

因此,人工智能故事的诚实版本不是一场取代统计学和机器学习的革命。它是建立在它们之上的额外一层,其价值完全取决于你用它来处理什么。

精炼而非创造基础真相

这是林奇拒绝简单表述的核心论点。直觉上,我们可能会说大型语言模型能够"验证"我们的科学知识,但他对这个词语提出了质疑:

"我认为'验证'是一个过于强烈的词……它可能是丰富和验证的结合。"

这种区分很重要。组织机构已经花费数十年和大量人力来构建经过整理的知识——例如知识图谱、通路数据和靶点信息——所有这些都有明确的来源和可评估的成熟度。错误的做法是希望大型语言模型能凭空创造这种基础真相,或者通过某种魔法消除使数据符合FAIR标准的艰苦工作。林奇直言不讳地表示,这在许多情况下"是跳跃过大的。"

可辩护的角色恰恰相反。当人类无法处理海量可用数据时,人工智能可以被用来丰富、链接和压力测试现有且经过良好验证的基础真相。人工智能可以在一定程度上自主运行验证,挑战一个假设并以人类团队无法企及的规模对其进行文献测试。随着数据量的增长,曾经完全由人工主导的整理工作,根据林奇的说法,变成了"人在环路中的人工智能整理"。

然而,这也隐藏着一个值得承认的风险——我们的对话揭示了这一点。模型,特别是那些在公开数据上训练的模型,只看到人们选择发表的内容。"暗数据"——那些失败或从未记录下来的实验——仍然不可见。用人工智能丰富基础真相并不能解决这个盲点;相反,它可能会"洗白"这个盲点,为基于系统性不完整图景得出的结论提供信心。这项技术在基础真相坚实的地方非常强大,在基础真相薄弱的地方则不可靠。

真正的价值:方向性价值

如果这次交流中有一句话值得铭记,那就是:当被问及人工智能在早期发现中真正擅长什么时,林奇重新定义了问题,围绕"接下来应该运行什么实验"展开。

"最终我们确实需要做实验……现在更多地帮助我们的正是选择哪些实验来丰富我们的决策过程。"

这比"人工智能将发现你的药物"的说法更为低调,也更为可信。它的价值在于提供方向,利用人工智能来识别能够同时实现两个目标的实验:推进项目并丰富未来的数据空间。不仅针对当前问题,也针对尚未提出的问题。

"它使用人工智能来帮助我们确定哪些实验将同时增加方向性价值——即真正推进项目——以及可能不仅对现在,也对未来丰富数据空间的数据。"

这与旧的组合化学习惯相反,后者基于"数量等于价值"的假设构建庞大但缺乏多样性的文库。如果做得好,人工智能可以让团队专注于信息量最大的实验,同时保持足够的想象力,在预算允许的情况下偶尔扩大范围,以填补真正的数据空白。已经承诺进行高通量实验的公司,如Recursion,正是为了填补数据中的这些空白。

有一个明显的注意事项,林奇自己也提到了:对于化学来说,如果分子无法合成,那么推荐就毫无价值。合成可行性必须嵌入到智能体和推荐中,否则你只是生成了一份无人能够合成的有吸引力分子列表。

从"做/不做"到探索空间

更具前瞻性的线索是决策框架的转变。早期的机器学习倾向于二元、区分性的决策:做或不做,推进或不推进。林奇认为,这始终是对实际问题的简化。

药物发现是多参数优化(MPO),边界不清晰,改变一个属性会降低另一个属性。人类直觉最多能处理三到四个维度;数据却有许多维度。这里使用人工智能的真正理由是关于"覆盖范围"——导航我们无法在脑海中把握的高维空间,并且避免我们的一些简化偏见。

"我们人类大脑可能最多只能处理三到四个维度,但凭借数据的维度,我们有更好的机会,"林奇说。

有一个值得注意的微妙矛盾。正如林奇所指出的,我们"热衷于简化";我们喜欢将复杂性压缩成我们可以在三维中可视化的形式,使其变得简单以便采取行动。人工智能的部分承诺是它不必像那样行事。然而,团队无法理解的建议是他们难以信任或采取行动的建议。使人工智能有价值的维度,也是使其输出难以审查的维度。这不是避免使用它的理由;而是要诚实地认识到"探索空间"是一项仍在发展的能力,而非已解决的问题。

对你的启示

按照这种理解,早期发现中实用的人工智能版本是平凡而具体的:它不是一台知道答案的机器,而是一套告诉你接下来应该运行什么实验的工具——在这样做的同时,悄无声息地构建更丰富的数据集。它所证明合理的支出是用于方向和数据的支出;而不是用于承诺的支出。

它所要求的纪律是古老的。首先定义你真正想要回答的问题。诚实地面对你的基础真相中的空白。并且对每一个"工具明天就能交付"的保证,都应用你对过去十年追逐的任何其他"兔子"所持的同样怀疑态度。

【全文结束】