规模分野:AI药物发现中的竞争策略The scale divide: competing strategies in AI drug discovery | Drug Target Review

环球医讯 / AI与医疗健康来源:www.drugtargetreview.com美国 - 英语2026-10-09 03:51:13 - 阅读时长8分钟 - 3852字
人工智能在临床前药物发现领域正呈现出两种截然不同的战略路径:一边是投入数千GPU的大规模计算资源策略,另一边是仅需少量参数的轻量级架构策略。本文深入分析了这两种方法的优劣势,通过罗氏、礼来等企业的实际案例,以及最新科研成果(如仅需21个参数就能学习RNA碱基配对规则的模型),探讨了在药物研发成本高达数十亿美元的背景下,如何合理配置计算资源以实现最佳研发效益,为行业提供了宝贵的战略思考框架,指出最有效的发现策略可能是任务分解而非单一方法,应当根据问题特性采用组合方法以最大化研发效率。
健康AI药物发现临床前研究基因组蛋白质结构靶点识别RNA调控疾病治疗药物重定位生物模型
规模分野:AI药物发现中的竞争策略

在临床前药物发现领域,AI的两种方法正在分道扬镳,一边是数千GPU系统,另一边是仅有少量参数的模型,早期结果引发了对哪种方法将最终胜出的质疑。

2026年3月,两周内发生的两项发展共同揭示了AI驱动的临床前药物发现中的一条战略断层线。一方面,罗氏(Roche)揭幕了制药行业最大的混合云AI工厂——在美国和欧洲部署3,500个英伟达(NVIDIA)Blackwell图形处理器(GPU)以支持基因泰克(Genentech)的"循环实验室"(Lab-in-the-Loop)策略1;礼来(Eli Lilly)则启用了LillyPod,一个拥有1,016个GPU的SuperPOD,提供超过9,000 petaflops的算力,用于训练药物发现和开发的生物医学基础模型2。另一方面,研究团队在《自然·通讯》(Nature Communications)发表论文,证明RNA碱基配对的基本生物规则仅从序列中就能学习,使用的模型仅包含21个参数3。

没有结构化训练数据,没有大规模计算——仅需二十一个参数。这些并非同一连续体上的不同点。它们代表了AI应如何应对临床前发现分子复杂性的两种截然不同的理论——而药物发现界尚未充分认识其分歧的影响。

在整个2025年到2026年,规模论主导了基础设施投资。Arc研究所的基因组基础模型Evo 2发表在《自然》(Nature)上,该模型在9万亿DNA碱基对上训练,拥有400亿参数,用于预测遗传变异的功能影响——包括零样本BRCA1变异致病性——涵盖所有生命领域4。单细胞基础模型CellVQ在6,800万个细胞上部署5亿参数,学习细胞状态表示并构建生物发现的知识图谱5。scLong则在全部28,000个人类基因上推进至10亿参数,以捕捉传统模型错过的长程调控依赖关系6。

逻辑很清晰:药物发现需要在广阔的化学和生物空间中导航,数据日益丰富,因此规模制胜。

在2026年英伟达GTC大会上,Proteina-Complexa生成模型发布,用于基于结构的蛋白质结合剂设计,诺和诺德(Novo Nordisk)、维亚生物(Viva Biotech)和Manifold Bio已使用它设计并实验验证治疗候选物7。同时,英伟达、谷歌DeepMind、欧洲分子生物学实验室-欧洲生物信息学研究所(EMBL-EBI)和首尔国立大学的合作将AlphaFold蛋白质结构数据库扩展了约3,000万个AI预测的蛋白质复合结构7。逻辑很清晰:药物发现需要在广阔的化学和生物空间中导航,数据日益丰富,因此规模制胜。

架构论则始于不同前提:生物系统包含深层结构规律性,将这些规律编码为归纳偏置的模型能够以显著更少的参数实现有竞争力的性能。21参数RNA结果是最尖锐的例证,但并非孤例。同样发表在2026年3月《自然·通讯》上的EPInformer仅用40万参数就能在预测增强子-基因调控相互作用方面超越现有方法——这是靶点识别的核心任务8。

Profluent在《自然·生物技术》(Nature Biotechnology)上发表的Protein2PAM,使用基于进化的蛋白质语言模型,该模型在超过45,000个CRISPR-Cas原间隔序列邻近基序(PAMs)上训练,通过计算进化实现了Cas9酶切割活性50倍的提升,无需任何实验室筛选或结构建模9。这些临床前工具以基础模型方法计算成本的一小部分提供实验验证结果。

这种分歧的经济维度值得更深入审视。专家系统公司(Expert Systems)CEO图多尔·奥普雷亚(Tudor Oprea)在2026年3月的Bio-IT World上提供了罕见的定量框架:生成式AI目前每天在制药行业发现管线中运行约1,000-2,000万次预测,但该领域缺乏评估单个预测价值的框架10。奥普雷亚的观点——一个可信的预测价值应至少相当于它所替代实验的5%——意味着如果AI输出无法显著减少湿实验室周期,那么大多数AI输出在经济上可能微不足道。仅阿斯利康(AstraZeneca)的预测洞察平台每天就生成约100万次预测10,11。如果其中只有一小部分改变了下游药物化学决策,那么对底层计算基础设施的回报就需要认真审视。

该领域缺乏评估单个预测价值的框架。

这种审视尤其适用于发现阶段的GPU军备竞赛。罗氏的AI工厂支持基因泰克的"循环实验室"——据描述这一方法已探索五年1。礼来的LillyPod则为TuneLab平台提供动力,向外部生物科技公司提供联邦访问权限,使其能够使用基于礼来10亿美元专有数据构建的专有发现模型2。两者都代表了拥有深厚发现专业知识的组织的认真承诺。但基础设施驱动推理的风险——3,500个GPU的可用性塑造了被提出的问题,而非基础生物学决定所需的计算——在技术密集型研发中是真实存在且有充分历史记录的。

基础设施驱动推理的风险——3,500个GPU的可用性塑造了被提出的问题,而非基础生物学决定所需的计算——在技术密集型研发中是真实存在且有充分历史记录的。

新兴证据表明,两种理论并非普遍正确,最有效的发现策略可能是任务分解而非单一的。某些临床前问题确实需要规模:跨数百万变异位置的全基因组靶点识别、多靶点选择性建模以及跨十亿化合物库的虚拟筛选都涉及组合复杂性,仅靠架构聪明无法简化。Evo 2的跨域变异解释4和HAMGNN图神经网络整合LLM提取知识用于药物重定位,跨越220万生物医学知识图谱边12,两者都例证了数据量和模型容量是不可减少要求的发现问题。

相反,具有强生物学先验的问题——RNA二级结构、酶-底物特异性、蛋白质-PAM识别、增强子-基因调控——似乎是在发现实验台上架构优先方法能提供不成比例回报的领域。2026年第一季度多项出版物的模式一致:基于生物学的模型以参数权重"超水平"表现,在特定、特征明确的临床前任务上达到与或优于大几个数量级模型的性能。

基于生物学的模型以参数权重"超水平"表现,在特定、特征明确的临床前任务上达到与或优于大几个数量级模型的性能。

对发现团队而言,实际含义是,对"构建基础模型"或"投资GPU基础设施"的全面承诺混淆了具有根本不同计算特征的问题。组合方法——为真正数据饥渴的发现问题配置大规模基础设施,为可将领域知识形式编码的任务配对轻量级生物学优先模型——可能比单独追求任一策略表现更好。21参数的挑战并不否定规模论。相反,它揭示该领域一直将组合问题视为规模问题——在将药物推向市场的估计成本以数十亿美元计的行业中,当分配临床前研究预算时,这一区别至关重要13。

最有效应对这一分歧的组织,将是那些在将计算资源投入发现项目前,提出一个看似简单问题的组织:生物学已经知道什么,而模型不需要从数据中学习?2026年第一季度,越来越多的同行评审证据表明,答案远比行业假设的要多。

参考文献

[1] 罗氏. 罗氏推出英伟达AI工厂,加速新治疗和诊断解决方案开发. 新闻稿,2026年3月16日.

[2] 英伟达博客. 上线:礼来用于药物发现和开发的AI工厂. 2026年2月27日.

[3] 普拉塔普JS, 克鲁格RK, 里瓦斯E. 深度学习模型证明RNA碱基配对规则可仅从序列中以最少参数学习. 《自然·通讯》,2026年3月26日.

[4] 布里克西G等. 使用Evo 2跨所有生命领域进行基因组建模和设计. 《自然》(2026). DOI: 10.1038/s41586-026-10176-5.

[5] 王J, 谭C, 李SZ. CellVQ:通过全面且可解释的单细胞基础模型照亮细胞状态. 《自然·通讯》(2026). DOI: 10.1038/s41467-026-70071-5.

[6] 白D等. scLong:用于捕获单细胞转录组学中长程基因上下文的十亿参数基础模型. 《自然·通讯》(2026). DOI: 10.1038/s41467-026-69102-y.

[7] 英伟达新闻室. 英伟达扩展开放模型家族,为下一代代理、物理和医疗AI提供动力. 2026年3月16日.

[8] 林J, 李Z, 赵Y等. EPInformer:通过启动子-增强子序列和多模态表观基因组特征可扩展且整合的基因表达预测. 《自然·通讯》(2026). DOI: 10.1038/s41467-026-70535-8.

[9] 纳法克S等. 使用蛋白质语言模型定制CRISPR-Cas PAM特异性. 《自然·生物技术》(2026). DOI: 10.1038/s41587-025-02995-0.

[10] Bio-IT World. 药物搜寻中预测的价值与成功成本. 2026年3月26日.

[11] 阿斯利康预测洞察平台. 《药物发现今日》(2024). DOI: 10.1016/j.drudis.2024.103945.

[12] 萨兰亚K等. 药物重定位和生物标志物发现中的生成式AI:多模态方法(HAMGNN). 《生物信息学前沿》(2026). DOI: 10.3389/fbinf.2026.1755412.

[13] 沃特斯OJ, 麦基M, 吕滕J. 2009-2018年将新药推向市场所需的研发投资估计. 《美国医学会杂志》323(9):844-853 (2020). DOI: 10.1001/jama.2020.1166.

【全文结束】