摘要
制药研发已积累了大量异构数据档案。这些知识大多来自已终止的项目,而重新利用这些档案对于反向翻译(reverse translation)具有不可估值的价值。然而,在实践中,这种再利用往往不可行。在本研究中,我们介绍了DiscoVerse,这是一种为支持罗氏制药研发而设计的多智能体科学辅助系统。作为一个人机协同的助手,DiscoVerse通过提供基于证据的答案来支持领域特定的查询:它检索相关数据、链接文档、总结关键发现并保存机构记忆。我们通过对源链接输出的专家评估来评估DiscoVerse。我们的评估涵盖了罗氏研发仓库中180种选定分子的子集,包含超过0.87亿字节对编码(BPE)令牌和四十余年的研究数据。据我们所知,这是首个在真实制药数据上系统评估用于反向翻译的智能体框架,得益于对涵盖药物开发全生命周期的机密档案的授权访问。我们的贡献包括:与科学家工作流程相匹配的角色专业化智能体设计;支持反向翻译的人机协同;专家评估;以及展示有希望的决策见解的大规模演示。简言之,在七个基准问题中,DiscoVerse实现了近乎完美的召回率(≥0.99)和中等精度(0.71-0.91)。定性评估和三个真实世界的制药用例进一步表明,该系统能够在临床前和临床证据之间进行忠实、源链接的综合。
1 引言
制药行业数十年来产生了大量实验数据。对于每个药物候选物,公司通常会产生内部研究报告、原始实验数据、毒理学发现、组织病理学评估、非临床和临床研究展示,以及贯穿药物发现和开发的决策过程文档。这些材料共同形成了一个庞大但未被充分利用的资源。
这些数据的相当一部分来自于在不同开发阶段停止的药物候选物。尽管淘汰是制药研究固有的特点,但这些数据仍然有价值。其中包含治疗相关发现、靶器官毒性、安全性和有效性信号以及详细的实验方法。通过反向翻译(Kasichayanula和Venkatakrishnan, 2018; Honkala等, 2022; Vanmeerbeek等, 2023; Sokol等, 2025),临床结果可以为早期研究提供信息,从而识别新的靶点和生物标志物(Shakhnovich, 2018)并重用临床药理学和监管审查的经验教训(Faucette等, 2018)。一个代表性例子是通过将临床研究中观察到的治疗耐药性追溯到潜在生物学,发现了TGF-β通路作为治疗靶点(Mariathasan等, 2018)。
反向翻译的一个关键挑战是规模和碎片化问题。端到端药物开发产生数千份异构文档,分布在组织和外部合作伙伴之间,命名规范不一致,项目特定术语不断演变。因此,手动浏览和基于关键词的搜索效果不佳。同义词、术语漂移、表格数据和上下文相关的措辞导致遗漏证据和错误匹配。解决这一问题需要语义检索、跨文档链接、临床前-临床数据对齐和可审计综合(Honkala等, 2022; Henrique Vieira E Vieira等, 2025)。当遗留数据集经过整理并可搜索时,它们可以支持跨项目的定量分析、机器学习和预测毒理学,减少重复实验并改善决策。
最近的大型语言模型(LLMs)可以阅读和综合大量非结构化语料库,并生成简洁、基于来源的生物医学文本摘要(Tung等, 2024; Van Veen等, 2024; Williams等, 2025; Ghim和Ahn, 2023; Wornow等, 2025; Gallifant等, 2025; Lai等, 2024)。这些能力使LLMs成为在许多历史报告中应用一致标准的实用工具,使相关证据能够在大规模上显现。
然而,制药研发对单一智能体LLMs提出了挑战。大型制药行业的研究高度特定于上下文,终点、检测方法和术语的差异限制了标准化提示和指令在上下文学习中的有效性(Brown等, 2020; Wei等, 2022a,b)。此外,与多个合同研究组织的合作引入了进一步的异质性。因此,单一智能体系统往往无法从稀疏或非代表性信息源中进行泛化(Reizinger等, 2024; Sengupta等, 2025; Peters和Chin-Yee, 2025)。这些问题因数据孤岛和长期术语漂移而加剧。此外,研究是以分子为基础组织的,在整个药物开发生命周期中,每个分子累积的文档远远超过现代LLMs的上下文窗口。
因此,我们采用了一种多智能体系统(MAS)架构,具有用于检索、研究、验证和综合的角色专业化智能体。通过使智能体能够相互批评并强制基于来源的输出,MAS支持可追踪和可审计的推理,这在受监管的制药研究中至关重要。先前的工作表明,在具有有限演示的专业领域中,MAS可以优于单一智能体系统(Wang等, 2024; Chen等, 2025; Wang Z.等, 2025; Jin等, 2025; Zhu等, 2025b; Wu等, 2024; Huang等, 2025; Zhu等, 2025a; Seal等, 2025)。
基于这一框架,我们开发了DiscoVerse,这是一种为药物开发全生命周期中的药物知识摄入和转化分析而设计的多智能体科学辅助系统。DiscoVerse整合了临床前和临床数据,以支持实验发现与临床结果之间的系统映射。作为一个"人机协同"系统,它允许科学家查询历史项目(例如化合物终止的原因)并检索关联的分子、毒理学和临床证据。通过这样做,DiscoVerse支持反向翻译并在当前研究项目中重用过去的开发经验。
我们框架的关键贡献是四重的:(i) 模拟科学家工作流程的专业化智能体设计,每个智能体针对具有外部知识可用的独特子任务进行优化;(ii) 将人机协同集成到药物设计工作流程中,从长文档摄入,通过领域特定的问答和历史比较分析,到可操作的设计见解和反向翻译;(iii) 对真实世界制药数据的专家评估:与主要依赖整理好的基准数据集的先前工作不同,我们使用真实的制药研发数据构建并系统评估我们的框架;以及(iv) 在真实制药知识库上的大规模演示,展示了在答案准确性和决策上下文洞察方面的有希望的结果,而这些以前是耗时才能组装的。
与现有AI驱动的药物发现系统的关系
最近的研究已经产生了几种用于制药和生物医学研究的多智能体LLM系统,每种都针对发现流程的不同阶段。AI Co-Scientist (Gottweis等, 2025)在公开文献上采用"生成、辩论和演进"范式,为药物重定位和靶点识别产生新假设。PharmaAgents (Gao等, 2025)模拟了一个虚拟制药流程,用于小分子设计,从靶点识别到先导物优化。TxGemma (Wang E.等, 2025)、BioDiscoveryAgent (Roohani等, 2025)和BioReason (Fallahpour等, 2026)分别专注于分子属性预测和基因扰动实验设计,利用计算生物学的专用工具链。BioMNI (Huang等, 2025)提供了一个通用生物医学智能体,结合LLM推理与跨公共数据库的动态工具执行。在工作流程层面,(Shahin等, 2025)提出了用于临床药理学和转化科学任务的AI智能体。一项由(Seal等, 2025)进行的全面调查显示,这些系统按照ReAct、Reflection、Supervisor和Swarm架构进行分类。
DiscoVerse在三个方面与这些系统不同。首先,它在专有、机密的制药档案上运行,而不是在公开文献或分子数据库上,需要稳健处理格式不一致的异构遗留文档。其次,它明确针对反向翻译,将临床结果与已终止项目中的临床前证据联系起来。这是一个现有系统尚未解决的用例。第三,它通过结构化模式强制端到端的源可追溯性,专为可审计性是硬性要求而非理想功能的受监管环境部署而设计。这些区别使DiscoVerse成为假设生成和分子设计智能体的补充:当那些系统提出新的候选物时,DiscoVerse挖掘机构记忆以确定这些候选物是否以及如何推进。
2 方法论
如图1所示,DiscoVerse作为一个模块化的多智能体系统实现,具有检索工具调用功能。该系统由模拟制药研发中常见科学工作流程的角色专业化智能体组成:
- 临床前智能体解决与人体首次试验前研究相关的问题,包括体外检测和动物毒理学研究。
- 临床智能体专注于进入人体研究后的研究活动,如临床试验和临床安全评估。
- 战略智能体处理更高级别的问题,包括组合决策、项目终止理由和跨项目比较。
这些领域智能体由一个监督智能体(Supervisor Agent)协调,该智能体编排查询路由、跟踪执行并整合跨领域的结果。这种设计允许每个智能体使用特定领域的提示和逻辑操作,同时确保发现被连贯地组合。所有智能体通过结构化消息进行通信,监督者确保输出与原始用户查询保持一致。
为了支持一致和可审计的输出(Karmaker Santu和Feng, 2023; Dagdelen等, 2024; Zaratiana等, 2025),DiscoVerse还包括分类智能体(Taxonomy Agents)。这些智能体在领域智能体下游运行,将提取的证据映射到与科学家和项目负责人共同开发的模式库中。模式库存储专家定义的问题类型,包括分类规则、所需证据元素和结构化输出模板。单个用户查询可能映射到多种问题类型,从而实现跨临床前、临床和战略维度的组合,同时保留证据来源。
当用户向DiscoVerse提交查询时,它通过一个协调的多智能体工作流程进行处理,包括查询分类、查询分解(Ma等, 2023)、文档检索、相关性过滤、特定领域证据提取、跨智能体综合和结构化输出生成。每个步骤由一个专业智能体处理,以减少提示复杂性并提高可解释性。
从高层次来看,DiscoVerse将复杂问题分解为更小的、由智能体管理的任务。输入查询首先被分类并分解为特定领域的子查询,然后路由到适当的智能体。然后使用混合符号-语义搜索方法检索相关文档,对相关性进行审查,并提炼为特定领域的发现。监督智能体将这些发现整合为统一响应,而分类智能体则将结果映射到结构化模式中,以支持一致性和可审计性。
完整的端到端工作流程,包括智能体交互、检索策略、相关性阈值和后备机制,在附录A中有详细描述。
3 材料
我们的文档库包含15,762个PDF文件中的872,453,585 BPE (Sennrich等, 2016)标记,涵盖180种选定的药物分子。平均而言,每个分子与大约10,000页文档相关联,形成了一个全面的集合,包括动物研究报告、临床研究报告、会议纪要、项目总结演示和研究者手册。相当一部分数据来源于临床前体内动物研究。
该数据集跨越了四十多年的时间。因此,该集合包括遗留文档的扫描副本,在语言风格、技术细节水平和结构格式方面表现出相当大的变异性。这种异质性,特别是非数字文档的存在,对可靠的文本检索、解析和数据协调提出了重大挑战。详细的数据准备流程(包括嵌入和索引)在附录B中有描述。
4 基准问题
为了确保我们的评估反映科学家的真实需求并全面测试DiscoVerse的能力,我们积极与毒理学项目负责人和安全临床及临床前科学家合作,确定评估已终止项目时通常提出的问题类型。因此,如图2所示,我们设计了九个临床前和临床相关问题,涵盖整个药物开发生命周期,每个问题旨在探究与后期药物开发相关的信息提取的一个不同方面。这些问题源自真实的决策场景和需求:评估已搁置的化合物是否可以重新用途化、了解为何类似的分子支架先前失败、或使用历史数据和先例分析确定新候选药物剂量范围研究的最佳上限剂量范围。总体而言,这些查询代表了一个复杂性的谱系,从简单的事实检索到不同信息的复杂综合。同时,设计策略确保我们的评估既有科学依据(反映科学家实际需要回答的问题)又全面诊断(系统测试有效药物知识提取所需的每种能力)。
5 结果
5.1 实验设置
我们的实验旨在测试和评估DiscoVerse多智能体架构的系统级性能,而非评估单个LLM的能力。所有智能体都由GPT-4.1 (gpt-4.1-2025-04-14)提供动力,以将架构贡献与模型特定变化隔离开来。我们在NVIDIA A100 GPU上本地运行嵌入和重排序模型。
我们对数据集中的每个分子执行了DiscoVerse的每个查询(Q1–Q9),为每个分子-查询对生成非结构化(自然语言)和结构化(格式化)输出。为了实现严格的专家评估并确保可追溯性,我们记录了所有检索到的文档块、中间智能体输出和源归属。
5.2 基准问题结果
我们评估了DiscoVerse在七个基准问题上的表现,这些问题是设计用来模拟真实制药信息检索任务的。完整指标(准确率、精确率、召回率、特异性率和F1分数)见表1。专家评估的设计在附录C中描述,每个基准问题的详细标准见附录D。我们选择准确率、精确率、召回率、特异性率和F1分数来量化性能,如附录E所述。结果显示出一致的性能模式,定义了该系统在药物开发工作流程中应该如何使用。
在所有查询中,DiscoVerse实现了近乎完美的召回率(六个查询为1.0000;Q4为0.9864),确保很少错过相关项目。性能变化的地方在于精确率和特异性率。精确率范围从0.7142(Q5)到0.9078(Q6),表明存在假阳性倾向。补充这一观点,特异性率跨度从0.6707(Q3)到0.8828(Q4),显示系统正确拒绝不匹配内容的频率。换句话说,当智能体接受边界或上下文不匹配的项目时,精确率(正集纯度)和特异性率(负集拒绝)都会下降。较低的特异性率反映了大量负样本被错误标记为正样本。与上述精确率范围一起,这描绘了一致的画面:系统积极检索候选项目(高召回率),但有时过度包含接近不匹配的证据,降低了精确率和特异性率。
专家评估表明,这些假阳性并非幻觉,而是上下文理解失败。每个错误类别同时降低了精确率(向正集中添加不正确的项目)和特异性率(将真负样本转换为假阳性):当被要求提供临床剂量时,智能体可能会提取临床前剂量(在表2中Q1和Q3有描述);将计划的给药途径描述为实际给药途径(在表2中Q1和Q2有描述);混淆试验阶段(在表2中Q3有描述);将剂量与不相关的不良事件联系起来(在表2中Q4有描述);报告计划但尚未在人体中测试的剂量的有效性(在表2中Q5有描述);提供不正确的剂量特定细节,如错误的输注持续时间(在表2中Q6有描述);或将临床前安全边际与临床数据混淆(在表2中Q7有描述)。
具有高召回率和中等精确率的性能特征表明,DiscoVerse作为辅助工具而不是独立系统工作效果最佳。它自动化了知识工作中最繁琐的部分(全面搜索),而将上下文验证留给领域专家。这将工作流程从手动"搜索和综合"转变为AI辅助的"审查和发现"。Q8和Q9的详细分析在附录F中描述。
5.3 真实世界制药行业用例
5.3.1 用例1:跨物种肝毒性反向翻译
制药研究中的一个常见挑战是理解临床上观察到的肝毒性如何映射回临床前模型,特别是当发现较弱、不一致或受物种限制混淆时。在包括T细胞衔接剂、基于免疫细胞因子的治疗、反义分子和小分子等多种模式中,尽管临床前信号最小或模糊,但可能出现临床上相关的肝损伤,这使得剂量递增和风险评估变得复杂。
DiscoVerse通过从临床肝脏安全信号(例如,LFT升高、Hy's定律事件、肝细胞损伤)开始,并检索跨物种的对齐临床前、体外和机制证据,支持系统的反向翻译。将DiscoVerse应用于已终止和降级的项目,确定了多个案例,其中临床肝毒性可以回顾性地对照临床前数据进行检查。
如图3A所示,出现了几种重复的模式。首先,物种不相关性是信号遗漏的主要原因,特别是对于LM模式(例如,RO_A和RO_B),其中没有可用物种能充分捕获靶向生物学或脱靶肽-MHC相互作用。其次,免疫介导的肝脏效应在非人类灵长类动物中通常轻微或不一致,但对于RO_C、RO_E和RO_F等分子,临床上会表现出来。整合报告中的免疫激活信号使得这些联系比单个研究审查更清晰。第三,啮齿类动物的发现有时具有误导性,因为肝毒性仅在超治疗剂量下出现(例如,RO_G),掩盖了临床风险。最后,人类体外系统在RO_A等案例中提供了早期风险指标,其中3D肝细胞球体识别出在体内未检测到的责任。
总之,这个用例展示了DiscoVerse如何通过明确物种差距、机制信号和暴露限制来加强反向翻译。通过将碎片化的档案数据转换为结构化、可审计的证据,该系统支持更早识别转化风险,指导特定模式的安全策略,并在发现和早期开发中实现更一致的决策。
5.3.2 用例2:胚胎-胎儿发育中的定量风险评估
区分直接胚胎-胎儿毒性与继发于母体毒性的效应仍然是发育安全评估中的一个关键挑战。这种区分取决于对母体和胚胎-胎儿无观察到有害效应水平(NOAE LS)的一致比较,然而这些数据通常分散在非结构化报告中。
为了量化相对敏感性,我们定义:使用DiscoVerse,我们在180种分子和多个物种上提取了配对的母体和胚胎-胎儿NOAEL,以及Cmax和AUC值。临床前智能体通过将数字表格与叙述性描述进行三角测量来验证提取的值,过滤出非特异性毒性。这种同时提取对项目毒理学家来说具有重要意义,因为它能够可视化整个产品组合中的特定致畸风险区域——这是一种以前无法大规模执行的分析。
如图3B所示,化合物聚类成不同的风险区域。"红色区域"(相对敏感性比率>1)确定了在低于母体NOAEL的暴露下具有胚胎-胎儿毒性的分子,表明可能是直接致畸责任。这些模式允许安全团队识别遗留风险并将机制见解应用于新兴支架。
为了评估跨物种一致性,DiscoVerse还提取了小鼠、大鼠、兔子和食蟹猴的二元发育毒性结果。如图3C所示,这使得无需手动交叉引用即可直接计算物种一致性率。生成的数据集支持对模型预测能力进行定量评估,并在开发早期更明智地选择相关物种。
5.3.3 用例3:免疫原性和淘汰的战略回顾
免疫原性在临床前研究中经常被观察到,特别是对于大分子,但当它不是主要淘汰驱动因素时,确定其在已终止临床项目中的存在具有挑战性。免疫原性团队寻求识别可能被其他原因终止的项目中隐藏的人类免疫原性特定实例。目标不是重新裁定淘汰原因,而是系统地定位免疫原性与临床安全或临床有效性的主要驱动因素共同发生的"隐藏"阳性案例。
使用DiscoVerse,首先按主要淘汰驱动因素对已终止项目进行分层。如图3D所示,临床安全(11.7%)和临床有效(17.6%)与战略和临床前安全驱动因素一起被识别。然后,我们对临床有效(图3E)和临床安全(图3F)队列进行聚焦子分析,以区分动物和人类免疫原性事件。
对这些子集的分析显示,虽然动物免疫原性在两个队列中都很普遍(36.4%),但确认的人类免疫原性很少见。DiscoVerse成功地在安全队列中找到了两个阳性人类案例,在有效队列中找到了一个。关键的是,该系统不仅标记了这些分子,还提供了这些信号的特定研究背景。这使得可以检索关于特定分子的潜在免疫原性数据,否则这些数据会被广泛归类为安全或有效失败,为专家提供必要的证据,而无需手动审查整个历史档案。
6 讨论和结论
这项工作表明,DiscoVerse可以将碎片化的制药档案文件转换为可追踪的、可操作的知识。传统研究工具难以处理不一致的格式和丢失的机构记忆。通过将科学问题分解为对齐的子任务(临床前、临床和战略)并通过协调智能体强制基于来源的综合,DiscoVerse操作化了一个结构化的推理工作流程,模仿跨学科科学团队。
在七个定量基准(Q1-Q7)中,DiscoVerse实现了高召回率(≥0.986)和中等精度(0.71-0.91),在安全关键设置中这是一个有用的平衡,因为错过真实信号的成本高于审查额外候选者的成本。大多数假阳性源于上下文模糊而不是虚构,表明检索广泛但与证据相关。对Q8(终止理由)和Q9(多阶段毒性证据综合)的定性评估突显了该框架将不同数据组装成结构化、可审计摘要的能力。
DiscoVerse的一个关键特点是与专家监督保持一致。它不是作为自主决策者,而是自动化彻底搜索和初步综合,使科学家能够裁决上下文和含义。这种设计降低了幻觉风险并支持监管可追溯性,这在GLP/GVP环境中很重要。通过结构化模式链接源材料,即使否定或已终止的项目也变得可分析,将潜在数据转化为可用于反向翻译、假设测试、靶点验证和安全边际估计的可重用证据。
实用建议
基于我们开发和部署DiscoVerse的经验,我们强调在制药环境中构建基于LLM系统的几个考虑因素。(i) 在安全关键检索中优先考虑召回率而非精确率:错过真实安全信号的成本高于为专家审查提供额外候选者的成本;下游人机协同验证可以有效过滤假阳性。(ii) 将复杂查询分解为领域对齐的子任务:单一整体提示无法可靠处理跨越临床前、临床和战略维度的查询;具有集中指令的角色专业化智能体减少幻觉并提高可解释性。(iii) 在每一步保持源出处:在受监管的环境中,没有可追溯证据链的答案,无论其正确性如何,都有限的实用性。(iv) 为优雅降级设计:当文档缺失、解析不良或模糊时,系统应报告不确定性,而不是编造听起来合理的输出。(v) 投资于领域专家评估:在制药应用中,自动化指标与科学实用性相关性较差;尽管资源密集,专家裁决对于验证系统输出仍然至关重要。
局限性包括(i)由上下文漂移和不完整元数据导致的中等精度和(ii)需要手动最终解释。未来工作将集中在专家评估和对活跃项目的更广泛评估上,与计算机模拟建模的集成可以进一步展示转化价值。标准化审计跟踪和量化不确定性将支持在受监管环境中的部署。
总之,DiscoVerse展示了多智能体LLM系统如何在证据丰富的领域中作为科学辅助系统。通过强调基础、可解释性和专家监督而非原始自动化,它为负责任的AI整合到制药研究中提供了蓝图。当与机构专业知识结合时,DiscoVerse将历史档案转换为活的知识,加速发现,增强可重复性,并确保过去的经验教训指导未来的药物。
【全文结束】

