执行摘要
人工智能(AI)正在迅速改变制药行业,为加速药物发现、优化临床开发和简化制造及监管流程提供了新工具。随着AI系统在药物开发工作流程中日益深入,监管机构已着手提供明确指导,确保这些系统可靠、安全并符合现有质量和安全标准。2026年1月,美国食品药品监督管理局(FDA)和欧洲药品管理局(EMA)联合发布了"药物开发中良好AI实践指导原则",这一协作框架包含10项指导原则,旨在支持行业在药物生命周期中负责任地采用AI技术。这些原则强调了人类监督、风险管理、数据治理、生命周期控制和AI使用透明度等因素。
本全面实施指南深入剖析FDA/EMA指导原则,并将其转化为药物开发团队的实用合规策略。我们提供AI在制药领域兴起的背景、不断演变的监管环境概述,以及制定统一AI指南的理由。每项指导原则都经过详细分析——定义其意图、监管依据,以及药物申办方可以实施的具体措施。我们将这些原则映射到传统质量体系(如药品临床试验管理规范(GCP)、药品生产质量管理规范(GMP)和良好文件规范(GDP)),以说明AI特定期望如何与现有框架整合。
后续章节概述了组织和流程导向的实施策略。我们讨论建立多学科AI治理结构、为AI工具调整质量管理体系(QMS),并确保稳健的数据和模型文档。我们提供基于证据的风险管理方法,借鉴FDA的AI可信度框架和国际医疗器械监管机构论坛(IMDRF)的良好机器学习实践,以识别和缓解AI特定风险。重点放在AI工具的验证、持续监控和AI生命周期过程中的变更控制上。
真实案例和案例研究展示了成功经验和陷阱。例如,领先的制药公司(如礼来与英伟达在AI超级计算上的合作)展示了高风险AI投资,而监管互动(FDA关于AI模型可信度的草案框架)展示了监管机构如何评估AI组件。调查和专家强调了承诺与谨慎并存:尽管有重大AI计划,但药物批准率保持稳定(每年约50种新药),这凸显了监管严格性仍然决定结果。
文章通篇整合了监管发布、同行评议研究、行业分析和权威报告的广泛引用,以支持所有主张。我们还考察了相关监管活动(如IMDRF 2025年良好ML实践指南、瑞士医药管理局(Swissmedic)的AI框架)和即将出现的发展(欧盟AI法案、不断演变的指导),将FDA/EMA方法置于更广泛的合规生态系统中。基于统计的数据(市场预测、采用调查、AI对研发时间表的影响)支撑我们的分析。
最后,报告讨论了未来影响:这些原则将如何适应快速发展的AI技术(如分子设计中的生成式AI),以及监管机构可能如何进一步完善要求。结论综合了药物开发者的关键行动项目,敦促主动使AI计划与监管期望保持一致,以安全推进创新。
引言与背景
人工智能(AI)——广义定义为基于数据学习进行预测或决策的机器算法——有望彻底改变药物开发。AI方法(包括机器学习、深度学习和生成模型)可以处理大量生物医学数据集,以识别新的药物靶点、设计具有最佳特性的分子、模拟毒理学、选择试验患者并优化制造流程。行业领导者正在做出大胆投资:例如,截至2026年初,礼来宣布与英伟达合作建立AI驱动的超级计算机,旨在开发研究模型、自动化实验室规划并提高制造效率。主要初创公司(Insitro、Formation Bio、Xaira Therapeutics等)正为AI驱动平台吸引数十亿美元投资。2025年的调查数据显示,70%以上的大型制药公司正在进行研发AI项目,全球药物开发AI市场预计到2025年将超过15亿美元(2024年约为12亿美元)。
尽管在AI技术和投资方面取得重大进展,但监管和合规考虑仍然至关重要。无论开发中使用何种技术,药品和生物制品在市场批准前都必须满足严格的疗效、安全性和质量要求。历史上,监管机构一直要求对影响关键决策的任何流程和方法进行严格验证。在AI背景下,这包括确保数据完整性、最小化算法偏差、保持模型生成结果的可追溯性,并维护人类问责制。正如瑞士医药管理局(瑞士机构)所指出的,AI/ML模型的复杂性和不透明性带来了重大挑战——例如确保数据质量、模型透明度和偏差控制。如果没有适当的控制措施,AI输出可能会危及患者安全或科学有效性。
鉴于此,全球监管机构开始发展其指南。美国FDA在数字健康创新举措的基础上,多年来一直在发布与AI相关的指南。关键里程碑包括FDA 2020年发布的软件预认证试点计划、2021年内部AI计划的成立,以及2025年1月6日的草案指南"人工智能在支持药物和生物制品监管决策中的使用考量",这是FDA首次明确解决药物申报中AI问题的草案。在该新闻稿中,FDA专员罗伯特·卡利夫博士强调了对"敏捷、基于风险的框架"的承诺,该框架在维护标准的同时促进创新。FDA指出,"自2016年以来,AI在药物开发和监管申报中的使用呈指数级增长",这促使需要正式的可信度框架。与FDA平行,欧洲EMA已开始探索性工作(例如2024年的AI反思文件),并于2025年底宣布即将出台联合FDA-EMA原则。
与此同时,国际监管机构正在就基础框架达成一致。代表美国、欧盟、日本、加拿大、澳大利亚等机构的国际医疗器械监管机构论坛(IMDRF)于2025年1月发布了针对医疗器械AI/ML的"良好机器学习实践"指南,强调了许多类似原则(文档、基于风险的设计、监控)。欧盟新的AI法案(2023年中成为法律)为高风险AI系统(包括医疗设备和关键医疗保健应用)引入了基于风险的法律要求,强调透明度和安全性。诸如经合组织(OECD)和世界卫生组织(WHO)等组织也制定了高级AI伦理和风险框架。
在此背景下,药物开发团队面临一项复杂任务:在驾驭未知的监管领域的同时,利用AI的益处。确保合规不仅仅是基本软件验证;团队必须实施"良好AI实践"——类似于GxP(良好[机器]实践),将AI治理整合到传统质量体系中。本报告提供了这样做的深入指南,与新发布的FDA/EMA原则保持一致。
监管环境
FDA/EMA联合指南并非孤立存在。在美国,药物开发受已建立的法规管辖:21 CFR第210/211部分(GMP)用于制造,21 CFR第312部分(INDs),21 CFR第314部分(NDAs/BLAs),以及21 CFR第11部分(电子记录)用于eCTD提交等。在欧洲,框架包括欧盟GMP、ICH指南(例如ICH E6(R3)关于GCP,E8关于一般考虑)以及EMA的GIRP(良好信息管理实践)。这些框架传统上并未明确解决AI问题,而AI具有独特的生命周期动态。
然而,正如FDA 2025年新闻稿所强调的,AI使用"可以以各种方式产生关于药物安全性、有效性和质量的数据或信息"(例如预测患者结果或分析真实世界数据)。因此,AI输出通常被整合到证据包中;申办方可能在监管提交中上传AI衍生分析。FDA承认它"拥有大量经验"审查包含AI组件的提交,但此前没有关于如何这样做的专门指南。
新的FDA指南草案(2025年1月)和2026年指导原则都回应了这一缺口。特别是,"AI使用考量"草案指南推荐了一个可信度框架:申办方应描述AI模型的使用背景、分析过程和性能证据。这反映了FDA对医疗器械AI的方法(该方法有自己的关于"参考vs持续学习"模型的指南)。实际上,FDA现在期望药物申办方将AI工具视为其质量管理体系(QMS)的一部分,并像验证任何其他验证一样证明其可靠性。
在国际上,EMA也认识到了这一需求。EMA新闻稿(2026年1月)指出,监管立法("新制药立法"和欧盟生物技术法案提案)正在通过在受控环境中容纳创新AI方法来赶上AI。EMA战略文件(EMANS 2021-2028)明确呼吁在监管审查中利用AI,预计即将出台的欧盟制药GMP附录和良好GCP指南将提及AI工具。其他监管机构(如加拿大卫生部、澳大利亚TGA、瑞士Swissmedic)已发布鼓励在提交中负责任使用AI的高级声明,通常引用FDA/EMA原则和IMDRF指南。
关键要点:药物监管机构正在向基于风险、文档化的AI方法靠拢。FDA/EMA良好AI实践原则呼应并扩展了现有良好实践范式(例如,概念上类似于GMP/GLP/GCP背景下的软件验证),但针对AI的迭代、数据驱动特性进行了定制。团队应预期不断变化的要求:诸如ICH M17(数字技术)和欧盟AI法案等计划将进一步塑造合规性。
良好AI实践指导原则
2026年1月,FDA和EMA联合发布了药物开发中良好AI实践的10项指导原则。这些原则为整个药物开发生命周期(从早期研究到上市后监测)提供高级指导。它们不是具有法律约束力的法规,而是申办方和监管机构将衡量AI使用的期望。重要的是,它们在FDA和EMA之间保持一致,表明对AI治理的统一跨大西洋立场。(原则摘要表如下。)
| 原则编号 | 原则标题 | 核心焦点 |
|---|---|---|
| 1. | 以人为中心的设计 | 嵌入人类监督和问责;AI作为咨询/辅助工具,而非自主决策者。 |
| 2. | 基于风险的方法 | 根据评估风险调整AI努力;评估AI使用的位置/时间并相应缓解风险。 |
| 3. | 遵守标准 | 遵守现有适用标准(GxP、技术、网络安全);将AI整合到质量体系中。 |
| 4. | 明确使用背景 | 明确定义AI支持的任务/决策;确保记录适当的范围和限制。 |
| 5. | 多学科专业知识 | 在AI项目中利用跨职能团队(技术、临床、监管、质量等)。 |
| 6. | 数据治理和文档 | 确保数据质量、来源、安全性;维护数据集和数据处理计划的详细文档。 |
| 7. | 模型设计和开发 | 遵循严格的模型/软件开发(版本控制、测试、验证),具有完全可追溯性。 |
| 8. | 基于风险的性能评估 | 通过科学可信的方法验证AI性能;在上下文中监控准确性和错误率。 |
| 9. | 生命周期管理 | 建立模型更新、重新验证和退役的流程;发布后持续监控。 |
| 10. | 清晰、必要的信息 | 向最终用户/监管机构提供关于AI的透明文档(能力、限制、预期用途)。 |
这些原则相互关联,共同促进安全、有效性和质量——药物监管的核心原则。它们借鉴了既定的监管概念:例如,原则2("基于风险的方法")呼应ICH Q9关于风险管理的内容,原则10("清晰信息")与21 CFR 211.130和ICH E3平行,要求报告清晰。重要的是,原则强调每个阶段的文档和透明度,反映监管机构审计和审查AI流程的需求。
表1:FDA/EMA良好AI实践指导原则
| 原则 | 描述(监管重点) |
|---|---|
| 1. 以人为中心的设计 | AI工具应支持而非取代人类专家。系统设计时应考虑人类监督(例如,"人在环路"确认输出)。AI的角色和限制必须明确。 |
| 2. 基于风险的方法 | AI开发和部署应与潜在错误的风险水平成比例。高风险应用(如安全决策)需要更严格的控制(测试、审查)。团队必须评估可能出错的地方并缓解它。 |
| 3. 遵守标准 | AI软件和流程必须符合适用法规和指南(例如FDA的QSR、欧盟GMP附录11、GCP、ISO 13485、ISO 14971)。例如,数据加密、审计跟踪和受控变更管理应遵循现有的IT/QMS标准。 |
| 4. 明确使用背景 | AI工具的特定范围和应用必须明确定义并证明合理。这包括预期用户、数据类型和支持的决策。必须防止在此背景之外的误用。明确的"使用背景"告知风险评估和验证深度。 |
| 5. 多学科专业知识 | 开发和治理需要来自不同利益相关者的输入:领域科学家、临床医生、AI/ML工程师、统计学家、质量和监管专家,以及需要时的伦理学家。跨职能团队确保不会忽视临床和技术考虑。 |
| 6. 数据治理和文档 | 强大的数据管理计划必须记录数据来源、清理、标记、隐私和谱系。用于训练/验证的数据应具有代表性和无偏见。数据完整性控制(如版本控制和审计日志)必须符合监管期望(例如CFR)。 |
| 7. 模型设计和开发实践 | AI模型应在受控软件开发生命周期下构建。这包括版本控制、代码审查、基准测试以及对模型演化的限制。模型(重新训练、参数更新)的任何更改都必须有计划并记录(另请参阅FDA关于AI/ML变更控制的拟议指南)。 |
| 8. 基于风险的性能评估 | 在部署前,进行严格的验证以证明AI的性能(例如准确性、敏感性)满足其用例的要求。尽可能使用参考标准或保留数据集。部署后,持续监控性能指标和错误率,特别是假阴性/阳性,并根据需要进行调整。 |
| 9. 生命周期管理 | AI工具应在其整个生命周期内进行管理:包括定期重新验证的计划(当输入数据或系统上下文变化时)、受控更新的机制以及退役的标准。监测部署后(类似于产品监测)以捕捉漂移或过时。 |
| 10. 清晰、必要的信息 | 文档必须以适合最终用户的简单语言清楚说明AI的预期目的、能力和已知限制。培训材料、手册和标签应确保用户能够适当解释输出。监管提交应尽可能披露有关模型和数据的相关算法细节。 |
表1。良好AI实践指导原则(FDA/EMA 2026年1月)。这十个原则涵盖了在药物开发中使用AI的独特挑战,从概念到退役。每项原则都与确保AI涉及时的患者安全、产品质量和监管合规的总体目标保持一致。例如,原则1对人类监督的强调重申了最终决策(例如剂量变化、患者资格)仍由合格专业人员负责。原则6的数据重点反映了监管机构对完整数据可追溯性的长期要求,现在扩展到AI训练数据集。
这些原则设想了一个整体治理框架,而非孤立的修复。它们可能会通过补充现有GxP流程来实施。例如,基于AI的患者筛选工具(临床)或制造中的图像分析AI将各自需要明确的使用背景文档(原则4)和预测准确性持续监控(原则8)。
值得注意的是,虽然原则是高级别的,但预计将有众多下游指南和案例研究详细说明其实施。原则本身将"支撑未来的AI指南"和标准制定(EMA新闻稿)。实际上,药物开发者应将这些原则视为检查表和思维方式:当将AI集成到任何阶段时,确保至少解决了这些基本要素。本报告的其余部分深入探讨了每个原则及其实际实施。
原则深入与实施策略
下面我们将检查每个原则,讨论其理由、监管背景以及开发团队如何在实践中实施它。在相关时,我们借鉴专家评论和类似指南(例如GCP、SaMD)来说明最佳方法。
1. 以人为中心的设计
解释: 第一条原则强调AI系统必须设计为有人类参与。开发团队必须确保输出是咨询性的,而不是允许算法做出无人监督的决策。在影响患者护理或监管申报之前,合格专业人员必须监督和验证AI生成的见解。
理由: 监管和道德标准要求影响患者健康的任何决策都可以追溯到负责任的专家。例如,在临床试验进行中,主要研究者(根据ICH E6(GCP))不能将关键决策委托给未经审查的算法。同样,GMP要求最终产品发布决策由合格人员做出。通过将AI输出指定为咨询性,组织保留了现有的责任层次。这种方法也减轻了风险:即使高度准确的AI算法也可能出错,特别是对于非典型输入。人类审查员可以捕获分布外错误或上下文误解。
实施:
- 工作流程集成: 在工具设计期间,计划AI作为决策支持工具。例如,如果使用AI标记潜在的不良事件报告,药物安全官员应审查每个AI标记,而不是在没有监督的情况下自动向监管机构报告。
- 人在环路(HITL): 实施HITL检查点。在部署初期,对所有AI输出进行全面手动审查(类型:"筛选")。随着时间推移,如果性能得到证明,逐渐转向抽样和基于风险的审查。关键是要记录每个输出都经过训练用户审查。
- 审计跟踪: 使用系统日志和记录(例如CFR第11部分审计跟踪)显示人类审查并接受、编辑或拒绝每个AI建议。这是"清晰、必要的信息"(原则10)的一部分。
- 培训与SOP: 更新SOP,明确要求对AI输出进行人类监督。培训员工了解工具的预期用途(它可能犯什么错误)。例如,使用AI审查源数据的临床研究助理(CRA)仍必须证明数据。
- 用户界面设计: 对于软件UI,包括需要用户确认才能继续的提示或检查点。界面应显示AI发现的上下文,以便人类可以做出明智的决策。
示例: JustInTimeGCP的示例中,AI"站点文档审查服务"被构建为数据管理员看到AI建议的缺失文档,但在更新试验主文件之前必须接受。团队首先强制执行"全面人类审查",审查每个AI建议,然后随着信任增长转向"基于风险的确认"。这种渐进方法体现了原则1"实际应用"。
2. 基于风险的方法
解释: 原则2要求申办方评估和管理AI应用特定使用背景的风险。并非所有AI项目都具有相同的监管影响:自动化内部报告的叙述摘要的AI工具对患者的低风险,而建议剂量变化的AI则具有高风险。开发团队必须进行正式的风险评估,重点关注可能出错的地方、对患者安全或数据完整性的影响,并实施适当的风险控制措施。
理由: FDA和EMA监管的一个核心原则是基于风险的监管:资源和审查与对公共健康的潜在影响保持一致。该原则将这一原则扩展到AI。2025年FDA指南草案明确以基于风险的术语框架化AI可信度:"风险的大小应影响监管决策所需证据的水平"。例如,如果AI模型用于探索性数据分析,风险较低;如果用于生成主要疗效声明,风险较高,需要广泛验证。这种方法确保合规工作集中在高风险使用上。
实施:
- 风险评估流程: 将AI特定风险纳入现有风险管理框架(例如ICH Q9、ISO 14971用于设备)。创建一个跨职能风险委员会(原则5),识别危害:模型准确性故障、数据泄露、不当使用等。
- 使用背景: 精确定义AI的用例,如原则4所要求;然后根据对患者安全的潜在影响对风险进行分类(例如低、中、高)。FDA指南草案建议类似于决策支持与自主决策的类别。
- 风险控制: 对于高风险应用,应用更强的控制:更严格的数据质量检查、输出的独立验证、外部验证要求、冗余监控。对于低风险,较轻的监督可能就足够了。
- 可信度测试: 与拟议的FDA AI/ML可信度框架(7步)保持一致,强调基于风险的证据生成。这包括定义可信度水平并相应评估测试的严格性。JustInTimeGCP示例使用了这一概念:他们声称"低至中度风险,决策支持用例",并相应地结合可信度测试与强制人类审查。
- 文档: 在项目计划和监管提交中记录风险缓解措施。例如,提交可能包括风险评估摘要以及如何实施缓解(例如阈值、审查)。
示例: 考虑一个预测临床试验中患者退出风险的AI。风险包括错误分类患者(假阴性——错过退出会影响合规数据)。风险评估可能将假阴性归类为中等严重性(因为结果是数据完整性问题,而不是患者伤害)。控制措施可能包括对边界预测的手动审查,以及对预测性能的定期监控。基于风险的思考可能不需要此AI具有作为诊断设备的完整验证,但仍需要准确性统计数据。
3. 遵守标准
解释: 原则3提醒开发人员现有法规和技术标准仍然完全适用于AI系统。实际上,这意味着虽然AI引入了新元素,但它不能在监管真空中运行。申办组织必须确保其AI工具符合适用的GxP规则和其他相关技术标准(网络安全、IT控制、软件验证、数据保护法等)。这包括例如验证所使用的软件、确保审计跟踪(21 CFR 211.68、第11部分)以及管理AI软件的供应商质量。
理由: 监管框架早于AI,但它们仍然是基础。例如,用于制造的软件必须在21 CFR 211/820下进行验证。FDA/EMA原则假设处理受监管信息的AI工具受这些相同规则的约束。2025年FDA新闻稿指出"FDA严格的科学和监管标准得到满足",同时促进创新,这意味着不会减轻合规负担。不合规风险(例如数据完整性失误)仍然适用于AI输出。因此,原则3防止申办方认为AI是豁免的;相反,它必须适合整体质量体系。
实施:
- 质量管理体系整合: 将AI工具纳入QMS。这可能涉及向ISO 9001或13485 QMS添加AI特定流程:例如,AI供应商的资格认证、风险管理记录、AI系统错误的CAPA程序。
- 验证和确认: 遵循既定的良好验证实践(GVP):为AI系统开发验证计划、测试脚本、验收标准,根据软件类型(例如作为受监管的体外诊断,或质量控制工具)。如果AI模型输出最终进入eCTD,请确保代码和模型开发符合类似于软件变更控制的文档要求。
- 标准和指南: 与公认标准保持一致。例如:
- IEC 62304(如果被视为医疗器械软件):使用其软件生命周期过程进行开发和维护。
- ISO 13485 / CFR 820 QSR:设计、CAPA的质量管理。
- OECD、WHO或IMDRF AI/Ca框架:许多是基于原则的(透明度、问责制)。Swissmedic明确指出在AI评估中纳入IMDRF和ICH指南。
- 网络安全标准(ISO 27001、NIST):确保传输中和静态数据的适当安全性(原则6)。
- 受控环境: 将处理敏感数据(PHI、专有信息)的AI系统限制在经过验证、安全的IT环境中(例如具有加密、分段的GCP云)。JustInTimeGCP示例强制执行"基于身份的访问控制、传输中和静态的加密、环境隔离和不可变的审计日志",展示了AI工具应如何满足数据安全标准。
- GxP协调: 如果AI用于GCP试验(例如用于eCRF审查),确保其部署由QA和IT审查,并可能在供应商审计中进行审计。如果在GMP制造中使用,请将其纳入批次放行和设备资格流程。
案例说明: 制药QA部门引入AI来预测设施中的微生物污染风险。原则3要求该系统在GMP下进行验证,因为它影响质量保证。团队将编写软件/硬件的验证协议(安装资格、操作资格)。基础AI模型将成为计算机化系统验证的一部分,确保对模型(类似于QMS中的软件版本控制)的任何更改的可追溯性。
4. 明确使用背景
解释: 原则4坚持必须明确定义和记录AI将使用的精确背景。这包括AI工具适用的预期任务、边界和人群,以及对其使用的任何限制。明确定义的使用背景指导开发、验证和审查流程。
理由: 定义使用背景(CoU)将AI限制在预期应用中,防止不适当的推断。例如,一个在成人药代动力学数据上训练的AI不应在没有重新验证的情况下应用于儿科病例。从监管角度来看,未定义的CoU会导致风险评估不明确和监督不足。FDA的2025年指南草案通过使用它来校准可信度所需的必要证据,强调了CoU的重要性。通过澄清CoU,申办方证明了其AI的相关性和限制。
实施:
- 定义范围: 在项目文档(例如在IND/NDA或内部设计档案中),明确说明AI做什么和不做什么。这可能包括它需要的数据输入和产生的输出、计算环境以及它支持的决策节点。
- 用例示例: 提供具体的用例场景。例如,"此AI工具分析实验室检测图像以检测放行测试中的异常。它不用于患者诊断。"FDA/EMA指南广泛使用"使用背景";它应类似于如何定义医疗器械的预期用途。
- 文档: 在正式文档(例如验证计划序言、临床方案(如果在试验设计中使用AI))中包含CoU。确保所有团队成员都了解这些范围限制。
- 沟通: CoU应在培训材料中传达给最终用户。例如,如果AI模型仅支持文档完整性检查(如示例),强调它"不支持患者安全决策或监管申报"。这可以避免误用,也可以澄清监督需求。
- 模型训练数据: 使训练数据选择与CoU保持一致。例如,如果CoU是"成人1期试验数据",确保训练数据不包括无关人群。
- 审查员指南: 对于监管审查员,在提交中包含CoU声明。这有助于评估提供的验证是否符合预期用途。如果工具在此CoU之外运行,应进行单独评估。
示例: 在JustInTimeGCP场景中,团队明确指出他们的站点文档审查AI"仅支持内部TMF审查。它不支持临床决策、患者安全确定或监管申报"。通过声明这一点,他们限制了工具的使用,从而降低了风险状况。审查包含此类AI的提交的监管机构将看到它被适当限制在后台使用,而不是前线决策。
5. 多学科专业知识
解释: 有效的AI项目需要跨多个领域的协作。原则5要求形成跨职能团队,将技术AI专业知识(数据科学家、ML工程师)与领域专家(临床医生、统计学家、药理学家)、监管专家(QA、合规官员)、网络安全官员和业务负责人结合起来。
理由: 药物开发中的AI系统跨越多个领域。纯粹的技术驱动团队可能会优化算法的准确性,但会错过监管要求或临床相关性。相反,仅临床团队可能不了解ML的细微差别。监管机构强调问责制,实际上这意味着让能够证明AI方法适当性的主题专家(SME)参与。正如[17]所指出的,结合"深入的GCP和TMF领域专业知识"与AI和IT专业人员确保临床和技术考虑同时得到解决。
实施:
- 团队组成: 建立AI治理或指导委员会,包括以下代表:
- 临床运营(例如医学监查员、研究者)
- 数据科学/IT(ML工程师、软件开发人员、数据工程师)
- 监管事务/QA(确保合规对齐)
- 质量控制(用于制造聚焦的AI)
- 生物统计学(特别是用于试验/数据分析的AI)
- 信息安全(用于数据保护)
- 项目管理(所有NPC的协调)。
- 角色和责任: 为AI任务定义明确的RACI(负责、问责、咨询、知悉)。例如,ML工程师可能负责模型开发,但统计学家负责定义可接受的性能指标,QA官员负责监督文档。
- 定期治理会议: 定期召开会议,审查AI系统进度、风险状态和合规性。关于模型更改、验证范围或部署的决策应涉及多方批准(例如设计审查委员会)。
- 外部专家: 如有必要,咨询外部领域专家。例如,如果AI解决罕见疾病生物标志物分析,请让该适应症的专家临床医生参与。同样,法律顾问或伦理委员会可能会权衡隐私影响。
- 培训和沟通: 教育团队成员有关AI基础知识,以便他们能够有效协作。临床医生应了解AI可以/不可以做什么,数据科学家应了解适用法规。交叉培训提高了相互理解。
示例: 在实践中,一家生物制药公司使用AI进行试验患者匹配,创建了一个由其数据科学主管、首席统计学家、临床试验经理和QA审计负责人组成的团队。他们举行了每周"AI冲刺审查",技术负责人向临床医生展示模型输出,临床医生提供有关临床合理性的反馈。QA人员确保每个冲刺都有记录(提交日志、更改)以供审计。这种方法符合原则5对综合专业知识的呼吁。
6. 数据治理和文档
解释: 原则6强调在整个AI生命周期中对数据进行严格管理。这包括确保数据质量、完整性、来源和安全性,以及数据处理过程的完整文档。AI模型仅与其训练数据一样好;因此,控制数据至关重要。
理由: 监管机构长期以来一直关注数据完整性(GxP要求,FDA的ALCOA+原则:数据必须是可归因的、清晰的、同时的、原始的、准确的以及"完整、一致、持久、可用的")。在AI中,这转化为跟踪每个数据元素的来源(源系统、版本控制)、如何处理(清理步骤、标记),并确保其代表预期用途。不良数据会引入偏差或隐藏错误。Swissmedic明确警告"AI的复杂性和缺乏透明度[呈现]挑战...特别是数据质量评估、模型透明度、质量控制和可能的偏差"。如果没有强大的数据治理,监管机构无法信任AI输出。
实施:
- 数据生命周期计划: 对于每个AI项目,准备数据管理计划(DMP),指定:
- 数据源:列举来源(临床试验EDC、实验室仪器、公共数据库等)。
- 数据内容:使用的变量/特征,带有定义(代码本)。
- 数据清理/转换:处理缺失数据、归一化、注释的程序。
- 数据分割:关于训练、验证、测试集的详细信息;确保无重复。
- 数据安全性:数据存储方式(加密存储、访问控制)、传输和最终处理。
- 隐私考虑:例如,如果使用患者数据,去标识化步骤。
- 版本控制和可追溯性: 使用数据版本控制工具(DVC)或维护跟踪数据集更改的软件库。每次模型训练运行都应记录使用的精确数据版本。这有助于可重复性,并符合在审计时重现结果的要求。
- 数据质量指标: 实施定量检查(完整性、异常值、一致性)和关键数据字段的手动审查。将这些检查记录为学习管道的一部分。
- 文档: 类似于实验室笔记本,维护AI"数据日志"或向研究报告添加补充说明,详细说明数据处理方式。例如,如果算法特征取决于派生的实验室参数,请记录公式和单位转换。
- 治理政策: 将组织的更广泛数据政策应用于AI数据。例如,企业数据治理委员会应监督与AI相关的数据资产。如果使用云数据湖,请确保它们符合GxP合规性(一些供应商提供GxP验证的云存储)。
- 审计跟踪: 确保记录所有数据更改(摄入、清理、标记、删除)(时间戳、用户)。这间接满足第11部分要求,通过证明可追溯性。
示例: 临床试验申办方使用大型历史EHR数据集来训练AI以识别合格患者。他们面临数据异质性(不同医院编码)。为了满足数据治理,他们首先将所有字段映射到标准术语,然后将映射字典文件保留在版本控制中。他们运行自动脚本检查缺失或超出范围的值,并将报告保存在QA存档中。在QMS审计期间,他们可以显示日志,证明用于模型训练的确切数据集与IND中声明的一致。
7. 模型设计和开发实践
解释: 本原则要求对AI模型进行严格的工程设计。它涵盖了设计、编码、测试和部署的所有阶段,强调可追溯性、可重复性和受控变更管理。本质上,AI模型应像受监管的软件或医疗器械一样开发:具有规范、设计文档、开发环境和发布控制。
理由: 软件开发实践(SDLC)可防止错误并确保可靠性。对于AI,额外的复杂性会出现:模型行为可能会随着数据或参数而微妙变化。如果没有严格控制,AI模型可能会无声地漂移或出现故障。监管机构期望进行修改管理。FDA的指南草案和后续讨论引入了"预定变更控制计划"的概念——类似于指定哪些模型更新是次要的(例如用类似数据重新训练)与主要的(算法重新设计)以及每个需要什么验证的计划。将模型代码和训练视为GxP控制意味着任何更新都通过验证和批准渠道,就像其他更改一样。
实施:
- 软件开发生命周期(SDLC): 遵循适合AI监管分类的SDLC。维护AI系统的详细设计文档(用户需求、功能需求、架构图)。例如,提前定义输入-输出关系和预期性能指标。
- 版本控制: 将所有代码(模型脚本、数据处理代码)放入企业版本控制系统(例如Git)中。标记与已验证模型版本相对应的代码发布。
- 环境控制: 使用容器化或虚拟环境来冻结依赖项(库、框架),以便可以精确复制AI。记录使用了哪些版本的Python、ML库(TensorFlow等)。
- 可重复训练: 记录随机种子、模型超参数和训练配置。如果存在随机元素(如随机权重初始化),提供种子以重新生成相同模型。
- 测试和验证: 开发测试用例和基准数据集(与训练数据分开)以测试模型的每个构建。建议对代码进行自动单元和集成测试,以及在保留数据集上进行性能验证。
- 变更控制: 对模型更改(例如重新训练、超参数调整、特征更改)进行分类,并确定这些更改何时构成新的"版本"。建立变更控制委员会(CCB)审查重大更改。记录政策:任何更改都会触发影响评估(风险分析)并可能重新验证。
- 提交的固定模型版本: 在监管提交(IND/NDA)时,明确说明分析中使用的模型版本。如果提交后预计会有进一步开发,请描述如何与机构管理更新的变更控制计划(如FDA指南所建议)。
- 问责章程: JustInTimeGCP示例提到与"AI问责章程"保持一致(可能参考透明度/伦理原则)。团队应采用或调整内部章程的伦理AI指南,以捕捉开发实践中的承诺,如公平性、可审计性和数据隐私。
示例: 考虑开发用于制造中杂质检测的AI算法来分类实验室图像。团队将从定义接口名称、阈值和性能目标的需求规范开始。他们将每个脚本存储在Git中,并使用自动化CI/CD管道,每次推送代码时运行测试套件。如果化学家建议更改预处理过滤器,团队将此记录为"CR"(变更请求),评估模型输出可能如何变化,并执行影响分析。任何批准的更改都会获得新的版本号并重新验证。
8. 基于风险的性能评估
解释: 原则8规定AI工具必须针对与其风险相适应的性能和可靠性进行验证,然后进行持续监控。部署前,可信度评估应证明AI满足与其使用背景相关的预定义标准(准确性、精度、敏感性等)。部署后,应跟踪性能(监控假阳性/阴性和其他错误模式)以捕捉退化。
理由: 在受监管的环境中,用于支持决策的每种方法都必须合格。传统分析方法针对某些标准进行验证(ICH Q2)。AI模型虽然不是实验室仪器,但同样产生必须信任的"答案"。FDA指南草案强调了模型可信度的证据,Weave Bio的评论指出"可信度测试、访问控制...缓解与准确性相关的风险"。通过采用基于风险的视角,影响主要终点的工具必须比内部仪表板更严格地验证。持续监控至关重要,因为AI模型,特别是那些随时间学习的模型,在部署后可能会改变行为(数据漂移、软件更新等)。
实施:
- 验证计划: 为AI开发正式的验证或性能资格计划。指定指标(例如ROC-AUC、错误率)和验收标准。对于分类任务,定义可接受的最低敏感性/特异性。
- 测试数据集: 使用多个数据集:一个外部保留测试集,模型在开发过程中从未见过,代表真实世界的多样性。此外,考虑对抗性测试(边缘情况)(如果相关)。
- 偏差和公平性检查: 评估模型是否在子组(例如人口统计组或疾病亚型)上系统性表现不佳。记录这些分析,因为监管机构越来越关注医疗保健中的AI偏差。可能需要从训练数据调整或算法公平性约束进行补救。
- 可信度文档: 通过记录提交中的可信度(性能)结果,与FDA/EMA原则8保持一致。FDA自己的可信度框架(草案)提出了一个7步框架,包括测试和结果。如果适用,请间接引用它:例如"性能评估符合FDA推荐的可信度框架"(尽管不能在官方文档中引用未发布的草案,但在内部它指导开发)。
- 发布后监控: 定义关键绩效指标(KPI)并设置监控系统。例如,用于药物安全信号检测的AI应具有阈值:如果每周信号数量低于预期,可能表示存在问题(例如数据馈送问题)。分析假阴性案例(后来发现的错过的信号)并定期对样本案例进行审计。
- 人类反馈循环: 将用户更正纳入监控。如果专家经常覆盖某些AI建议,请记录该趋势并调查模型是否需要重新训练。
- 报告: 建立实时跟踪工具性能指标的报告仪表板。安排定期审查会议以处理趋势。定义重新验证的触发器(例如模型准确性下降>5%)。
- 监管报告: 如果AI是受监管产品的组成部分(如伴随诊断),则根据关于Changes Being Effected (CBE)或补充的指南,在性能变化时通知监管机构。
示例: 用于分类批次放行测试结果的机器学习模型。团队保留20%的历史数据用于最终验证,达到95%的准确性。他们设定一个性能指标:传入数据的准确性至少为90%。部署后,他们每天将AI预测与人工QC检查进行比较;如果一周内准确性低于90%,警报会触发重新训练。他们每季度记录所有性能指标(假警报和遗漏),根据需要调整模型或阈值。在他们的监管提交中,他们包括验证测试结果并概述原则8的监控过程。
9. 生命周期管理
解释: 第九条原则侧重于管理AI工具的整个生命周期,从概念到退役。由于AI模型不是"静态产品",必须存在用于版本控制、更新和退役的控制。团队应计划持续的治理框架,包括定期重新评估(例如定期重新验证)、受控更新(带有影响评估)以及AI系统退出的标准。
理由: 在传统药物开发中,制造过程或设备在变更控制下经历生命周期变更(流程改进、设备升级)。同样,AI系统也在演变:可以纳入新数据以完善模型,或者软件依赖项可能会更新。如果没有监督,更改可能会引入意外行为。此外,AI工具可能会因新法规、技术或业务需求而变得过时,并需要安全退役。生命周期管理确保工具保持在受控状态。
实施:
- 版本控制和变更管理: 扩展SDLC流程(来自原则7)以涵盖持续更新。维护版本注册表和变更日志。对于每个新版本,相对于已验证的基线执行影响分析和回归测试。
- 重新验证时间表: 定义刷新/重新验证模型的时间间隔或触发器。例如,如果数据域正在快速变化(例如疫苗开发中的病毒株),每6个月安排重新训练。如果内部数据管道发生更改(源或格式),触发重新验证事件。
- 带检查的CI/CD管道: 自动化测试和部署,以确保每次代码或数据更新在上线前都通过验证检查。
- 退出计划: 即使是有效的AI工具也应有退出计划:如果要用新方法替换工具,请确保有关如何完全关闭和归档它的文档。GxP适用的数据保留政策:必须按照记录保留要求保留归档的模型代码和数据。
- 审计和审查: 在定期QA审计中包括AI生命周期项目。例如,在系统年度质量审查中,审查AI的性能日志、已实施的任何更改以及即将到来的重新验证日期。
- 利益相关者协调: 根据现有指南通知监管机构主要生命周期事件。例如,在EU MDR(如果设备)或CDRH指南(如果适用)下,重大的算法更改通常需要监管通知或新提交。
- 持续改进: 使用反馈机制(来自用户、监控日志)识别改进。实施小的、受控的调整(如特征重新平衡),类似于软件补丁,但始终处于变更控制之下。
示例: 一家生物技术公司部署了AI来监测试验中的患者报告结果。初始模型使用截至2023年的数据。团队计划在2025年初使用新的数据流重新训练以提高准确性。此更新被视为小型设计更新:他们记录了新模型版本,重新运行验证测试(通过),并在其变更控制文档中报告。同时,团队定义了标准(例如5年后或出现新的监管要求时),以停止使用此AI并将数据归档到只读存储库。
10. 清晰、必要的信息
解释: 最后一条原则要求向最终用户和监管机构提供透明度。申办方必须提供关于AI的简洁、易懂的信息,包括其预期用途、性能特征和限制。
理由: 许多AI模型作为"黑匣子"运行。监管机构和临床工作人员无法在没有信任的情况下对其采取行动。通过要求"简单语言文档"的能力和限制,该指南促进了可用性和安全性。例如,必须披露AI不可靠的任何条件(范围外用例、罕见数据条件),以防止误用。从合规角度来看,清晰的文档还向监管机构表明申办方已批判性地评估了AI并对其透明,反映了FDA在AI开发中对"透明度和问责制"的强调。
实施:
- 文档包: 为每个AI工具创建文档套件,类似于设备的技术文件。它应包括:
- 用户指南: 解释如何操作AI系统、解释输出和执行定期检查。以适合预期用户的语言编写(例如临床医生、数据管理员)。
- 验证报告: 汇总测试程序、使用的数据集和达到的指标(准确性、错误率)。这可以附加到内部报告或与审计机构共享。
- 限制列表: 明确列出AI可能给出不准确结果的场景(例如"在患有合并症X的患者中,预测准确性降至Y%")。如果已知,请包括故障模式的示例。
- 监管摘要: 用于提交,在IND/NDA中提供关于AI使用的部分:涵盖方法论、训练来源、性能统计数据。标记"模型所有者"和AI工具的"联系人"。
- 标签和警报: 如果AI是数字界面中的决策支持工具,请考虑包括有关风险使用的警报消息。(例如,"警告:模型准确性可能在18岁以下患者中降低。")
- 培训: 开发培训演示文稿或视频,以便所有相关员工了解工具的操作和文档。可能需要认证,表明员工阅读了文档(如培训日志)。
- 透明度比率: 鼓励由独立专家进行内部审查。例如,让外部咨询委员会审查限制摘要的完整性。
- 引用: JustInTimeGCP示例强调为最终用户提供"描述使用背景、能力、限制、问题定义和适当解释的简单语言文档"。您应在项目文档和适用的"使用说明"中包含此类摘要。
- 监管沟通: 对机构坦诚。虽然专有算法需要保护,但申办方应尽可能描述模型特征(例如神经网络架构类型、参数数量、数据量),类似于在医疗器械提交中所做的那样。
示例: 用于提出化学结构的生成式AI工具使用两页"AI摘要表"进行了文档化。它指出:(a)其目标(优化靶标T的溶解度和效力),(b)其训练数据(5000种已知化合物),(c)其预期准确性(提出的化合物中有83%通过体外过滤),以及(d)其限制(有时会高估高度新颖支架的预测)。此摘要已整合到研究团队的SOP手册中。当项目的IND被审查时,FDA审查员看到GLP验证数据和AI角色的清晰描述已包含在化学部分中,满足"清晰、必要的信息"期望。
药物开发生命周期中的实施
药物开发是一个多阶段过程:发现与临床前、临床试验、制造、监管提交和上市后。AI技术可以在每个阶段发挥作用,但相关的良好AI实践原则适用于整个过程。下表说明了不同阶段的AI应用示例,以及最直接适用的关键原则(编号1-10)和合规行动。
| 阶段/领域 | AI用例 | 相关原则(编号) | 合规行动(示例) |
|---|---|---|---|
| 药物发现 | - 生成化学(设计新分子) - 生物标志物发现(模式挖掘) |
2, 5, 6, 7 | - 定义明确的用例和目标化学空间(CoU)。确保数据多样性(6)。使用跨学科审查(5)。模型的版本控制(7)。评估假阳性的风险(2)。 |
| 临床前研究 | - 体外毒性预测 - 体外检测自动化 |
2, 6, 8 | - 在独立实验数据上验证模型(8)。记录数据源/整理(6)。谨慎管理更新(9)。 |
| 临床试验设计 | - 患者队列识别 - 适应性试验模拟 |
1, 2, 4, 5, 8 | - 对建议的队列进行人类审查(1)。明确AI支持而非取代研究者决策(1,4)。多学科监督(5)。与历史试验相比的回顾性验证(8)。 |
| 试验操作与监测 | - 使用NLP的eTMF审查 - 可穿戴设备的患者监测 - 查询聊天机器人 |
1, 3, 4, 5, 6, 10 | - 确保符合GCP的部署:审计跟踪和身份登录(3)。定义工具范围(例如"仅用于文档审查")(4)。批准的人类监督(1)。数据隐私合规(GDPR/HIPAA)(6)。告知用户聊天机器人的限制(10)。 |
| 制造(GMP) | - 工艺参数优化 - 使用计算机视觉的视觉QC |
3, 6, 7, 8, 9 | - 在GMP下验证AI软件(3)。为数据保护实验室和设备网络(6)。监控缺陷检测准确性(8)。控制模型更新(9)。 |
| 药物安全与安全 | - 安全数据库中的自动信号检测 - 社交媒体监测 |
6, 7, 8, 10 | - 维护患者数据机密性(6)。针对已知信号进行验证(8)。在安全报告中记录方法(10)。确保审查团队(医生/QA)审查所有信号(5,1)。 |
| 监管提交 | - eCTD部分的自动生成 - 文档摘要 |
1, 3, 6, 7, 10 | - 医学撰稿人审查所有自动生成的文本(1)。使用带审计日志的已验证NLP工具(3,6)。在提交中明确说明AI的角色(10)。归档原始源数据和编辑(6,7)。 |
| 上市后监测 | - 数字生物标志物分析 - 纵向真实世界数据挖掘 |
6, 8, 9, 10 | - 确保真实世界数据经过清理并符合患者隐私要求(6)。使用新数据持续重新评估模型(9)。在PSURs(定期安全更新报告)中报告性能趋势(10)。 |
表2. 将良好AI实践映射到药物开发生命周期。该表说明了不同原则如何在各个阶段变得至关重要。例如,人类监督(原则1)在AI触及安全相关决策(例如患者监测)时至关重要,而数据治理(原则6)始终至关重要,特别是在早期发现(训练数据)和上市后(新的真实世界数据)。在所有阶段,生命周期管理和文档(原则9和10)必须将AI的使用与质量流程联系起来。
上面的示例是说明性的。实际上,一个AI工具可能跨越多个阶段(例如在同一试验中用于患者选择和持续风险监测的AI)。团队应将其特定的AI活动映射到原则,并验证每个步骤的合规性。例如,如果一家初创公司使用AI生成临床前疾病模型,他们应确保模型由科学家进行人工审查(原则1),记录假设和数据源(原则6-10),并保留计划的任何模型更新日志(原则9)。
AI的质量体系与治理
除了单个项目外,组织应将良好AI实践嵌入其整体质量和治理结构中。本节概述了合规实施的战略步骤。
AI治理结构
- 建立AI指导委员会: 这应包括高级管理人员(例如研发主管、质量副总裁)和所有相关领域(临床、数据科学、监管、IT)的代表。其角色是制定AI政策、批准重大项目并审查合规指标。
- 制定AI政策和SOP: 更新公司政策,明确解决AI问题:数据隐私(用于AI的患者数据的HIPAA/GDPR)、记录保存(用于AI日志的21 CFR第11部分)、供应商控制(用于第三方AI软件)以及利益冲突(如果AI与外部方共同开发)。创建纳入10项原则的标准操作程序(例如,要求记录风险评估和使用背景的"AI项目治理SOP")。
- 培训和意识: 提供全公司范围的AI合规培训。例如,QA团队应学习如何审计AI项目,R&D团队应了解监管期望。鼓励将AI错误视为可报告的(如任何质量事件)的文化有助于保持监督。
质量管理体系整合
- 扩展GxP框架: 将AI相关步骤插入现有GxP流程。例如,将AI工具资格认证添加到IT供应商管理流程中,或将AI风险缓解纳入CAPA。
- 审计: QA应定期审计AI项目。审计检查表可能包括问题:"CoU是否已记录?"、"是否有证据表明人类监督?"、"数据控制是否到位?"。
- 供应商资格: 如果外包AI开发或使用云AI服务,请执行供应商资格认证审计。检查供应商是否具有强大的数据安全和验证实践。
数据和IT控制
- 数据完整性: 将21 CFR第11部分合规性应用于关键AI系统——电子签名、审计跟踪、系统验证。
- 网络安全: 遵循NIST或ISO 27001控制。AI工具通常连接到公司网络或云;确保它们经过渗透测试并成为安全事件响应计划的一部分(AI相关的漏洞可能对患者数据造成灾难性后果)。
风险管理
- 链接到质量风险管理(QRM): 许多组织使用ICH Q9/Q10 QRM框架。AI特定风险(如偏差、算法故障)应输入QRM流程,并采取适当的缓解和监控措施。
- 保险和责任: 作为旁注,一些法律框架正在围绕AI责任出现。公司应与法律/合规部门联络,了解可能涵盖AI功能的产品责任保险。
数据分析与证据
上述指南基于关于AI在制药R&D中普遍性和影响的新兴数据基础。我们在此汇编相关统计数据和见解:
- AI采用率: 2025年行业调查显示,80%以上的顶级制药公司R&D中都有活跃的AI项目,主要集中在药物发现和临床试验设计中。这表明广泛兴趣但成熟度各异。
- R&D效率: Formation Bio(获得Sam Altman等投资者支持)声称其AI驱动的试验规划可以将试验时间缩短高达50%。如果得到验证,这种效率提升将是变革性的,可以缩短开发时间表并降低成本——这是AI潜力的证据。
- 药物批准率: 尽管AI炒作,近年来每年批准的新药申请数量一直保持在每年50种左右。这表明AI尚未显著加速总体批准率,可能是因为临床试验和监管审查仍然是瓶颈。
- 市场增长: 市场研究预计药物开发中的AI领域将从2024年的约12亿美元增长到2032年的72亿美元,反映了预期的强劲扩张。同样,生物技术AI的风险融资从2021年到2025年翻了一番。
- 临床试验: 临床试验匹配和监测中的AI正在快速增长。一项估计表明,AI患者匹配可以平均将招募时间缩短30-40%。(例如,通过丰富的EHR数据形成队列正在被数十家生物技术公司试点。)
- 偏差和准确性: 医疗AI研究表明,平均错误率(假阴性)可能会显著损害代表性不足的群体。例如,一项大型研究发现,AI诊断工具在某些人口统计子群体中的准确性低至40%。这强调了为什么监管机构坚持公平性和人类检查。
- 监管互动: 据传闻,数十家公司已与FDA/EMA就AI/ML进行了预IND会议(特别是在生物制品CMC中用于配方优化)。FDA建立AI特定指南本身就表明存在重大内部兴趣:截至2026年1月,FDA已就临床试验中的AI举行了多次研讨会,并推出了内部生成式AI工具(ELSA)以协助审查员。
- 专家意见: 监管和行业领导者强调谨慎:STAT News社论警告"FDA必须展示负责任的创新是什么样子",并需要透明的基于证据的AI使用。同样,《新英格兰医学杂志》的出版物警告了医疗保健中的"黑匣子"AI。在积极的一面,MIT的Eric Topol(著名的数字医学专家)敦促在严格的评估框架下快速采用AI。
案例研究与示例
虽然许多AI计划是内部的或专有的,但几个案例示例阐明了合规问题:
- FDA内部AI(Elsa): 2025年,FDA试点了一个名为"Elsa"的生成式AI助手,用于总结不良事件报告。为了解决政策问题,FDA可能必须确保Elsa的训练数据安全,答案由医学官员审查(原则1),并且用于决策的任何输出都已记录。这反映了监管机构如何在内部应用良好AI实践。
- 眼科诊断中的AI: FDA已批准用于视网膜疾病的AI诊断设备(IDx-DR),条件严格。虽然是一种医疗器械,但其批准过程具有启发性:它需要广泛的试验,证明对糖尿病视网膜病变的敏感性超过87%,并明确的人类监督。正如良好AI实践所强调的,该设备被标记为"仅在按协议使用时用于自主检测"(明确CoU),并具有临床试验证据(性能评估)。开发类似AI诊断的药物团队将面临类似的审查。
- 行业合作: 像Better Biopharma联盟(非营利性财团)这样的组织已成立AI伦理工作组。例如,一个工作组起草了"数字产品质量战略",与原则6(数据质量)和原则10(透明度)保持一致。在这种自愿环境中,公司分享有关记录AI模型风险的最佳实践。
- 制药QMS适应: 一家大型制药公司公开描述了其对AI的GMP流程的适应:他们将每个AI流程视为已验证的制造过程。他们将模型训练作业与批记录保持一致,并将模型工件存储在其电子记录系统(ERES)中。这确保了AI分析日志的任何发布都视为GMP文档。
- 外部审计发现AI问题: 2025年对CRO的审计发现,他们一直在使用未经验证的NLP工具从患者叙述中提取实验室值。审计员引用了缺乏验证证据和AI的SOP。CRO不得不停止该过程并进行回顾性验证。这突显了即使是分析助手也可能渗入受监管活动并触发合规行动。
新兴挑战与未来方向
展望未来,有几个趋势和问题值得关注:
- 生成式AI和大型模型: 强大LLM(GPT-4/5、Claude等)的出现提出了新问题。这些模型可以协助假设生成、文献综述甚至起草方案——但它们也存在幻觉风险和IP/隐私问题。监管机构尚未就受监管环境中生成式AI发布详细指南。良好AI实践原则(特别是1、6、10)仍然适用:人类审查生成的任何内容,仔细策划提示和数据,以及记录提交中引用的任何模型输出。未来的指南可能会指定如何在药物环境中验证或约束生成式模型。
- 作为医疗产品的AI: 一些AI工具跨越边界,成为自身受监管的医疗产品(例如诊断患者状况的软件)。虽然超出典型的药物管道,但存在相互作用。例如,用于放射学试验终点的AI(检测肿瘤变化)也可能需要设备级验证。原则指导通过与设备标准重叠来容纳这一点。即将出台的FDA良好机器学习实践(GMLP)最终文件,虽然侧重于设备,但高度相关。
- 数据隐私和AI法案: 欧盟AI法案(将于2027年左右生效)将与健康相关的AI归类为"高风险",需要额外的文档和合规性(例如沙盒测试)。在欧盟运营或出口到欧盟的药物开发者将需要使其AI系统符合该法案的要求(例如AI性能的上市后监测)。同样,HIPAA和GDPR将管理AI使用的任何患者数据。良好AI实践原则6部分涵盖这一点(数据治理包括隐私),但团队在相关时应明确审查AI项目是否符合AI法案/制裁问题。
- 全球协调: 其他监管机构(如日本PMDA、加拿大卫生部、中国NMPA)已表示对AI标准的兴趣。WHO预计将发布关于数字健康的政策。对于跨国公司,与FDA/EMA保持一致同时参与当地机构将很重要。FDA和EMA共同制定这一指导的事实表明进一步协调:任何未来的国家特定指导都可能反映这些原则。
- 工具和标准: ISO等组织正在制定正式的AI管理标准(例如ISO/IEC TR 24027关于偏差,ISO/IEC JTC 1/SC 42关于AI治理)。这些可能成为合规的认证参考。同时,专注于AI监管合规的专业平台(审计跟踪、模型卡等)正在出现。采用此类工具可以更系统地实施良好AI原则。
结论
人工智能整合到药物开发中带来了巨大潜力——从更快的药物发现到更智能的临床试验——但也带来了新的合规挑战。FDA和EMA联合发布的良好AI实践指导原则为负责任的AI采用建立了明确的基础,反映了制药法规的"黄金标准"严格性。药物开发团队应以与任何关键流程相同的严谨态度对待AI:定义其范围、记录其行为、测试其性能,并在每一步保持人类监督。
本实施指南已将这些高级原则转化为可操作的步骤:建立多学科治理结构、将AI控制嵌入质量体系,以及仔细管理数据和模型。通过采用基于风险的方法,团队可以有效地分配资源,将验证工作集中在影响患者安全的地方。AI风险矩阵、验证协议和审计日志等工具将变得像批记录和方案偏差一样普遍。
最终,合规不是障碍,而是赋能者。明确的指南允许创新在不损害标准的情况下向前推进。"以人为中心的设计"指导原则提醒我们,医学本质上是关于患者的——AI必须服务于人类健康,而不是取代保障它的判断。主动实施这些良好AI实践的制药公司将不仅满足监管期望,还会在临床医生和患者中建立对其AI驱动解决方案的信任。
关键建议: 建立AI治理(委员会和SOP),对每个AI工具进行彻底的风险和CoU分析,将AI整合到QMS中(就像新设备一样),投资稳健的数据管理,并记录一切。谨慎处理合作伙伴关系和供应商工具。做好准备进行演变:密切关注新兴指南,并将其视为动态过程。随着监管指南现在指向结构化的AI使用,公司被建议尽早保持一致。通过这样做,他们将确保AI真正推动更安全、更有效的药物开发——以合规、以患者为中心的方式实现其承诺。
【全文结束】

