小型语言模型用于开发医疗保健中的代理AI:全面系统审查和批判性分析Small Language Models for Developing Agentic AI in Healthcare: A Comprehensive Systematic Review and Critical Analysis | Cureus

环球医讯 / AI与医疗健康来源:www.cureus.com美国 - 英语2026-08-24 20:27:27 - 阅读时长15分钟 - 7297字
本文对小型语言模型(SLMs)在医疗保健领域中的代理AI应用进行了全面系统性审查,综合分析了35项研究,发现SLMs在临床文档处理、决策支持、患者分诊和行政自动化等任务中表现出足够的能力,同时提供了部署效率高、成本低和操作简便等显著优势,使其成为医疗实施中可行且往往更优的选择,尤其适合资源有限的医疗机构环境。研究指出SLMs在医疗领域的应用前景广阔,但当前证据基础仍存在方法学质量中等、样本量小和长期临床结果数据不足等局限性,需要更多标准化评估框架、随机对照试验和真实世界实施研究来充分评估其安全性和有效性。
医疗保健小型语言模型代理型AI临床应用患者分诊临床决策支持临床文档处理医疗监管医疗效率医疗成本患者安全
小型语言模型用于开发医疗保健中的代理AI:全面系统审查和批判性分析

摘要

代理型人工智能(AI)系统作为医疗保健领域的变革性方法正在兴起,通过集成推理和工具使用实现自主任务执行。虽然早期实施主要依赖大型语言模型(LLMs),但越来越多的证据表明,由于其在效率、可扩展性和实际临床环境中的实用性方面具有优势,小型语言模型可能更适合许多医疗保健工作流程。本审查研究了目前用于代理型医疗应用的小型语言模型(SLMs)现状,包括临床文档处理、决策支持、患者分诊和行政自动化。我们综合分析了关于其性能、安全性和经济影响的现有证据,并讨论了临床部署的关键考虑因素,包括监管协调和治理。总体而言,小型语言模型似乎能够为大多数代理型医疗保健任务提供足够的能力,同时在可部署性、成本和运营效率方面提供有意义的优势,支持其作为临床实施的可行且往往更优的选择。

引言与背景

医疗保健行业正处于由代理型人工智能(AI)系统驱动的技术革命的门槛上。与传统的、需要持续人工监督的被动式AI应用不同,代理型AI系统能够作为自主控制器运行,能够感知环境条件、制定战略计划,并通过复杂的工具集成执行复杂的、有目标导向的任务。在本次审查中,代理型人工智能被定义为能够自主调用工具、进行多步规划和结构化输出生成而无需持续人工提示的系统。

大型语言模型(LLMs)的出现最初主导了代理AI领域,诸如GPT-4、Claude和Gemini等系统展示了在自然语言理解、推理和工具操作方面的卓越能力。然而,医疗保健部门的独特需求,包括严格的延迟限制、成本敏感性、隐私要求和监管合规需求,暴露了基于LLM方法的显著局限性。大型模型的计算密集型特性,参数数量通常超过700亿,为临床环境中的实时部署创造了实质性障碍,而在这些环境中,毫秒级响应时间对患者安全至关重要。

小型语言模型(SLMs),通常定义为参数少于100亿的系统,已成为解决这些局限性的同时保持足够医疗应用能力的引人注目的替代方案。最近的技术进展,包括NVIDIA Nemotron Nano 2系列的混合Mamba-Transformer架构,表明SLMs能够实现与更大的模型相当的性能,同时在吞吐量、能源效率和部署灵活性方面提供显著改进。Salesforce xLAM-2系列进一步验证了这一趋势,在参数仅为80亿的模型上展示了在函数调用基准测试中的最先进性能。

医疗领域为SLM部署提供了特别有利的条件,因为大多数临床工作流程都以结构化的重复性任务为特征。电子健康记录(EHR)交互、临床文档处理、患者分诊协议、药物管理和行政流程通常涉及具有可预测输入输出关系的明确定义的程序。这些特征与SLM能力非常吻合,SLM在具有明确模式和确定性输出的有限转换中表现出色,而在需要开放推理的挑战方面,性能不如大型模型。

经济考量进一步加强了在医疗环境中采用SLM的理由。医疗保健组织面临越来越大的压力,需要控制成本,同时提高护理质量和可及性。通过SLM部署可实现的10-30倍成本降低,加上能够在本地或边缘运行模型的能力,为资源受限的环境(包括农村医院、社区健康中心和国际发展背景)提供了显著优势。这种经济效率能够更广泛地普及基于AI的医疗工具,可能解决高级技术仅对资金充足的机构可及而导致的健康公平问题。

监管框架正在适应医疗保健中AI的整合,最近的指南来自FDA针对AI设备的预定变更控制计划(PCCP)、欧盟AI法案的实施以及世界卫生组织对医疗健康AI的监管考量。这些框架强调了透明度、问责制和持续监控要求的重要性,这些要求通过更小、更易解释的模型可能更容易实现,这些模型可以彻底验证并在临床环境中进行监控。

尽管有这些令人鼓舞的发展,但关于SLM在医疗应用中有效性的证据基础仍然分散且异质化。先前的综述主要集中在大型语言模型或仅对小型模型能力进行了肤浅的覆盖。没有综合性系统综述专门考察SLM在医疗环境中代理系统的证据,造成了一个关键的知识缺口,限制了医疗领导者、技术实施者和监管机构的循证决策。

本系统性审查通过提供关于SLM有效性证据的综合分析来解决这一缺口。我们检查技术性能指标、临床验证研究、经济评估以及监管合规考量,为考虑SLM实施的医疗组织提供可操作的指导。我们的分析包括同行评议的研究和高质量的技术报告,以捕捉SLM开发和部署的快速发展格局。

这项研究的意义超越了即时技术考量,涉及到医疗保健服务未来的根本问题。当全球的医疗系统应对劳动力短缺、成本上升和服务需求增加时,由高效SLM驱动的代理型AI系统可能为可持续、可扩展和公平的医疗增强提供一条途径。了解这些技术的证据基础对于负责任的创新至关重要,这种创新在优先考虑患者安全的同时最大化社会效益。

审查

研究设计和注册

本系统性审查是按照系统性综述和荟萃分析的首选报告项目(PRISMA)2020指南进行的。在研究设计、资格标准和分析前制定了审查方案,遵循了针对医疗保健中人工智能干预的系统性综述的方法学标准。

搜索策略和信息来源

我们与医学图书管理员和AI研究专家协商,制定了全面的搜索策略。搜索涵盖了四个主要数据库:PubMed/MEDLINE、arXiv预印本服务器、IEEE Xplore数字图书馆和Google Scholar。搜索期从2020年1月1日延伸至2025年8月31日,以捕获语言模型开发的基础工作和小型语言模型应用的最新进展。

搜索策略采用了组合式受控词汇术语(MeSH标题,如适用)和自由文本关键词。主要搜索词包括:("small language model" 或 SLM 或 "compact language model" 或 "efficient language model") 与 (healthcare 或 medical 或 clinical 或 health) 与 (agent 或 agentic 或 autonomous 或 tool calling 或 function calling 或 workflow automation)。次要搜索词捕获了特定应用,如 "electronic health record*" 或 EHR 或 clinical documentation 或 patient triage 或 decision support 或 diagnostic assistance。额外的搜索针对特定模型家族、技术能力和监管及经济术语。研究选择过程总结在PRISMA 2020流程图中(图1)。

资格标准

研究如果检查了小型语言模型(≤100亿参数)在医疗应用中的核心代理AI能力相关性,则被纳入。研究需要证明至少一项核心代理能力,定义为自主工具集成、多步推理或独立工作流程执行。合格的研究设计包括临床验证研究、技术评估、经济分析和系统性综述。我们纳入了2020年1月至2025年8月间以英文发表的同行评议文章、具有详细方法的高质量预印本以及官方技术报告。研究要求提供定量结果、定性评估或综合分析框架(表2)。

研究如果仅专注于大型语言模型(>100亿参数)而没有小型模型比较、与医疗应用或代理能力无关、是观点文章、社论或没有经验数据的博客文章、方法学细节不足以进行质量评估、是重复出版物或非英文,则被排除。

研究选择过程

两名独立评审员(ZK和研究助理)使用标准化方法进行研究选择。初始筛选包括根据预先确定的纳入和排除标准对标题和摘要进行审查。对所有可能符合资格的研究进行全文审查,通过讨论解决分歧,必要时咨询第三名评审员。研究选择过程使用Covidence系统性综述软件进行管理,以确保透明度和可重复性。研究选择过程总结在图1中。

数据库搜索总共确定了1,106条记录:PubMed/MEDLINE,n=312;arXiv,n=487;IEEE Xplore,n=94;Google Scholar,n=213。其他方法(引文搜索、参考列表审查和专家推荐)产生了另外58条记录,总共有1,164条记录。在删除218条重复记录后,888条记录进入标题和摘要筛选(1,164-218-58条不符合的导入=888)。标题/摘要筛选后,排除了695条记录(与SLMs或医疗无关,n=512,无代理AI组件,n=183),留下193份报告进行全文检索。其中12份因无法访问而无法获取,剩下181份报告接受全文资格评估。全文审查排除了进一步的146份报告:仅>100亿LLMs无SLM比较,n=67;无医疗应用,n=28;无经验数据的观点或社论,n=22;方法学细节不足,n=18;重复出版,n=7;非英语,n=4。这产生了35项纳入最终审查的研究(181-146=35)。在筛选的两个阶段,评审员间可靠性都超过了预先设定的κ>0.70阈值,然后才进行数据提取。35项纳入研究的特征总结在表3中。

数据提取和管理

数据提取使用专门为本次审查开发并经过五个研究试点测试的标准表进行。提取的数据包括研究特征(作者、出版年份、研究设计、设置、样本量和随访持续时间)、模型规范(架构、参数数量、训练数据、微调方法和部署配置)、医疗应用(临床领域、特定用例、与现有系统的集成和用户群体)、技术性能(准确性指标、延迟测量、吞吐量数据、能耗和成本分析)、临床结果(患者安全措施、工作流程效率、用户满意度和临床有效性)、经济评估(成本效益比、预算影响分析和投资回报计算)以及监管考量(合规框架、批准状态和安全监控方法)。

方法学原理和决策框架

概念框架

研究问题专门围绕SLMs(≤100亿参数)在代理环境中,而不是一般医疗AI,因为代理行为(自主工具调用、多步规划和结构化输出生成)是最直接转化为可测量临床工作流程影响的能力组合。搜索期从2020年1月开始,因为可靠的代理SLM基准在Transformer扩展时代之前不存在,有意义的医疗部署研究在此之前未出现。

数据库和源选择

PubMed/MEDLINE被选为主要生物医学来源。arXiv被纳入,因为AI领域在预印本上发布关键技术进展,比期刊出版早12-18个月;排除arXiv将系统性低估SLM发展,尤其是来自行业集团的发展。IEEE Xplore捕获了PubMed中不一致索引的生物医学工程会议论文。Google Scholar提供了灰色文献和技术报告的补充扫查。引文搜索和专家咨询按照PRISMA 2020框架纳入作为第2列来源,以减少出版偏倚。

PICO操作化

严格应用了≤100亿参数的阈值;当报告模型大小为范围时,使用上限。包括使用量化或剪枝模型的研究,只要部署的参数数量落在100亿或以下。预指定了广泛的成果集:限制成果为患者水平的临床终点会排除几乎所有符合条件的研究,这反映了代理SLM在医疗保健中部署的早期阶段。接受异质性比较器,包括基于规则的系统、更大的LLMs和标准临床工作流程,以反映真实世界实施的多样性。

研究选择和评审员间可靠性

涉及三名评审员,因为SLM术语在文献中不一致,并预期会有边界情况。在每个筛选阶段后计算Cohen's kappa (κ);要求κ>0.70的阈值在进行前达到,符合既定的系统性综述标准。任何低于此阈值的κ都会触发校准会议和20%样本的重新筛选。使用Covidence进行研究管理,按数据库手动记录导入前的记录数量。

数据提取试点

提取表在跨越预期设计范围的五项研究上进行了试点测试。试点测试发现了"医疗设置"字段中的模糊性,该字段在完整提取开始前已修订为需要具体的机构类型。当模型大小未明确陈述时,从架构描述中推断并与公开可用的模型卡交叉引用。

质量评估工具匹配

工具选择遵循既定指南,即风险偏倚评估应与研究设计相匹配。没有单一工具充分涵盖本次审查中遇到的所有研究设计,这就是为什么为技术报告开发了额外的定制框架。

综合策略

选择混合方法,因为文献对于所有结果而言太异质,无法进行元分析。在研究报告直接可比指标的相同临床任务上进行了使用随机效应模型的定量元分析。使用I²量化的统计异质性;值>50%触发了按模型大小(10-30亿、30-70亿和70-100亿参数)和应用类型进行的亚组分析。叙事综合用于结果太多样而无法进行定量汇总的情况。经济数据使用购买力平价调整系数转换为2024美元。

质量评估

质量评估使用既定工具,根据研究设计进行定制。所有工具在学术研究使用时都不需要版权费或许可费。

Cochrane偏倚风险工具版本2(RoB 2)为随机对照试验预先指定。在包含的研究中未确定随机对照试验,因此未应用此工具。

非随机干预研究的偏倚风险(ROBINS-I)用于非随机研究。它由BMJ发表并开放获取,可从Cochrane偏倚方法组免费获得;研究使用不需要书面许可。

系统性评估的测量工具(AMSTAR-2)应用于包含在纳入文献中的系统性综述。它在amstar.ca上免费提供;学术使用不需要许可或许可费。

针对人工智能的卫生经济评估统一报告标准(CHEERS-AI)用于经济评估。它以CC BY-NC-ND 4.0开放获取,学术使用需引用。商业使用需要Elsevier/ISPOR的明确许可。

为技术报告和未被上述验证工具涵盖的预印本开发了定制的质量评估框架。评估了四个维度:(a)方法透明度和可重复性,(b)验证严格性,(c)与商业利益冲突的独立性,以及(d)报告的完整性。无版权限制。两名评审员独立评估研究质量,通过讨论解决分歧。研究基于总体风险偏倚被归类为高质量、中等或低质量。

纳入文献的总体风险偏倚各不相同。如表4所示,大多数研究显示出中等风险偏倚,主要是由于非随机设计中的混杂和在技术评估中报告质量的可变性。

数据综合与分析

考虑到研究设计、人群和结果的异质性,我们采用了混合方法综合方法,适当结合定量元分析与叙事综合。当研究对相同结果报告可比结果时,使用随机效应模型进行元分析,以考虑预期的异质性。使用I²统计量评估统计异质性,值>50%表明实质性异质性,需通过亚组分析或元回归进行调查。对结果太多样化无法进行元分析的情况进行了主题分析。综合遵循复杂干预的既定框架,按技术能力、临床应用、经济考量和实施因素组织发现。计划的亚组分析检查了医疗设置(医院vs门诊)、模型大小类别(10-30亿、30-70亿和70-100亿参数)和应用类型之间的差异。

结果

系统性搜索和筛选过程产生了35项符合评估代理型小型语言模型在医疗保健设置中资格的研究。包含的文献涵盖了广泛的研究设计、临床应用和技术评估,反映了这些系统的快速发展和异质性。为提供这个新兴领域的结构化综合,按三个主要领域组织发现。首先,我们考察了小型语言模型在各种任务中的技术性能和核心代理能力。第二,我们评估了它们在临床工作流程和特定医疗应用中的实际整合。最后,我们分析了与其部署相关的经济和运营考量,突出了对医疗组织的资源影响。

技术性能和代理能力

在包含的研究中,代理型小型语言模型在任务复杂性和部署背景依赖的情况下表现出可变的技术性能。几项研究报告,对于范围狭窄的任务,尤其是文档和行政工作流程,小型代理模型实现了与大型语言模型相当的性能。经常报告的优势包括降低延迟、减少计算需求以及在医疗基础设施内部署的改进可行性。

性能一致性在需要更广泛背景推理或多领域推断的任务中下降。评估方法在研究间差异显著,限制了直接定量比较,但突显了效率、可扩展性和通用性之间的权衡。

临床应用和工作流程整合

临床应用涵盖了文档辅助、工作流程自动化、决策支持和患者分诊。评估文档和行政任务的研究一致报告了工作流程效率的改进和临床医生时间负担的减少。相比之下,专注于临床决策支持的研究报告了更多可变结果,性能和接受度受临床医生监督程度和系统透明度影响。

包含临床医生在回路中的设计的研究普遍报告了更高的可用性和信任,这表明混合部署策略可能更适合近期临床采用。

经济和运营考量

经济分析表明,代理型小型语言模型可能比大型模型和传统系统提供运营优势,特别是对于高容量、重复性任务。报告的益处包括降低基础设施需求和减少运营成本。然而,经济结果高度依赖上下文,集成成本和监管要求影响总体成本效益。研究中限于长期经济评估。

研究质量和证据缺口

总体而言,包含研究的方法学质量中等。常见的局限性包括小样本量、有限的外部验证和结果报告的异质性。这些发现突显了对标准化评估框架和纵向研究的需求,以更好地评估安全性、有效性和经济影响。

研究结果总结

综合起来,包含的研究表明,代理型小型语言模型有可能提高医疗保健工作流程的效率、可扩展性和成本效益,特别是对于定义明确的运营任务。然而,研究设计和评估方法的可变性限制了对临床领域的决定性结论。任务选择的谨慎性、约束自主权和临床医生监督被证明是与成功实施相关的一致因素。

结论

小型语言模型代表了医疗AI中的重要进展,提供了一种平衡技术能力、效率和部署可行性的方法,解决了大型模型的许多局限性。当前证据表明,SLMs可以支持核心代理功能,包括结构化输出生成、工具集成和工作流程自动化,其性能足以满足许多临床和行政用途。它们在延迟、成本和基础设施要求方面的优势使它们特别适合现实世界中的医疗环境,包括资源受限的设置。这些特性使SLMs成为扩展基于AI的医疗解决方案可及性的实用和可扩展选项。

然而,成功的实施取决于与临床需求的仔细匹配、适当的任务选择以及在复杂决策中整合人工监督。当前的证据基础仍受到研究设计的异质性、小样本量和缺乏长期临床结果数据的限制。未来研究应优先考虑标准化评估框架、随机对照试验和真实世界实施研究,以更好地评估安全性、有效性和经济影响。持续的监管发展和治理也将对确保安全和平等部署至关重要。总体而言,SLMs提供了强大潜力,但需要严格验证以支持广泛的临床采用。

【全文结束】