2026年,人工智能如何革新医疗诊断How AI Is Revolutionizing Medical Diagnostics in 2026

环球医讯 / AI与医疗健康来源:acadcalendar.com美国 - 英语2026-08-27 09:58:04 - 阅读时长31分钟 - 15474字
本文深入探讨了2026年人工智能在医疗诊断领域的革命性应用,包括在放射影像、病理学、肿瘤学、心脏病学和神经学等领域的实际部署情况,详细分析了AI在提升诊断速度、准确性和扩大医疗资源可及性方面的具体优势,同时坦诚地指出了算法偏见、数据隐私、可解释性不足以及责任归属模糊等核心风险与伦理挑战,并系统梳理了美国FDA和欧盟的监管框架,为临床医生、患者和医疗管理者提供了全面、基于证据的决策参考,以区别于单纯的技术炒作。
AI医疗诊断健康影像学病理学肿瘤学心脏病学神经学罕见病算法偏见隐私监管
2026年,人工智能如何革新医疗诊断

人工智能正在通过以超越人类认知能力的规模和速度,在影像、基因组和临床数据中识别模式,从而革新医疗诊断,降低诊断错误率,并在全球范围内扩大专家级分析的可及性。

这并非未来的预测。截至2026年,已有超过950款人工智能医疗设备获得美国食品药品监督管理局的批准或认证,其中大部分集中在放射学和病理学领域。

根据MarketsandMarkets的数据,2024年全球医疗诊断AI市场估值约为17.1亿美元,预计到2029年将以22.5%的复合年增长率增长。

本指南涵盖了AI在影像学、病理学、肿瘤学、心脏病学、神经学和罕见病检测中的应用。

它审视了底层技术、准确性证据、监管框架、伦理风险,以及目前在临床环境中部署这些系统的公司。

它不涉及AI在药物发现、手术机器人或行政自动化中的应用,这些是拥有独立证据基础的截然不同的领域。

有三类读者会关注这个话题:

  • 临床医生和医疗专业人员,寻求准确的数据、研究对比,以及对AI表现不佳之处诚实评估的人。
  • 患者和普通读者,寻找清晰、基于证据的解释,以了解这些工具如何影响护理的人。
  • 医院管理者、医疗IT专业人士和政策制定者,正在评估实施可行性、监管状态和投资回报率的人。

AI旨在解决的诊断问题

诊断错误是一个可量化、有记录可循的临床问题

根据美国国家科学院、工程院和医学院2015年的一份报告,仅在美国的初级保健机构中,诊断错误每年影响约1200万成年人,并导致估计每年4万至8万人死亡。

初级保健诊断的错误率在10%至15%之间。在放射学领域,2016年发表在《放射学》杂志上的一项研究发现,在标准工作流程下,放射科医生的错误率在每次研究3%至5%之间——在高工作量、时间紧迫的条件下,这个数字会显著上升。

三个结构性因素加剧了这个问题:

  • 影像量过载。 一位放射科医生每天可能需要阅读80到100份影像研究。一次胸部CT扫描包含300到500张独立图像。持续的注意力会随着工作量的增加而下降。
  • 专家短缺。 世界卫生组织估计全球缺少430万卫生工作者,短缺主要集中在低收入和中等收入国家。撒哈拉以南非洲许多地区的放射科医生与人口比例低于1:100万。
  • 罕见病确诊延迟。 根据美国国家罕见病组织的数据,罕见病患者平均需要等待4到7年才能获得确诊。他们在获得准确诊断之前,平均要看7.3位医生。

AI通过一种特定的机制来解决这些问题:它在大型数据集上应用一致的模式识别,而不受疲劳、锚定偏见或注意力漂移的影响,这些是人类临床医生常见的问题。

AI能做什么——以及不能做什么

在大多数已部署的系统中,诊断领域的AI起的是增强而非替代的作用。这种区别在法律和临床上都至关重要。

增强意味着AI输出一个发现、标记或概率评分,由临床医生审查并据此采取行动。医生保留诊断权。自主AI诊断——即系统在没有强制性人工审查的情况下发出发现——仅适用于一小部分特定的FDA认证工具。IDx-DR,现在以LumineticsCore品牌销售,是第一个获得FDA认证的自主AI诊断系统,于2018年4月获批用于糖尿病视网膜病变筛查。

AI无法复制整合了患者病史、护理目标、社会心理背景或体格检查结果的临床推理。

它在处理其训练数据分布之外的新型疾病时表现不佳。它无法替代传达和解释诊断所需的人际沟通。

2026年AI在医疗诊断中的应用方式

AI在放射学和医学影像中的应用

应用于放射学的AI使用卷积神经网络分析X光片、CT扫描、MRI和超声图像中的像素级模式,标记出符合所学特定疾病标准的发现。

在所有医学专科中,放射学拥有最多的FDA认证AI诊断工具。截至2026年初,FDA的AI/ML医疗器械软件行动计划数据库列出了超过650款已获认证的放射学AI产品。

当前的临床应用包括:

  • 肺结节检测。 Aidoc的AI平台在胸部CT扫描中标记出偶发性肺结节,并将紧急病例排在放射科医生工作列表的最前面。
  • 脑出血检测。 Viz.ai的ContaCT平台分析CT扫描以发现大血管闭塞和颅内出血,通过同时通知神经科团队与放射科报告,缩短了治疗时间。
  • 骨折识别。 Gleamer公司的BoneView在X光平片上检测四肢骨骼的骨折,据报道对骨折的敏感性为91%,而未经AI辅助的急诊医生读片敏感性为86%(2022年发表于《放射学》杂志)。
  • 胸片分诊。 Nuance集成AI的PowerScribe和Qure.ai的qXR平台能够检测胸部X光片上的气胸、胸腔积液、心脏肥大和实变等发现。

AI与人类放射科医生:已发表研究显示的结果

  • McKinney等,《自然》2020年:乳腺癌,乳腺X线摄影,AI性能AUC 0.895,人类性能AUC 0.814(6位放射科医生均值),AI使假阳性减少5.7%,假阴性减少9.4%。
  • Ardila等,《自然-医学》2019年:肺癌,低剂量CT,AI性能AUC 0.944,人类性能AUC 0.883(6位放射科医生均值),AI模型在42,290次扫描上训练。
  • Rajpurkar等,斯坦福大学2018年:肺炎,胸部X光片,AI性能AUC 0.761,人类性能AUC 0.761(9位放射科医生均值),性能相当,AI速度更快。
  • Titano等,《自然-医学》2018年:颅内发现,头部CT,AI性能AUC 0.991,未直接比较,侧重于分诊加速。
  • Poplin等,《自然-生物医学工程》2018年:心血管风险,视网膜眼底照片,AI性能AUC 0.70,高于人类(眼科医生),新颖生物标志物发现。

这些研究反映了受控的研究条件。现实世界中的部署性能通常低于研究报告的数字,原因是人群异质性、图像质量差异和扫描仪不同。2022年发表在《柳叶刀-数字健康》上的一项系统评价发现,不到40%的AI放射学研究包含在独立数据集上的外部验证。

AI在癌症筛查与早期检测中的应用

AI通过识别筛查图像中符合所学恶性风险标准的亚放射学或亚视觉发现,从而改善早期癌症检测,使得在临床症状出现前就能进行干预。

肿瘤筛查代表了AI诊断中风险最高的应用,因为检测分期是大多数癌症类型生存率的主要决定因素。

已部署的关键系统包括:

  • 乳腺X线摄影筛查。 ScreenPoint Medical公司的Transpara,于2021年获得FDA认证,为乳腺X光片分配1-10分的恶性评分,并在欧洲试验数据中显示,在保持诊断准确性的同时,阅读时间减少了34%。Kheiron Medical公司的Mia(乳腺X线摄影智能评估)在一项涉及25,000名女性的英国国家医疗服务体系试验中,将假阴性率降低了13%。
  • 肺癌。 由麻省理工学院和麻省总医院开发、并于2023年1月发表在《临床肿瘤学杂志》上的Sybil,能够从单次低剂量CT扫描中预测6年肺癌风险,多个队列的AUC在0.75至0.81之间。Veracyte公司的Prosigna和Afirma基因组测序分类器使用AI从活检标本中分类甲状腺结节恶性风险。
  • 结直肠癌。 美敦力公司的GI Genius,于2021年4月获得FDA认证,在结肠镜检查中使用实时计算机视觉标记腺瘤。2020年发表在《柳叶刀》上的一项随机对照试验显示,与标准结肠镜检查相比,腺瘤检出率相对提高了14%。
  • 宫颈癌。 Google Health使用深度学习的自动视觉评估在2019年《自然-医学》的一项研究中,对宫颈癌前病变检测的敏感性为91%,而护士目视检查的敏感性为69%。
  • 皮肤癌。 Esteva等人开发并于2017年发表在《自然》杂志上的AI系统,在129,450张临床图像上训练,对皮肤病变的分类达到了委员会认证皮肤科医生的水平(AUC 0.96)。

AI在病理学中的应用

数字病理学AI扫描组织样本的全切片图像,并使用在标注病理切片上训练的深度学习模型,识别癌变、癌前或异常细胞。

传统病理学需要训练有素的病理学家在显微镜下手动审阅染色的组织切片——这个过程缓慢、主观,且受限于专家可用性。AI将这一工作流程数字化。

PathAI公司成立于2016年,开发用于病理切片分析的AI模型。其AISight平台已被验证用于前列腺癌分级、肝病量化和生物标志物表达分析。2019年《自然-医学》上的一项研究发现,与仅由病理学家审阅相比,AI-病理学家合作将前列腺癌分级错误减少了70%。

Paige.ai于2021年9月获得了FDA对病理学中首个主要诊断AI工具的批准,该工具被批准用于辅助前列腺癌检测。在发表在《自然-数字医学》上的一项研究中,该工具识别出了病理学家最初给出阴性结果时遗漏的30.6%的临床显著癌症。

AI在心脏病学和神经学中的应用

AI在心脏病学中主要通过心电图分析和超声心动图解释来应用,在神经学中则通过神经影像分析和生物标志物模式识别来应用。

在心脏病学领域:

  • AliveCor公司的KardiaMobile设备使用单导联心电图和AI算法检测心房颤动,敏感性和特异性分别达到99%和97%,结果于2018年发表在《美国心脏病学会杂志》上。
  • 苹果手表的房颤检测算法,于2018年9月获得FDA认证,在涉及419,297名参与者的苹果心脏研究中,阳性预测值为84%,结果于2019年发表在《新英格兰医学杂志》上。
  • Eko Health公司的心脏AI,于2022年获得FDA认证,能够从听诊器录音中检测射血分数降低,AUC为0.93,无需超声心动图即可实现即时筛查。

在神经学领域:

  • Viz.ai公司用于大血管闭塞检测的LVO模块,灵敏度和特异性分别达到90.4%和91.7%,根据2020年《卒中》杂志的一项研究,平均将中风患者的门到治疗时间缩短了52分钟。
  • 基于AI的淀粉样蛋白PET扫描和MRI体积分析正被应用于早期阿尔茨海默病检测。2022年《放射学》杂志上的一项研究表明,一个AI模型可以在临床诊断前6年预测阿尔茨海默病,AUC为0.84。

AI在罕见病检测中的应用

AI通过将患者表型数据——包括身体特征、症状和基因组标记——与包含数千种疾病的罕见病数据库进行交叉比对,从而减少罕见病诊断延迟。

罕见病的诊断之旅是一个有记录可循的临床失败案例。根据2019年发表在《孤儿病杂志》上的一项研究,平均确诊时间为4.8年。患者平均看7.3位医生,40%的患者在获得正确诊断之前至少接受过一次误诊。

有两款AI工具直接解决了这个问题:

  • FDNA公司的Face2Gene使用深度学习从照片分析面部畸形特征,并与包含超过10,000种遗传综合征的数据库进行模式匹配。2019年《自然-医学》上的一项研究发现,对于216种疾病,它在91%的病例中能在前10个结果中识别出正确的综合征。
  • Isabel DDx使用自然语言处理分析临床笔记和症状,生成一个涵盖超过11,000种疾病的排名鉴别诊断列表。

AI医疗诊断背后的技术

临床实践中的机器学习与深度学习

  • 特征:机器学习处理结构化数据,如化验值、电子病历字段、人口统计数据;深度学习处理非结构化数据,如图像、病理切片、音频。
  • 特征工程:机器学习需要手动选择输入变量;深度学习则自动从原始数据中学习特征。
  • 主要算法类型:机器学习包括随机森林、梯度提升、支持向量机、逻辑回归;深度学习包括CNN、Transformer、循环神经网络。
  • 临床用例:机器学习用于脓毒症预测、再入院风险、基于电子病历的分诊;深度学习用于放射影像分析、病理切片审阅、心电图分类。
  • 训练数据需求:机器学习对较小数据集可行;深度学习需要大型、标注的数据集。
  • 可解释性:机器学习中等,有特征重要性评分;深度学习默认较低,需要可解释性工具。
  • 临床验证示例:机器学习如Epic脓毒症模型、Cerner早期预警评分;深度学习如DeepMind的视网膜病变AI、PathAI、IDx-DR。

医学影像中的卷积神经网络

CNN通过在整个像素网格上应用学习到的过滤器来识别图像中的空间模式,从边缘和纹理等低级特征,到结节、肿块或出血等复杂结构,建立起层次化的表征。

应用于胸部CT扫描的CNN并不会接收关于要寻找什么的文字描述。它接收原始像素矩阵,并基于其训练数据分布的模式匹配,为每个目标疾病生成一个概率评分。

训练过程需要标注数据集——即人类专家已经识别出相关发现的图像。这些训练数据的质量、规模和人口统计学多样性直接决定了模型的性能和泛化能力。

ResNet、DenseNet和EfficientNet是FDA认证的放射学AI工具中最常部署的CNN架构。从自然语言处理借鉴而来的视觉Transformer,由于能够建模长距离空间依赖关系,在2025年和2026年正越来越多地被评估用于医学影像任务。

电子健康记录中的自然语言处理

NLP从非结构化的医生笔记、出院小结和转诊信中提取有临床意义的信号——这些文本数据是传统的基于规则的系统无法处理的。

根据IBM的数据,大约80%的医疗数据是非结构化文本。NLP模型将这些文本转换为结构化、可查询的特征,供AI诊断系统使用。

环境文档工具——Nuance DAX和Suki AI——使用自动语音识别结合NLP,从医患对话中生成结构化的临床笔记。根据微软健康数据,到2026年初,Nuance DAX已整合到美国超过500个医疗系统中,平均将文档记录时间减少了50%。

临床NLP还被应用于药物警戒(从笔记中识别不良药物事件信号)、脓毒症筛查(在分诊笔记中检测早期全身性感染的语言模式)以及罕见病症状提取。

多模态AI:整合影像、基因组学和患者病史

多模态AI诊断模型同时处理来自多种输入类型的数据——影像、基因测序、化验值、临床笔记和可穿戴设备数据——产生的诊断输出优于单一模态模型的表现。

单模态AI模型天生受限于单一数据类型中包含的信息。一个胸部CT AI模型不知道患者的吸烟史、遗传风险谱或既往影像。多模态模型整合了这些输入。

谷歌的ETHOS模型,于2024年在《自然》杂志中描述,整合了组织学图像与多组学数据,以预测癌症预后和治疗反应。微软的BiomedCLIP,在来自PubMed的1500万科学图像-文本对上进行训练,支持跨模态检索和超过40种生物医学影像任务的零样本分类。

谷歌的Med-PaLM 2,一个在医疗数据上微调的大型语言模型,在2023年7月《自然》杂志上发表的结果中,在USMLE风格的医学问题基准测试中得分86.5%——超过了60%的及格线,在知识类问题上接近专家医师的水平。

临床决策支持系统

临床决策支持系统是一种软件,它在电子健康记录中分析患者数据,并在诊疗点生成针对特定疾病的建议、警报或诊断提示。

CDSS工具并非独立于EHR运行。它们嵌入在包括Epic、Oracle Cerner和Meditech等平台中。它们在临床医生现有工作流程内产生如药物相互作用警报、脓毒症风险评分和鉴别诊断建议等输出。

CDSS和AI诊断工具之间的区别在于监管和功能。在FDA的医疗器械软件指南下,提供建议供临床医生审阅的CDSS与提供特定诊断的AI系统,其分类不同。这种分类决定了监管路径、验证要求和责任归属。

AI诊断准确性:证据及其局限性

在特定的、狭窄的任务中——主要是受控研究条件下的高容量图像分类——AI诊断工具表现出与专家临床医生相当或更优的性能。由于分布偏移、人口统计学不匹配和部署变量,现实世界中的性能始终较低。

AI一贯表现良好的领域

AI诊断在三个有记录的情境中优于无辅助的人工审阅:

  1. 跨工作量的一致性。 AI对同一会话中的第1张和第1000张图像应用相同的标准。根据《学术放射学》的研究,人类放射科医生的错误率在连续阅读4小时后会显著增加。
  2. 高通量筛查中的检测灵敏度。 在乳腺X线摄影、肺结节检测和糖尿病视网膜病变筛查中,当AI作为并行的第二阅片者使用时,能够降低假阴性率。
  3. 时间紧迫情况下的速度。 Viz.ai通过在CT血管造影上发现大血管闭塞并在60秒内通知值班神经科医生,将中风患者的门到介入时间缩短了。

AI表现不佳的领域

AI诊断工具在可测量、有记录的方式上存在失败:

  • 新颖和罕见的表现形式。 在常见疾病模式上训练的模型,在面对非典型表现、新型病原体和训练分布之外的罕见病时会失败。2020年3月之前训练的COVID-19影像AI模型无法泛化到新型病毒性肺炎的模式。
  • 人口统计学边缘案例。 主要在高收入、西方人群数据上训练的模型,在来自其他人口群体的患者身上表现不佳。2021年《美国医学会内科杂志》上的一项研究发现,胸部X光片AI模型对黑人患者肺炎检测的敏感性低于白人患者,这归因于训练数据不平衡。
  • 多重共病患者的挑战。 为单一疾病检测优化的AI模型,在多种疾病并存时表现不佳,因为相互竞争的发现可能会抑制单个疾病的概率评分。

算法偏见:人口统计学数据缺口

根据2022年发表在《柳叶刀-数字健康》上的一项分析,不到33%的FDA认证AI医疗设备报告了按性别划分的性能数据,不到25%报告了按年龄分层的亚组性能。

这不是一个假设性的担忧。根据2020年12月《新英格兰医学杂志》上发表的一项研究,AI脉搏血氧仪——一种通过可穿戴传感器估算血氧饱和度的算法——在深色皮肤患者中表现出临床上显著的性能不足。其根本问题在于:训练数据集偏向于浅肤色受试者。

按种族、性别和年龄划分的性能差距对全球健康公平性有影响。一个完全基于美国或欧洲学术医疗中心数据训练的AI诊断工具,可能在加纳、尼日利亚、孟加拉国或印度农村的患者身上表现系统性地更差——而恰恰是这些人群,专家短缺使得AI的可及性最为宝贵。

联邦学习——一种在分散式数据上本地训练模型,而无需集中化敏感患者记录的训练方法——是在保护隐私的同时增加数据集多样性的技术途径之一。谷歌、英伟达(通过其Clara联邦学习框架)和英特尔已在医疗环境中发布了联邦学习实现。

AI在医疗诊断中的益处

速度与早期检测的影响

在有记录的部署中,基于AI的中风检测工具将治疗时间缩短了30到60分钟。在缺血性中风中,根据美国中风协会的数据,每加快15分钟治疗,患者出院时能够行走的几率就会提高4%。

对于癌症,早期检测的生存获益与分期相关。根据美国国家癌症研究所的SEER数据库数据,乳腺癌I期的5年相对生存率为99%,到IV期降至28%。在标准阅片中被遗漏的I期癌症,如果被筛查AI发现,则直接可以在人群层面改善生存结局。

扩大低资源环境中的可及性

能够在标准硬件和低带宽连接上运行的AI诊断工具,正被部署在撒哈拉以南非洲、南亚和全球农村地区,使得在没有专家的情况下也能进行专家级分析。

截至2026年的具体部署案例:

  • Qure.ai的qXR已部署在90多个国家,分析了超过1000万张胸部X光片,并在印度、尼日利亚和越南的政府结核病筛查项目中积极使用。
  • Peek Vision的基于智能手机的视网膜影像AI正在肯尼亚的社区眼健康项目中部署,那里的眼科医生密度约为每百万人1名。
  • Ubenwa,在尼日利亚开发,使用AI分析婴儿哭声来检测出生时的出生窒息——这是一种在低收入国家每年导致70万人死亡的疾病——而无需专门的设备。

加纳、尼日利亚、卢旺达、肯尼亚和印度是记录在案的AI优先诊断路径部署活跃区,这些地区的传统基础设施并未限制其采纳。

减轻临床医生职业倦怠

根据美国医学会的数据,2021年美国医生的职业倦怠率达到63%,其中文档记录负担被确定为主要驱动因素。AI环境文档工具在已发表的实施研究中,将文档记录时间减少了25%到50%。

AI图像预筛选工具能够自动将正常影像从放射科医生的工作列表中过滤掉,在在不减少吞吐量的情况下减少了每次阅片的数量,从而解决了阅读疲劳背后的核心注意力耗竭机制。

风险、伦理关切与局限性

AI诊断错误时的责任归属

截至2026年3月,美国没有既定的法律标准明确地将AI诊断错误的责任分配给AI供应商、部署医院或监督临床医生。

当前的框架将医生视为任何在AI辅助下做出的诊断的责任方,理由是AI作为一种工具,医生保留决策权。然而,随着自主AI诊断工具的扩展——即医生审查非强制性步骤的工具——这一框架正面临法律和监管压力。

FDA在2021年12月发布的AI/ML医疗器械软件行动计划承认了上市后监管和适应性监管框架的必要性,但并未明确责任归属。美国医学会2021年关于增强智能的政策指出,当医生无法审查或覆盖算法时,不应为AI错误负责。

截至2026年,美国关于AI诊断工具的相关集体诉讼尚处于早期阶段。尚无具有里程碑意义的判决确立先例。

患者数据隐私与HIPAA合规性

HIPAA在美国管辖受保护健康信息。任何摄入患者数据——影像、EHR记录、基因组数据——的AI诊断工具都必须遵守HIPAA的隐私规则、安全规则和违规通知规则。

关键的合规机制包括:

  • 在模型训练前,使用安全港或专家确定标准对训练数据集进行去标识化处理。
  • 在医疗机构和AI供应商之间签订商业伙伴协议
  • 对要求PHI在特定地理管辖区域内处理的医疗系统,制定数据驻留要求

联邦学习通过在本地、基于医院的数据集上训练模型,而无需将原始患者数据传输到中央服务器,从而解决了训练数据隐私问题。2021年《自然-医学》上的一项联邦学习研究证明,一个在美国和英国20个机构训练的COVID-19恶化预测模型,其性能与集中训练的模型相匹配,而无需交换患者记录。

可解释AI与黑箱问题

AI诊断工具的临床采纳障碍并非准确性——而是可解释性。临床医生不会依据他们无法解释或审计的发现采取行动。

标准的深度学习模型在设计上不可解释。一个标记出肺结节的CNN不会产生推理链,它只会生成一个概率评分。

可解释AI技术通过为模型输出生成视觉或数值解释来解决这个问题:

  • Grad-CAM在输入图像上生成一个热力图,高亮显示对模型预测影响最大的像素区域。
  • SHAP为每个输入特征分配一个贡献分数,显示在表格型AI模型中哪些变量推动了风险评分预测。
  • LIME围绕特定预测生成复杂模型行为的局部近似。

FDA 2023年关于AI/ML医疗器械软件的指南将可解释性作为良好机器学习实践的一个组成部分。欧盟AI法案于2024年生效,将AI诊断系统归类为高风险应用,要求记录系统透明度和人工监督机制。

临床环境中的影子AI

影子AI指的是临床医生在机构治理框架之外,且未经临床验证的情况下,使用通用AI工具——包括ChatGPT、Google Gemini和Claude——进行诊断推理。

2024年发表在《美国医学会杂志》上的一项调查发现,40%的受访医生报告使用通用AI聊天机器人执行临床任务,包括生成鉴别诊断、查询用药剂量和解释检验结果。其中不到20%的机构有正式的政策来规范这种使用。

风险不在于这些工具产生错误的输出——它们经常产生看似合理、有用的输出。风险在于,这些输出是由未经临床人群验证、不受FDA监督、未审计偏见、也未与患者实际数据整合的模型生成的。在未经验证的情况下,依据一个看似合理但不正确的AI建议采取行动,可能构成诊断错误,给患者带来实际后果。

FDA监管与AI诊断的法律环境

FDA如何对AI诊断工具进行分类

FDA在其数字健康卓越中心框架下,将AI诊断软件作为医疗器械软件进行监管,采用基于风险的分类系统,该分类与AI预期输出的临床重要性相关联。

适用三种主要的监管途径:

  • 510(k)许可:AI与已上市器械实质等同,审查类型为实质等同审查,时间线为3-12个月。
  • De Novo授权:无已上市器械的新型AI,风险低至中等,审查类型为基于风险的审查,时间线为12-24个月。
  • 上市前批准:具有新型声明的高风险AI,属于III类,审查类型为全面的科学审查,时间线为18-36个月。
  • 突破性器械认定:用于治疗严重疾病且存在未满足需求的AI,审查类型为加速审查,时间线为可变,更快。

FDA的预定变更控制计划框架于2023年正式确立,允许开发者提交未来算法更新的计划,而无需每次更新都提交新的监管申请——这是一项重要的变化,解决了自适应AI系统的动态特性。

截至2026年3月,已有超过950款AI/ML器械获得FDA许可或批准。放射学约占所有获批AI医疗器械的75%。

医疗器械软件:什么符合条件,什么不符合

当软件的主要目的是诊断、治疗、预防或监测医疗状况时,它才作为医疗器械软件发挥作用。一个医生用来查找药物剂量的通用AI聊天机器人不符合此定义。一个从CT扫描生成恶性概率的AI模型符合——并且必须满足FDA的上市前审查要求。

支持或补充临床决策但不驱动诊断的软件——例如环境文档工具或行政调度AI——被归类为非器械软件,无需接受FDA的上市前审查。

欧盟的CE标志

在欧盟市场销售的AI诊断工具必须根据器械类型,获得欧盟医疗器械法规或体外诊断法规下的CE标志。

欧盟MDR于2021年5月过渡期后全面适用,引入了比之前的医疗器械指令显著更严格的上市后监管要求。与FDA框架的主要区别包括:

  • 公告机构参与。 与FDA的直接审查模式不同,欧盟认证需要由大约50个认可的公告机构之一进行评估。
  • 临床证据要求。 MDR要求进行临床调查或提供等效的临床数据,以证明器械在目标人群中的性能。
  • 唯一器械标识。 所有CE标志医疗器械必须在欧洲数据库EUDAMED中注册UDI。

欧盟AI法案将AI诊断系统归类为高风险AI应用,并于2026年8月全面执行,增加了一个平行的合规层,要求提供技术文档、进行符合性评估并在欧盟AI数据库中注册。

报销缺口

由于大多数AI辅助诊断服务缺乏特定的当前程序术语计费代码,医院无法独立为AI工具的使用计费,这直接限制了商业采纳,即使这些工具已获得FDA认证且临床有效。

美国医疗保险和医疗补助服务中心曾为特定的AI诊断工具发布过新技术附加支付代码——包括Viz.ai的中风分诊工具,该工具于2022年通过NTAP计划获得了单独的支付津贴。然而,NTAP是一种临时机制,由于大多数AI诊断工具缺乏永久的CPT代码,这些系统的成本被吸收到现有的手术报销中。

截至2026年,美国放射学会和美国医学会正在研究AI辅助解读的CPT代码提案。在永久代码存在之前,AI诊断采纳的经济模型取决于展示工作流程效率、责任减少或市场差异化——而非直接的计费收入。

临床医生和患者对AI诊断的看法

医生的视角

2025年和2026年,专业社区和已发表调查中的主流临床共识是,AI最好作为增强临床医生判断的工具,而非替代品。

2023年一项针对1000名医生、发表在《美国医学会网络开放版》上的调查发现,65%的医生认为AI将提高他们专业的诊断准确性,但只有28%报告认为自己接受了足够训练来批判性地评估AI诊断工具的输出。

在放射学社区,替代叙事已发生了显著变化。2022年《学术放射学》上的一项调查发现,78%的放射科医生将AI视为生产力工具,而2018年一项类似调查中这一比例为45%。2016-2018年媒体中常见的“AI将取代放射科医生”的框架,已经让位于更细致的临床观点:AI处理高容量、模式识别部分的阅片,而放射科医生则管理临床背景、报告综合、多学科沟通和边缘案例。

根据2023年《npj数字医学》上的一项研究,表达最高程度AI怀疑论的临床医生,一致报告对特定AI工具的直接经验最少。

患者的视角

2023年发表在《美国医学会杂志-肿瘤学》上的一项研究发现,56%的癌症患者不知道AI已被用于分析他们的诊断影像,72%的患者表示希望被告知AI参与了他们的诊断。

患者对AI诊断的信任是有条件的,而非绝对的。2022年发表在《患者教育与咨询》上的研究发现,当临床医生解释了工具的作用、临床验证了发现并仍在决策过程中时,患者接受AI诊断输出的意愿显著增加。

面向患者的AI诊断工具——包括Ada Health、K Health和Buoy Health——直接向患者提供症状评估和分诊指导。这些工具作为决策支持而非诊断,且目前形式下并未作为医疗器械受FDA监管。它们在症状分诊方面的临床准确性已在有限的研究中得到评估,结果因疾病类型而异。

在肿瘤学中,AI第二意见的概念正在兴起。包括Tempus、Foundation Medicine和一些学术医疗中心在内的服务机构,提供AI辅助的分子谱分析报告,患者可以请求这些报告来补充其主治肿瘤医生的建议。这些不是AI取代肿瘤医生的服务;它们是AI作为额外分析层的服务。

AI在医疗诊断中的未来

可穿戴和持续诊断监测

**可穿戴AI诊断将模型从间歇性的、基于诊所的测试转变为持续的、被动的健康监测——### 可穿戴和持续诊断监测

可穿戴AI诊断将模型从间歇性的、基于诊所的测试转变为持续的、被动的健康监测——生成纵向数据流,供人群层面和个体层面的AI模型实时分析。

当前FDA认证的可穿戴诊断能力包括:

  • 心房颤动检测(苹果手表、三星Galaxy手表、AliveCor KardiaMobile)
  • 血糖估算(雅培FreeStyle Libre、德康G7)
  • 睡眠呼吸暂停检测(Withings Sleep Analyzer,2022年获FDA认证)
  • 通过光电体积描记法进行血氧饱和度监测

正在积极开发的下一代可穿戴诊断包括无袖带连续血压监测(三星和Valencell已发布验证数据)、无创血糖监测,以及通过汗液分析进行的连续生物标志物检测(截至2025年,斯坦福和麻省理工学院正在进行注册试验)。

医学基础模型

医学基础模型是大型AI系统,在多模态临床数据——影像、基因组学、临床笔记、化验值——上进行训练,可以针对特定诊断任务进行微调,而无需从头开始训练。

此前,特定任务医学AI模型开发的计算和数据需求使得只有大型机构才能进行,而现在这些需求正被基础模型微调所取代。拥有较小数据集的一家医院,可以更高效地在本地数据上微调一个预训练的医学基础模型,而不是从头构建一个任务特定模型。

截至2026年初,活跃的医学基础模型包括:

  • Med-PaLM 2(Google DeepMind):为医学问答和临床推理微调的大型语言模型
  • BiomedCLIP(微软研究院):在1500万对PubMed图文对上训练的视觉-语言模型
  • CheXagent(斯坦福大学):用于胸部X光片分析的基础模型,支持13个诊断任务
  • PLIP(病理学语言-图像预训练):多伦多大学开发的病理学专用视觉-语言模型

非洲和东南亚的AI诊断

没有传统诊断基础设施的国家——包括加纳、尼日利亚、卢旺达、印度和孟加拉国——正在采用AI优先的诊断路径,绕过了高收入卫生系统对基础设施依赖的模式。

这是一个结构性的机遇。一个没有国家远程放射学网络的国家,可以先部署基于云的AI放射学平台,而无需先建设网络。一个拥有智能手机和便携式超声设备的农村诊所,可以将图像传输到云端AI系统,该系统在几秒钟内返回初步发现。

沙特阿拉伯的Seha虚拟医院,于2021年宣布为世界上最大的虚拟医院,使用AI诊断和监测工具远程管理30多个专科。非洲疾病预防控制中心的AI诊断倡议,于2024年启动,正在资助15个成员国的AI结核病筛查部署。在加纳和卢旺达运营的Zipline公司,将AI诊断与无人机药物配送相结合,服务于偏远社区。

2026年领先的AI诊断公司和工具

AI影像和放射学平台

  • Aidoc:主要产品aiOS平台,临床重点为偶发和紧急发现分诊,FDA状态为多项认证。
  • Viz.ai:主要产品ContaCT、Viz LVO,临床重点为中风、心脏、肺栓塞,FDA状态为多项510(k)认证。
  • Nuance(微软):主要产品PowerScribe AI,临床重点为放射学报告、环境文档,FDA状态为已整合在FDA认证工作流程中。
  • Qure.ai:主要产品qXR、qCT,临床重点为胸部病理、头部CT,FDA状态为FDA认证、CE标志。
  • Enlitic:主要产品Curie Framework,临床重点为企业级放射学AI,FDA状态为CE标志。
  • Zebra Medical Vision(Nanox AI):主要产品HealthCCSng,临床重点为冠状动脉钙化评分、肝脏脂肪,FDA状态为FDA认证。
  • Gleamer:主要产品BoneView、NeuroView,临床重点为肌肉骨骼骨折、神经发现,FDA状态为FDA认证、CE标志。

AI病理学和基因组学平台

  • PathAI:主要产品AISight,临床重点为前列腺、肝脏、肿瘤病理学,FDA状态为多项FDA突破性器械认定。
  • Paige.ai:主要产品Paige Prostate,临床重点为前列腺癌检测,FDA状态为FDA De Novo(首个AI初级病理诊断)。
  • Tempus:主要产品Tempus AI Platform,临床重点为多模态肿瘤学、基因组学,FDA状态为CLIA认证实验室。
  • Foundation Medicine(罗氏):主要产品FoundationOne CDx,临床重点为全面的基因组分析,FDA状态为FDA批准的伴随诊断。

面向患者和护理点的AI工具

  • Ada Health:开发者Ada Health GmbH,功能为症状评估、分诊,监管状态为当前形式下非医疗器械。
  • K Health:开发者K Health,功能为症状检查、初级保健分诊,监管状态为非医疗器械。
  • LumineticsCore(IDx-DR):开发者Digital Diagnostics,功能为自主糖尿病视网膜病变检测,监管状态为FDA De Novo(首个自主AI诊断工具)。
  • Eko Duo:开发者Eko Health,功能为AI增强听诊器、心脏筛查,监管状态为FDA 510(k)认证。
  • 苹果手表AFib:开发者苹果公司,功能为心房颤动检测,监管状态为FDA 510(k)认证。

关于AI与医疗诊断的常见问题

AI诊断疾病能比医生更准确吗?

在特定的、狭窄的任务中——特别是高容量图像分类任务,如糖尿病视网膜病变分级、肺结节检测和皮肤病变分类——AI在受控研究条件下表现出与专家临床医生相当或更优的性能。在一般的临床推理中,AI无法匹配医生的表现。

这种比较是针对特定任务的,而非全局性的。一个在42,290张低剂量CT扫描上训练的AI,可以以0.944的AUC检测肺癌(Ardila等,《自然-医学》2019)。该性能适用于该特定任务、该特定模态、以及类似于训练数据的人群。它不能转移到关于症状、治疗选择、患者沟通或多重共病管理的临床推理上。

更有用的框架是:AI减少了特定类型的诊断错误——主要是高通量筛查中的遗漏错误——同时引入了不同的风险,包括在代表性不足人群中的偏见以及在非典型表现上的失败。

AI会取代放射科医生和其他医生吗?

截至2026年3月,没有已发表的证据表明AI诊断工具的采用导致了临床人员配置的净减少。放射科医生的需求随着AI的部署而增加,这是由不断增长的影像量所驱动的。

美国放射学会的劳动力数据显示,从2019年到2025年,尽管同期AI影像工具得到了广泛采用,但放射科医生职位持续增长。AI工具减少了每次研究的时间,使放射科医生能够处理更高的数量——但并未消除对放射科医生监督AI输出的需求。

最容易受到AI驱动的范围缩减影响的特定任务是重复性的、高容量的分类任务:对正常胸部X光片的初步解读、常规糖尿病视网膜病变分级、标准骨龄评估。那些专门从事这些任务,而不扩展至复杂解读、介入手术或多学科协作的放射科医生,面临更大的替代风险。

在医疗诊断中使用AI的最大风险是什么?

在已发表文献和监管指南中,五个最确凿的风险是:

  1. 算法偏见。 在非代表性数据集上训练的AI模型,在训练数据中代表性不足的人口统计学亚组上表现不佳,存在按种族、性别和年龄划分的性能差距记录。
  2. 分布偏移。 部署在与训练环境不同的临床环境中的模型——不同的扫描仪硬件、不同的患者群体、不同的疾病患病率——可能会产生系统性不准确的输出。
  3. 过度依赖。 不加批判地采纳AI输出的临床医生,可能会错过一个未受辅助的临床医生通过独立推理本可以发现的错误。
  4. 责任模糊。 没有既定的法律标准明确分配AI诊断错误的责任。
  5. 隐私和数据安全。 AI诊断系统需要访问受保护的健康信息;不充分的安全控制会带来泄露风险和监管暴露。

AI辅助诊断是否由保险覆盖?

截至2026年3月,美国大多数AI辅助诊断服务没有单独的报销代码。AI工具的成本通常被捆绑到现有的手术付款中,或由部署的医疗系统承担。

例外情况包括一些已获得CMS新技术附加支付状态的工具,例如Viz.ai的中风分诊平台。在美国以外,报销模式差异很大。例如,英国国家医疗服务体系通过其AI诊断基金资助AI诊断工具,该基金于2023年拨款2100万英镑用于AI影像采购。

对患者的实际影响是:AI可能被用于他们的诊断检查,而不会在他们的账单上产生单独的项目。成本已嵌入到影像或病理学手术代码中。

结论

AI并没有取代医疗诊断中的临床判断。它正在扩展诊断的可能性——在更早的阶段检测发现,在大量工作中保持诊断一致性,并将专家级分析扩展到没有专家的地区和人群。

AI在影像学、肿瘤筛查、病理学和心脏病学方面的证据基础是实质性的,并且在不断增长。其局限性也同样真实:算法偏见、现实世界性能差距、监管滞后、报销障碍以及未解决的责任框架。

成熟最快的技术——多模态基础模型、联邦学习、可穿戴持续监测和护理点AI——很可能在未来五到十年内从根本上重新定义诊断过程。人类临床角色将持续存在,但其构成将转向复杂解读、临床综合、患者沟通以及对AI系统的监督。

对于评估特定工具的临床医生来说,FDA认证状态、外部验证数据、人口统计学性能亚组报告以及与现有EHR工作流程的集成,是区分基于证据的AI采纳与营销驱动的采购的四个变量。

【全文结束】

猜你喜欢
    相关文章