医疗保健中的可解释人工智能:当前格局、挑战与未来方向Explainable Artificial Intelligence in Healthcare: Current Landscape, Challenges, and Future Directions - Shiddik - 2026 - Health Science Reports - Wiley Online Library

环球医讯 / AI与医疗健康来源:onlinelibrary.wiley.com孟加拉国 - 英语2026-08-27 21:54:36 - 阅读时长17分钟 - 8243字
本文系统综述了70篇2017-2025年间关于可解释人工智能(XAI)在医疗保健中应用的研究,涵盖肿瘤学、心脏病学、传染病学和神经病学等领域。深度学习模型(CNN、RNN、LSTM、Transformer)占主导(76%),SHAP(54%)和LIME(30%)是最常用的XAI技术。研究指出,虽然XAI提升了透明度和临床信任,但缺乏标准化可解释性指标、真实世界验证不足以及伦理监管框架薄弱仍是主要挑战。未来需要发展混合可解释模型、以人为中心的设计和领域特定定制方案。
医疗保健可解释人工智能临床信任诊断预后个性化治疗透明伦理监管临床验证
医疗保健中的可解释人工智能:当前格局、挑战与未来方向

摘要

背景与目标

人工智能(AI),特别是机器学习(ML)和深度学习(DL),正通过改善诊断、预后和个性化治疗来改变医疗保健。然而,许多AI模型的不透明性使其成为“黑箱”,限制了可解释性、临床医生的信任和实际应用。可解释人工智能(XAI)应运而生,旨在通过提供透明且可操作的见解来解决这些局限性。本系统综述旨在综合当前关于XAI在医疗保健中的证据,将AI模型映射到XAI技术、领域和临床应用。

方法

在六个数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM和IEEE Xplore)中进行了系统检索,检索对象为2017年至2025年间发表的同行评审出版物。经过去重和标题/摘要筛选后,根据预定义的纳入/排除标准对全文进行评估,遵循PRISMA指南。数据提取包括AI模型类型、XAI技术、医疗保健领域、研究设计、验证方法以及伦理/监管报告。

结果

共纳入70项研究,涵盖肿瘤学(40%)、心脏病学(21%)、传染病(14%)、神经病学(11%)和临床决策支持系统(13%)。深度学习模型(CNN、RNN、LSTM和Transformer)应用最频繁(76%),其次是基于树的模型(随机森林、XGBoost、决策树;24%)。SHAP(54%)和LIME(30%)是最常用的XAI技术,Grad-CAM(23%)和注意力机制(20%)主要用于图像和序列任务。仅有12项研究明确涉及伦理或监管考虑。混合可解释模型和以人为中心的设计是新兴趋势,但真实世界验证和标准化可解释性指标仍然有限。

结论

XAI增强了医疗保健AI应用中的透明度、临床医生信任和决策能力,但仍存在挑战,包括验证不一致、伦理/监管框架不完善以及缺乏标准化的可解释性度量。未来的工作应侧重于混合的、经过临床验证的XAI模型、全面的伦理合规性以及以用户为中心、针对特定领域的实施,以确保安全有效地整合到临床实践中。

1 引言

人工智能(AI),特别是机器学习(ML)和深度学习(DL),对医疗保健产生了深远影响。这些技术使医生和研究人员能够评估来自电子健康记录、医学影像和基因序列的大量信息。这种能力可以实现更准确的诊断、个性化治疗和更好的患者预后。AI整合到临床工作流程中,正在日益影响决策制定、资源分配和预测性公共卫生策略。

然而,许多AI模型的复杂性常常导致“黑箱”系统,其决策过程不透明。这种缺乏可解释性在医疗保健中带来了重大挑战,因为理解临床决策背后的理由对于确保信任、问责和患者安全至关重要。没有可解释性,临床医生可能会犹豫接受AI建议,从而限制了这些技术的转化影响。

为了解决这些问题,可解释人工智能(XAI)应运而生。XAI指的是使AI模型更易于解释的策略和技术,让人们能够理解决策是如何做出的。诸如SHapley Additive exPlanations(SHAP)、Local Interpretable Model-agnostic Explanations(LIME)、Gradient-weighted Class Activation Mapping(Grad-CAM)和注意力机制等方法有助于揭开AI预测的神秘面纱,从而增强透明度、信任度、可用性以及医疗专业人员和患者的临床接受度。此外,XAI通过识别和减轻偏见,促进公平的医疗保健服务。

最近的证据强调了将XAI整合到临床实践中的重要性。当提供清晰、上下文特定且可操作的解释时,临床医生更有可能信任AI系统。同时,监管机构越来越要求医疗决策中的AI系统具有可解释性,反映了其伦理、法律和安全意义。这种对透明度的重视与全球负责任的AI举措相一致,包括FDA的AI/ML软件指南和欧盟AI法案。

尽管XAI研究迅速扩展,但现有的综述通常是叙述性、领域特定或专注于单一技术的,对模型、解释方法和临床应用之间的系统性比较有限。本综述的独特贡献在于通过明确将机器学习模型家族映射到XAI技术和医疗保健领域,提供XAI在医疗保健中的系统性综合,同时识别真实世界临床验证、可解释性评估以及伦理和监管覆盖方面的差距。通过整合方法论、临床和治理视角,本综述旨在支持研究人员、临床医生和政策制定者负责任地开发、评估和部署医疗保健中的可解释AI系统。

2 方法与方法论

本综述采用了结构化的跨学科方法来审视机器学习(ML)和可解释人工智能(XAI)在医疗保健中的作用。该方法结合了系统性文献计量分析、主题综合和比较评估,整合了来自临床研究、政策框架和大数据分析的见解。基础研究,包括Frasca等人(2024)、Tjoa和Guan(2020)以及Fahim等人(2025),指导了方法论,强调透明度、伦理相关性、临床适用性和实际实施。本综述遵循PRISMA指南进行,以确保方法论透明度和可重复性。

在六个主要学术数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore)中进行了全面的系统性文献检索。检索目标为2017年至2025年间发表的同行评审文章,关键词包括“Machine Learning in healthcare”、“Deep Learning in medicine”、“Explainable AI”、“interpretable models”和“interpretable machine learning”。应用布尔运算符以提高检索敏感性和特异性,确保跨技术、临床和政策领域的全面覆盖(附录A和B)。初步检索识别出1200篇出版物。去重后,基于标题和摘要筛选了302篇独特记录,排除了232篇不相关的研究。随后,70篇全文文章符合纳入标准,被纳入定性综合,但没有一项适合定量元分析(图1)。筛选过程中应用的纳入和排除标准见表1,各数据库检索结果摘要见表2。

对于每项纳入的研究,系统提取了关键信息,包括使用的AI模型、应用的XAI方法、医疗保健领域、研究设计和主要结果。为了提高效率和一致性,使用基于Python的包装器进行了初步的自动提取书目和方法学信息。随后进行了手动全文审查以验证准确性并补充缺失或细微的细节,包括解释级别(全局或局部)、评估策略、伦理和法律考虑(偏见检测、患者同意、公平性、问责和监管合规)以及临床相关性。任何差异都通过直接查阅原始文章来解决。随后进行了主题综合,以识别文献中反复出现的模式、创新、挑战和差距(附录A–D)。

通过遵循这种结构化方法,本综述确保了XAI在医疗保健中应用的严谨性、可重复性和全面评估,为研究推进和临床实施提供了宝贵的见解。

3 结果

3.1 研究特征

本综述纳入了2017年至2025年间发表的70篇同行评审研究,涵盖不同的医疗保健领域。最具代表性的领域是肿瘤学(28篇,40%)、心脏病学(15篇,21%)、传染病(10篇,14%)、神经病学(8篇,11%)和临床决策支持系统(CDSS,9篇,13%)(表3和表4)。关于AI模型,大多数研究采用了深度学习模型,包括卷积神经网络(CNN)(28篇,40%)、循环神经网络(RNN)和长短期记忆网络(LSTM)(18篇,26%)以及Transformer架构(7篇,10%),这些模型特别适用于分析复杂的、高维度的医学数据。基于树的模型,如XGBoost、随机森林和决策树,常用于17项研究(24%),用于结构化临床数据集(表3)。

最常用的可解释性方法是SHAP(38篇,54%)、LIME(21篇,30%)、Grad-CAM(16篇,23%)和注意力机制(14篇,20%)。一些研究还采用了基于规则的模型、因果性框架和特征归因技术。在70篇纳入的研究中,有12篇明确涉及了伦理和监管考虑,包括偏见、公平性、患者同意和问责,反映出对医疗保健中负责任和透明AI的关注日益增长(见表3和表4)。代表性研究的选择基于对多样化医疗保健领域的覆盖、AI模型家族的多样性以及可解释技术的纳入,确保这些例子能够捕捉应用的广度并说明跨文献的趋势、创新和差距。

3.2 可解释AI在医疗保健中的应用

可解释AI方法应用于多个临床背景。在肿瘤学和放射学中,CNN与Grad-CAM或SHAP结合,能够可视化肿瘤区域并识别关键影像特征,增强了临床决策的可解释性。在心脏病学中,RNN和LSTM与注意力机制相结合,提高了对心电图信号和纵向患者数据的理解,支持准确的风险评估和个性化护理。

在传染病预测和预后中,基于树的模型如XGBoost和随机森林被广泛应用。SHAP和LIME突出了最具影响力的临床和人口统计学特征。对于基因组学和临床笔记分析,Transformer架构利用注意力机制和SHAP促进了序列和文本数据的解释,改善了对复杂分子和患者层面信息的洞察。此外,采用集成梯度的自编码器模型被探索用于异常检测和罕见疾病识别,展示了XAI揭示可能被忽视的隐藏模式的潜力。AI模型到XAI技术跨医疗保健领域的映射如图2所示,突出了方法和临床应用的多样性。

3.3 趋势、创新与差距

在纳入的研究中观察到几个显著趋势。混合模型将高性能AI与可解释框架相结合,越来越多地用于平衡准确性和透明度。对以人为中心和伦理设计的关注日益增加,重点在于临床医生友好的可解释性、偏见缓解和公平性。XAI的领域特定应用变得越来越普遍,方法针对影像、基因组学、时间序列数据和结构化临床数据集进行了定制。

尽管取得了这些进展,但仍存在一些差距。目前没有标准化的度量标准来衡量可解释性,使得跨研究比较具有挑战性。许多模型尚未在真实临床环境中得到验证,限制了实际应用。一些XAI输出对于非技术性的医疗专业人员来说仍然难以解释。此外,用于XAI临床部署的监管和伦理框架仍不完善,限制了其在医疗实践中的广泛采用。

3.4 选定研究总结

表4提供了医疗保健中可解释AI的代表性研究概述。值得注意的例子包括:Fahim等人(2025)使用CNN、LSTM和XGBoost模型结合SHAP和注意力机制进行跨领域的可扩展诊断和患者监测。Ennab和Mcheick(2024)专注于生物医学机器人,回顾了可解释性挑战并提出了更安全的AI策略。Frasca等人(2024)对448篇文章进行了文献计量综述,强调了多领域应用中的信任和透明度。Frasca等人(2020)对跨临床决策支持系统的可解释性进行了伦理评估,而Holzinger等人(2019)提出了一种使用决策树和因果性度量的可解释AI在肿瘤学和基因组学中的框架。其他值得注意的贡献包括ICU和电子健康记录分析中的XAI应用、基因组学和神经学研究、传染病爆发预测以及心脏病学中的心律失常检测。

这些研究共同突出了XAI应用的广度、模型和技术的多样性,以及对医疗保健中伦理和以人为中心AI设计的新兴关注。

4 讨论

本综述强调了可解释人工智能(XAI)在推进医疗保健AI系统的透明度、问责制和临床信任方面的关键作用。可解释性框架(如SHAP、LIME、Grad-CAM和注意力机制)的整合,显著改善了对复杂机器学习模型的理解,有效地弥合了计算复杂性与临床适用性之间的差距。这些发现强化了日益增长的共识,即可解释性是AI在医疗保健环境中安全、负责任部署的关键要求。

深度学习架构(CNN、RNN、LSTM网络和Transformer)在多样化医疗保健应用中的广泛采用在本综述中显而易见。当与XAI方法结合时,这些模型在医学影像、基因组学和电子健康记录(EHR)分析中显示出巨大潜力。例如,CNN-Grad-CAM组合使得诊断影像中的肿瘤区域可视化成为可能,而SHAP和基于注意力的解释则阐明了疾病进展和治疗结果预测模型中的特征贡献。这种整合不仅提高了模型透明度,还支持了临床医生的理解和决策。

该领域一个显著的发展是混合框架的兴起,这些框架将高性能AI模型与可解释组件相结合。这些模型旨在平衡预测精度和临床可解释性,直接解决了医疗保健AI中准确性和透明度的双重需求。这种方法与新兴证据一致,表明临床医生的信心和采用与模型解释的清晰度、一致性和可访问性密切相关。因此,混合和以人为中心的XAI设计正作为实际实施中的实用解决方案而日益突出。

尽管取得了实质性进展,但仍存在一些挑战。缺乏标准化的可解释性度量标准阻碍了不同XAI技术之间的有意义比较。尽管许多模型在受控研究环境中表现出色,但其临床转化和验证仍然有限。此外,XAI输出的可用性和认知负担各不相同,某些解释对非专业医疗用户来说在技术上具有挑战性。解决这些限制需要以用户为中心的设计、跨学科合作和有针对性临床医生培训,以确保可解释性转化为实际临床效用。

伦理和监管考虑仍然是医疗保健AI负责任部署的核心。所审查的研究显示出对公平性、偏见缓解和问责制的日益认识,反映了向负责任AI实践的转变。然而,专门针对XAI的全面监管框架的发展仍处于起步阶段。有效的实施将需要临床医生、研究人员和监管机构之间的协调行动,以建立透明、可执行且具有伦理基础的可解释AI系统标准。

展望未来,未来的研究应优先制定标准化的可解释性基准,开展大规模临床试验以评估模型泛化能力,并设计适应不同临床专业水平的直观XAI工具。此外,健全的伦理和治理框架的演变对于AI技术公平、透明和可持续地整合到医疗保健系统中至关重要——最终促进信任、患者安全和改善健康结果。

4.1 局限性

本综述存在一些局限性。首先,文献检索仅限于六个主要学术数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore),这可能遗漏了其他来源的重要研究。其次,只考虑2017年至2025年间发表的同行评审出版物,可能排除了较早的基础性工作或最新的预印本。第三,所选研究本身具有异质性,在AI模型、XAI方法、医疗保健领域和评估方法上存在差异,使得直接比较变得困难。最后,由于方法学和报告的可变性,本综述没有进行定量元分析,而是侧重于研究层面发现的定性综合。

5 结论

本系统综述综合了2017年至2025年间发表的70篇同行评审研究的证据,考察了可解释人工智能(XAI)如何整合到医疗保健机器学习应用中。研究结果表明,深度学习模型(CNN、循环架构和基于Transformer的系统)主导了当前实践,SHAP、LIME、Grad-CAM和注意力机制成为临床领域(如肿瘤学、心脏病学、传染病、基因组学和临床决策支持)中最常用的解释技术。除了将模型映射到XAI方法和应用领域外,本综述还识别了清晰的跨研究模式和差距。虽然可解释性越来越多地被纳入以增强透明度和临床医生信任,但只有少数研究明确涉及伦理、监管和公平性考虑,真实世界临床验证仍然有限。此外,用于评估可解释性的标准化度量标准的缺失继续阻碍了跨研究和方法的有效比较。

总体而言,本综述为XAI在医疗保健中的应用提供了结构化的综合,突出了方法论趋势和持续存在的局限性。未来的研究应优先制定标准化的可解释性基准、严格的临床验证以及以用户为中心的解释界面开发,同时辅以更清晰的伦理和监管指导。解决这些问题对于将XAI驱动的系统从实验环境转化为透明、可信且临床可行的医疗保健解决方案至关重要。

作者贡献

Md. Abu Bokkor Shiddik:概念化、调查、资金获取、撰写初稿、方法论、验证、可视化、撰写审阅与编辑、软件、正式分析、项目管理、数据管理、监督、资源。

致谢

我要感谢Md. Siddikur Rahman博士教授我研究方法,并在我整个研究工作中给予宝贵的支持。

资金

作者未获得本工作的特定资金。

伦理声明

不适用,因为本研究是对已发表研究的系统综述。

利益冲突

作者声明无利益冲突。

透明度声明

首席作者Md. Abu Bokkor Shiddik确认本手稿是对所报告研究的诚实、准确和透明的描述;没有遗漏研究的任何重要方面;并且已解释与计划(以及相关注册)的任何差异。

附录A:数据库特定搜索策略

在六个电子数据库(Elsevier(ScienceDirect)、SpringerLink、Taylor & Francis Online、Semantic Scholar、ACM Digital Library和IEEE Xplore)中进行了系统性文献检索。检索限于2017年1月至2025年12月间发表的同行评审期刊文章,且以英文撰写。核心布尔检索逻辑根据每个数据库的语法进行了调整。以下展示了用于IEEE Xplore的检索字符串示例:(“explainable artificial intelligence” OR “explainable AI” OR XAI OR “interpretable machine learning” OR “模型解释”或“模型可解释性”)

AND

(“机器学习”或“深度学习”或“神经网络*”)

AND

(医疗保健或医学或临床或诊断或预后)

等效的关键词逻辑和布尔运算符应用于其余数据库,并根据各数据库进行了细微修改(例如,字段标签和通配符用法)。检索阶段未应用地理限制。初步检索在各数据库中返回了大量原始记录。在筛选前,应用了自动过滤器(出版物类型、年份和主题相关性)以排除非同行评审和超出范围的记录。最终的数据库检索于2025年9月1日至2025年10月15日期间进行。

附录B:筛选和研究选择工作流程

从六个数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore)检索到的所有记录均被导出,并使用Zotero参考文献管理软件合并到一个单一的参考文献库中。表2报告了每个数据库的原始关键词检索命中数。在合并并使用Zotero内置的重复检测功能以及随后的人工验证去除重复记录后,确定了302篇独特记录进行标题和摘要筛选,这与PRISMA流程图(图1)一致。

为了提高效率和一致性,使用基于Python的包装器从合并的库中提取书目元数据(例如,标题、作者、年份和摘要)。这种初步的自动提取之后进行了人工验证以确保准确性和完整性。

进行标题和摘要筛选以评估与医疗保健为重点的机器学习/深度学习应用的相关性,这些应用具有可解释性或可解释性。然后进行全文筛选以根据预定义的纳入和排除标准确认资格(见表1)。筛选决策基于与医疗保健的相关性、机器学习或深度学习模型的使用、XAI或可解释性技术的纳入以及实际、临床或政策相关性的证据。筛选和评估由一名评审员进行,并对模糊记录进行重新评估以确保一致性。

最终选择包括70项符合所有标准并纳入定性综合的研究。研究选择工作流程总结在PRISMA流程图中(图1)。本系统综述方案未在PROSPERO或任何其他综述注册中心注册。

附录C:提取的研究层面变量

对于每项纳入的研究,系统提取并记录了以下变量:

i. 医疗保健领域或应用领域。

ii. 人工智能/机器学习模型家族(例如,传统机器学习、深度学习和混合模型)。

iii. 可解释性方法(例如,SHAP、LIME、Grad-CAM、注意力机制、基于规则或内在可解释模型)。

iv. 可解释性级别(全局和/或局部)。

v. 数据类型(例如,影像、临床记录、时间序列和多模态数据)。

vi. 验证策略(例如,内部验证、外部数据集和真实世界部署)。

vii. 报告的结果和性能指标。

viii. 伦理和监管考虑(例如,偏见、公平性、透明度、问责制、同意和监管一致性)。

这些提取的变量构成了结果和讨论部分中提出的主题综合和比较评估的基础。

附录D:数据可用性和透明度声明

本研究未生成或收集任何原始患者层面数据。所有分析均基于从已发表的同行评审文章中提取的数据。提取的研究层面数据可根据合理要求从通讯作者处获得。

数据可用性声明

数据共享不适用于本文,因为本研究未创建或分析任何新数据。

【全文结束】