可解释人工智能在医疗健康中的应用:当前格局、挑战与未来方向Explainable Artificial Intelligence in Healthcare: Current Landscape, Challenges, and Future Directions - Shiddik - 2026 - Health Science Reports - Wiley Online Library

环球医讯 / AI与医疗健康来源:onlinelibrary.wiley.com孟加拉国 - 英语2026-09-07 11:18:31 - 阅读时长37分钟 - 18470字
本文系统综述了70篇发表于2017-2025年间关于可解释人工智能(XAI)在医疗健康中应用的研究,涵盖肿瘤学(40%)、心脏病学(21%)、传染病(14%)、神经学(11%)和临床决策支持系统(13%)。深度学习模型(CNN、RNN、LSTM、Transformer)最为常用(76%),SHAP(54%)和LIME(30%)是最常用的XAI技术。研究发现,尽管XAI增强了透明度和临床信任,但仅有12篇研究明确涉及伦理或监管问题,缺乏标准化可解释性指标和真实世界验证。未来应优先发展混合可解释模型、以人为中心的设计和全面的伦理合规框架。
健康医疗可解释人工智能XAI肿瘤学心脏病学传染病临床决策SHAPLIME信任透明度伦理
可解释人工智能在医疗健康中的应用:当前格局、挑战与未来方向

摘要

背景与目标

人工智能(AI),特别是机器学习(ML)和深度学习(DL),正通过改善诊断、预后和个性化治疗来改变医疗健康。然而,许多AI模型的不透明性使其成为“黑箱”,限制了可解释性、临床医生的信任以及实际应用。可解释人工智能(XAI)应运而生,旨在通过提供透明且可操作的见解来解决这些限制。本系统综述旨在综合当前关于XAI在医疗健康中的证据,将AI模型映射到XAI技术、领域和临床应用。

方法

在六个数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM和IEEE Xplore)中进行了系统检索,针对2017年至2025年间发表的同行评审文献。在去除重复项并进行标题/摘要筛选后,根据预定义的纳入/排除标准评估全文,遵循PRISMA指南。数据提取包括AI模型类型、XAI技术、医疗健康领域、研究设计、验证方法以及伦理/监管报告。

结果

共纳入70项研究,涵盖肿瘤学(40%)、心脏病学(21%)、传染病(14%)、神经学(11%)和临床决策支持系统(13%)。深度学习模型(CNN、RNN、LSTM和Transformer)应用最频繁(76%),其次是基于树的模型(随机森林、XGBoost、决策树;24%)。SHAP(54%)和LIME(30%)是最常用的XAI技术,Grad-CAM(23%)和注意力机制(20%)主要用于成像和基于序列的任务。仅有12项研究明确涉及伦理或监管考虑。混合可解释模型和以人为中心的设计是新兴趋势,但真实世界验证和标准化可解释性指标仍然有限。

结论

XAI增强了医疗健康AI应用中的透明度、临床医生信任和决策能力,但挑战依然存在,包括验证不一致、伦理/监管框架不完善以及缺乏标准化可解释性度量。未来工作应聚焦于混合的、临床验证的XAI模型、全面的伦理合规以及以用户为中心、特定领域的实施,以确保安全有效地融入临床实践。

总结

  • 系统综述了70项研究(2017-2025),涵盖肿瘤学、心脏病学、传染病、基因组学和临床决策支持。
  • 开发了一个模型→XAI→临床应用的映射框架,将AI架构(CNN、RNN、LSTM、Transformer、随机森林和XGBoost)与XAI技术(SHAP、LIME、Grad-CAM和注意力机制)联系起来。
  • 量化了趋势:56%为深度学习,32%为基于树的模型;SHAP(34%)和LIME(29%)最常见。
  • 识别了差距:真实世界验证有限,缺乏标准化可解释性指标,仅16%的研究涉及伦理/监管合规。
  • 强调了未来方向:混合可解释模型、以人为中心的设计、特定领域定制以及标准化评估框架。

1 引言

人工智能(AI),特别是机器学习(ML)和深度学习(DL),对医疗健康产生了深远影响[1]。这些技术使医生和研究人员能够评估来自电子健康记录、医学影像和基因序列的大量信息[2, 3]。这种能力有助于更准确的诊断、个性化治疗和更好的患者预后[4]。AI融入临床工作流程正日益塑造决策、资源分配和预测性公共卫生策略[5]。

然而,许多AI模型的复杂性常常导致“黑箱”系统,其决策过程不透明[6, 7]。这种缺乏可解释性在医疗健康中带来了重大挑战,因为理解临床决策背后的理由对于确保信任、责任和患者安全至关重要[8]。没有可解释性,临床医生可能会犹豫是否采纳AI建议,从而限制了这些技术的转化影响[9]。

为了解决这些问题,可解释人工智能(XAI)应运而生[10]。XAI指的是使AI模型更可解释的策略和技术,让人们理解决策是如何做出的[10]。诸如SHAPley Additive exPlanations(SHAP)[11]、局部可解释模型无关解释(LIME)[12]、梯度加权类激活映射(Grad-CAM)[13]和注意力机制[13]等方法有助于揭示AI预测,从而增强医疗专业人员及患者的透明度、信任、可用性和临床接受度[14]。此外,XAI通过识别和减轻偏见,促进平等和公平的医疗健康服务[4]。

最近的证据强调了将XAI融入临床实践的重要性[15, 16]。当提供清晰、具体情境且可操作的解释时,临床医生更可能信任AI系统[17]。同时,监管机构日益要求医疗决策AI系统具有可解释性,这反映了其伦理、法律和安全意义[18]。这种对透明度的强调与全球负责任AI的倡议相一致,包括FDA的AI/ML软件指南和欧盟AI法案[19]。

尽管XAI研究迅速扩展,现有综述常常是叙述性的、特定领域的或集中于单一技术,对模型、解释方法和临床应用之间的系统比较有限。本综述的独特贡献在于通过明确将机器学习模型家族映射到XAI技术和医疗健康领域,提供XAI在医疗健康中的系统综合,同时识别真实世界临床验证、可解释性评估以及伦理和监管覆盖方面的差距。通过整合方法学、临床和治理视角,本综述旨在支持研究人员、临床医生和政策制定者负责任地开发、评估和部署医疗健康中的可解释AI系统。

2 方法与 methodology

本综述采用结构化和跨学科的方法来审视机器学习(ML)和可解释人工智能(XAI)在医疗健康中的作用。该方法结合了系统文献计量分析、主题综合和比较评估,整合了来自临床研究、政策框架和大数据分析的见解。基础研究包括Frasca等人(2024)[20]、Tjoa和Guan(2020)[21]以及Fahim等人(2025)[22]指导了方法学,强调了透明度、伦理相关性、临床适用性和实际实施。本综述按照PRISMA指南进行,以确保方法学透明性和可重复性。

在六个主要学术数据库(Elsevier [23]、Springer [24]、Taylor & Francis [25]、Semantic Scholar [26]、ACM Digital Library [27]和IEEE Xplore [28])中进行了全面的系统文献检索。检索目标为2017年至2025年间发表的同行评审文章,使用关键词如“Machine Learning in healthcare”、“Deep Learning in medicine”、“Explainable AI”、“interpretable models”和“interpretable machine learning”。应用布尔运算符以提高检索敏感性和特异性,确保涵盖技术、临床和政策领域(附录A和B)。初步检索识别了1200篇出版物。去除重复项后,根据标题和摘要筛选了302篇独特记录,排除了232篇不相关的研究。随后,70篇全文文章符合纳入标准并纳入定性综合,而无一适合定量荟萃分析(图1)。筛选过程中应用的纳入和排除标准见表1,各数据库的检索结果汇总见表2。

图1:PRISMA模型,展示记录的纳入和排除过程。

表1:纳入和排除标准。

纳入标准 排除标准
在医疗健康中应用ML或DL技术的研究,包括诊断、预后、治疗计划、公共卫生监测或行政决策。 缺乏医疗健康背景的研究。
纳入可解释或可解释人工智能(XAI)的研究,包括事后方法(如SHAP、LIME、Grad-CAM和注意力机制)或事前/可解释模型(如决策树和基于规则的模型)。 未涉及可解释性或可解释性的研究。
展示临床或现实世界相关性的研究,包括实践验证、政策含义或大规模数据集成。 缺乏验证或仅提出理论方法的研究。
观察性、建模或临床研究设计,发表于同行评审的英文期刊。 非同行评审文章、预印本、社论、观点文章、无全文的会议摘要或非英文出版物。

表2:原始检索结果及检索到的相关文章汇总。

数据库引擎 原始检索结果数量 相关文章数量
Elsevier [23] 1200 30
Springer [24] 1000 15
Taylor & Francis [25] 900 7
Semantic Scholar [26] 650 10
ACM Digital Library [27] 1100 5
IEEE Xplore [28] 1900 10

对于每项纳入研究,系统地提取了关键信息,包括所使用的AI模型、应用的XAI方法、医疗健康领域、研究设计和主要结果。为了提高效率和一致性,使用基于Python的包装器对书目和方法学信息进行了初步自动提取。随后进行手动全文审查以验证准确性并补充缺失或细微的细节,包括解释水平(全局或局部)、评估策略、伦理和法律考虑(偏见检测、患者同意、公平性、责任和监管合规)以及临床相关性。任何差异均通过直接查阅原始文章解决。随后进行了主题综合,以识别文献中反复出现的模式、创新、挑战和差距(附录A-D)。

通过遵循这种结构化方法,本综述确保了对XAI在医疗健康中应用的严谨、可重复和全面的评估,为研究进展和临床实施提供了有价值的见解。

3 结果

3.1 研究特征

本综述纳入了70篇2017年至2025年间发表的同行评审研究,涵盖多样化的医疗健康领域。最具代表性的领域是肿瘤学(28项研究,40%)、心脏病学(15项研究,21%)、传染病(10项研究,14%)、神经学(8项研究,11%)和临床决策支持系统(CDSS,9项研究,13%)(表3和4)。在AI模型方面,大多数研究采用深度学习模型,包括卷积神经网络(CNN)(28项研究,40%)、循环神经网络(RNN)和长短期记忆网络(LSTM)(18项研究,26%)以及Transformer架构(7项研究,10%),这些模型特别适用于分析复杂的高维医学数据。基于树的模型,如XGBoost、随机森林和决策树,在17项研究(24%)中应用于结构化临床数据集(表3)。

表3:关于可解释AI在医疗健康中的纳入研究汇总(n=70)。

类别 子类别 计数 百分比(%)
医疗健康领域 肿瘤学 28 40
心脏病学 15 21
传染病 10 14
神经学 8 11

| | 临床决策支持系统(CDSS) | 9 | 13 | | AI模型家族 | 卷积神经网络(CNN) | 28 | 40 | | | 循环神经网络/LSTM/GRU | 18 | 26 | | | Transformer架构 | 7 | 10 | | | 基于树的模型(XGBoost、随机森林、决策树) | 17 | 24 | | XAI方法a | SHAP | 38 | 54 | | | LIME | 21 | 30 | | | Grad-CAM | 16 | 23 | | | 注意力机制 | 14 | 20 | | | 基于规则/因果性/特征归因 | 9 | 13 | | 伦理/监管关注 | 明确提及 | 12 | 17 | | | 未提及 | 58 | 83 |

a 研究可能使用多种XAI方法;因此,XAI方法计数总和(98)超过了纳入研究总数[70]。

表4:可解释人工智能(XAI)在医疗健康中应用的代表性研究:领域、AI模型、XAI技术及主要发现。

研究 领域 使用模型 XAI方法 发现
Fahim 等 (2025) [22] 多领域 CNN、LSTM和XGBoost SHAP和注意力 用于诊断和监测的可扩展AI
Ennab & Mcheick (2024) [29] 生物医学机器人 DL模型 可视化和特征归因 综述了可解释性挑战并提出了更安全的AI策略
Frasca 等 (2024) [20] 多领域 多种 SHAP和Grad-CAM 对448篇文章的文献计量综述;强调信任和透明度
Holzinger 等 (2019) [2] 肿瘤学和基因组学 决策树 因果性和SHAP 可解释AI的伦理框架
Antoniadi 等 (2021) [30] CDSS 表格ML模型 事后和事前 综述了CDSS中的XAI;强调临床医生可用性差距
Tjoa & Guan (2020) [21] 多领域 CNN、RNN和决策树 SHAP和LIME 医学XAI技术和挑战的综述
Adadi & Berrada (2018) [31] 一般医疗 黑箱模型 SHAP和LIME XAI在医疗健康中的概念框架
Ghassemi 等 (2021) [32] ICU和EHR分析 深度神经网络 特征归因 对临床ML模型可解释性的批评
Topol (2019) [33] 医疗创新 多种 概念性 倡导医学中以人为中心的AI
Nazir 等 (2024) [34] 神经学和肿瘤学 CNN和Transformer SHAP和Grad-CAM 基于PRISMA的89项研究综述;发现数据和工作流整合方面的差距
Kabir 等 (2025) [35] 传染病 XGBoost和LSTM SHAP AI预测疫情趋势;强调气候和流动因素
Yoo 等 (2023) [36] 心脏病学 CNN和LSTM Grad-CAM和SHAP XAI提高了基于ECG的心律失常检测的可解释性

缩写:CDSS,临床决策支持系统;CNN,卷积神经网络;DL,深度学习;Grad-CAM,梯度加权类激活映射;LIME,局部可解释模型无关解释;LSTM,长短期记忆网络;ML,机器学习;RNN,循环神经网络;SHAP,SHapley Additive exPlanations;XAI,可解释人工智能;XGBoost,极限梯度提升。

最常用的可解释性方法是SHAP(38项研究,54%)、LIME(21项研究,30%)、Grad-CAM(16项研究,23%)和注意力机制(14项研究,20%)。一些研究还纳入了基于规则的模型、因果性框架和特征归因技术。在70项纳入研究中,有12项明确提及了伦理和监管考虑,包括偏见、公平性、患者同意和问责,反映了对医疗健康中负责任和透明AI日益增长的关注(见表3和4)。代表性研究的选择基于对不同医疗健康领域的覆盖、AI模型家族的多样性以及可解释技术的纳入,确保这些示例捕捉到了应用的广度并说明了文献中的趋势、创新和差距。

3.2 可解释人工智能在医疗健康中的应用

可解释AI方法应用于多种临床情境。在肿瘤学和放射学中,CNN与Grad-CAM或SHAP相结合,能够可视化肿瘤区域并识别关键成像特征,增强了临床决策的可解释性[34, 37]。在心脏病学中,RNN和LSTM配合注意力机制改善了对ECG信号和纵向患者数据的理解,支持准确的风险评估和个性化护理[38-41]。

在传染病预测和预后中,基于树的模型如XGBoost和随机森林被广泛应用。SHAP和LIME突出了最具影响力的临床和人口统计学特征[2, 22, 35, 42, 43]。在基因组学和临床笔记分析中,Transformer架构利用注意力机制和SHAP促进了序列和文本数据的解释,改进了对复杂分子和患者层面信息的洞察[44-46]。此外,使用集成梯度的基于自动编码器的模型被探索用于异常检测和罕见疾病识别,展示了XAI挖掘可能被忽视的隐藏模式的潜力[47-49]。AI模型到XAI技术在医疗健康领域的映射如图2所示,突出了方法和临床应用的多样性。

图2:AI模型到XAI技术和医疗健康应用的映射。CNN,卷积神经网络;RNN,循环神经网络;LSTM,长短期记忆;GRU,门控循环单元;XGBoost,极限梯度提升;LightGBM,轻量梯度提升机;SHAP,SHapley Additive exPlanations;LIME,局部可解释模型无关解释;Grad-CAM,梯度加权类激活映射;XAI,可解释人工智能;ECG,心电图;ICU,重症监护室。

3.3 趋势、创新与差距

在纳入的研究中观察到几个显著趋势。混合模型将高性能AI与可解释框架相结合,越来越多地用于平衡准确性和透明度[50-52]。对以人为中心和伦理设计的关注日益增加,重点在于临床医生友好的可解释性、偏见缓解和公平性[53-56]。特定领域的XAI应用正变得更加普遍,方法针对成像、基因组学、时间序列数据和结构化临床数据集进行定制[57]。

尽管取得了这些进展,但一些差距依然存在。目前缺乏衡量可解释性的标准化指标,使得跨研究比较具有挑战性。许多模型尚未在真实临床环境中得到验证,限制了实际应用。一些XAI输出对非技术性医疗专业人员来说仍然难以解释[29]。此外,临床部署XAI的监管和伦理框架仍不完善,限制了其在医疗实践中的广泛采用。

3.4 所选研究总结

表4提供了可解释AI在医疗健康中代表性研究的概述。显著的例子包括:Fahim等人(2025)使用CNN、LSTM和XGBoost模型结合SHAP和注意力机制,实现了跨多个领域的可扩展诊断和患者监测[22]。Ennab和Mcheick(2024)专注于生物医学机器人,综述了可解释性挑战并提出了更安全的AI策略[29]。Frasca等人(2024)对448篇文章进行了文献计量综述,强调了多领域应用中的信任和透明度[20]。Frasca等人(2020)对跨临床决策支持系统的可解释性提供了伦理评估[20],而Holzinger等人(2019)使用决策树结合因果性度量,为肿瘤学和基因组学中的可解释AI提出了一个框架[2]。其他值得注意的贡献包括XAI在ICU和EHR分析中的应用[32]、基因组学和神经学研究[34]、传染病疫情预测[35]以及心脏病学中的心律失常检测[36]。

这些研究共同展示了XAI应用的广度、模型和技术的多样性,以及医疗健康中对伦理和以人为中心AI设计的日益关注。

4 讨论

本综述强调了可解释人工智能(XAI)在推进医疗健康AI系统透明度、问责制和临床信任方面的关键作用。可解释性框架(如SHAP、LIME、Grad-CAM和注意力机制)的整合显著改善了对复杂机器学习模型的理解,有效地弥合了计算复杂性与临床适用性之间的差距[12, 58, 59]。这些发现强化了日益增长的共识,即可解释性是AI在医疗环境中安全、负责任部署的关键要求。

本综述中,深度学习架构(CNN、RNN、LSTM网络和Transformer)在多样化医疗健康应用中的广泛采用显而易见[6, 29, 37, 38, 60, 61]。当与XAI方法结合时,这些模型在医学影像、基因组学和电子健康记录(EHR)分析中展现出巨大潜力[17, 20, 29, 37, 38, 40, 62]。例如,CNN-Grad-CAM组合能够在诊断成像中可视化肿瘤区域,而SHAP和基于注意力的解释则阐明了疾病进展和治疗结果预测模型中的特征贡献[34, 63]。这种整合不仅提高了模型透明度,还支持了临床医生的理解和决策。

该领域一个值得注意的演变是融合高性能AI模型与可解释组件的混合框架的兴起[64, 65]。这些模型旨在平衡预测精度与临床可解释性,直接解决了医疗AI中准确性和透明度的双重需求。这种方法与新兴证据一致,表明临床医生的信心和采纳与模型解释的清晰度、一致性和可访问性密切相关[66-68]。因此,混合和以人为中心的XAI设计正作为实际实施中的实用解决方案日益受到重视。

尽管取得了实质性进展,但仍存在几个挑战。缺乏标准化的可解释性指标阻碍了XAI技术之间的有意义比较[69]。尽管许多模型在受控研究环境中表现出强劲性能,但其临床转化和验证仍然有限[70]。此外,XAI输出的可用性和认知负担各不相同,某些解释对非专业医疗用户而言在技术上要求较高[71-74]。解决这些限制需要以用户为中心的设计、跨学科合作以及有针对性的临床医生培训,以确保可解释性转化为实际的临床效用[75]。

伦理和监管考虑仍然是医疗健康中负责任部署AI的核心[76]。在所综述的研究中,对公平性、偏见缓解和问责的认识日益增强,反映了向负责任AI实践的转变[77]。然而,专门针对XAI的全面监管框架的发展仍处于初期阶段。有效实施将需要临床医生、研究人员和监管机构之间的协调行动,以建立透明、可执行且符合伦理标准的可解释AI系统。

展望未来,未来的研究应优先建立标准化的可解释性基准,开展大规模临床试验以评估模型泛化能力,并设计直观的XAI工具,使其适应不同水平的临床专业知识。此外,健全的伦理和治理框架的演变对于将AI技术公平、透明且可持续地整合到医疗系统中至关重要,最终将促进信任、患者安全和改善健康结果。

4.1 局限性

本综述存在一些局限性。首先,文献检索仅限于六个主要学术数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore),可能遗漏了来自其他资源的重要研究。其次,仅考虑了2017年至2025年间发表的同行评审出版物,可能排除了更早的基础性工作或极其近期的预印本。第三,所选研究本质上具有异质性,在AI模型、XAI方法、医疗领域和评估方法上存在差异,使得直接比较变得困难。最后,由于方法学和报告的可变性,本综述未进行定量荟萃分析,而是侧重于研究层面发现的定性综合。

5 结论

本系统综述综合了70篇2017年至2025年间发表的同行评审研究的证据,以审视可解释人工智能(XAI)如何融入医疗健康机器学习应用。研究结果显示,深度学习模型(CNN、循环架构和基于Transformer的系统)在当前实践中占主导地位,SHAP、LIME、Grad-CAM和注意力机制成为临床领域(如肿瘤学、心脏病学、传染病、基因组学和临床决策支持)中最常用的解释技术。除了将模型映射到XAI方法和应用领域外,本综述还识别了明确的研究间模式和差距。尽管可解释性越来越多地被纳入以增强透明度和临床医生信任,但只有少数研究明确提及了伦理、监管和公平性考虑,且真实世界临床验证仍然有限。此外,缺乏评估可解释性的标准化指标继续阻碍研究和方法之间的有意义比较。

总体而言,本综述对XAI在医疗健康中的应用进行了结构化综合,强调了方法学趋势和持续存在的局限性。未来的研究应优先考虑标准化的可解释性基准、严格的临床验证以及以用户为中心的解释界面的开发,同时辅以更清晰的伦理和监管指导。解决这些问题对于将XAI驱动系统从实验环境转化为透明、可信且临床可操作的医疗健康解决方案至关重要。

作者贡献

Md. Abu Bokkor Shiddik:概念化、调查、资金获取、撰写初稿、方法学、验证、可视化、撰写审查与编辑、软件、形式化分析、项目管理、数据管理、监督、资源。

致谢

我要感谢Md. Siddikur Rahman博士教授我研究方法学,并在我研究工作中给予的无价支持。

资金

作者未因本研究获得任何特定资金。

伦理声明

不适用,因为本研究是对已发表研究的系统综述。

利益冲突

作者声明无利益冲突。

透明度声明

主要作者Md. Abu Bokkor Shiddik确认,本手稿对所报告的研究进行了诚实、准确和透明的描述;未遗漏研究的重要方面;并且已解释与研究计划(以及相关注册)的任何差异。

附录A:数据库特定检索策略

在六个电子数据库(Elsevier (ScienceDirect)、SpringerLink、Taylor & Francis Online、Semantic Scholar、ACM Digital Library和IEEE Xplore)中进行了系统文献检索。检索仅限于2017年1月至2025年12月间以英文发表的同行评审期刊文章。

核心布尔检索逻辑根据每个数据库的语法进行了调整。以下显示了用于IEEE Xplore的检索字符串示例:

(“explainable artificial intelligence” OR “explainable AI” OR XAI OR “interpretable machine learning” OR “model interpretability”)

AND

(“machine learning” OR “deep learning” OR “neural network*”)

AND

(healthcare OR medicine OR clinical OR diagnosis OR prognosis)

等效的关键词逻辑和布尔运算符应用于其余数据库,并进行了微小的数据库特定修改(例如,字段标签和通配符用法)。在检索阶段未应用地理限制。初步检索在数据库中返回了大量原始记录。在筛选前,应用了自动过滤器(出版物类型、年份和主题相关性)以排除非同行评审和范围外的记录。最终数据库检索于2025年9月1日至2025年10月15日之间进行。

附录B:筛选与研究选择流程

从六个数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore)检索到的所有记录均被导出并整合到使用Zotero参考文献管理软件的单一参考文献库中。表2报告了来自每个数据库的原始关键词检索命中数。在整合并使用Zotero内置的重复检测功能去除重复项,随后进行手动验证后,确定了302篇独特记录用于标题和摘要筛选,这与PRISMA流程图一致(图1)。

为了提高效率和一致性,使用基于Python的包装器从整合的库中提取了书目元数据(如标题、作者、年份和摘要)。此初步自动提取后进行了手动验证以确保准确性和完整性。

进行了标题和摘要筛选,以评估与医疗健康领域的ML/DL应用(包含可解释性或可解释性)的相关性。然后进行全文筛选,以根据预定义的纳入和排除标准确认资格(见表1)。筛选决策基于与医疗健康的相关性、ML或DL模型的使用、XAI或可解释性技术的纳入,以及实践、临床或政策相关性的证据。筛选和评估由一名评审员进行,并对模糊记录进行重新评估以确保一致性。

最终选择包括70篇符合所有标准并纳入定性综合的研究。研究选择流程总结于PRISMA流程图(图1)。本系统综述方案未在PROSPERO或任何其他综述注册中心注册。

附录C:提取的研究层面变量

对于每项纳入研究,系统提取并记录了以下变量:

i. 医疗健康领域或应用领域。

ii. AI/ML模型家族(例如,传统ML、深度学习、混合模型)。

iii. 可解释性方法(例如,SHAP、LIME、Grad-CAM、注意力机制、基于规则或固有可解释模型)。

iv. 可解释性水平(全局和/或局部)。

v. 数据类型(例如,成像、临床记录、时间序列、多模态数据)。

vi. 验证策略(例如,内部验证、外部数据集、真实世界部署)。

vii. 报告的结果和性能指标。

viii. 伦理和监管考虑(例如,偏见、公平性、透明度、问责、同意、监管一致性)。

这些提取的变量构成了结果和讨论部分中主题综合和比较评估的基础。

附录D:数据可用性和透明度声明

本研究未生成或收集任何初级患者层面数据。所有分析均基于从已发表同行评审文章中提取的数据。提取的研究层面数据可应要求从通讯作者处获取。

数据可用性声明

数据共享不适用于本文,因为本研究未创建或分析任何新数据。

参考文献

(此处省略了参考文献列表,因为要求去掉全部网络地址,且参考文献为引用格式,保留原文或适当| 临床决策支持系统(CDSS) | 9 | 13 | | AI模型家族 | 卷积神经网络(CNN) | 28 | 40 | | | 循环神经网络/LSTM/GRU | 18 | 26 | | | Transformer架构 | 7 | 10 | | | 基于树的模型(XGBoost、随机森林、决策树) | 17 | 24 | | XAI方法a | SHAP | 38 | 54 | | | LIME | 21 | 30 | | | Grad-CAM | 16 | 23 | | | 注意力机制 | 14 | 20 | | | 基于规则/因果性/特征归因 | 9 | 13 | | 伦理/监管关注 | 明确提及 | 12 | 17 | | | 未提及 | 58 | 83 |

a 研究可能使用多种XAI方法;因此,XAI方法计数总和(98)超过了纳入研究总数[70]。

表4:可解释人工智能(XAI)在医疗健康中应用的代表性研究:领域、AI模型、XAI技术及主要发现。

研究 领域 使用模型 XAI方法 发现
Fahim 等 (2025) [22] 多领域 CNN、LSTM和XGBoost SHAP和注意力 用于诊断和监测的可扩展AI
Ennab & Mcheick (2024) [29] 生物医学机器人 DL模型 可视化和特征归因 综述了可解释性挑战并提出了更安全的AI策略
Frasca 等 (2024) [20] 多领域 多种 SHAP和Grad-CAM 对448篇文章的文献计量综述;强调信任和透明度
Holzinger 等 (2019) [2] 肿瘤学和基因组学 决策树 因果性和SHAP 可解释AI的伦理框架
Antoniadi 等 (2021) [30] CDSS 表格ML模型 事后和事前 综述了CDSS中的XAI;强调临床医生可用性差距
Tjoa & Guan (2020) [21] 多领域 CNN、RNN和决策树 SHAP和LIME 医学XAI技术和挑战的综述
Adadi & Berrada (2018) [31] 一般医疗 黑箱模型 SHAP和LIME XAI在医疗健康中的概念框架
Ghassemi 等 (2021) [32] ICU和EHR分析 深度神经网络 特征归因 对临床ML模型可解释性的批评
Topol (2019) [33] 医疗创新 多种 概念性 倡导医学中以人为中心的AI
Nazir 等 (2024) [34] 神经学和肿瘤学 CNN和Transformer SHAP和Grad-CAM 基于PRISMA的89项研究综述;发现数据和工作流整合方面的差距
Kabir 等 (2025) [35] 传染病 XGBoost和LSTM SHAP AI预测疫情趋势;强调气候和流动因素
Yoo 等 (2023) [36] 心脏病学 CNN和LSTM Grad-CAM和SHAP XAI提高了基于ECG的心律失常检测的可解释性

缩写:CDSS,临床决策支持系统;CNN,卷积神经网络;DL,深度学习;Grad-CAM,梯度加权类激活映射;LIME,局部可解释模型无关解释;LSTM,长短期记忆网络;ML,机器学习;RNN,循环神经网络;SHAP,SHapley Additive exPlanations;XAI,可解释人工智能;XGBoost,极限梯度提升。

最常用的可解释性方法是SHAP(38项研究,54%)、LIME(21项研究,30%)、Grad-CAM(16项研究,23%)和注意力机制(14项研究,20%)。一些研究还纳入了基于规则的模型、因果性框架和特征归因技术。在70项纳入研究中,有12项明确提及了伦理和监管考虑,包括偏见、公平性、患者同意和问责,反映了对医疗健康中负责任和透明AI日益增长的关注(见表3和4)。代表性研究的选择基于对不同医疗健康领域的覆盖、AI模型家族的多样性以及可解释技术的纳入,确保这些示例捕捉到了应用的广度并说明了文献中的趋势、创新和差距。

3.2 可解释人工智能在医疗健康中的应用

可解释AI方法应用于多种临床情境。在肿瘤学和放射学中,CNN与Grad-CAM或SHAP相结合,能够可视化肿瘤区域并识别关键成像特征,增强了临床决策的可解释性[34, 37]。在心脏病学中,RNN和LSTM配合注意力机制改善了对ECG信号和纵向患者数据的理解,支持准确的风险评估和个性化护理[38-41]。

在传染病预测和预后中,基于树的模型如XGBoost和随机森林被广泛应用。SHAP和LIME突出了最具影响力的临床和人口统计学特征[2, 22, 35, 42, 43]。在基因组学和临床笔记分析中,Transformer架构利用注意力机制和SHAP促进了序列和文本数据的解释,改进了对复杂分子和患者层面信息的洞察[44-46]。此外,使用集成梯度的基于自动编码器的模型被探索用于异常检测和罕见疾病识别,展示了XAI挖掘可能被忽视的隐藏模式的潜力[47-49]。AI模型到XAI技术在医疗健康领域的映射如图2所示,突出了方法和临床应用的多样性。

图2:AI模型到XAI技术和医疗健康应用的映射。CNN,卷积神经网络;RNN,循环神经网络;LSTM,长短期记忆;GRU,门控循环单元;XGBoost,极限梯度提升;LightGBM,轻量梯度提升机;SHAP,SHapley Additive exPlanations;LIME,局部可解释模型无关解释;Grad-CAM,梯度加权类激活映射;XAI,可解释人工智能;ECG,心电图;ICU,重症监护室。

3.3 趋势、创新与差距

在纳入的研究中观察到几个显著趋势。混合模型将高性能AI与可解释框架相结合,越来越多地用于平衡准确性和透明度[50-52]。对以人为中心和伦理设计的关注日益增加,重点在于临床医生友好的可解释性、偏见缓解和公平性[53-56]。特定领域的XAI应用正变得更加普遍,方法针对成像、基因组学、时间序列数据和结构化临床数据集进行定制[57]。

尽管取得了这些进展,但一些差距依然存在。目前缺乏衡量可解释性的标准化指标,使得跨研究比较具有挑战性。许多模型尚未在真实临床环境中得到验证,限制了实际应用。一些XAI输出对非技术性医疗专业人员来说仍然难以解释[29]。此外,临床部署XAI的监管和伦理框架仍不完善,限制了其在医疗实践中的广泛采用。

3.4 所选研究总结

表4提供了可解释AI在医疗健康中代表性研究的概述。显著的例子包括:Fahim等人(2025)使用CNN、LSTM和XGBoost模型结合SHAP和注意力机制,实现了跨多个领域的可扩展诊断和患者监测[22]。Ennab和Mcheick(2024)专注于生物医学机器人,综述了可解释性挑战并提出了更安全的AI策略[29]。Frasca等人(2024)对448篇文章进行了文献计量综述,强调了多领域应用中的信任和透明度[20]。Frasca等人(2020)对跨临床决策支持系统的可解释性提供了伦理评估[20],而Holzinger等人(2019)使用决策树结合因果性度量,为肿瘤学和基因组学中的可解释AI提出了一个框架[2]。其他值得注意的贡献包括XAI在ICU和EHR分析中的应用[32]、基因组学和神经学研究[34]、传染病疫情预测[35]以及心脏病学中的心律失常检测[36]。

这些研究共同展示了XAI应用的广度、模型和技术的多样性,以及医疗健康中对伦理和以人为中心AI设计的日益关注。

4 讨论

本综述强调了可解释人工智能(XAI)在推进医疗健康AI系统透明度、问责制和临床信任方面的关键作用。可解释性框架(如SHAP、LIME、Grad-CAM和注意力机制)的整合显著改善了对复杂机器学习模型的理解,有效地弥合了计算复杂性与临床适用性之间的差距[12, 58, 59]。这些发现强化了日益增长的共识,即可解释性是AI在医疗环境中安全、负责任部署的关键要求。

本综述中,深度学习架构(CNN、RNN、LSTM网络和Transformer)在多样化医疗健康应用中的广泛采用显而易见[6, 29, 37, 38, 60, 61]。当与XAI方法结合时,这些模型在医学影像、基因组学和电子健康记录(EHR)分析中展现出巨大潜力[17, 20, 29, 37, 38, 40, 62]。例如,CNN-Grad-CAM组合能够在诊断成像中可视化肿瘤区域,而SHAP和基于注意力的解释则阐明了疾病进展和治疗结果预测模型中的特征贡献[34, 63]。这种整合不仅提高了模型透明度,还支持了临床医生的理解和决策。

该领域一个值得注意的演变是融合高性能AI模型与可解释组件的混合框架的兴起[64, 65]。这些模型旨在平衡预测精度与临床可解释性,直接解决了医疗AI中准确性和透明度的双重需求。这种方法与新兴证据一致,表明临床医生的信心和采纳与模型解释的清晰度、一致性和可访问性密切相关[66-68]。因此,混合和以人为中心的XAI设计正作为实际实施中的实用解决方案日益受到重视。

尽管取得了实质性进展,但仍存在几个挑战。缺乏标准化的可解释性指标阻碍了XAI技术之间的有意义比较[69]。尽管许多模型在受控研究环境中表现出强劲性能,但其临床转化和验证仍然有限[70]。此外,XAI输出的可用性和认知负担各不相同,某些解释对非专业医疗用户而言在技术上要求较高[71-74]。解决这些限制需要以用户为中心的设计、跨学科合作以及有针对性的临床医生培训,以确保可解释性转化为实际的临床效用[75]。

伦理和监管考虑仍然是医疗健康中负责任部署AI的核心[76]。在所综述的研究中,对公平性、偏见缓解和问责的认识日益增强,反映了向负责任AI实践的转变[77]。然而,专门针对XAI的全面监管框架的发展仍处于初期阶段。有效实施将需要临床医生伦理和监管考虑仍然是医疗健康中负责任部署AI的核心[76]。在所综述的研究中,对公平性、偏见缓解和问责的认识日益增强,反映了向负责任AI实践的转变[77]。然而,专门针对XAI的全面监管框架的发展仍处于初期阶段。有效实施将需要临床医生、研究人员和监管机构之间的协调行动,以建立透明、可执行且符合伦理标准的可解释AI系统。

展望未来,未来的研究应优先建立标准化的可解释性基准,开展大规模临床试验以评估模型泛化能力,并设计直观的XAI工具,使其适应不同水平的临床专业知识。此外,健全的伦理和治理框架的演变对于将AI技术公平、透明且可持续地整合到医疗系统中至关重要,最终将促进信任、患者安全和改善健康结果。

4.1 局限性

本综述存在一些局限性。首先,文献检索仅限于六个主要学术数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore),可能遗漏了来自其他资源的重要研究。其次,仅考虑了2017年至2025年间发表的同行评审出版物,可能排除了更早的基础性工作或极其近期的预印本。第三,所选研究本质上具有异质性,在AI模型、XAI方法、医疗领域和评估方法上存在差异,使得直接比较变得困难。最后,由于方法学和报告的可变性,本综述未进行定量荟萃分析,而是侧重于研究层面发现的定性综合。

5 结论

本系统综述综合了70篇2017年至2025年间发表的同行评审研究的证据,以审视可解释人工智能(XAI)如何融入医疗健康机器学习应用。研究结果显示,深度学习模型(CNN、循环架构和基于Transformer的系统)在当前实践中占主导地位,SHAP、LIME、Grad-CAM和注意力机制成为临床领域(如肿瘤学、心脏病学、传染病、基因组学和临床决策支持)中最常用的解释技术。除了将模型映射到XAI方法和应用领域外,本综述还识别了明确的研究间模式和差距。尽管可解释性越来越多地被纳入以增强透明度和临床医生信任,但只有少数研究明确提及了伦理、监管和公平性考虑,且真实世界临床验证仍然有限。此外,缺乏评估可解释性的标准化指标继续阻碍研究和方法之间的有意义比较。

总体而言,本综述对XAI在医疗健康中的应用进行了结构化综合,强调了方法学趋势和持续存在的局限性。未来的研究应优先考虑标准化的可解释性基准、严格的临床验证以及以用户为中心的解释界面的开发,同时辅以更清晰的伦理和监管指导。解决这些问题对于将XAI驱动系统从实验环境转化为透明、可信且临床可操作的医疗健康解决方案至关重要。

作者贡献

Md. Abu Bokkor Shiddik:概念化、调查、资金获取、撰写初稿、方法学、验证、可视化、撰写审查与编辑、软件、形式化分析、项目管理、数据管理、监督、资源。

致谢

我要感谢Md. Siddikur Rahman博士教授我研究方法学,并在我研究工作中给予的无价支持。

资金

作者未因本研究获得任何特定资金。

伦理声明

不适用,因为本研究是对已发表研究的系统综述。

利益冲突

作者声明无利益冲突。

透明度声明

主要作者Md. Abu Bokkor Shiddik确认,本手稿对所报告的研究进行了诚实、准确和透明的描述;未遗漏研究的重要方面;并且已解释与研究计划(以及相关注册)的任何差异。

附录A:数据库特定检索策略

在六个电子数据库(Elsevier (ScienceDirect)、SpringerLink、Taylor & Francis Online、Semantic Scholar、ACM Digital Library和IEEE Xplore)中进行了系统文献检索。检索仅限于2017年1月至2025年12月间以英文发表的同行评审期刊文章。

核心布尔检索逻辑根据每个数据库的语法进行了调整。以下显示了用于IEEE Xplore的检索字符串示例:

(“explainable artificial intelligence” OR “explainable AI” OR XAI OR “interpretable machine learning” OR “model interpretability”)

AND

(“machine learning” OR “deep learning” OR “neural network*”)

AND

(healthcare OR medicine OR clinical OR diagnosis OR prognosis)

等效的关键词逻辑和布尔运算符应用于其余数据库,并进行了微小的数据库特定修改(例如,字段标签和通配符用法)。在检索阶段未应用地理限制。初步检索在数据库中返回了大量原始记录。在筛选前,应用了自动过滤器(出版物类型、年份和主题相关性)以排除非同行评审和范围外的记录。最终数据库检索于2025年9月1日至2025年10月15日之间进行。

附录B:筛选与研究选择流程

从六个数据库(Elsevier、Springer、Taylor & Francis、Semantic Scholar、ACM Digital Library和IEEE Xplore)检索到的所有记录均被导出并整合到使用Zotero参考文献管理软件的单一参考文献库中。表2报告了来自每个数据库的原始关键词检索命中数。在整合并使用Zotero内置的重复检测功能去除重复项,随后进行手动验证后,确定了302篇独特记录用于标题和摘要筛选,这与PRISMA流程图一致(图1)。

为了提高效率和一致性,使用基于Python的包装器从整合的库中提取了书目元数据(如标题、作者、年份和摘要)。此初步自动提取后进行了手动验证以确保准确性和完整性。

进行了标题和摘要筛选,以评估与医疗健康领域的ML/DL应用(包含可解释性或可解释性)的相关性。然后进行全文筛选,以根据预定义的纳入和排除标准确认资格(见表1)。筛选决策基于与医疗健康的相关性、ML或DL模型的使用、XAI或可解释性技术的纳入,以及实践、临床或政策相关性的证据。筛选和评估由一名评审员进行,并对模糊记录进行重新评估以确保一致性。

最终选择包括70篇符合所有标准并纳入定性综合的研究。研究选择流程总结于PRISMA流程图(图1)。本系统综述方案未在PROSPERO或任何其他综述注册中心注册。

附录C:提取的研究层面变量

对于每项纳入研究,系统提取并记录了以下变量:

i. 医疗健康领域或应用领域。

ii. AI/ML模型家族(例如,传统ML、深度学习、混合模型)。

iii. 可解释性方法(例如,SHAP、LIME、Grad-CAM、注意力机制、基于规则或固有可解释模型)。

iv. 可解释性水平(全局和/或局部)。

v. 数据类型(例如,成像、临床记录、时间序列、多模态数据)。

vi. 验证策略(例如,内部验证、外部数据集、真实世界部署)。

vii. 报告的结果和性能指标。

viii. 伦理和监管考虑(例如,偏见、公平性、透明度、问责、同意、监管一致性)。

这些提取的变量构成了结果和讨论部分中主题综合和比较评估的基础。

附录D:数据可用性和透明度声明

本研究未生成或收集任何初级患者层面数据。所有分析均基于从已发表同行评审文章中提取的数据。提取的研究层面数据可应要求从通讯作者处获取。

数据可用性声明

数据共享不适用于本文,因为本研究未创建或分析任何新数据。

参考文献

(此处省略了参考文献列表,因为要求去掉全部网络地址,且参考文献为引用格式,保留原文或适当处理)

【全文结束】