摘要
人类大脑作为中枢神经系统的关键器官,易受多种复杂且危及生命的疾病影响,包括脑肿瘤、阿尔茨海默病和中风。这些疾病的准确及时诊断对于有效治疗和管理至关重要。传统上,脑部疾病检测依赖于对磁共振成像(MRI)等医学影像模态的手动解读,这一过程耗时长、易出错且常常缺乏一致性。为解决这些限制,本研究提出了一种基于深度学习的自动化框架,用于脑部疾病分类,采用迁移学习概念。对四种先进的卷积神经网络(CNN)架构进行了比较分析:VGG-16、VGG-19、EfficientNet和DenseNet121,以评估它们在公开可用的MRI数据集上的诊断性能。为增强泛化能力并防止过拟合,在训练阶段应用了数据增强技术。所提出的流程包括数据采集、预处理和综合模型评估,分为各种训练和测试分割。通过包括准确率、精确度、召回率、特异性和F1分数在内的指标严格评估了性能。结果表明,基于VGG-16的方法在分类性能上优于其他最先进的模型,展示了其作为自动化脑部疾病诊断可靠工具的潜力。这项工作强调了深度学习在神经影像分析中的适用性,并为未来与更先进架构和多模态数据集成的改进开辟了道路。
1 引言
目前,人类社会面临诸多重大挑战,其中医疗保健仍然是最关键的问题之一[1]。各种复杂疾病继续影响着人体,不同计算和临床技术正在开发以检测和诊断这些疾病。人类大脑尤其是最重要和复杂的器官之一[2]。它控制着情绪、身体运动以及所有自愿和非自愿活动。典型的人脑由三个主要部分组成:白质、灰质和脑脊液。每个部分都执行特定且复杂的功能,对维持整体大脑活动至关重要[3]。
脑肿瘤、阿尔茨海默病(AD)和中风等神经系统疾病因其高患病率、复杂的病理学以及对发病率和死亡率的重大影响,构成了主要的全球健康挑战。脑肿瘤以脑组织内细胞的异常增殖为特征,广泛分为原发性(良性)或继发性(恶性)[4]。虽然原发性肿瘤通常局限于局部,但继发性肿瘤可以侵入额外的脑区域并转移到远处器官。无论分类如何,持续的肿瘤生长在刚性颅腔内会升高颅内压,导致进行性神经损伤。这些临床风险凸显了准确和早期肿瘤检测对有效诊断、预后和治疗规划的重要性[4]。
阿尔茨海默病(AD)作为老龄化人群中痴呆症的主要原因,构成了严峻的全球健康挑战,其日益增长的患病率和目前缺乏疾病修饰疗法的情况进一步加剧了这一挑战。这种治疗差距突显了迫切需要能够识别早期、前驱阶段病理的诊断策略。然而,尽管在理解AD神经生物学基础方面取得了相当大的进展,但可靠地检测早期疾病仍然是一个重要的临床难题,主要是由于缺乏适用于常规应用的足够特异性和敏感性的生物标志物[5]。此外,目前尚无治愈性治疗方法,且治疗开发在临床试验中持续面临高失败率。因此,提高早期诊断准确性仍然是正在进行的研究工作的核心重点,旨在延迟疾病进展并改善患者预后[6]。在计算方法中,源自线性主成分分析(PCA)的特征脑方法在区分认知正常(CN)、轻度认知障碍(MCI)和AD人群方面表现出了有希望的性能,尽管它依赖于线性特征投影[7]。
中风构成另一种主要的神经科急症,由脑血管破裂或阻塞引起,中断了向脑组织输送氧气和营养物质。症状快速发作以及不可逆神经损伤的潜在性使中风成为一种与大量长期残疾和高死亡率相关的关键医疗状况。根据世界卫生组织(WHO)的数据,中风仍然是全球死亡和残疾的主要原因之一[8]。如图1所示,这些脑部疾病的示例。
这些神经系统疾病的异质性和重叠症状概况继续挑战现有的诊断框架,凸显了对更稳健和可靠的检测策略的持续需求。最近的技术进步已将人工智能(AI)定位为临床神经科学中的变革性工具。基于机器学习(ML)的模型在从复杂生物医学数据中提取信息模式、提高预测准确性和增强临床决策过程方面已显示出巨大潜力[9]。这些方法能够在各种临床背景下实现非平凡的模式发现和疾病分类[10]。
计算机断层扫描(CT)和磁共振成像(MRI)等神经影像模态对于识别大脑中的结构和功能异常至关重要[11]。然而,由于神经生物学特征的重叠,鉴别诊断,特别是在精神病学和神经退行性疾病方面继续构成挑战。新兴证据表明,基于任务的MRI可能提供改进的诊断特异性,为未来研究提供了一个有希望的方向[12]。CT是一种成像技术,它使用与X射线源相连的计算机来生成内部解剖结构的详细横截面图像。该模态也被称为计算机轴向断层扫描、CAT扫描或简称CT扫描。MRI是另一种广泛使用的成像技术,它利用强磁场和射频波产生内部组织的高分辨率图像[13]。使用来自磁共振成像(MRI)的多模态信息在病变分割中起着至关重要的作用,特别是对于脑肿瘤[14]。MRI扫描仪由一个大型圆柱形结构组成,内含强大的磁体,能够对解剖细节进行无创可视化。MRI的开发代表了医学诊断中的一个重大里程碑,为临床医生和研究人员提供了以非凡清晰度检查内部器官和软组织的能力。MRI常规用于检测大脑和脊髓中的异常,以及全身的肿瘤、囊肿和其他病理状况[15]。如前所述,CT扫描和MRI都在临床实践中广泛用于患者评估,每种方法都提供独特的优势。CT扫描特别适用于评估骨骼损伤、肺部状况和某些癌症相关异常。相比之下,MRI可以从几乎任何平面提供成像,提供解剖结构的全面三维视图。虽然CT和X射线成像通常为硬组织提供高分辨率图像,但MRI在评估软组织(包括韧带和肌腱)方面更为优越。高分辨率MRI系统,如3特斯拉扫描仪,特别适用于检测肿瘤和其他脑部异常[16]。
1.1 问题陈述
脑部疾病的准确高效检测在临床实践中仍然是一个重大挑战,这是由于现有诊断方法的固有限制。传统的手动检查虽然几十年来广泛使用,但容易受到人为错误的高敏感性、不同从业者之间结果不一致、处理速度慢和可重复性有限的影响[17]。计算机辅助诊断(CAD)系统被开发用于帮助临床医生解释医学图像,然而这些方法受到图像噪声、模糊性和不确定性的约束,这可能会对诊断决策产生不利影响[18]。
机器学习技术已被用于改进脑部疾病的自动检测,包括特征提取、降维和分类。虽然ML方法解决了手动和基于CAD方法的几个缺点,但它们也存在局限性。具体而言,特征选择可能导致信息丢失(如果使用不足的特征),而更多的特征会增加模型复杂性和计算需求。此外,传统的ML分类器如ANN、KNN、朴素贝叶斯、决策树、逻辑回归、随机森林(RF)和支持向量机(SVM)难以完全捕捉高维医学图像中的复杂模式[19]。
深度学习(DL)方法已成为一种强大的替代方案,能够进行自动特征提取和表示学习,从而克服了传统ML的许多限制。然而,DL模型对网络架构敏感:简单架构可能欠拟合,而过于复杂的模型则面临过拟合的风险,降低对未见数据的泛化能力。此外,现有研究主要集中在使用一种成像方式(如MRI或CT)检测单一脑部疾病,而没有提供能够在单一系统内识别多种疾病的统一框架[20]。
因此,迫切需要一种能够解决以下问题的稳健高效诊断机制:
- 利用DL的优势进行准确的特征提取和分类。
- 使用精简统一的框架同时检测多种脑部疾病。
解决这些差距对于提高诊断效率、减少处理时间以及增强脑部疾病检测的准确性和可靠性至关重要。
1.2 目标和贡献
本研究的主要目标和贡献如下:
- 自动化深度学习框架:开发了一种基于VGG-16 CNN架构的DL方法,用于使用MRI数据对脑部疾病进行分类,有效解决了手动图像检查相关的局限性。
- 结构化诊断流程:设计了一个系统的三阶段诊断流程,包括数据采集、预处理和模型评估,以确保脑部疾病检测的全面和可重复框架。
- 稳健性能评估:使用包括准确率、精确度、召回率、特异性、F1分数和混淆矩阵分析在内的多种性能指标对所提出的模型进行了严格评估,以证明其可靠性和有效性。
- 与最先进技术的基准测试:进行了与现有DL模型的比较分析,证明VGG-16架构在脑部疾病检测中实现了卓越的分类性能。
- 在公开数据集上的应用:该方法在公开可用的MRI数据集上得到验证,强调了其在实际临床部署和真实世界医疗环境中的可扩展性潜力。
1.3 论文结构
本文其余部分结构如下:第2节简要总结了相关文献。第3节详细概述了方法论。第4节讨论结果。第5节总结工作,第6节以最终评论和未来研究建议结束。
2 相关工作
Narmatha[21]提出了一种用于医学图像分割和分类的混合方法,称为模糊脑暴优化(FBSO)算法,该算法结合了模糊C均值聚类和脑暴优化(BSO)算法的优势。该框架旨在提高医学影像中分割任务的效率和准确性。该过程始于BSO的应用,这是一种受人类脑力激荡行为启发的基于群体智能的元启发式算法。在此阶段,潜在解决方案(概念化为"想法")被分组并迭代细化,以收敛到最优解决方案。这种自适应优化策略已被证明在解决复杂现实问题方面有效。在优化阶段之后,应用FCM算法将医学图像分割为不同的区域。FCM的概率聚类能力允许每个像素在不同聚类中具有不同程度的成员资格,从而有效管理图像数据中的固有不确定性。随后的特征提取阶段量化了对准确图像分类至关重要的纹理、形状、颜色和对比度等基本属性。他们提出的模型在BRATS 2018数据集上进行了评估,表现出稳健的性能和降低的计算成本。他们的框架达到了93.85%的准确率、94.77%的精确度、95.77%的敏感性和95.42%的F1分数,突显了该方法在医学图像分割应用中的可靠性和计算效率[21]。
Ismael[22]提出了一种使用残差网络(ResNet)对脑癌MRI图像进行分类的增强方法。该研究实施了一个全面的基于流水线的方法,由多个阶段组成,从原始数据获取开始,到生成分类输出结束。该流水线的每个阶段都会产生中间结果,作为后续阶段的输入,从而确保结构化和顺序处理流程。该研究使用的数据集由3,064个T1加权对比增强MRI图像组成,公开可用,涵盖三种最常见的脑肿瘤类型:脑膜瘤、胶质瘤和垂体瘤。
数据预处理阶段涉及将基于MATLAB的数据集(其中每条记录存储为结构化数据格式"struct")转换为DL应用可用的形式。为减轻过拟合并提高泛化能力,应用了数据增强技术(如照明调整、缩放和水平翻转),以合成方式扩展数据集,同时保持标签完整性。所提出的模型架构基于ResNet50,这是一个50层深度残差学习框架,以其解决梯度消失问题和在图像识别任务中提高模型性能的能力而闻名。实验评估表明,所提出的方法达到了约85%的分类准确率,优于在同一数据集上训练的几种早期模型。这些结果证实了残差学习在医学图像肿瘤分类中的有效性,并强调了ResNet架构在诊断成像应用中的潜力[22]。
Subudhi[10]开发了一种用于使用MRI的扩散加权成像(DWI)序列检测和分类缺血性中风的自动计算机辅助决策支持系统。所提出的框架旨在根据牛津社区中风项目(OCSP)分类方案将脑中风分为三大类,即部分前循环综合征(PACS)、腔隙综合征(LACS)和总前循环卒中(TACS)。受影响脑区域的分割使用期望最大化(EM)算法执行,该算法能够精确定位中风病变[23]。
为了提高检测准确性,使用分数阶达尔文粒子群优化(FODPSO)技术对分割区域进行了后续优化,允许改进边界细化和特征一致性。实验评估使用了总共192个MRI扫描。从这些分割的病变中,提取了全面的形态学和统计特征,以构建稳健的特征向量。分类随后使用两种ML模型SVM和RF分类器进行。实验结果表明,所提出的系统在使用RF分类器时达到了93.4%的高检测准确率,优于基于SVM的分类。这些发现强调了混合分割-优化框架在改进从DWI MRI中检测缺血性中风的诊断可靠性方面的有效性[10]。
考虑到深度学习的新进展,Toğaçar[24]提出了一种创新的DL框架,该框架集成了CNNs、超列技术、预训练AlexNet和VGG-16架构、递归特征消除(RFE)和支持向量机(SVM)分类器。该方法的主要优势在于它能够通过超列表示保留和利用来自深度架构多个层次的判别性局部特征。这使模型能够在不同抽象级别上保持空间信息丰富的细节,提高其区分复杂视觉模式的能力。
该方法论包括三个主要阶段。在第一阶段,应用数据增强技术以确保各类别中样本的平衡表示,从而提高模型泛化能力和减少偏差。在第二阶段,在平衡数据集上实施基于超列的掩码策略,以增强图像区域的可见性和可区分性,促进CNN模型更有效的特征提取。在最后阶段,使用SVM分类器进行分类,选择该分类器是因为它在现实世界识别任务中的稳健泛化性能。特征选择过程利用RFE识别最相关特征,同时减少冗余。实验结果表明,所提出的模型在不依赖手工特征提取技术的情况下实现了96.77%的令人印象深刻的准确率,突显了其在自动图像识别应用中的效率和适应性。
Hasan[25]提出了一项综合性研究,引入了熵对比的概念,该概念在量子计算框架内使用Marsaglia公式进行数学定义。在此基础上,作者将传统的局部二值模式(LBP)方法扩展,开发了量子熵(QE)描述符,用于从MRI脑扫描中提取增强特征。该研究采用了特征提取的两种互补方法:基于QE的纹理特征和基于DL的表示。在MRI预处理阶段,应用了各种增强和归一化技术,为特征分析准备输入扫描。
QE-LBP描述符展示了捕获图像强度细微变化的能力,有效地将灰度值中的精细纹理信息表示为低频分量。DL组件围绕CNNs构建,包括两个主要部分:由多个互连卷积层组成的特征提取器,以及负责最终决策的分类器。通过将QE-LBP导出的特征与CNN-based深度特征集成,所提出的混合框架显著提高了分类准确性。此外,将组合特征整合到作为最终分类器的长短期记忆(LSTM)网络中显著提高了诊断精度。[25]当与AlexNet、GoogleNet和SqueezeNet等既定模型进行评估时,所提出的QELBP-DL混合方法在包含154个MRI脑扫描的数据集上实现了98.80%的最大准确率,优于所有比较方法。
Arunkumar[26]提出了一种用于使用MRI进行脑组织分析的新分割技术。该方法整合了多种计算机视觉策略——图像增强、分割和非感兴趣区域(non-ROI)过滤——基于纹理分析和定向梯度直方图(HOG)特征。所提出的框架包括四个顺序阶段:预处理、可训练分割、非脑对象过滤和霍夫圆变换。在预处理阶段,应用傅里叶滤波,将图像数据从时域转换到频域,以增强图像清晰度并抑制噪声。
在可训练分割阶段,通过特征提取、监督学习和测试程序的组合,从MR图像中提取感兴趣区域(ROI)。输出随后通过使用来自直方图签名的圆形度、面积和平均灰度强度等参数过滤掉非脑区域进行优化。在最后阶段,使用霍夫圆变换确定ROI的几何参数,提供受异常影响的脑区域的准确定位。该模型整合了使用人工神经网络(ANNs)的全自动、可训练分割和分类机制,以精确定位肿瘤区域。在200个MRI病例上的实验评估表明了高水平的准确性,达到92.14%,结果与手动分割结果非常接近。这项研究强调了混合视觉技术在增强基于MRI的脑肿瘤分割自动化和精度方面的潜力[26]。
Amin[18]提出了一种用于检测MRI扫描中肿瘤区域的基于全局阈值的分割框架,随后是用于对癌性和非癌性组织进行分类的自定义CNN模型。所提出的方法包括四个主要阶段。在第一阶段,四个MRI模态融合成单个复合图像,以丰富结构和纹理信息。第二阶段使用概率密度差函数(PDDF)去除噪声,确保分割前的图像质量。在第三阶段,应用全局阈值技术将肿瘤区域与正常脑组织区分开来。最后阶段将分割后的图像馈送到专为分类任务设计的CNN架构中。
CNN模型集成了关键层,包括卷积层、批归一化层、ReLU激活层、最大池化层、全连接层和SoftMax层,优化了肿瘤和非肿瘤区域之间的区分。该方法在五个基准数据集上进行了严格评估——BRATS 2012、BRATS 2013、BRATS 2015、BRATS 2013排行榜和BRATS 2018。结果表明,融合的多模态MRI图像相比单模态输入产生了更优的分割和分类准确性。报告的性能指标表明,在BRATS 2012上准确率为0.97,在BRATS 2013挑战赛上为0.98,在BRATS 2013排行榜上为0.96,在BRATS 2015挑战赛上为1.00,在BRATS 2018上为0.97。这些发现突显了将全局阈值与CNN-based学习相结合,用于可靠和自动脑肿瘤检测的有效性[18]。
Kalaiselvi[27]开发并评估了六种不同的CNN架构,用于使用MRI进行脑肿瘤切片分类。这些模型在BraTS 2013数据集上进行训练,随后在全脑图谱(WBA)数据集上进行测试,以评估它们在不同数据源上的泛化性能。每个模型都设计有不同的架构配置和超参数,以确定最适合准确肿瘤分类的网络结构。CNN模型的比较分析展示了持续强劲的性能,分类准确率在96%至99%之间。这种高准确率跨越多种架构,突显了CNN-based模型在识别和分类MRI数据中肿瘤切片方面的稳健性。该研究结果突显了DL技术,特别是CNNs在实现可靠和自动脑肿瘤分类方面的重大潜力,为医学影像中的诊断支持做出了贡献[27]。在[28]中,脑功能网络的结构属性为研究痴呆提供了有用的依据,因为它们捕获了异常连接与认知能力下降之间的关系。然而,数据可用性的有限限制了在此背景下应用数据驱动模型。为解决这一问题,本研究引入了具有变换器模块的分布正则化对抗图自动编码器(DAGAE),用于生成用于数据增强的合成脑网络。该模型通过正则化标签分布稳定潜在表示学习,并通过变换器生成器保留长距离拓扑依赖性。使用ADNI数据集,该方法提高了分类性能,达到85.33%的准确率,优于现有的增强方法。这些结果表明,生成合成网络可以增强认知障碍的诊断建模。相关工作汇总见表1。
所调查的文献揭示了医学图像分析方面的重大进展,但现有方法仍存在若干方法学限制。虽然Narmatha[21]展示了混合优化-聚类技术的潜力,但FBSO算法的性能仍然严重依赖参数调整,并且在异构图像数据集上表现出可变的收敛率。同样,尽管Ismael[22]使用ResNet50实现了85%的准确率,但相对温和的性能表明,仅靠迁移学习可能不足以捕获特定于领域的病理特征,而无需进行大量架构修改。Subudhi[10]提出的混合分割-优化框架虽然在中风分类中达到了93.4%的准确率,但严重依赖手工制作的形态学特征,这些特征可能无法在不同的临床表现中泛化。尽管深度学习方法报告了令人印象深刻的准确率,但它们也带来了自身的限制。Toğaçar[24]引入的超列集成技术虽然达到了96.77%的准确率,但通过多阶段特征处理产生了大量的计算开销。Hasan的量子熵描述符[25],虽然在有限数据集上展示了98.80%的准确率,但引发了关于特征可解释性和在更大、更多样化人群中的临床验证的问题。此外,Arunkumar的基于视觉的分割框架[26],虽然是全自动的,但通过霍夫变换纳入了刚性几何假设,这些假设对于不规则的肿瘤形态可能不够充分。值得注意的是,大多数回顾的研究单独专注于分割或分类任务,而没有建立集成的诊断流程。Amin[18]和Kalaiselvi[27]部分解决了这一差距,但他们的方法要么依赖于简单的阈值技术,要么缺乏跨多机构数据集的稳健验证。Zuo的基于图的增强策略[28],虽然对阿尔茨海默病检测具有创新性,但仅达到85%的准确率,突显了生成具有临床意义的合成表示的挑战。本工作通过三个主要贡献解决了这些已识别的限制。首先,与需要大量手工特征工程的方法不同,所提出的方法利用自适应特征学习来自动捕获任务相关的表示。其次,与将分割和分类视为不相关过程的方法相比,该框架在统一的架构内集成这些任务,实现信息共享和改进的诊断一致性。第三,虽然先前的方法展示了特定于数据集的优化,但所提出的方法强调了在不同成像条件和病理表现下的架构泛化能力。这些方法论上的进步直接回应了现有解决方案的碎片化性质,提供了一个平衡计算效率与诊断准确性的统一框架,同时保持临床采用的可解释性。
3 研究动机与创新点
作为控制认知和生理功能的中枢器官,人类大脑易受一系列严重且危及生命的病理影响,包括脑肿瘤、阿尔茨海默病和中风。这些状况的准确及时诊断对于有效治疗和患者结果至关重要。现代医学成像,特别是MRI和CT,作为非侵入性可视化这些颅内异常的基石。然而,这些扫描的手动解释是一项复杂且专业化的任务,可能耗时且存在诊断变异性。这为自动化辅助工具创造了关键需求,这些工具可以增强诊断准确性和效率。此外,在患者可及性和财务限制是重大考虑因素的临床现实中,迫切需要成本效益高且简化的诊断解决方案。受这些挑战的推动,本工作源于开发一种用于多种脑部疾病分类的稳健且可访问系统的需要。所提出的方法利用基于VGG-16架构的CNN来分析MRI图像。通过使用单一、优化良好的模型来检测多种病理,它旨在提供不仅准确,而且实用的解决方案,满足临床有效性和患者护理实际可行性的双重需求。
4 提出的方法
本研究的方法采用系统化流程开发脑部疾病检测,包括肿瘤和阿尔茨海默病。该过程组织为四个关键阶段:数据获取和准备(预处理和数据增强)、实验模型选择(VGG16[29]、VGG19[30]、EfficientNet[31]和DenseNet121[32])、最终模型训练和微调(DenseNet121)以及系统部署(基于Web的工具)。本研究将MR图像分为三类:正常、肿瘤、阿尔茨海默病。各阶段的描述如下:图3显示该模型包含三个阶段:1. MRI;2. 疾病检测;然后进行性能评估。每个步骤将详细解释。如上图所示,第一步,收集相关数据,然后对收集的数据应用一些数据预处理任务,如图像调整大小、分割等,以便清理并转换为特定和标准格式,从而使分类器可以在数据上进行训练。
4.1 数据收集
本研究的图像数据来自Kaggle(一个科学数据集的公共存储库)。使用了一个包含三个不同类别的脑部疾病样本数量大致相等的平衡数据集。这种类别均衡是模型开发中的一个关键因素,因为它防止分类算法对多数类产生偏见,从而确保学习到的特征代表所有病理状况。脑肿瘤数据集:第一个数据集包含用于开发自动肿瘤检测模型的磁共振成像(MRI)扫描。它被分为两类:来自诊断为脑肿瘤患者的图像和来自健康对照的图像。来自多个医疗机构的原始图像表现出异质的空间分辨率。为确保与标准深度学习架构的兼容性,实施了预处理流程。所有图像被重新采样为224×224像素的固定输入大小,并对像素强度进行归一化以标准化特征空间。此外,为防止算法偏见,数据集通过平衡使肿瘤和正常类别包含数量相当的实例。阿尔茨海默病数据集:第二个数据集包含用于对与阿尔茨海默病相关的认知状况进行分类的MRI扫描。数据被分为两组:"NonDemented"类代表健康个体,"VeryMildDemented"类代表处于疾病早期阶段的患者。初步检查显示,虽然这些图像的原生分辨率为176×208像素,但它们需要调整为224×224像素以匹配分类模型的输入层。与肿瘤数据一样,在预处理过程中强制实施类别平衡,以防止模型偏向多数类别,并应用特征标准化以提高训练稳定性。类别不平衡缓解:尽管数据集通过重采样进行了平衡,但类加权损失函数被整合到训练阶段作为额外的保障。此技术在反向传播过程中为少数类的错误分类分配更高的惩罚,确保模型对病理和健康状态的特征同样敏感。这种双重方法——平衡数据和加权损失——被用来增强最终分类结果的可靠性和公平性。数据集的一些样本图像如图2所示。
4.2 预处理
VGG16模型的预处理步骤是一个关键且标准化的程序,旨在准备输入图像,使其与最初训练网络的数据分布保持一致。此过程涉及两个关键操作。首先,图像中的每个像素(通常具有红、绿、蓝(RGB)通道值,范围从0到255)被缩放。然而,与简单地归一化到0-1范围不同,VGG16使用一种称为均值减法的特定方法。从整个ImageNet训练数据集计算的均值RGB值(具体为R=123.68,G=116.779,B=103.939)从输入图像中对应的每个通道中减去。这使每个通道中的数据以零为中心,确保模型接收的输入中平均强度是中性的,这稳定并加速了训练过程,并对正确的推理至关重要。其次,图像被调整为224x224像素的固定空间维度,因为VGG16架构末端的全连接层需要固定的输入大小。通过执行这种一致的预处理,我们确保输入数据在结构上与网络兼容,并且像素统计数据与模型权重优化的分布匹配,从而实现稳健和准确的预测。之后,清洗后的数据被提供给分类器进行训练。模型成功训练后,使用测试数据集进行测试,然后根据训练模型提供输出。
4.3 数据分割
预处理步骤后,图像被分为训练和测试类别。将数据分为五种比例是ML中的一项基础技术,用于在有限数据集上最大化数据的效用,用于训练和严格评估。为确定最佳训练-测试数据比例,进行了五次实验,评估了50/50、60/40、70/30、80/20和90/10的分割。目标是找出产生最高和最稳定性能的配置。结果在第4节中呈现。与简单的训练/测试分割不同,此方法系统地将整个数据集分为五个相等或成比例定义的段,称为"折"。核心思想是执行五轮训练和测试,其中在每轮中,不同的折被保留作为测试集,其余四个折组合形成训练集。此过程确保每个数据点恰好在测试集中出现一次,通过对所有五次迭代的结果(如准确率、损失)求平均,提供对模型性能的稳健可靠估计。这种称为5折交叉验证的方法特别有价值,因为它减少了性能估计的方差;模型性能不依赖于单个可能幸运或不幸的随机训练/测试分割,而是在整个数据集上得到验证,使评估更加稳定和可泛化。
4.4 模型选择
为确定最适合本研究的架构,评估了各种DL模型,包括几种著名架构:VGG16[29]、VGG19[30]、EfficientNet[31]和DenseNet121[32],最终模型训练和微调在VGG16上完成。在这些初始实验中,遇到了实际限制;由于大型数据集规模和其显著的计算需求,一些较大的模型,特别是更复杂的EfficientNet[31]变体,导致系统不稳定和内存相关崩溃。对于能够成功训练的模型,进行了直接性能比较,如第4节中总结。虽然所有模型表现都非常出色,但VGG16[29]最终被选中。选择的理由是双重的:首先,它在最终配置中对阿尔茨海默病达到了99%的准确率,对肿瘤达到了89%;其次,与VGG19[30]、Densenet121[32]和较轻量的EfficientNet变体等其他高性能候选者相比,它展示了卓越的训练稳定性和资源效率。这种高准确率和实际可靠性的结合使VGG16[29]成为最终系统的理想选择。
4.4.1 深度神经网络和迁移学习
CNN的发展极大地改进了图像分类任务。训练这些深度网络通常需要大量数据集,因为它们的性能在很大程度上取决于可用数据量。CNNs可以通过滤波器自动学习空间和时间特征。然而,当只有小数据集可用时,可以应用迁移学习。在此方法中,从一个数据集使用预训练CNN学习的特征被重新用于处理相关问题,从而无需从头开始训练新模型[33]。迁移学习通常在两个主要阶段进行:特征提取和参数调整(优化)。在第一阶段,预训练模型从新数据集的训练数据中提取有用的表示。在第二阶段,模型的架构被调整,其参数被微调,以在目标域中实现更好的性能。以这种方式使用预训练模型有助于克服小数据集的限制,同时降低计算需求。DL模型用于迁移学习的选择很大程度上取决于其捕获与目标域相关的特征的能力。在医学领域,迁移学习最常见的方法是利用在ImageNet等大规模数据集上预训练的模型,这些数据集广泛用于目标检测和分类任务。
本工作中使用的预训练模型概述如下。具体而言,VGG16[29]、VGG19[30]、EfficientNet[31]和DenseNet121[32]被使用。这些架构最初在自然图像数据集上训练,随后针对本研究的目的使用脑MRI扫描进行微调。
- VGG-19架构:VGG-19[30]是一种深度CNN,以其统一简单的架构而闻名,由牛津大学的视觉几何组(VGG)开发。名称中的"19"表示网络的19个可学习层,包括16个卷积层和3个全连接层。VGG-19架构的定义特征是其在整个网络中专门使用非常小的3×3卷积滤波器。这些滤波器被堆叠在块中以增加网络的深度,这增强了其从图像中学习复杂和分层特征的能力。在每个卷积层块之后,使用2×2最大池化层逐步降低特征图的空间维度。该网络以三个全连接层结束:前两个充当分类器,最后一层是输出不同类别的概率分布的softmax函数。
- EfficientNet-B2架构:EfficientNet-B2[31]是EfficientNet家族的一部分,由Google AI开发,旨在实现高准确率同时保持出色的计算效率。EfficientNet的核心创新是其复合缩放方法。与任意增加单个网络维度(如深度或宽度)不同,复合缩放根据固定的缩放系数均匀调整深度、宽度和输入分辨率。基础模型EfficientNet-B0是通过神经架构搜索(NAS)发现的,优化了准确率和效率之间的权衡。EfficientNet-B2代表了这一基础模型的放大版本,通过应用复合缩放规则来扩展网络容量。这种平衡的缩放策略使EfficientNet模型能够以显著更少的参数和降低的计算成本提供最先进的性能,与具有可比准确率的其他架构相比。
- DenseNet121架构:DenseNet121是一种具有121层的CNN,使用密集连接,其中每个层以前馈方式连接到其他每个层。其架构包括初始卷积和池化层、四个具有特定数量卷积层(6、12、24和16)的"密集块"、块之间的过渡层、全局平均池化层、最终全连接层和softmax输出层。这种结构促进了特征重用和高效的信息流。
4.5 最终模型训练
VGG-16架构被用于脑部疾病的多类别分类。该模型被微调以区分肿瘤、阿尔茨海默病和正常脑扫描,使用PyThon框架。训练使用学习率为0.001的Adam优化器和交叉熵损失函数。模型性能使用包括准确率、精确度、召回率和F1分数在内的综合指标进行评估,以及通过混淆矩阵进行额外分析,以评估所有三个类别的分类性能。数据集被划分为训练、验证和测试子集,比例分别为50-50、60-40、70-30、80-20和90-10。该模型训练了30个周期,每个周期大约需要55-60秒完成。整个训练过程在Kaggle的计算平台上使用CPU和GPU资源进行,每次实验运行的总训练时间平均为1小时15分钟。所有超参数,包括学习率和批量大小,都经过系统优化,以提高脑部疾病分类任务的模型性能。
4.6 超参数配置和调整
优化过程旨在平衡训练稳定性与高效收敛,基于文献中的既定实践和关于模型架构和数据集规模的经验考虑。不是采用详尽的网格搜索,而是采用了一种混合策略,结合了一组固定的基线超参数和一个动态学习率调整机制,以在训练的最后阶段微调权重。静态超参数的选择是基于它们在类似任务中的证明功效。AdamW优化器被选择代替标准Adam,因为它对权重衰减与梯度更新解耦的改进方法,已被证明能带来更好的泛化。初始学习率设置为0.001,这个值通常被采纳为Adam-based优化器的稳健起点,为有意义的初始进展提供足够大的步长,而不会导致早期不稳定。应用了1e-5的权重衰减作为轻微的正则化形式,以防止过拟合,特别是考虑到模型容量被认为足以满足数据集的复杂性。批量大小设置为32,以在梯度稳定性和计算效率之间取得平衡,允许更平滑的收敛,同时符合内存约束。最后,模型总共训练了50个周期,这个持续时间通过初步实验确定,为验证损失达到平稳并允许调度器充分利用其减少步骤提供了足够容量。为了细化这个训练过程,通过ReduceLROnPlateau学习率调度器引入了一个动态组件。该调度器在每个周期结束时监控验证损失;如果连续两个周期未观察到改进,则将学习率减少0.5倍。这种方法允许模型在初始阶段以较大步长导航损失景观,然后自动减速以执行更精细的微调,因为它接近最小值,从而增强最终模型状态的稳健性并避免不必要的手动干预。
4.7 模型测试
训练阶段后,对训练好的模型进行测试。此阶段用于检查训练模型的准确率、精确度、召回率和其他评估指标。未标记数据被提供给分类器,分类器在此阶段给出给定数据的标签。测试数据集用于评估分类器的性能以及模型对给定数据的表现。研究结果非常有希望。最后,结果以图表形式展示,以便对结果进行分析。
4.8 性能分析
使用精确度、召回率、F1分数、准确率和混淆矩阵分析评估了模型性能。这些指标共同提供了对整体有效性和类别特定预测性能的洞察。
4.9 准确率
准确率用于衡量整个数据集上的总体正确性。它衡量正确预测占总输入样本的比例。定义为:
准确率 = (TP + TN) / (TP + TN + FP + FN)
其中TP = 真阳性,TN = 真阴性,FP = 假阳性,FN = 假阴性。
4.10 召回率
召回率,通常称为灵敏度或真阳性率(TPR),代表模型正确检测到的实际阳性实例的比例。它反映了模型识别真正患病患者的能力。
灵敏度 = TP / (TP + FN)
4.11 精确度
精确度衡量模型分类为阳性的所有实例中真阳性预测的比例。
精确度 = TP / (TP + FP)
4.12 F1分数
F1分数定义为精确度和召回率的调和平均数,提供了一个平衡这两个指标的统一测量。在类别分布不平衡的场景中特别有价值,因为它考虑了假阳性和假阴性。
F1分数 = 2 × (精确度 × 召回率) / (精确度 + 召回率)
4.13 接收者操作特性(ROC)
接收者操作特性(ROC)曲线是分类器在不同决策阈值下的性能的图形表示。它通过绘制TPR(灵敏度)与假阳性率(FPR)来构建。
4.14 混淆矩阵
混淆矩阵是模型性能的表格表示,显示真阳性、真阴性、假阳性和假阴性的计数。
5 结果
本节介绍了对所提出的脑部疾病检测系统进行全面性能评估的实验发现。实验设计用于系统分析几个关键因素对脑部疾病诊断准确率的影响。评估包括对四种DL架构(即VGG-16、EfficientNet-B2、VGG-19和DenseNet121)的直接比较,以确定最适合解释MRI数据的模型。此外,调查了五种不同的训练-测试数据分割比例(50-50、60-40、70-30、80-20和90-10)的影响,以确定模型泛化的最佳数据分区策略,并减轻有限医学数据集上的过拟合。评估的性能包括准确率、召回率、精确度、F1分数、ROC和混淆矩阵。训练动态的分析提供了清晰客观的测量,说明每个实验变量如何贡献于系统的总体诊断精度和临床适用性。
5.1 实验设置
在本小节中,讨论了实验设置和结果,包括使用不同模型的训练和验证损失及准确率的图形表示。每次改变迭代次数和比例时,我们都会获得不同的结果和不同的准确率。所用算法在本模型中以前用于不同问题,但其工作方式独特。所提出的想法以前未被使用过,因此这是一种完全新的方法,可以一次性检测不同疾病。
5.2 计算效率
训练阶段:模型在单个NVIDIA V100 GPU(32GB内存)上开发。使用32的批量大小,30个周期的总训练时间约为4-5小时,平均每个周期7.8分钟。训练期间的峰值GPU内存使用量达到11.2GB,仍在可用的32GB容量范围内。这种内存开销表明,该架构可能在规格更适中的硬件上训练,为在不同计算约束下复制或适应提供可行的基准。
推理阶段:为评估实际部署能力,我们在相同硬件上评估了推理性能。处理单个扫描平均需要0.8秒,前向传递期间的内存消耗降至3.4GB。这种快速的推理时间支持实时或近实时集成到临床工作流程的可行性。此外,减少的内存占用表明可能部署在具有功能较弱GPU的系统上,或用于优化的基于CPU的实现。提供这些指标是为了帮助读者评估模型准确率与实际效用之间的权衡。
5.3 提出的VGG-16架构
VGG 16用于识别感染。信息图片将在VGG 16的不同层上使用激活函数进行测量。可以使用这种方法识别不同的疾病,有基本步骤被迭代使用,直到为数据创建了合适的模型。在模型选择步骤中,使用数据的图表、测量数据和对过程的假设来确定要拟合到数据的模型类型。在所提出的工作中,使用基于CNN的Vgg16模型进行脑部疾病的检测和分类。
在题为"大规模图像识别的非常深的卷积网络[34]"的文章中,牛津大学视觉几何组实验室的Karen Simonyan和Andrew Zisserman提出了VGG 16模型。VGG-16是一个16层深的CNN。VGG16最显著的特点是,它不依赖于许多超参数,而是使用3x3滤波器(步幅1)的卷积层,并始终使用相同的填充,以及2x2滤波器(步幅2)的最大池化层[34]。在整个设计中,这种卷积和最大池化层的组合是恒定的。最后,它具有两个全连接层和一个用于输出的softmax函数。图4展示了用于图像分类的VGG-16模型架构。
考虑到VGG-16在此工作中的灵活性、稳健性和效率,它已被成功应用于脑部疾病检测,并引入了对其工作流程的改进以提高性能。最近,He等人[35]评估了VGG模型对复杂视觉数据的性能。VGG-16拥有大量以特定模式连接的单元,允许所有单元之间的通信。这些模块是并行运行的基本处理器,通常称为节点或神经元。这些神经元分布在层中[18]。第一层称为输入层,除最后一层外的所有其他层称为隐藏层。在输出层用于根据图像特征进行最终分类。
5.4 不同训练-测试分割下DL模型的比较性能
不同训练-测试分割下DL模型的比较性能揭示了模型泛化能力和数据效率的关键见解。在评估VGG-16、VGG-19、Densenet和EfficientNet等架构时,研究人员一致观察到性能权衡,直接受分割比例影响。在较大训练部分(例如80-20或90-10分割)上训练的模型通常表现出更高的准确率和稳定性,因为丰富的训练数据使更好的特征学习和减少过拟合成为可能。相反,当限制在较小的训练集(50-50或60-40分割)时,即使是复杂的架构也显示出明显的性能下降,验证指标变得更加不稳定。这种模式强调了数据量和模型有效性之间的基本依赖关系,其中具有高参数计数的复杂模型需要大量训练样本来发挥其潜力。此外,最佳分割比例通常因架构而异,有些模型比其他模型表现出更好的数据效率。这些发现强调,分割选择不仅是一个程序步骤,而且是一个直接影响性能基准测试和实际部署可行性的关键超参数,突显了在比较DL研究中需要标准化的评估协议。
5.4.1 50-50%(实验1)不同模型的性能评估
基于表2中显示的50-50分割结果,该表展示了四种CNN模型(DenseNet121、VGG-16、VGG-19和EfficientNet B2)在使用平衡的50-50数据分割检测肿瘤和阿尔茨海默病方面的比较分析。评估指标揭示了两种医疗状况之间不同的性能模式。对于肿瘤检测,VGG-16展示了出色的灵敏度(0.926)和F1分数(0.961),表明其在识别真阳性病例方面的强大能力,尽管DenseNet121实现了最高的总体准确率(0.8317)。相比之下,阿尔茨海默病检测显示出截然不同的结果,VGG-16在所有指标上(准确率、精确度、召回率和F1分数均为0.96)展示出卓越且一致的性能,表明它特别适合此诊断任务。疾病之间的性能差距很大,所有模型在阿尔茨海默病检测上的指标都明显高于肿瘤识别。VGG-19在两项任务中都展示了中等性能,而EfficientNet B2在两项疾病的评估标准中始终排名最低,特别是在肿瘤检测中,其精确度和F1分数降至0.38。这些结果突显了模型有效性如何根据所诊断的医疗状况而有显著差异,强调了在医学图像应用中疾病特定模型选择的重要性。
5.4.2 60-40%(实验2)不同模型的性能评估
表3展示了四种DL模型(VGG-16、DenseNet121、VGG-19和EfficientNet B2)在使用60-40数据分割检测肿瘤和阿尔茨海默病方面的性能比较。结果显示了清晰的性能层次,VGG-16成为两种医疗状况中最有效的模型。对于肿瘤检测,VGG-16在所有指标上都取得了最高分数(准确率:0.883,精确度:0.897,召回率:0.913,F1分数:0.905),展示了强大而平衡的诊断能力。DenseNet121紧随其后,表现稳健,而VGG-19显示中等结果,EfficientNet B2继续表现显著不佳。在阿尔茨海默病检测中,性能模式显著变化。VGG-16保持其优越地位,具有异常的一致性(所有指标均为0.97),而EfficientNet B2展示了显著的改进,取得了强劲的第二名结果(准确率:0.9531,所有其他指标:0.95)。DenseNet121和VGG-19在阿尔茨海默病检测中展示了可比但较低的性能水平。肿瘤和阿尔茨海默病检测之间存在显著的性能差距,所有模型在阿尔茨海默病检测中都取得了更高的指标,表明阿尔茨海默病检测任务可能不那么复杂,或者模型更适合这种类型的神经影像分析。
5.4.3 70-30%(实验3)不同模型的性能评估
表4评估了四种DL模型在70-30数据分割上对肿瘤和阿尔茨海默病检测的性能,揭示了医疗状况之间诊断能力的不同模式。对于肿瘤检测,VGG-16保持领先地位,具有强劲的总体性能(准确率:0.87,F1分数:0.90)并特别在召回率(0.93)上表现出色,表明在识别真阳性病例方面具有出色的灵敏度。DenseNet121紧随其后,表现均衡,而VGG-19显示中等性能,EfficientNet B2继续表现出显著挑战,特别是在精确度和F1分数(均为0.38)方面。在阿尔茨海默病检测中,模型显示了明显更高的性能水平,VGG-16在所有指标上都达到了近乎完美的结果(0.98)。EfficientNet B2表现异常出色,成为第二好的模型(准确率:0.9596),大大优于其肿瘤检测能力。VGG-19与肿瘤检测结果相比表现有所提升,而DenseNet121在阿尔茨海默病模型中排名最低,但仍取得不错的分数。两种疾病之间的一致性能差距表明,阿尔茨海默病检测可能代表一个更易于处理的问题,或者神经影像数据提供了更具区分性的特征,可用于可靠的分类,与肿瘤检测任务相比。
5.4.4 80-20%(实验4)不同模型的性能评估
表5展示了使用80-20数据分割的四种DL模型的性能,揭示了一个关键趋势:随着训练数据的增加,阿尔茨海默病检测的模型性能接近完美水平,而肿瘤检测仍然是一个更具挑战性的任务。对于肿瘤检测,DenseNet121和VGG-16在最佳表现者中展开激烈竞争,DenseNet121在准确率(0.8878)和精确度(0.89)上略微领先,而VGG-16在召回率(0.94)上显著胜出,意味着它在找到所有阳性病例方面表现最佳。相比之下,阿尔茨海默病检测展示了卓越的结果,VGG-19和VGG-16都达到了近乎完美的分数(分别为0.9926和0.99)。EfficientNetB2在阿尔茨海默病检测方面也表现异常出色,与其在肿瘤检测中一贯较差的表现相比有显著改善。这种巨大的性能差距凸显了所选模型架构特别适合阿尔茨海默病数据集,但发现肿瘤检测问题明显更难,即使有更大的训练集也是如此。
5.4.5 实验5:90-10%(实验5)不同模型的性能评估
表6呈现了使用90-10数据分割时模型性能的一个显著异常。对于肿瘤检测,结果遵循既定模式:VGG-16表现出最佳性能,具有高准确率(0.89)和异常高的召回率(0.95),而EfficientNet B2继续表现显著不佳。然而,阿尔茨海默病检测结果揭示了一个戏剧性和意外的结果。VGG-16显示了严重的性能矛盾,达到近乎完美的准确率(0.997),但在精确度、召回率和F1分数上灾难性地低(均为0.10)。这种极端差异表明模型出现了严重故障,可能是严重过拟合或由于类别不平衡导致模型主要预测一个类别,从而实现高准确率但无法正确识别阳性病例。同时,EfficientNet B2成为阿尔茨海默病检测的最强表现者,具有平衡且稳健的指标(准确率:0.9274,F1分数:0.93),而DenseNet121和VGG-19在与先前分割相比时表现显著下降。这种模型层次结构的逆转,加上VGG-16的异常结果,表明90-10分割可能将一些模型推向了其对阿尔茨海默病数据集的有效学习能力之外,可能是由于训练数据多样性不足或验证集的特殊性。
5.5 VGG 16在不同训练-测试分割上的性能评估
VGG 16在不同训练-测试分割上的性能评估揭示了模型泛化和潜在过拟合之间的基本权衡,很大程度上受训练数据量的影响。因此,分割的选择充当了数据充足性的代理,表明对于VGG16这样的大型网络,更大的训练比例对于充分利用其深度并确保学习到的表示足够泛化以在保留的测试数据上进行可靠评估至关重要。
5.5.1 使用50/50%数据分割的VGG-16评估(实验6)
本节展示了使用50/50%数据分割策略对所提出的CNN模型在脑肿瘤和阿尔茨海默病分类任务上的综合评估。该分析采用多种性能指标,提供对模型有效性的全面视图,包括通过损失/准确率曲线的训练动态、通过ROC分析的判别能力、精确度-召回率权衡以及通过混淆矩阵的分类性能。训练进展揭示了两种医疗状况之间不同的学习模式。如图5a所示,阿尔茨海默病模型在学习曲线中表现出更明显的波动,可能表明特征学习或数据集特性的复杂性更高。两种模型都达到了显著的准确率水平,训练和验证曲线最终稳定在高性能平台上,确认了模型从医学图像数据中学习有意义表示的能力。
ROC曲线分析提供了模型判别能力的关键见解。图6显示,脑肿瘤分类器实现了约0.89的AUC,如图6a所示,明显偏离随机分类器基线。阿尔茨海默病模型展示了更令人印象深刻的表现,AUC为0.99,反映了类之间的近乎完美分离。这种卓越的表现表明,该模型有效地捕捉了与阿尔茨海默病病理相关的独特神经解剖模式,在整个操作范围内保持高真阳性率,同时将假阳性降至最低。
精确度-召回率曲线进一步阐明了模型的性能特征,这在医学诊断中尤为重要,因为假阳性和假阴性都会产生重大后果。如图7所示,脑肿瘤模型(图7a)在大多数召回率水平上保持稳健的精确度,尽管在中等召回率范围内出现一些变化,可能表明特征空间中的某些困难区域。阿尔茨海默病模型(图7b)展示了卓越的表现,在几乎整个召回率谱上保持高精确度(高于0.92),仅在最高召回值时下降——这是高性能分类器的特征模式。这种持续的高精确度在临床环境中特别有价值,因为假阳性可能导致不必要的患者焦虑和额外测试。
混淆矩阵提供了最终性能验证,量化了确切的分类结果。图8显示,对于脑肿瘤检测(图8a),该模型展示了两类之间的平衡性能,具有代表正确分类的强对角值和相对较少的代表误分类的非对角元素。阿尔茨海默病混淆矩阵(图8b)展示了更令人印象深刻的结果,误分类极少,与ROC和PR曲线的卓越表现一致。这些矩阵确认,两种模型不仅有效地学习了判别特征,而且在未见的测试数据上保持了这种能力,验证了50/50分割策略用于模型开发和评估。
5.5.2 使用60/40%数据分割的VGG 16评估(实验7)
本节展示了使用60/40%数据分割策略对所提出的CNN模型在脑肿瘤和阿尔茨海默病分类任务上的综合评估。该分析采用相同的性能指标套件,提供对模型有效性的全面评估,从通过损失和准确率曲线的训练动态开始。训练进展揭示了两种医疗状况之间的不同学习模式。如图9a所示,阿尔茨海默病模型展示了稳健的学习特性,训练和验证性能均衡。两种模型都达到了显著的准确率水平,训练和验证曲线最终稳定在高性能平台上,确认了模型在60/40分割配置下从医学图像数据中学习有意义表示的能力。
ROC曲线分析提供了模型判别能力的关键见解。图10显示,脑肿瘤分类器实现了0.94的AUC,如图10a所示,明显偏离随机分类器基线,表明在各种阈值设置下区分肿瘤和非肿瘤病例的强能力。阿尔茨海默病模型展示了更令人印象深刻的表现,AUC为0.99,反映了类之间的近乎完美分离。这种卓越的表现表明,该模型有效地捕捉了与阿尔茨海默病病理相关的独特神经解剖模式,在整个操作范围内保持高真阳性率,同时将假阳性降至最低。
精确度-召回率曲线进一步阐明了模型的性能特征,这在医学诊断中尤为重要,因为假阳性和假阴性都会产生重大后果。如图11所示,脑肿瘤模型(图11a)在大多数召回率水平上保持稳健的精确度,从完美精确度开始,逐渐下降到1.0召回率时的0.75,同时持续优于随机分类器基线。阿尔茨海默病模型(图11b)展示了卓越的表现,平均精确度为0.98,在几乎整个召回率谱上保持高精确度(高于0.95),仅在极端召回值时下降——这是高性能分类器的特征模式。这种持续的高精确度在临床环境中特别有价值,因为假阳性可能导致不必要的患者焦虑和额外测试。
混淆矩阵提供了最终性能验证,量化了确切的分类结果。图12显示,对于脑肿瘤检测(图12a),该模型展示了两类之间的平衡性能,具有代表正确分类的强对角值和相对较少的代表误分类的非对角元素。阿尔茨海默病混淆矩阵(图12b)展示了更令人印象深刻的结果,误分类极少,与ROC和PR曲线的卓越表现一致。这些矩阵确认,两种模型不仅有效地学习了判别特征,而且在未见的测试数据上保持了这种能力,验证了60/40分割策略用于模型开发和评估。
5.5.3 使用70/30%数据分割的VGG 16评估(实验8)
本节详细介绍了使用70/30%数据分割策略对所提出的CNN模型在脑肿瘤和阿尔茨海默病分类任务上的性能评估。该分析采用多种性能指标,提供对模型有效性的全面视图,包括通过损失/准确率曲线的训练动态、通过ROC分析的判别能力、精确度-召回率权衡以及通过混淆矩阵的分类性能。图13显示,使用70/30%数据分割的所提出CNN模型展示了脑肿瘤和阿尔茨海默病分类任务通过损失和准确率曲线的训练动态。如图5所示,脑肿瘤检测模型展示了稳健和稳定的收敛,训练和验证指标在向高性能平台发展时紧密对齐;这种同步性表明有效的泛化,没有显著的过拟合。相比之下,阿尔茨海默病分类模型虽然最终达到高准确率,但显示出训练和验证曲线之间明显的差距,表明轻微的过拟合,或反映了阿尔茨海默病数据集内在的复杂性和更嘈杂的特征模式。尽管存在这些差异,两种模型都成功学习了有意义的表示,确认了它们掌握医学图像数据提出的各自诊断挑战的能力。
ROC曲线分析提供了模型判别能力的关键见解。图14显示,脑肿瘤分类器实现了强劲的性能,如图14a所示,明显偏离随机分类器基线。
精确度-召回率曲线进一步阐明了模型的性能特征,这在医学诊断中尤为重要,因为假阳性和假阴性都会产生重大后果。如图15所示,两种分类任务之间出现了明显的性能模式。脑肿瘤模型(图15a)展示了精确度和召回率之间的特征权衡,随着召回率从0增加到1,精确度逐渐从约0.95下降到0.70。这种稳定下降表明该模型在大多数操作点上保持合理的判别能力,尽管在更高召回率水平时精确度下降表明尝试识别更多阳性病例时假阳性增加。相比之下,阿尔茨海默病模型(图15b)展示了卓越的性能特征,在几乎整个召回率谱上保持异常一致的精确度,高于0.96,直到非常高的召回值。这种在几乎所有操作点上持续的高精确度在临床环境中特别有价值,因为假阳性可能导致不必要的患者焦虑和额外测试。阿尔茨海默病模型的性能模式,精确度在极端召回值之前保持稳定,是具有强大特征判别能力的高性能分类器的特征。两种模型都显著优于随机分类器基线,随机分类器基线在70-30类别分布假设下会保持0.3的恒定精确度,展示了所提出方法对这些医学诊断任务的有效性。
混淆矩阵提供了最终性能验证,量化了确切的分类结果。图16显示,对于脑肿瘤检测(图16a),该模型展示了两类之间的平衡性能,具有代表正确分类的强对角值和相对较少的代表误分类的非对角元素。阿尔茨海默病混淆矩阵(图16b)展示了更令人印象深刻的结果,误分类极少,与ROC和PR曲线的卓越表现一致。这些矩阵确认,两种模型不仅有效地学习了判别特征,而且在未见的测试数据上保持了这种能力,验证了70/30分割策略用于模型开发和评估。
5.5.4 使用80/20%数据分割的VGG 16评估(实验9)
本节通过实施80/20%数据分割策略,扩展了对所提出的CNN模型的综合评估,适用于两种分类任务。该分析保持其整体方法,采用相同的性能指标套件——包括通过损失/准确率曲线的训练动态、通过ROC分析的判别能力、精确度-召回率权衡以及通过混淆矩阵的详细分类性能——以提供对模型有效性的严格评估,使用更大的训练集。训练进展揭示了两种医疗状况之间的不同学习模式。如图17a所示,阿尔茨海默病模型显示出训练和验证性能之间的明显差距,可能表明特征学习或数据集特性的复杂性更高。两种模型都达到了显著的准确率水平,训练和验证曲线最终稳定在高性能平台上,确认了模型在80-20分割配置下从医学图像数据中学习有意义表示的能力。
ROC曲线分析提供了模型判别能力的关键见解。图18显示,脑肿瘤分类器实现了强劲的性能,如图18a所示,明显偏离随机分类器基线。
80-20数据分割的精确度-召回率曲线,如图19所示,揭示了与临床要求相符的两种诊断任务的不同性能模式。对于脑肿瘤分类(图19a),模型展示了特征性的精确度-召回率权衡,精确度随着召回率从0增加到1.0而稳定下降,从0.95下降到0.70。这种逐渐下降表明该模型在大多数操作点上保持合理的判别能力,尽管随着尝试达到更高灵敏度而精确度持续下降表明假阳性率增加。阿尔茨海默病分类模型(图19b)展示了卓越的性能,在几乎整个召回率谱上保持精确度高于0.96,直到极端上限范围。这种持续的高精确度在阿尔茨海默病诊断中特别关键,因为假阳性可能导致显著的患者痛苦和不必要的医疗干预。两种模型都显著优于随机分类器基线,随机分类器基线在80-20类别分布下会保持0.2的恒定精确度,确认了模型的稳健预测能力。阿尔茨海默病模型在大多数召回值上保持稳定精确度的能力反映了其强大的特征判别能力,使其特别适合临床部署,在各种操作阈值下需要一致性能的环境。
混淆矩阵提供了确定性性能验证,精确量化了80-20数据分割的分类结果。图20显示,两种模型都实现了卓越的性能,脑肿瘤检测模型(图20a)展示了稳健的分类能力,具有代表正确预测的强对角值和最少的代表误分类的非对角元素。同样,阿尔茨海默病混淆矩阵(图20b)展示了近乎完美的分类性能,误分类极少,与AUC和精确度-召回率分析中观察到的卓越指标一致。这些矩阵共同确认,两种模型有效地学习了判别特征,并在未见的测试数据上保持了卓越的泛化能力,从而验证了80-20分割策略用于模型开发和评估的有效性。
5.5.5 使用90/10%数据分割的VGG 16评估(实验10)
本节展示了使用90/10%数据分割策略对所提出的CNN模型在脑肿瘤和阿尔茨海默病分类任务上的综合评估。该分析采用多种性能指标,提供对模型有效性的整体视图,包括通过损失/准确率曲线的训练动态,以评估在最小验证数据下最大训练数据利用条件下的收敛行为,通过ROC分析的判别能力,精确度-召回率权衡,以及通过混淆矩阵的分类性能,以评估在大幅减少的测试集上对泛化的评估。
训练进展揭示了90/10%数据分割下两种医疗状况之间的不同学习模式。如图21a所示,阿尔茨海默病模型展示了更明显的训练和验证性能差异,验证指标的波动更大,可能反映了从大幅减少的验证集中学习复杂神经退行性模式的更大挑战。两种模型最终都达到了显著的准确率水平,学习曲线稳定在高性能平台上,确认了模型从大量训练数据中提取有意义表示的能力,同时突显了数据分区对不同医疗领域模型稳定性的差异化影响。
ROC曲线分析提供了模型判别能力的关键见解。图22显示,脑肿瘤分类器实现了卓越的性能,如图22a所示,明显偏离随机分类器基线。
90-10数据分割的精确度-召回率曲线,如图23所示,展示了在严重类别不平衡的挑战性场景下的显著性能特征。对于脑肿瘤分类(图23a),模型表现出相对稳定的精确度配置文件,在整个召回率谱上保持在0.75和0.62之间。与先前的分割相比,这种压缩范围表明该模型在区分此高度不平衡数据集中的阳性案例时面临更大挑战,尽管它仍然保持合理的判别能力。相比之下,阿尔茨海默病分类模型(图23b)实现了近乎完美的性能,在召回率的大部分范围内保持精确度为1.00,并且仅在召回率约60%后开始逐渐下降。这种卓越的表现即使在90-10类别分布下也特别引人注目,表明该模型在识别真阳性案例方面具有强大的能力,同时即使在显著类别不平衡的情况下也将假警报降至最低。两种模型都显著优于随机分类器基线,随机分类器基线在90-10类别分布下会保持0.1的恒定精确度。阿尔茨海默病模型在召回率的大部分值上保持近乎完美精确度的持续表现突显了其临床可靠性,使其非常适合诊断应用,即使在固有数据集不平衡的情况下也需要将假阳性降至最低。
混淆矩阵提供了确定性性能验证,精确量化了90-10数据分割的分类结果。图24显示,两种模型都实现了卓越的性能,脑肿瘤检测模型(图24a)展示了稳健的分类能力,具有代表正确预测的强对角值和最少的代表误分类的非对角元素。同样,阿尔茨海默病混淆矩阵(图24b)展示了近乎完美的分类性能,误分类极少,与AUC和精确度-召回率分析中观察到的卓越指标一致。这些矩阵共同确认,两种模型有效地学习了判别特征,并在未见的测试数据上保持了卓越的泛化能力,从而验证了90-10分割策略用于模型开发和评估的有效性。
6 总结和讨论
人体内存在许多严重疾病,有各种方法可以检测它们。大脑被认为是人体最重要的组成部分之一,医疗保健研究人员对其感兴趣,以解决人类大脑中发现的各种异常,从而保持健康的大脑。像身体的其他部分一样,大脑容易受到各种危险和危及生命的疾病的影响。不同疾病,如脑肿瘤、阿尔茨海默病和中风,可以在大脑的不同区域被发现。为了检测人类大脑中的异常表现,使用了CT和MRI等多种图像模态。手动检查一直是深入和无偏见地研究各种模态的标准做法,但它有许多重大缺陷,使这种方法不准确且容易出错。为解决这些缺陷,开发了某些先进过程,包括使用DL模型进行疾病诊断。
根据表7中的综合性能总结,VGG-16模型在医学图像检测中展示了卓越的能力,尽管在不同疾病中表现有所不同。对于阿尔茨海默病检测,该模型实现了近乎完美的性能,准确率、精确度、召回率和F1分数均达到0.99,表明出色的诊断可靠性。在肿瘤检测中,尽管仍然非常有效,准确率为89%,召回率为95%,但模型的精确度略低,为88%,表明它在识别真实病例方面非常出色,但偶尔会标记假阳性。总体而言,该模型在两种应用中保持了高一致性和可靠性,敏感性成为其最强指标。最佳训练配置因疾病而异,在阿尔茨海默病检测中使用80-20分割表现最佳,在肿瘤识别中使用90-10分割,突显了任务特定微调以获得最大性能的重要性。
6.1 研究贡献
虽然有限数量的DL架构以前已部署用于神经诊断任务,但在多样化数据集上探索其他模型的适用性仍有重大机会。本研究调查了VGG-16架构用于脑部疾病检测的有效性,遵循包括数据收集、数据处理和性能测量的方法流程。该模型在公开可用的数据集上进行了严格评估,划分为各种训练-测试比例以评估稳健性。其性能使用包括准确率、精确度、敏感性、特异性、F1分数和混淆矩阵在内的一套综合指标进行量化,并与既定的最先进技术进行基准测试。结果表明,VGG-16模型在该领域中超过了之前应用的几种DL模型的性能。这项工作的主要创新点在于该模型进行多疾病分类的能力,这与传统的单一疾病检测器不同。这种集成方法提供了更优化的诊断解决方案,具有提高处理速度和准确性的潜力。临床影响是减少了对个别条件进行重复、昂贵测试的需求,从而减轻患者负担并简化诊断路径。通过实现肿瘤、中风和阿尔茨海默病等多种病理的同时检测,该系统有望减少患者和临床医生的工作量,并显著降低相关医疗成本。
7 结论和未来工作
本节总结了整体研究发现。通过完成所需的操作,我们能够实现所有目标。此外,发现了本研究工作的局限性,在开发用于检测更多脑部疾病的新模型时应予以考虑。本章还概述了其他研究人员可以追求的潜在研究路线,以关注实验发现,以及本研究中发现的局限性,并将此技术应用于检测更多疾病。最后,我们希望并期望本研究中使用的模型将激励学者以及医疗领域。
本研究的发现对神经学中计算机辅助诊断系统的进步具有重要意义。特定脑部疾病实现的高分类准确率表明该模型作为临床医生的实用决策支持工具的潜力,可能加速诊断并减少解释主观性。此外,系统评估提供了对领域的关键实证指导,提供了基于证据的模型和优化器选择建议,可以简化未来开发工作。然而,性能对数据分割比例的依赖性凸显了医学AI中的一个基本挑战,强调了大型、多样化数据集对于确保模型稳健性的必要性。因此,虽然这项工作建立了一个可扩展和有效的基础,但其主要意义在于它为未来扩展提供的明确路径。最关键的下一步是通过整合神经系统疾病的更广泛谱系来解决当前的分类学范围限制,从而从专业分类器向更全面和临床可泛化的诊断助手迈进。
尽管结果令人鼓舞,但所提出的系统受制于某些限制,这些限制值得注意。首先,比较分析仅限于四种DL架构;纳入更广泛的CNN算法可以提供更全面的性能基准。更显著的限制是诊断分类法的范围。当前模型设计为区分仅三个类别:正常、肿瘤和阿尔茨海默病。这代表了已知神经系统疾病庞大谱系中的一个狭窄子集。因此,该系统对帕金森病、亨廷顿病或各种形式痴呆等其他流行脑部疾病的泛化能力未经验证,这是未来扩展的关键领域。
大脑代表了人体中最复杂和最脆弱的器官之一,其疾病对患者生存和生活质量具有深远影响。尽管所提出的模型成功克服了先前工作中的几个限制——如对单一肿瘤类型的依赖、小数据集和计算密集型流程——但其对日益增长的疾病异质性和数据集可变性的弹性需要进一步调查。要将这种方法转化为临床上可行的工具,未来的工作将追求三个相互关联的目标。第一个涉及扩展模型的诊断范围,超越当前焦点,包括神经退行性疾病、脑血管疾病和炎症病理等更广泛的神经系统状况,从而解决现有文献中普遍存在的狭窄疾病覆盖问题。第二个目标集中于使用大规模、多机构数据集进行严格的外部验证,这些数据集包含各种获取协议、人口分布和疾病阶段;这种验证对于建立泛化能力并最小化数据集诱导的偏差至关重要。第三个目标涉及系统消融研究,量化每个架构组件和预处理策略的边际贡献,从而为驱动模型性能的机制提供透明度并为未来优化工作提供信息。除了这些近期目标外,一个变革性的长期方向涉及开发预测框架,能够识别临床前生物标志物并在明显症状出现之前实现早期干预。实现这一目标将代表从反应性、症状驱动的诊断向预防性神经学的范式转变,最终重新定义高风险人群的护理标准。
数据可用性
本研究中分析的数据集可在Brain-Disease-Dataset存储库中获取,可通过以下永久链接访问:
注意:访问该数据集可能需要获得存储库维护者的许可。
参考文献
[此处省略参考文献列表,因为原文中包含大量参考文献,根据翻译要求,只保留正文内容]
致谢
本研究得到了沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目编号(PNURSP2026R161)的支持。
资金
本研究工作得到了马来西亚高等教育部(MOHE)2023年能源可持续性重点领域的转化研究计划(项目ID:MMUE/240001)、2024年东盟IVO(项目ID:2024-02)以及马来西亚多媒体大学的支持。
作者信息
作者和隶属机构
- 巴基斯坦哈里布尔哈里布尔大学信息技术系,哈里布尔,22620
- Muniba Bibi, Fazli Wahid & Sikandar Ali
- 英国德比大学科学与工程学院数据科学研究中心,德比,DE22 3AW
- Fazli Wahid
- 韩国城南加川大学计算学院
- Jawad Khan
- 巴基斯坦曼塞赫拉哈扎拉大学电信系,曼塞赫拉,21300
- Syed Owais Shah
- 伊拉克纳杰夫伊斯兰大学技术工程学院
- Syed Owais Shah
- 沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学计算机与信息科学学院计算机科学系,邮政信箱84428,11671
- Eatedal Alabdulkreem
贡献
概念化,M. B.和S. A.;方法论,M. B.和S. A.;软件,F. W.;验证,M. B.和S. A.和F. W.;正式分析,S. J.和E. A.;调查,S. A.;资源,F. W.;数据整理,M. B.;写作–原始草稿准备,M. B.;写作–审阅和编辑,S. A., I. E. L.,和H. E. A.;可视化,M. B.;监督,S. A.;项目管理,S. J.;资金获取,I. E. L.;所有作者已阅读并同意发表版本。
通讯作者
通讯请联系Sikandar Ali (sikandar@uoh.edu.pk)或Jawad Khan (jkhanbk1@gachon.ac.kr)。
伦理声明
合规声明
在研究过程中,我们严格遵守监管指南和道德标准,以确保负责任和严谨的研究实践。
伦理批准
由于本研究不涉及人类或动物参与者,因此不需要伦理审查委员会批准。然而,该研究是在遵守实验研究的道德指南的情况下进行的。
知情同意
由于本研究不包括人类或动物受试者,因此不需要知情同意。该研究基于公开可用的数据集,并遵守所有相关道德指南。
利益冲突
作者声明无利益冲突。
临床试验编号
不适用。
附加信息
出版商注意
Springer Nature对已发表地图和机构隶属关系中的管辖权声明保持中立。
权利和许可
开放获取 本文根据知识共享署名4.0国际许可协议授权,允许在任何媒体或格式中使用、共享、改编、分发和复制,只要您给予原作者和来源适当信用,提供知识共享许可的链接,并表明是否进行了修改。本文中的图像或其他第三方材料包含在文章的知识共享许可中,除非在材料的信用行中有其他说明。如果材料不包含在文章的知识共享许可中,且您的预期用途未被法定法规允许或超出了许可的使用范围,您将需要直接从版权所有者处获得许可。要查看此许可的副本,请访问
【全文结束】

