TL;DR
- 将深度学习应用于ECG时间序列数据可以达到专家级别的心律失常检测性能。
- 修改后的1D U-Net架构在多样化的PhysioNet数据集上展示了稳健的分割能力。
- 模型缩放分析表明,较小的架构可以在减少硬件需求的同时保持准确性。
- 解决数据不平衡、信号变异性以及人口统计多样性对于临床可靠性至关重要。
- 轻量级AI ECG模型为可部署的辅助诊断系统提供了实用路径。
心电图(ECG)仍然是无创心脏评估的黄金标准,为心脏电健康提供了一个重要的窗口。通过表面电极记录电信号,临床医生可以识别心律失常、心肌梗死和传导异常等危及生命的状况。
如今,该领域正处于一个十字路口:数字健康的激增已将ECG数据从诊所转移到云端。虽然一些波形数据现在可以通过互联网和可穿戴设备获取,但这些数据可能嘈杂、不一致且质量参差不齐。
本文探讨了深度学习和人工智能在这种数据环境中的变革潜力。ECG是时间序列信号,非常适合用于卷积神经网络,后者擅长在序列数据中进行模式识别。研究表明,深度学习模型在心律失常检测方面可以达到甚至超过专家水平;然而,真正的挑战在于当基础数据未经整理或标注不佳时实现这种准确性。
通过这一过程,我们的目标是确定卷积深度学习架构在训练于代表性的、真实的、反映现代医疗数据收集缺陷的数据集时的稳健性。我们的目标是解决规模和泛化问题:开发尽可能小的模型,该模型不仅能在实验室中工作,而且在面对来自不同互联网来源和低质量心脏记录中典型的信号干扰和类别不平衡时,仍能保持临床可靠性。
AI在ECG分析中的应用
将AI应用于ECG信号已成为一个日益活跃的研究领域。类似的趋势可以在其他医疗时间序列数据中观察到,例如捕获大脑活动信息的EEG信号。虽然递归和卷积神经网络架构的进步极大地促进了这一日益增长的兴趣,但ECG分析呈现出几个额外的特性,使其对研究人员特别有吸引力。这些原因包括但不限于:
- ECG波形模式(P波、QRS复合波、T波)结构高度有序,使神经网络能够检测细微的形态变化。
- 大型公共数据集(如MIT-BIH心律失常数据库、PTB诊断ECG数据库、PhysioNet挑战数据集)使得可重复研究成为可能。
- 深度学习模型可以执行分类、分割、去噪和异常检测。
在StarFish Medical,我们在开发管理各种生物信号(特别是ECG)的工具和算法方面拥有丰富经验。由于标记的心律数据普遍存在,我们认为有机会将机器学习技术应用于自动心脏事件检测和分类。设计用于执行诊断功能的机器学习医疗设备面临更严格的监管审查,然而旨在提醒训练有素的临床医生注意特定时间点的医疗机器学习,而不揭示意图或诊断,适合于辅助、节省时间的角色。这个领域正是医疗AI大放异彩的地方,它减少了临床医生的信息过载,并将专家注意力集中在所需之处。在这次实验中,我们利用开源ECG数据设计并训练了一个机器学习模型,以识别潜在的异常心脏事件。
我们选择了1D U-Net,因为它有效,因为该设计通过压缩数据捕获"大局",同时使用跳跃连接保留细粒度细节。
ECG波形模式
ECG波形模式代表了心脏收缩和放松时的电活动。正常的ECG包括P波(心房去极化)、QRS复合波(快速心室去极化)和T波(心室复极化)。形状、持续时间或时间的变异可能表明心脏异常。例如,ST段抬高可能提示心肌梗死,而QT间期延长可能表明心律失常风险。心房颤动表现为不规则的、纤维性基线波,没有明显的P波,而室性心动过速显示宽而快的QRS复合波。准确的解释有助于诊断心律失常、缺血、电解质失衡和其他心脏疾病。
数据集描述
在机器学习模型的开发中,基础数据集的质量至关重要。虽然我们认识到,最终需要第一手、专业的数据收集才能实现生产就绪的解决方案,但我们当前的研究阶段利用了来自PhysioNet的四个世界级开源数据库。通过整合这些不同的信号——从健康对照组到罕见的室上性事件——我们确保我们的原型针对全球医学研究界使用的相同黄金标准进行基准测试。
MIT-BIH心律失常数据库包含48个半小时的双通道ECG记录,采样率为360 Hz,取自门诊Holter数据。它包括各种心律失常,每个心跳都由专家心脏病学家标注,使其成为心律失常检测研究的基准数据集。MIT-BIH正常窦性心律数据库提供来自没有显著心律失常的健康个体的长期ECG记录。这些干净的窦性心律信号作为对照组,用于比较病理性与正常心脏模式。
MIT-BIH室上性心律失常数据库增加了78个记录,重点强调在核心MIT-BIH心律失常数据集中代表性不足的室上性事件,如心房心律失常。这些记录包括详细的节拍标注,以支持对起源于心室以上条件的研究。
圣彼得堡INCART 12导联心律失常数据库由从12导联Holter记录中提取的75个半小时片段组成,这些记录来自接受冠状动脉疾病评估的患者。采样率为257 Hz,它提供了多导联视角,包含超过175,000个标注的心跳,涵盖了各种心室和室上性异常。
结合这些多样化的数据集确保我们的模型具有弹性和泛化性,而不是过度拟合到单一临床环境。这种多源策略为我们的当前研究阶段提供了必要的严格基准测试,同时为向专有数据收集和临床级部署的过渡铺平了道路。
原型描述
模型架构,修改后的1D U-Net
U-Net是一种卷积神经网络架构,最初为生物医学图像分割而提出,但后来已成为许多密集预测任务的基础。其定义特征是由收缩路径(编码器)和扩展路径(解码器)组成的U形拓扑结构,通过跳跃连接相连。
编码器由重复的3×3卷积块、非线性(通常是ReLU)和通过最大池化的下采样组成。随着空间分辨率降低,特征通道的数量增加,使网络能够学习越来越抽象的表示。解码器镜像这种结构:每个阶段上采样特征图,通常使用转置卷积或插值后跟卷积,逐步恢复空间分辨率。
一个关键创新是使用跳跃连接,将编码器的特征图连接到相应的解码器层。这些连接保留了下采样过程中丢失的高分辨率空间信息,并改善了训练期间的梯度流动,即使在相对较少的训练样本下也能实现精确定位。
U-Net通过交叉熵或Dice损失等损失函数进行端到端训练,具体取决于类别不平衡情况。变体通过注意力机制、残差块或用于体数据的3D卷积来扩展架构。其效率、在小数据集上的强大性能以及生成详细分割图的能力,使U-Net成为医学成像及其他领域的基石模型。
类别描述
如前所述,该模型是波形样本中每个节拍和非节拍部分的多类别分类器。类别0映射到波形的背景部分,即心跳之间。类别1指围绕正常节拍的信号部分,类别2指围绕异常节拍的区域。
使用上述方案,我们可以计算每位患者的异常节拍数量。
方法和结果
我们为每个模型训练了5,000轮次,这个限制被选择为足够长,以便许多不同大小的模型收敛以进行直接比较。每一步涉及从每个记录中随机选择两秒的单通道ECG信号片段。我们改变了模型超参数,以研究模型缩放对训练动态的影响。
超参数
以下是我们在1D U-Net实例中使用的超参数。使用这些超参数,我们可以创建和比较多个模型,并获得最佳结果的模型。此外,这些是卷积神经网络中最常操作的超参数。
内核大小是卷积在时间序列上滑动的窗口大小。对于图像处理,内核是二维参数集。对于时间序列数据(我们的情况),它是一维参数数组,因此内核大小是正整数。
扩张率是一个超参数,定义了卷积操作期间内核权重之间的间距。在标准1D卷积中,扩张率等于1,意味着内核处理时间序列中的相邻样本。U-Net深度指的是从输入层到瓶颈的层次结构中的连续级别数。
指标
为了全面评估1D U-Net分割模型的性能,我们选择了三个互补指标:交叉熵损失、交并比(IoU)和宏F1分数。交叉熵损失作为主要训练目标,衡量模型预测类别概率的效果。IoU评估预测段与真实段之间的重叠质量,捕捉空间或时间对齐。宏F1分数平衡所有类别的精确率和召回率,确保少数类别得到平等对待。这些指标共同提供了对优化行为、分割准确性和类别级性能公平性的洞察。在接下来的段落中,我们将更详细地定义这些指标。
交叉熵损失:在1D U-Nets的上下文中,交叉熵损失是训练期间使用的主要目标函数。它衡量分类模型的性能,该模型的输出是0到1之间的概率值。
交并比(IoU):也称为Jaccard指数,IoU是一种空间或时间一致性指标,评估预测段与真实段的重叠程度。
宏F1:F1分数是精确率和召回率的调和平均值。在多类1D分割中,我们使用宏版本以确保所有类别得到平等对待。
模型评估结果
下表中,模型名称以M
| 名称 | CE损失 | IoU | 宏F1 |
|---|---|---|---|
| M3_7_8 | 0.1120 | 0.8809 | 0.9345 |
| M3_7_32 | 0.0862 | 0.9009 | 0.9462 |
| M3_14_8 | 0.1108 | 0.8823 | 0.9354 |
| M3_14_32 | 0.0835 | 0.9042 | 0.9482 |
| M3_21_8 | 0.1047 | 0.8857 | 0.9374 |
| M3_21_32 | 0.0847 | 0.9060 | 0.9493 |
| M7_7_8 | 0.1714 | 0.9001 | 0.6186 |
| M7_7_32 | 0.0765 | 0.9129 | 0.9721 |
趋势表明,使用具有高扩张率的小内核可以提供与具有小扩张率的大内核相似的性能。这表明我们的模型在对信号区域进行分类时,很少使用高频域的信息。利用这一知识,我们可以通过同时降低采样率和内核扩张率,在假设的部署中节省大量内存,从而能够将模型与成本更低的硬件配对,例如患者可以带回家的边缘设备。
在观察一般结果和趋势后,检查模型如何为给定ECG样本输出预测也很有启发性。预测与真实情况非常接近。
性能缩放结果
在我们的超参数探索过程中,我们发现了一个有趣的配置,其性能远超其大小相对于更大模型的预期。具有两个输入特征和编码器-解码器深度为四层的模型实现了与更大模型相似的训练动态。
这个例子突显了广泛超参数探索的好处;缩放的影响很少是线性的,大小和性能的理想平衡可能存在人们最意想不到的地方。
解决AI诊断中的障碍
实现临床级可靠性需要克服数据完整性和多样性的障碍。主要挑战在于数据稀缺和碎片化;高质量的ECG数据集通常被孤立在专有的医院网络内,难以聚合所需的大量数据进行稳健训练。当数据可用时,它通常高度不平衡,因为健康的心律自然比罕见的病理多。为了解决这个问题,我们使用战略性类别重加权和罕见形态的聚类,以确保模型对关键的、不太频繁的事件保持敏感。
此外,信号变异性仍然是一个技术障碍。在不同设备上记录的ECG通常在采样频率和导联放置上有所不同。我们通过数据归一化和重采样技术来缓解这个问题,以创建通用信号语言。最后,我们考虑人口统计变化;年龄、生物性别和既往病史等因素可能会微妙地改变ECG形态。通过策划反映广泛患者群体的多样化训练集,我们确保我们的模型在所有人口统计学特征上都能准确泛化,从平均结果向个性化临床可靠性迈进。
创新路线图:AI驱动的ECG分析的未来
展望下一代心脏诊断,我们的开发路线图侧重于从二元检测过渡到对心脏健康的更全面理解。将深度学习技术应用于生物时间序列分析可以提高临床效率,减少认知负荷,减少临床医生必须筛选以识别感兴趣信号的噪声量。我们的心脏U-Net示例展示了一个足够轻量级的模型,可以在小型、廉价、非联网的ECG记录系统上运行,同时仍然作为有效的临床辅助工具。
AI在医疗设备中的未来在节省时间的应用中显得特别有希望,其中模型提供改进的信息,以支持更快、更清晰的临床决策。Starfish Medical已做好充分准备,应对新兴机遇,帮助客户推进其开发工作。
参考文献
Liu X, Wang H, Li Z, Qin L. 深度学习在ECG诊断中的应用:综述. 基于知识的系统. 2021年9月5日;227:107187.
Pyakillya B, Kazachenko N, Mikhailovsky N. ECG分类的深度学习. 物理学杂志:会议系列 2017年10月1日 (第913卷, 第1期, 页012004). IOP出版社.
Murat F, Yildirim O, Talo M, Baloglu UB, Demir Y, Acharya UR. 使用ECG信号进行心跳检测的深度学习技术应用-分析与综述. 生物医学中的计算机. 2020年5月1日;120:103726.
数据集来源
MIT-BIH心律失常数据库v1.0.0
MIT-BIH正常窦性心律数据库v1.0.0
MIT-BIH室上性心律失常数据库v1.0.0
圣彼得堡INCART 12导联心律失常数据库v1.0.0
Ronneberger, O., Fischer, P. and Brox, T., 2015年10月. U-net: 用于生物医学图像分割的卷积网络. 国际医学图像计算和计算机辅助干预会议 (第234-241页). Cham: Springer国际出版.
作者简介
Ali Bahrani是StarFish Medical的全栈和系统软件工程师,在为医疗和金融系统构建高性能、安全关键软件方面拥有5年以上经验。专注于C++和云原生架构,提供生产级应用程序、DevOps管道和ML驱动服务。在敏捷和受监管环境(ISO 13485)方面有经验,重点关注可靠性、测试和现代化遗留系统。
Thor Tronrud博士是StarFish Medical的机器学习科学家,专门从事机器学习工具的开发和应用。此前是一名天体物理学家,从事磁流体动力学模拟工作,Thor于2021年加入StarFish,已将机器学习技术应用于包括图像分割、信号分析和语言处理在内的问题。
标题图片:Adobe Stock
【全文结束】

