心血管疾病是全球主要的死亡原因。随着心电图机日益普及,用于心律失常检测的被动监测已成为可能。本研究强调了自监督学习在心律失常检测中的重要性,通过利用大规模未标记心电图数据来提高性能并减少对类别不平衡和噪声的过拟合。我们提出了掩码补丁建模(MPM),并使用820万个未标记心电图进行自监督预训练,推出了PatchECG,一种可针对各种心电图任务进行微调的一维Transformer模型。PatchECG在标准数据集上取得了最先进的结果,包括PTB-XL多标签分类,并在迄今为止最大、质量最高的多标签数据集上设立了新的基准。与现有方法相比,PatchECG的计算效率提高了五倍,同时模型容量增加了14倍。我们还将一维PatchECG模型与最先进的二维视觉Transformer模型HeartBEiT进行了比较,观察到明显的性能提升。最后,消融研究揭示了在处理类别不平衡、标签噪声和过参数化方面,性能提升了2%。这些发现证明了自监督学习在推进自动化心律失常检测方面的潜力。
根据世界卫生组织的数据,心血管疾病是全球主要的死亡原因,占全球所有死亡人数的32%。心血管疾病每年对欧洲和美国经济造成的负担估计分别为2100亿欧元和5550亿美元。
基于心电图的人群筛查可以早期发现心血管疾病,并有助于预防危及生命的并发症。最常用的方法是标准的12导联心电图,这是一种非侵入性的监测形式。然而,全球每年进行超过3亿次心电图,人工监测在实践中的劳动强度和时间消耗都过大,除非人工智能能够帮助减轻工作量。随着通过动态心电图监测器(如Holter监测器)和消费电子产品(如Apple Watch、FitBit等)进行的心电图监测普及,收集到的心电图数量只会增加,因为监测已扩展到临床环境之外。然而,这也提供了一个进行实时检测的机会——这是手动无法完成的——用于时间关键性事件,同时筛查偶发性的阵发性心律失常。
最近将现代深度学习方法应用于心律失常检测的工作取得了令人难以置信的成果,其性能优于受过培训的心脏病专家,且速度快至毫秒级。然而,这些方法在推广到现实世界数据时已被证明是脆弱的,这些数据经常受到各种信号污染物的影响。这可能导致严重失败,如误诊和“警报疲劳”,即医疗专业人员会忽视可能挽救生命的警报,因为他们对假阳性越来越不敏感——这种情况被认为是顶尖的健康技术危害之一。
此外,随着深度学习研究的快速发展以及近年来大规模心电图数据集的引入,基准研究中探索的方法已被相邻研究领域(如自然语言处理)提出的新方法所超越。利用这些方法以及迅速增加的标记和未标记数据,是推动实时监测可部署系统持续进步的主要驱动力。
尽管随着深度学习的兴起,自动化心血管疾病检测的进展保持一致,但仍然存在严重问题。首先,缺乏一个足够灵活的标准环境来支持未来的工作,包括快速原型设计新的机器学习架构和想法。以前提供这种环境的许多尝试要么是对公众不可用的私人开发成果,要么缺乏允许与最先进模型进行公平比较的多样化实验。这项工作建立在一个新颖的环境之上,该环境汇集了该领域最大的公开可用数据集,同时也为未来的工作提供了标准的测试平台。
先前关于心脏超声分割的研究已经证明了在心脏领域利用大规模数据集进行自监督学习的潜力。基于这些见解,我们的工作将重点转移到使用心电图数据进行心律失常检测——这是一个涉及分析一维信号时间模式的独特挑战。通过调整在超声分割中已被证明有效的自监督预训练原则,我们引入了掩码补丁建模(MPM)来解决心电图数据的独特特征,从而将自监督技术的适用性扩展到这一领域。
先前工作的第二个主要问题是缺乏在一维数据上预训练的大规模模型。尽管先前已尝试提供这样的标准模型,但它们使用了二维视觉Transformer,将心电图数据作为图像接受,模仿临床医生对心电图波形的视觉评估。特别是,HeartBEiT模型在ST段抬高型心肌梗死分类中获得了最先进的性能,同时成功地将模型扩展到约8600万个参数。然而,将信号解释为图像数据会压缩可用信息,包括大片无意义的空白区域,并且不必要地增加了模型的复杂度。
近期的进展伴随着大规模心电图基础模型的出现而加速。这些模型利用数百万条心电图记录来学习适用于各种临床任务的通用表示。然而,大多数大规模工作集中在基于二维图像的方法或多模态心电图+文本基础模型上,后者需要配对的临床报告。这种集中留下了一个重要的空白:理解基于一维信号的模型如何随着数据和模型容量的增加而扩展,以及原生一维心电图处理的时间保真度是否能达到或超过二维图像压缩方法。我们的工作通过证明带有掩码补丁建模的一维视觉Transformer能够利用大规模未标记心电图数据实现最先进的性能,同时与二维替代方案相比保持5倍的计算效率,填补了这一空白。
总之,本文提出的主要贡献如下:
- 我们引入了一个统一的环境,汇集了最大的公开可用标记和未标记心电图数据集(820万未标记样本,26.8万标记样本),为微调和识别最优的一维Transformer架构及预训练任务创建了一个新的基准。
- 我们提出了PatchECG网络,一种专为心电图数据定制的新颖架构,并调整了视觉Transformer中的掩码自编码预文本任务,以创建一种计算高效的预训练方法。这种方法使我们能够用仅1/5的资源训练出迄今为止最大的公开可用心电图模型(约8500万个参数),为下游任务提供了一个基础模型。
- 我们证明了自监督学习在处理含噪数据并获得最先进结果方面的有效性。我们的消融研究表明,随着数据量的增加,专门技术的重要性会降低。这一观察结果与先前研究的结果一致,强调了扩展规模、计算资源和数据是实现机器学习中通用且稳健解决方案的关键因素。
- 通过解决如数据有限、类别不平衡、标签噪声和过参数化等关键挑战,与PatchECG模型一起实现了超过2%的性能提升。该模型在大规模数据集上设立了新的基准,并在PTB-XL等较小数据集上取得了最先进的结果。
- 本研究中进行的比较实验是文献中最全面的之一,包括在新数据集上的评估和与最先进方法的比较。这为未来的研究提供了一个稳健的基线。
科学贡献:
- 我们提供了迄今为止最全面的证明,表明一维信号处理对于大规模心电图分析既充分又在计算上优于(效率高出5倍)二维方法,支持并扩展了先前主张直接信号处理的工作。
- 我们提供了经验证据,表明自监督学习能够有效地利用未标记的心电图数据(820万个样本)进行扩展,从而训练出最大的公开可用心电图模型(8500万个参数)。
- 我们引入了关于模型容量、隐式偏差和数据集大小之间关系的新见解,表明卷积偏差在大规模设置下会导致过早饱和,而普通Transformer则继续受益于更多的预训练数据。
临床相关性:
- 该模型的置信区间变异减少了10倍,表明每个患者的预测更加一致,这对于临床部署至关重要,因为跨不同患者表现的预测稳定性至关重要。
- 展示的标签置信度与模型性能之间的相关性为识别可能需要临床复查的潜在错误标记数据提供了一个框架,解决了医学数据集管理中的一个基本挑战。
- 5倍的计算效率使得在资源受限设备上实现实时监测的潜在应用成为可能,尽管在部署前需要进行临床验证研究。
这些贡献共同建立了一个可扩展、高效且通用的框架,具有在自动化心律失常检测实际应用中的潜力。
结果部分展示了该研究的实验结果。
(注:由于原文“Results”部分包含大量具体数据、表格和详细分析,为保持译文准确性和完整性,此处翻译核心要点,具体数值和表格内容参见原文。)
结果部分包含三个主要分类任务:PTB-XL数据集多标签分类、统一数据集多标签分类和PTB-XL数据集STEMI二分类。研究首先比较了不同一维Transformer架构,发现普通ViT受益于预训练最多,因此被选为PatchECG模型的基础。在PTB-XL多标签分类任务中,PatchECG模型性能与当前最先进的LSTM模型非常接近,但线性评估分数显著更高,证明了其学习到的表征能力更强。在统一数据集上,PatchECG模型取得了最佳性能,并且置信区间明显更窄,显示了对不同数据样本更稳定的表现。在STEMI二分类任务中,PatchECG模型在AUROC和AUPRC指标上均显著优于二维基础模型HeartBEiT。
此外,研究还对结果进行了深入探讨,包括模型效率比较(PatchECG在参数多14倍的情况下,预训练速度是LSTM的5倍)、标签噪声问题(分析了PTB-XL数据集中标签置信度与性能的相关性),以及与多模态心电图基础模型和掩码自编码方法的对比。研究表明,一维信号处理和MPM方法对于心电图分析是有效且计算高效的,并且隐式偏差较少的架构在数据规模增大时表现更好。该工作也指出了未来研究方向,包括可解释性、导联子集鲁棒性、少样本学习等,并强调了其基础模型的潜力。
方法部分详细介绍了研究中使用的大规模数据集(包括Ribeiro、CinC-2020、Chapman-Shaoxing、PTB-XL等)、数据预处理(重采样至100Hz,10秒时长,零填充等)、基线模型(PatchTST、MLE-ViT、ViT、LSTM等)、PatchECG模型的具体改进(测试时增强、特殊标记、逐层衰减)以及自监督学习框架(掩码补丁建模MPM)和低秩适应(LoRA)微调技术。
总的来说,本研究表明,PatchECG和掩码补丁建模提供了一种比现有方法更高效、更稳定、可扩展性更强的解决方案,并随着更多数据的可用而具有持续改进的潜力。结果清楚地证明了自监督学习对于推进心电图心律失常检测的重要性,同时为未来利用心电图数据的研究提供了一个基础模型。
【全文结束】

