问题与动机
心脏心律失常,即异常心律,是美国及全球范围内导致发病率和死亡率的主要且诊断不足的原因。
- 疾病范围
- 心房颤动(AFib) 目前影响约1050万美国人,预计到2030年将超过1200万。房颤使中风风险增加五倍,并带来数十亿美元的年度医疗费用。(来源)
- 其他临床显著的心律失常 同样重要但远未被充分检测:
- 室性心动过速/心室颤动(VT/VF)导致美国每年约18万至30万例心源性猝死中的大多数。(来源)
- 阵发性室上性心动过速(PSVT/SVT)每年产生约18.9万例新发症状病例和数万次急诊就诊。(来源)
- 心房扑动(AFL)、病态窦房结综合征和高等级房室传导阻滞等缓慢性心律失常,以及高负荷室性早搏(PVC)均具有中风、晕厥或心肌病的显著风险。
- 检测缺口
- 消费级可穿戴设备(Apple Watch、Fitbit、Garmin)仅捕获短期、单导联、用户启动的心电图,并仅可靠分类房颤,遗漏了大多数危及生命或致残的心律(VT/VF、SVT、高等级缓慢性心律失常、高PVC负荷)。
- 临床监测设备(Holter、Zio贴片、植入式循环记录仪)提供连续多导联数据,但需处方、昂贵且缓慢,需要设备归还和人工审核,延误干预。
结果是关键的人群层面缺口:数百万出现间歇性心悸或心脏风险升高的患者没有及时、低成本的方法来检测或预测房颤以外的严重心律失常。
想象一位55岁的患者凌晨2点心悸,打开应用程序,上传可穿戴设备的心电图,并立即获得是否应联系医生的指导。
漏诊或延迟诊断会导致可预防的中风、心源性猝死、心力衰竭进展以及可避免的医疗支出。
我们的项目旨在通过开发一种基于移动边缘设备的心律失常检测与早期预警系统来弥补这一缺口。该系统可输入用户已生成的数据(消费级心电图、可穿戴心率/PPG流或上传的心电图报告),并在设备端进行分类和短期预测。
通过将深度学习与生理验证相结合,我们可以提供可信赖的实时洞察,将更广泛危险心律的心律失常护理从被动转变为主动。
数据源与数据科学方法
数据源
Chapman 12导联心电图数据库
用于模型训练、验证和测试。
- 12导联
- 45,152条记录
- 每条记录5000个样本
- 500 Hz
- 97个独特的心律失常标签
Zheng, J., Guo, H., & Chu, H. (2022). A large scale 12-lead electrocardiogram database for arrhythmia study (version 1.0.0). PhysioNet. RRID:SCR_007345.
Apple Watch Series 9 心电图数据 (Recas et al., 2025)
用于标准化来自不同来源的信号。
- 180条记录
- 每条记录15,000个样本
- 512 Hz
Recas, J., Buelga Suárez, M., González-Cabeza, S., Sanz-Guerrero, M., Diaz-Vicente, M., Rebolleda, A., Piñuel Moreno, L., & Alonso Salinas, G. L. (2025). Electrocardiogram-Capable Smartwatches: Assessing Their Clinical Accuracy and Application (version 1.0.0). PhysioNet. RRID:SCR_007345.
数据科学方法
我们的数据科学方法从一个精心设计的雄心起点开始:一个包含超过100种不同SNOMED编码心律和诊断标签的大型心电图数据集。即使最终产品只需要检测少得多的心律失常子集,使用如此丰富的标签空间也是有意为之。广泛且临床多样的数据集迫使模型学习更深层次、更普适的心脏电活动表征,而不是对窄的、人工挑选的心律子集过拟合。许多罕见心律失常共享细微的形态学特征或频率模式,让模型接触这些变异性有助于其理解“正常”和“异常”在广泛范围内的表现,即使只有少数类别随后会在可穿戴设备中呈现。
接下来,关键的科学问题是:我们能否利用完整12导联心电图中的信息来训练一个单导联模型,使其学习到自身永远无法发现的特征?在医院环境中,临床医生解读12导联心电图正是因为它们提供了心脏的多个空间视图。相比之下,单个可穿戴导联本质上是有限且嘈杂的。与其孤立地训练一个1导联模型并希望它重新发现有用的模式,我们首先在完整的12导联数据上训练一个更强的“教师”模型。该教师模型利用多导联信息的丰富性和所有可用标签,学习区分窦性心律和心律失常,并进一步对心律失常进行亚型分类。
然后,我们使用知识蒸馏将该专业知识迁移到一个仅观察单导联的“学生”模型中,模拟腕戴设备的限制。教师模型生成各类别的软概率分布,编码诸如“主要是房颤但带有部分类似SVT特征”或“介于正常和异位之间”的细微判断。学生模型被训练为在同一示例上匹配这些软输出,从而在仅观察一个通道的情况下有效学习12导联决策边界的近似。这使得学生模型能够内化那些仅靠单导联监督极难推断的特征交互和心律失常模式。
最后,我们将教师和学生模型构建为两级层次结构——首先检测是否存在任何心律失常,然后分类其亚型,使得单导联模型可以在每一步专注于更简单的决策。第一级优化为敏感的心律失常检测器,第二级仅在心律失常段上训练,以区分房颤、APB、SA和其他心律失常。学生模型结合这两个阶段,从单导联产生连贯的多类预测。总之,广泛且丰富标注的12导联数据集以及教师-学生架构使我们能够测试一个核心假设:在强大多导联教师指导下,单导联可穿戴设备可以接近12导联系统的临床洞察力。
评估
模型评估
我们的模型在广泛心律类别上表现出强劲性能,但在区分更具体的心律失常时显示出有意义的局限性。对于窦性心律,指标始终很高:召回率达到69%,精确度为83%,表明模型通常能够正确识别该类别且假阳性较少。对其他心律失常的性能同样强劲,F1得分为70%。然而,该类别的Brier分数较高表明虽然预测通常正确,但模型的置信度估计校准度较差。
相比之下,更细粒度的心律失常仍然具有挑战性。房颤召回率适中(53%),但精确度和F1得分非常低,表明模型错误地将许多非房颤病例标记为房颤。窦性心律失常和房性早搏遵循类似模式:尽管这些心律在数据集中存在,但模型很少正确预测。两个类别的精确度介于5%至8%之间,表明即使模型尝试识别这些心律,通常也是错误的。
总体而言,评估突显了一个明确趋势:模型在常见的高层次模式上表现可靠,但在捕捉频率较低、临床重要心律失常的细微差别方面存在困难。改进类别平衡、纳入更多代表性样本以及优化特征提取可能有助于模型在未来的迭代中更好地区分这些微妙的心律类型。
关键学习与影响
学习#1:来自不同来源的信号
不同心电图硬件系统使用各种心跳感应技术,导致信号具有不同的频率、幅度缩放和噪声特性。缺乏设备特定信号预处理的可视性使得模型泛化成为一项非平凡任务,因为不同信号将限制模型对Apple Watch心电图数据进行推理的能力。为了对齐这些信号,我们设计了一个符合常见心电图标准的清理过程,并使用功率谱密度图分析信号。
对齐来自临床心电图机和Apple Watch等消费设备等来源的信号,确保用于心律失常检测或心脏健康监测的预测模型能够可靠地泛化。这提供了几个实际好处:
- 跨设备兼容性:在一种类型的心电图上训练的模型可以准确解释来自其他设备的数据,减少了对单独管道或重新训练的需求。
- 改进的诊断一致性:清理和标准化信号可最小化噪声和伪影,导致更可靠的特征提取和下游预测。
- 可扩展部署:预处理步骤允许更无缝地集成新的心电图源,支持大规模健康监测应用。
过程:
- 应用4阶巴特沃斯带通滤波器
- 将信号重采样到公共采样率
- 执行z-score归一化
- 移除畸形数据以改进模型训练
学习#2:显著的类别不平衡
我们的数据集包含超过45,000个十秒心电图段,每个段大约有10-15个心跳,但真正的心律失常是罕见事件。因此,绝大多数样本是正常窦性心律,而心律失常案例稀疏地分布在超过107种不同的SNOMED编码诊断中。这种极端的类别不平衡使得模型学习并可靠检测罕见但临床关键的心律失常特别具有挑战性。
为了解决不平衡问题:
- 聚焦标签集:我们将任务缩小到一组临床重要心律失常的子集,而不是尝试建模所有可能的心律,这减少了混淆并将模型能力集中到最关键的地方。
- 集成加权:我们使用从集成模型导出的类别权重来更好地应对类别不平衡,在训练期间放大罕见但关键心律失常的影响。
- 两级层次架构:我们采用分阶段设计,一个模型首先检测“任何心律失常 vs 窦性心律”,然后第二个模型对心律失常亚型进行分类,提高了对罕见类别的敏感性,同时避免了被多数SR类别主导。
学习#3:单导联数据受限
大多数心律失常通过12导联心电图诊断,这提供了心脏每个腔室运动的完整图像。尝试从健身可穿戴设备检测特定心律失常很困难,因为信号有限、有噪声且通常是间接的。大多数可穿戴设备使用光学传感器(PPG)或源自微小接触区域的单导联心电图,而不是临床使用的丰富12导联心电图。模型只能看到心脏电活动的一个狭窄视图,空间信息减少,信号质量较低。日常条件如运动、汗水、接触不良或皮肤导电性差会引入运动伪影和噪声,很容易掩盖微小的节律变化,尤其是在短暂或间歇性心律失常中。
第二个挑战是许多临床重要的心律失常(如房颤、SVT或短暂的VT发作)既罕见又偶发。可穿戴设备可能记录数小时的完全正常窦性心律,只有几秒的异常活动(如果有的话)。在该环境中收集高质量、准确标注的训练数据很困难:需要同步的临床确认,而大多数用户从未用金标准设备捕获这些事件。
我们的模型尝试用大型12导联数据集训练边缘设备模型。由于单个可穿戴导联仅看到心脏活动的一个狭窄片段,我们首先在完整12导联心电图(其中心律失常更容易识别)上训练一个“教师”模型。该教师学习每种心律的更丰富表示,并为房颤、SVT、APB、SA和其他模式生成校准的“软”概率。然后训练1导联学生模型模仿这些输出,有效地将12导联知识提炼成可以在可穿戴设备上运行的形式,同时尽可能保留诊断信号。
致谢
我们要感谢Yann Fleureau在可穿戴设备市场和数据集方面的宝贵见解。我们还要感谢Saheli Nandi提供的富有思想的医生视角,帮助指导了我们的工作。最后,感谢Zona和Morgan本学期的所有支持和指导。
【全文结束】

