睡眠脑电图中的大脑健康:一种用于认知、疾病和死亡率的多队列深度学习生物标志物(PDF) Brain Health from Sleep EEG: A Multicohort, Deep Learning Biomarker for Cognition, Disease, and Mortality

环球医讯 / AI与医疗健康来源:www.researchgate.net美国 - 英语2026-08-29 14:00:33 - 阅读时长19分钟 - 9038字
本研究利用深度学习技术分析来自六个大型队列的36,000份睡眠脑电图记录,开发了一种客观、整合的大脑健康生物标志物。研究团队创建了一个端到端、多任务深度学习框架,该框架能够从夜间睡眠脑电图中学习大脑健康的1024维潜在表示,并提炼为一个单一的、具有临床解释性的大脑健康评分(BHS)。研究发现,BHS能有效预测认知表现、疾病风险和死亡率,其预测能力显著优于传统人口统计学和专家定义的脑电图特征模型,为大脑健康评估提供了新方法。研究表明,睡眠脑电图中的信息远比传统睡眠指标所显示的更丰富,可以用来评估大脑的整体健康状况,有望成为预防认知衰退、早期诊断神经退行性疾病和优化健康干预的有力工具。
睡眠脑电图大脑健康深度学习生物标志物认知疾病死亡率多队列
睡眠脑电图中的大脑健康:一种用于认知、疾病和死亡率的多队列深度学习生物标志物

摘要

背景:睡眠是认知功能、疾病预防和整体大脑健康的关键决定因素,但客观、整合的大脑健康生物标志物仍然缺乏。我们假设夜间睡眠脑电图(EEG)可以为这种生物标志物提供基础。我们探讨了一种新开发的端到端、数据驱动的睡眠脑电图深度学习框架是否能够学习大脑健康的潜在表示,并将其提炼为与认知、疾病状态和死亡率相关的单一评分。

方法:我们分析了来自六个队列的27,000名受试者的36,000份多导睡眠图记录。脑电图数据表示为一维时间序列或二维时频谱图。一个多任务深度神经网络(无需专家定义特征即进行端到端训练)学习了1024维的大脑健康潜在空间,并共同预测认知表现、疾病状态和睡眠指标。潜在表示被进一步提炼为单一的大脑健康评分。我们将该模型的性能与人口统计学基线、传统脑电图指标(如快速眼动比例、棘波密度)和经典多元机器学习方法进行了比较。

结果:深度学习衍生的大脑健康评分在所有比较中始终超越了人口统计学和专家定义的脑电图特征模型。对于认知结果,相关性(r)从较小(仅人口统计学)提高到中等水平(最高r=0.40);疾病分类的受试者工作特征曲线下面积从基线的0.50-0.55提高到0.65-0.75。在年龄调整的Cox模型中,大脑健康评分增加一个标准差,死亡风险降低了31%-35%(风险比0.65至0.69;P<0.0001),超越了传统脑电图指标。与经典机器学习相比的提升以及潜在空间的可视化表明,既有的生理标记和新型脑电图特征共同推动了性能的提升。

结论:多任务、端到端深度学习方法生成了一种可解释的、源自睡眠的大脑健康生物标志物。通过建模认知、疾病和死亡率,这一框架提供了大脑健康的稳健指数,且可能扩展到其他模式,进一步增强其临床效用。(由美国国立卫生研究院等资助。)

引言

睡眠是大脑和全身健康的关键决定因素,影响认知、疾病风险和长期神经学完整性。多种神经生物学过程参与其中,包括慢波睡眠期间的突触稳态、记忆巩固和代谢废物的类淋巴系统清除。睡眠还调节内分泌、代谢、自主神经和免疫功能,其中慢波睡眠以副交感神经占主导,快速眼动(REM)睡眠则具有独特的自主神经和生理动态特征。因此,睡眠紊乱或不足与神经、心血管和精神障碍的升高风险密切相关。

大型流行病学研究已经记录了睡眠特征与认知及不良健康结果(包括痴呆、情绪障碍、心血管疾病和死亡率)之间的关联。然而,这些文献大多依赖于单变量或狭窄的多变量分析个体睡眠指标,这可能低估了睡眠生理学中编码的多维信息。睡眠脑电图(EEG),直接捕捉整晚的脑部活动,代表了关于大脑健康的一个极其丰富但未充分利用的信息源。先前研究表明,睡眠脑电图特征的改变——如棘波活动减少或慢波模式紊乱——可能先于认知能力下降和神经退行性疾病。

人工智能(AI)的最新进展,特别是卷积神经网络和Transformer等深度学习架构,为建模EEG等复杂生理信号提供了新机会。这些方法能够进行层次化特征学习并捕获长程时间依赖性,允许从原始数据中提取丰富的潜在表示,而不是依赖专家定义的特征。因此,这种方法可能更好地反映睡眠和大脑健康的整合、系统层面性质。

在此,我们整合了一个大型多队列数据集,并开发了一个端到端、多任务深度学习框架,该框架将夜间睡眠脑电图直接映射到与大脑健康相关的结局,包括认知、疾病状态和死亡率。该模型学习了大脑健康的1024维潜在表示,从中我们推导出一个单一、具有临床解释性的大脑健康评分。通过同时优化多个结局,该框架最小化了对预定义脑电图特征的依赖,而是利用完全数据驱动的表示学习。

我们假设这种潜在表示及其提炼评分将在预测认知表现、疾病风险和生存方面优于传统睡眠指标和经典多元机器学习方法。因此,本研究旨在(1)利用迄今为止整合的最大多队列睡眠脑电图数据集,检查睡眠脑电图与大脑健康之间的关联和预测关系;(2)引入一种人工智能方法,将复杂的神经信号合成为个体化、临床可用的生物标志物。

方法

数据收集

我们汇编了多个独立队列的夜间多导睡眠图(PSG)和认知或疾病相关数据:马萨诸塞州总医院(MGH)具有神经心理测试(MGH-COG)和简易精神状态检查(MGH-MMSE)的患者;弗雷明汉心脏研究(FHS);多族裔动脉粥样硬化研究(MESA);男性骨质疏松性骨折研究(MrOS);骨质疏松性骨折研究(SOF);以及韩国基因组和流行病学研究(KoGES);以及具有电子健康记录信息但没有标准化认知测试的MGH患者。

这些数据集包括以家庭为基础的大型队列(FHS、MESA、MrOS、SOF和KoGES)进行的家庭睡眠研究,以及代表为睡眠、神经、精神和心血管代谢状况进行评估的患者的MGH临床实验室PSG队列。

所有分析均获得了机构审查委员会的批准,适用时豁免知情同意,外部数据在地方批准和数据使用协议下获得。睡眠和认知评估的时间接近度因队列而异:在MGH-COG和KoGES中不超过20天;MGH-MMSE和FHS中平均(±标准差)延迟分别为2.1(±2.1)年和0.7(±1.0)年;在MESA、MrOS和SOF中通常不超过2年。所有疾病诊断反映了受试者在睡眠记录时的状况。

疾病分类和匹配程序

对于MGH队列,疾病诊断从电子健康记录中提取,如先前所述。在SOF和MrOS中,抑郁症通过老年抑郁症量表评估;SOF中的痴呆诊断通过标准化自报告问卷获得。疾病受试者根据联合年龄-性别分布与对照组匹配,通过双样本Kolmogorov-Smirnov检验验证其可比性。

认知变量标准化

认知测量值(见表1)通过队列内z分数标准化。主要结局为来自已建立的神经心理学构建的复合流体、结晶和总认知评分;认知测试的个别分析被视为探索性(见附录补充材料,认知测试分组部分)。

模型开发

我们开发了两种建模方法:(1)使用手工工程特征和传统机器学习的基线模型;(2)深度学习模型。

睡眠特征计算

脑电图特征从中央通道(C3-M2)计算,所有PSG中均如此;家庭研究使用两个中央通道,而MGH实验室研究整合了六个通道(F3-M2、F4-M1、C3-M2、C4-M1、O1-M2和O2-M1)。我们提取了452个基于时间、频谱和复杂度的脑电图特征,68个棘波和慢振荡特征(使用LUNA工具),以及25个宏观睡眠特征(例如睡眠阶段持续时间、呼吸暂停-低通气指数、缺氧负担、觉醒和肢体运动指数),这些特征均依据美国睡眠医学会指南。所有特征都进行了受试者层面的z分数标准化。

经典机器学习模型

我们在每个队列内使用三种预测器集对Elastic Net、随机森林和XGBoost模型进行基准测试:(1)人口统计学,(2)人口统计学加上宏观睡眠和呼吸变量,(3)人口统计学加上专家定义的脑电图特征。由于性能在方法间没有显著差异,Elastic Net作为代表性经典基线报告。

深度学习——睡眠脑电图大脑健康潜在空间

一个单一的多任务模型在合并的多队列数据集上进行训练(不创建特定队列的模型)。仅使用C3-M2脑电图通道。信号进行带通滤波(0.3-30 Hz),重采样至200 Hz,并填充至每条记录11小时。使用三种输入格式:(i)一维时间序列,(ii)多锥谱图,(iii)小波谱图,每个具有1秒分辨率和100个频率通道。

两个端到端架构(谱图和时间序列)将整晚脑电图编码为共享的1024维潜在表示("睡眠脑电图大脑健康潜在空间")。两者使用具有三层深度可分离卷积神经网络主干的共享编码器-解码器设计,后接捕获长程时间-频率依赖性的MaxViT(多轴视觉Transformer)和Transformer块。

从潜在空间,该模型通过线性回归头预测认知表现,训练时使用Huber损失;并通过逻辑回归头预测疾病状态,操作灵活地处理每个记录可用的标签。通过预测整晚睡眠生理指标和30秒睡眠分期(使用U-Net解码器),添加了辅助监督,提供密集目标,稳定优化;移除这些任务会导致潜在空间崩溃(图S12)。

在端到端训练过程中——即模型从原始脑电图到所有输出进行自动化单一管道学习——编码器和所有任务特定头(即认知、疾病、辅助生理和睡眠分期)都使用加权多任务目标进行联合优化:

• Lcog = 平均Huber损失,适用于该记录可用的所有认知测试。

• Ldx = 适用于该记录可用疾病标签的二元交叉熵损失的加权和。

• Laux = 适用于该记录的辅助生理回归目标的平均Huber损失。

• Lstage = 该记录睡眠阶段序列的分类交叉熵损失。

总损失 = ωcogLcog + ωdxLdx + ωauxLaux + ωstageLstage,其中{ωcog, ωdx, ωaux, ωstage} = {0.55, 0.30, 0.11, 0.04},且Σωcog,dx,aux,stage = 1。

最终线性头通过线性组合1024维潜在特征导出单一的大脑健康评分(BHS),该头在训练后的潜在表示上进行事后训练。其目标整合任务损失,使得较高分数表示更好的认知(受试者可用认知测试分数的平均值)和较低的疾病风险(受试者可用疾病类别的平均值):

BHS = α × BHS_cognition + (1−α) × BHS_disease

其中,BHS_cognition = (1/N)ΣHuber(r_i, 认知分数)

BHS_disease = -(1/M)ΣCE(i, 疾病)

BHS_total_loss = BHS_cognition - α × BHS_disease

在本工作中,我们将alpha设为0.7。敏感性分析显示,认知-疾病加权参数alpha(0.2-0.8)的扫掠显示了认知和疾病性能之间的平滑权衡(图S11)。最终BHS进行了z分数标准化。

标签可用性和训练逻辑

所有记录都通过完整模型传递,但损失仅针对每个记录存在的标签计算。睡眠分期和辅助生理损失始终活跃,而认知和疾病损失在不存在时被掩码,避免了数据排除或插补。

交叉验证

使用参与者层面划分、结局分层和队列平衡进行了五折交叉验证,以防止信息泄露并确保独立评估(图S3)。

预测模型的评估指标

认知使用Pearson相关系数(r)和中位绝对误差评估;疾病分类使用受试者工作特征曲线下面积(AUROC)和精确度-召回曲线下面积(AUPRC),并附带bootstrap置信区间(100,000次重采样)。疾病性能还在固定特异性操作点(50%、75%和80%)进行评估。模型比较、分层分析、集成梯度和均匀流形近似和投影(UMAP)可视化在附录补充材料的方法部分有详细说明。

睡眠脑电图预测大脑健康的表现优于人口统计学和睡眠宏观指标

表S2A和图3显示了人口统计学单独和睡眠脑电图大脑健康潜在空间的预测结果。图3添加了传统睡眠宏观模型,并可视化了三个关键模型类别中代表性结局。所有结局的完整定量结果和四个模型的比较在表S2、S3和图S6中提供。

在各队列中,基于睡眠脑电图的深度学习表现优于所有使用人口统计学或睡眠宏观预测器的基线模型。流体认知——部分已由年龄驱动(人口统计学r=0.31,MGH;0.27,KoGES;0.23,MrOS;0.19,FHS;0.13,SOF)——小幅提升(Δr≈0.01-0.12)。结晶认知在MGH、FHS和SOF中提升更显著(Δr≈0.08-0.22),但在MrOS或KoGES中没有。在MESA中,总认知表现显著提高,r从0.30增加到0.38。在所有队列中,流体和结晶复合分数的改善保持一致,相关性增加通常处于从轻度到中度的范围,超过人口统计学基线。个别测试结果见表2。

在疾病预测方面,AUROC从约0.50-0.55提高到0.65-0.75,涵盖痴呆、轻度认知障碍(MCI)、主观下降、心房颤动、心肌梗塞、高血压、双相情感障碍和抑郁症,强调夜间脑电图捕捉到的病理相关特征远超年龄传达的信息。

睡眠脑电图大脑健康潜在空间优于经典机器学习

与使用专家定义脑电图特征的经典机器学习相比(表S3),睡眠脑电图大脑健康潜在空间通常表现相似或更好。在MrOS中结晶认知方面,以及在MGH中MCI、抑郁症、心房颤动和心肌梗塞方面,它显著更优。基于谱图的深度学习变体表现优于时间序列模型,被选为主要架构。使用小波作为输入的谱图比多锥谱图略好(详细结果见附录补充材料)。

睡眠脑电图大脑健康潜在空间:睡眠分期和传统指标

该模型准确执行了睡眠分期并预测了标准睡眠指标,主要作为正则化和自监督学习组件。它实现了SOTA(state-of-the-art)的睡眠分期表现,各队列间Kappa系数为0.85(混淆矩阵见图S14)。预测的睡眠特征与传统估计值紧密匹配:棘波密度(r=0.89),棘波-慢振荡重叠(r=0.98),慢振荡计数(r=0.85),REM潜伏期(r=0.82),睡眠后觉醒(r=0.84),以及非REM(NREM)中的相对三角波功率(r=0.89)。值得注意的是,尽管仅依赖EEG输入,该模型还以中等至较高的准确性估计了呼吸和肢体运动指标:呼吸暂停-低通气指数(r=0.65),缺氧负担(r=0.62),和肢体运动指数(r=0.63)。

临床操作点:敏感性-特异性权衡

在九种疾病中,深度学习模型实现了AUROC 0.68-0.75,始终超过人口统计学基线(0.50-0.69),在不同操作点上有明确的敏感性-特异性权衡(图3;图S7-S9)。在50%特异性时,敏感性达到约0.80-0.90,适用于筛查导向使用;在75%特异性时,敏感性保持中等水平(~0.55),精确度提高(~0.79-0.89);在80%特异性时,敏感性下降(~0.25-0.35)但精确度提高(~0.83-0.89)。这些结果表明,基于脑电图的生物标志物可以从筛查导向调整为更保守的决策场景。

大脑健康评分揭示认知和临床差异

在各队列中,BHS与年龄负相关(合并r=-0.34;图4C和图S8、S10)。当受试者按观察到的认知分数分层(前四分位数vs.后四分位数)时,高四分位数始终显示更高的BHS,通常在年龄亚组中具有统计学意义(图4A)。同样,患有情绪障碍或神经认知损害的受试者分数低于未诊断此类疾病的对照组(图4B),神经认知疾病显示总体分数最低。

个体层面检查

图S1(认知)和图S12(痴呆)展示了代表性个体的睡眠谱图和显著性图,突出显示模型如何处理脑电图特征以及误分类可能发生的场景。

值得注意的是,显著性图强调了NREM睡眠阶段(N2和N3)的两个不同的频段:等于或低于1 Hz的频率主要显示负显著性,表明慢振荡活动增加可能预测较低的认知分数;而1-3 Hz频段内显示正显著性,将三角波活动增加与预测较高认知联系起来。在纺锤体频率范围(11-16 Hz)内的显著性不太明显,可能由于这些显著性图的方法学限制。片段化睡眠时段(频繁转换到N2或觉醒)显示theta-alpha范围内的显著性增加。REM睡眠时段显示更分散的显著性,与REM特征的异质脑电图模式一致。

大脑健康评分预测全因死亡率

在年龄调整的Cox模型中,BHS每增加一个SD,在MrOS(风险比,0.71;P<0.0001;C指数,0.692)、FHS(风险比,0.85;P=0.28)、MGH(风险比,0.65;P<0.0001;C指数,0.81)和BIDMC(风险比,0.76;P<0.0001;C指数,0.62)中均预测较低的死亡率(图5)。在FHS中,风险比未达显著(风险比,0.85,P=0.28),但区分能力保持高位(C指数,0.755),与较低的事件发生率一致。添加BHS到年龄模型提高了区分能力(ΔC指数≈0.02),模型拟合度和风险分层,将最低和最高BHS四分位数之间的5年死亡风险降低了一半,显著改善个体风险分配。

与基于脑电图的大脑年龄指数的比较

在独立的BIDMC队列中,BHS和基于脑电图的大脑年龄指数(BAI)均在年龄调整的Cox模型中预测死亡率(BHS风险比,0.76每SD;P<0.0001;BAI风险比,2.09;P=0.038),但仅BHS在另一个指标存在下提供了增量价值:将BHS添加到age+BAI模型中显著改善了拟合(P<0.0001),而将BAI添加到age+BHS中则没有(P=0.39)。BHS还实现了最高的区分能力,包括最高C指数和最强5年时间相关表现。

多维潜在空间

UMAP对潜在空间的投影(图S2)揭示了与定量结果一致的结构化梯度和聚类。具有更高BHS的个体在潜在空间中聚集在以较长、较少片段化睡眠、更高REM比例以及更广泛年龄范围内的三角波和纺锤体活动为特征的区域,而低分值则与短、片段化的睡眠、减少的REM和纺锤体活动、较低的三角波功率和较大年龄相关。除了简单梯度外,嵌入还捕获了多维表型——例如,根据纺锤体密度和片段化分离具有相似三角波功率的个体——提供了内部验证,表明潜在空间将多个脑电图特征整合为临床有意义的表示。

讨论

本研究中,我们开发了一个多队列深度学习框架,该框架从夜间睡眠脑电图学习大脑健康潜在空间和综合BHS。该表示稳健预测了认知表现、疾病状态和各队列的全因死亡率。与人口统计学基线和使用专家定义脑电图特征的经典机器学习模型相比,BHS持续改进了预测性能。与认知相关的相关性从人口统计学模型的接近零提高到中等水平(最高r≈0.40),疾病分类从机会水平曲线下面积(~0.50-0.55)提高到约0.70-0.75,生存分析显示死亡风险显著降低(风险比低至0.65每SD),超过了传统睡眠脑电图指标。总的来说,这些发现支持核心假设:数据驱动分析睡眠脑电图能产生比传统睡眠测量更信息丰富和临床上相关的生物标志物。

这项工作的主要优势在于汇编数据集的规模和多样性,据我们所知,这是将整晚脑电图与认知、疾病和死亡率联系起来的最大多队列资源。这种广度使我们能够全面评估睡眠脑电图与大脑健康结果之间的关联性和预测关系。结果强调,整合的睡眠生理学表示捕获了大脑健康更多的方差,而非单独考虑的个体睡眠指标,支持从单变量标记转向多维脑电图衍生表型。

预测性能增益在不同结果领域有所不同。相对于人口统计学的改进对流体认知较为温和,但对结晶认知和疾病结果更为显著。这种模式可能反映了生物稳定性差异和测量对齐。流体认知能力波动较大,并受急性状态因素影响,而脑电图和认知测试都代表了可能不同步的单一快照。相比之下,结晶能力积累了数十年,可能与睡眠振荡中编码的长期神经生理完整性更紧密一致。疾病终点,特别是慢性疾病,可能在睡眠脑电图上留下更稳定和区分性标志,解释了为何观察到这些结果的更强分类性能。

操作点分析突显了框架的临床灵活性。较低特异性阈值产生较高敏感性,符合筛查导向使用;而更严格阈值提高精确度,适用于确认性场景。这些权衡表明,该框架导出的基于脑电图的生物标志物可以针对不同临床环境进行调整,尽管此类应用仍处于探索阶段。

显著性分析和潜在空间分析提供了对学习表示的见解。该模型差异加权了相邻频段,为极慢振荡(≤1 Hz)分配负显著性,为三角波功率(1-3 Hz)分配正显著性,与近期发现这些特征与认知健康和疾病风险不同相关的研究相呼应。潜在空间的可视化揭示了与已知生理标记(如睡眠阶段比例和纺锤体密度)的一致组织,同时性能增益表明存在传统特征未捕获的额外信息。尽管可解释性仍然有限,但这些结果表明潜在空间反映了生理上有意义的结构,而非任意模式。

在方法学上,这项工作弥合了传统的监督式脑电图建模与新兴的自监督方法。传统脑电图机器学习依赖密集结局标签,而自监督模型从无标签数据学习一般生理结构。我们的方法通过联合优化临床有意义的结局(认知和疾病)以及跨队列可用的辅助生理任务,将这些范式结合在一起。这种混合策略稳定了训练,鼓励生理学基础的表示,并将潜在空间导向健康相关维度。当代睡眠队列的规模和异质性现在使得这种联合优化成为可能。

在更广泛的多变量睡眠脑电图生物标志物文献中,大脑年龄建模受到了特别关注。大脑年龄指数——通过从脑电图预测实际年龄并检查偏差——已与痴呆症和死亡风险相关联。先前工作还探索了两阶段深度学习方法和使用手工脑电图特征的经典机器学习,但相对于人口统计学基线增益有限。相比之下,我们的框架直接优化临床有意义的结局而非年龄;在原始整晚脑电图上端到端运行;并联合建模认知、疾病和死亡率。结果表明BHS相对于大脑年龄指数表现良好,同时捕获了部分互补的信息,表明结局优化和年龄回归方法反映了部分重叠但不同的生理维度。

独立队列的外部验证进一步支持了该方法的稳健性。尽管人口特征和采集协议存在差异,BHS重现了死亡率关联、区分度指标和风险分层模式。这一发现令人鼓舞,特别是考虑到深度学习模型对协变量转移的敏感性,尽管更广泛的外部验证仍然至关重要。

几个局限性值得考虑。尚不清楚单晚睡眠脑电图记录中究竟编码了多少关于长期大脑健康的信息,而观察到的中等效应量可能既反映了生物限制,也反映了当前数据集的实用约束。大多数分析依赖于单晚脑电图,尽管已知有夜-夜变异性,而认知和疾病结局往往在数月或数年后测量,引入了来自异质测试和电子健康记录的噪声。可解释性也不完整,除了一个外部队列外,大多数评估依赖于内部交叉验证。综合来看,这些因素表明报告结果代表了睡眠脑电图预测价值的下界估计。

最后,此框架应视为基础而非终点。虽然睡眠脑电图提供了信息丰富且可扩展的信号,但潜在空间架构本质上兼容多模态扩展,包括神经成像、基于血液的生物标志物、基因组学和可穿戴或行为数据。在共享表示中整合这些模态可能产生更准确、稳健和机制上可解释的大脑健康模型。

总之,我们提出了一个端到端、数据驱动的框架,将夜间睡眠脑电图转化为大脑健康的多维表示和一个临床可解释的综合评分。该方法在预测认知、疾病和死亡率方面优于传统睡眠指标和经典机器学习模型,同时在各队列中泛化。更广泛而言,该研究证明睡眠脑电图包含丰富、分布广泛的大脑健康标记,并展示了现代AI方法如何将复杂神经生理信号转化为具有转化潜力的整合健康测量。

【全文结束】