生物医学信号处理与控制 100 (2025) 106959
目录列表可在ScienceDirect上获取
生物医学信号处理与控制
期刊主页:[链接]
HydraViT:用于胸部X光图像多标签疾病分类的自适应多分支Transformer
Şaban Öztürk a,b,∗, M. Yiğit Turalı a, Tolga Çukur a,c
a 土耳其安卡拉比尔肯大学电气与电子工程系,邮编06800
b 土耳其安卡拉哈奇巴伊拉姆维里大学管理信息系统系,邮编06500
c 土耳其安卡拉比尔肯大学国家磁共振研究中心(UMRAM),邮编06800
文章信息
关键词:
多标签分类
胸部X光
深度学习
视觉Transformer
标签共现
摘要
胸部X光因其对肺部病理异常的高敏感性,成为胸部疾病诊断的重要工具。然而,由于病理在大小和位置上的异质性,以及不同病理之间的视觉相似性和共现性,基于图像的诊断仍然具有挑战性。由于疾病相关区域通常只占诊断图像的一小部分,基于传统卷积神经网络(CNN)的分类模型因其局部性偏差而受到不利影响。虽然先前的研究通过注意力图或空间掩码增强CNN以引导关注潜在关键区域,但在病理空间分布异质性下学习定位引导仍然困难。为提升多标签分类性能,本文提出一种新颖方法HydraViT,该方法将Transformer骨干网络与具有学习权重的多分支输出模块协同结合。Transformer骨干网络增强了对X光图像长程上下文的敏感性,同时利用自注意力机制自适应聚焦于任务关键区域。多分支输出模块为每个疾病标签分配独立分支以在单独疾病类别间实现鲁棒学习,同时设置跨标签聚合分支以保持对病理共现关系的敏感性。实验表明,在多标签分类性能上,HydraViT平均优于注意力引导方法1.9% AUC和5.3% MAE,优于区域引导方法2.1% AUC和8.3% MAE,优于语义引导方法2.0% AUC和6.5% MAE。
- 引言
胸部疾病的患病率日益增长,对人类健康构成重大威胁。肺癌是全球第二常见的癌症,占所有癌症病例的11%-12%,并导致约18%的癌症相关死亡。吸入性肺炎是另一种侵袭性胸部疾病,在发达国家约占所有死亡的2%-3%。一种用于早期诊断这些致命疾病的突出成像技术是胸部X光(CXR),与其他常见模态相比具有成本效益。然而,CXR扫描数量的不断增加、复杂的病理、可变的病灶大小以及细微的纹理变化可能影响放射学读片的准确性。在放射学专业知识积累相对有限的发展中国家,这些挑战因操作者偏差而进一步加剧。因此,开发能够从CXR扫描自动诊断胸部疾病的计算机辅助诊断(CAD)算法,有助于提高放射学评估的效率和准确性。
主流CAD方法用于诊断胸部疾病,依赖于提取CXR特征以帮助识别和定位病理区域,然后基于提取的特征进行分类以识别疾病是否存在。在受试者仅存在单一类型病理的情况下,通过选择预测概率最高的标签将每张CXR图像分配给唯一的疾病类别,即可解决多类别分类问题。然而,个体受试者的CXR图像中经常同时出现不同的病理或同一病理的多个实例,使得诊断变成多标签分类问题。这大大增加了问题难度,因为一张CXR图像可能需同时分配给多个疾病类别,通过在所有可能子集中选择多元概率最高的标签子集。面对这些挑战,卷积神经网络(CNN)因其在提取视觉特征用于下游成像任务方面的效率,已成为CXR特征提取的事实标准。然而,CNN在识别胸部疾病复杂病理时常常表现次优,原因如下:(1) CXR图像中病理的大小、位置和外观在不同疾病类别和受试者间表现出高度变异性。由于CNN模型使用静态权重的紧凑局部滤波器进行特征提取,其泛化能力可能因CXR图像中病理的解剖变异性而受损。(2) 单个受试者的CXR图像中可能同时出现多种不同病理,然而同时存在的病理的共现统计量在不同疾病类别间表现出高度异质性。CNN模型通常使用传统的softmax输出层训练,该层主要依赖于类别互斥性的多类别分类问题。然而,这些输出层在处理CXR图像的多标签分类时可能遇到困难,因为它们在单个类别的敏感性与类别间共现关系的敏感性之间进行妥协。
近期研究考虑了改进多标签CXR分类的先进方法。第一类CXR研究提出用注意力模块或注意力掩码增强CNN模型,以改善网络对小尺寸病理的关注。尽管注意力增强的CNN具有效率和有前景的性能,但在多个分布性或大尺寸病灶下,它们对长程上下文的捕获能力仍然有限,且跨受试者的泛化性能有限。第二类研究提出了基于自注意力机制的视觉Transformer(ViT)模型,以改善长程上下文的捕获并提升泛化能力。Transformer架构已被广泛应用于众多基于图像的应用,包括图像分割、目标检测、分类及其他相关任务,展示了其在多个领域的通用性,尽管通常以增加计算负荷为代价。为在性能和效率之间保持理想的权衡,还提出了集成CNN和ViT块的混合模型。虽然这些深度学习模型已被用于学习多标签CXR研究中的代表性特征,但它们常常忽略不同病理之间的共现关系。先前的研究已考虑使用病理标签之间预定义的层次关系来构建多标签CXR分类器。然而,这些先前的方法通常通过优化跨类别的聚合输出向量的预测精度来训练,导致在单个病理标签上的分类性能具有异质性。
本文提出一种新颖的自适应多分支Transformer模型用于CXR图像的多标签疾病分类,称为HydraViT。我们提出的模型采用混合架构,由卷积空间编码器模块高效提取CXR图像的特征图,以及基于Transformer的上下文编码器模块捕获图像块之间的长程上下文关系和共现病理。为避免疾病标签共现模式导致的偏差,基于多分支输出层执行多任务学习,受近期机器学习研究启发。然而,与先前多任务学习研究不同,我们提出一种新颖的损失函数,自适应地对每个输出分支加权,以进一步改善病理共现的学习。据我们所知,HydraViT是文献中第一种在多标签CXR分类中为每个病理标签采用多任务学习的模型。我们的主要贡献总结如下:
- HydraViT是一种新颖的混合卷积-Transformer模型,通过多任务学习提高CXR图像多标签疾病分类的可靠性。
- HydraViT使用基于Transformer的上下文编码器捕获长程上下文和不同病理之间的共现关系。
- HydraViT使用基于距离的自适应权重来考虑不同病理之间可变的共现统计量,从而改善模型在各类别间性能的同质性。
本文其余部分结构如下:第2节介绍关于多标签CXR分类的全面文献综述。第3节阐述所提模型的理论基础和细节。第4节详述实验设置和参数细节。第5节报告模型组件的消融研究以及与最先进基线的比较研究。最后,第6节总结研究发现、局限性和未来工作。
- 相关工作
2.1 用于CXR分类的深度学习
CXR图像自动分析的传统框架依赖于手工构建的特征和人工操作者干预,这削弱了分类性能。随着深度学习的出现,基于多种不同CNN架构的CXR分析取得了性能飞跃。CNN模型的改进方向包括更深层的架构、集成递归依赖、金字塔架构、基于量子分类器的架构、融合架构以及集成架构以捕获多样化的特征集。在近期基于CNN的CXR分类研究中,[27]使用深度特征选择提取最具信息量的图像特征,[43]利用CXR图像和咳嗽声音提升性能,[7]使用特征选择器和集成器分支学习病理的判别性特征,[25,44,45]使用图特征捕获图像特征之间的语义相似性,[46,47]采用优化技术识别更有效的特征集,从而帮助提升分类性能。几项近期研究采用了基于扩散的方法,通过稳定扩散和潜在扩散模型提升特征可靠性。
传统CNN模型的一个主要局限在于使用静态的局部滤波器权重,这会损害对不同受试者间大小、位置、形状各异的非典型解剖结构的泛化能力。近期CXR分类研究考虑使用注意力机制,要么作为CNN骨干的增强,要么作为ViT骨干中的自注意力,以改善泛化并引导模型聚焦于疾病相关区域。已经部署了跨不同维度的多种注意力机制,包括通道、元素、尺度注意力的组合,通道和空间注意力,类别和标签注意力,以及多头自注意力。在近期研究中,[11]提出PCAN,使用逐像素注意力分支。[21]提出Thorax-Net,具有注意力分支以利用类别标签与病理位置之间的相关性。[24]的DuaLAnet包含两个非对称注意力网络以提取更具判别性的特征。[23]引入PCSANet,使用shuffle注意力模块以优先考虑与病理相关的特征。尽管这些先前方法专注于CXR分类模型的架构改进,通过聚焦病理来提取任务相关特征,但当多标签分类任务中存在多种共现病理时,它们可能导致异质的分类性能。为解决这一局限,HydraViT独特地使用多任务学习,为每个标签设置单独的输出分支,并通过自适应加权每个分支来应对不同标签间可变的共现统计量。
2.2 多标签分类
多标签CXR分类的常见方法是通过softmax层产生的跨所有检查类别的多维输出向量,使用多标签交叉熵损失训练模型。然而,这种传统方法可能损害对单个标签的敏感性,并导致对单独标签间共现关系的次优捕获。为改善标签间共现统计量的学习,一组研究提出通过附加网络模块(如共现模块、图模块、递归模块、标签相关性引导的判别学习或空间-通道编码模块)来细化标签预测,以捕获单独标签之间的语义依赖关系。作为替代方法,其他研究提出使用修改后的损失函数,如加权交叉熵或多标签softmax损失,以利用标签之间的相关性提升分类性能。通常,这些先前研究有助于在类别预测中强调标签共现关系。然而,由于它们使用单一的多维输出向量,在保持对单个标签的敏感性方面可能次优。最近一项研究通过集成CNN模型旨在解决这个问题,其中为每个类别使用单独的CNN预测标签。虽然这提高了对单个标签的敏感性,但它忽略了标签共现关系。
为同时获得对单个标签及其共现关系的敏感性,HydraViT采用多分支输出模块,将其Transformer编码器提取的上下文嵌入映射到类别标签上。与先前多标签方法不同,HydraViT同时为每个单独标签使用分离的单维输出变量和跨标签的聚合多维输出向量。在计算交叉熵损失之前,为每个输出变量分配自适应权重,并增加单个与聚合输出之间的一致性损失,以保持其预测病理标签的一致性。尽管几项影像和计算机视觉研究已考虑在分类模型中使用每个单独标签的单独网络分支,据我们所知,没有先前研究提出同时使用单个和聚合分支,并通过一致性损失对齐其预测。
- 理论
3.1 问题定义
假设一个训练集包含CXR图像和对应的疾病标签 {𝑥𝑖, 𝑦𝑖}𝑁𝑖=1,其中𝑁是训练样本数。𝑥𝑖 ∈ R𝐻,𝑊是第𝑖张图像,(𝐻, 𝑊)表示空间尺寸。𝑦𝑖 ∈ Z𝐶2是𝐶维标签向量,其中𝐶是疾病类别数,𝑦𝑐𝑖 ∈ {0,1}作为第𝑐类的指示符(0: 不存在,1: 存在)。为学习多标签分类所需的映射,即 𝑓: 𝑥𝑖 → 𝑦𝑖,主流方法使用交叉熵损失。然而,传统交叉熵损失反映了所有疾病标签的聚合度量,因此它没有明确考虑不同病理之间的共现关系。因此,在多标签分类中简单采用交叉熵损失可能导致次优性能。
3.2 HydraViT
为解决上述问题,HydraViT基于混合架构利用多任务学习,其中基于CNN的空间编码器提取局部特征的低维图,随后基于Transformer的上下文编码器捕获输入CXR图像中病理内部和之间的上下文化嵌入(图1)。然后通过单个标签的专用输出变量与跨标签聚合的多维输出向量的协同组合来执行多任务学习。为保持对单个标签和标签共现关系的敏感性,使用输出变量的可学习加权,并结合单个与聚合输出变量之间的一致性损失。下面描述HydraViT的网络组件和学习过程。
3.2.1 空间编码器(SE)
基于CNN的SE模块,参数为𝜃𝑆𝐸,用于提取CXR图像的局部空间特征,并在上下文编码之前降低特征图的维度。给定输入图像𝑥𝑖,低维潜在表示𝑚𝑖 ∈ R𝐻,𝑊,𝑧通过𝑓𝑆𝐸: 𝑥𝑖 → 𝑚𝑖得到,其中𝑧是特征通道的维度:
𝑚𝑖 = 𝑃𝑜𝑜𝑙(𝜎(𝐶𝑜𝑛𝑣(⋯ 𝑃𝑜𝑜𝑙(𝜎(𝐶𝑜𝑛𝑣(𝑥𝑖)))⋯))
其中𝑃𝑜𝑜𝑙表示在2×2邻域上的最大池化层进行两倍下采样,𝜎是ReLU激活函数,𝐶𝑜𝑛𝑣表示卷积块。
3.2.2 上下文编码器(CE)
基于Transformer的CE模块,参数为𝜃𝐶𝐸,将空间编码的特征图投影到上下文化嵌入向量上,𝑓𝐶𝐸: 𝑚𝑖 → 𝐸𝑖,以捕获病理内部和之间的长程空间关系。为此,来自SE模块的𝑚𝑖被分割成𝑁𝑝 = 𝑟²/𝑃²个不重叠的块,大小为(𝑃, 𝑃),其中𝑃 = 𝑟/2,并展平为𝑧𝑃²维向量。Transformer编码器首先通过可学习的线性投影和位置编码将展平的块投影到𝑁𝐷维空间:
𝐸𝑖⁰ = [(𝑚𝑖)¹·𝑃𝐸; (𝑚𝑖)²·𝑃𝐸; ⋯; (𝑚𝑖)^(𝑁𝑝)·𝑃𝐸] + 𝑃𝐸𝑝𝑜𝑠
其中𝐸𝑖⁰ ∈ R^(𝑁𝑝,𝑁𝐷)表示块嵌入,(𝑚献[1]-[74]的内容。请注意,由于原文篇幅较长,翻译将从前述中断处开始,并确保以【全文结束】结尾。
3.2.2 上下文编码器(CE)(续)
第𝑙个块执行以下计算:
𝐸̄ ᶦˡ = 𝑀𝐻𝑆𝐴(𝑁𝑜𝑟𝑚(𝐸ᶦˡ⁻¹)) + 𝐸ᶦˡ⁻¹
𝐸ᶦˡ = 𝑀𝐿𝑃(𝑁𝑜𝑟𝑚(𝐸̄ ᶦˡ)) + 𝐸̄ ᶦˡ
CE模块的输出𝐸ᶦᴸ被取为上下文化嵌入向量𝐸ᶦ。请注意,Transformer编码器中的传统输出头会将嵌入向量映射到𝐶个输出神经元的激活𝑜ᶦ¹…ᶜ上,并利用softmax函数(𝜍)计算各个类别的概率:𝜍(𝑜ʲᶦ) = 𝑒^(𝑜ʲᶦ) / ∑ᵏ₌¹ᶜ 𝑒^(𝑜ᵏᶦ), 对于𝑗 = 1,…,𝐶。由于这种公式强制输出向量中的单一类别主导其他类别,因此在捕获单独标签之间的共现关系方面可能效率不高。
3.2.3 多分支输出(MBO)模块
给定𝐸ᶦ,MBO模块计算每个标签的𝐶个单维输出变量 𝑦̃¹ᶦ, 𝑦̃²ᶦ, …, 𝑦̃ᶜᶦ,使得 {𝑦̃ᶜᶦ ∈ R¹ : 0 ≤ 𝑦̃ᶜᶦ ≤ 1},以及跨标签聚合的多维输出向量 𝑦̃ᴬᶦ ∈ Rᶜ,使得 {[𝑦̃ᴬᶦ]ᶜ ∈ R¹ : 0 ≤ [𝑦̃ᴬᶦ]ᶜ ≤ 1}。结果映射为 𝑓ᴹᴮᴼ: 𝐸ᶦᵈ → [𝑦̃¹ᶦ], [𝑦̃²ᶦ], …, [𝑦̃ᶜᶦ], [𝑦̃ᴬᶦ]。为每个输出变量使用可学习权重𝑤¹, 𝑤², …, 𝑤ᶜ, 𝑤ᴬ ∈ R¹ 来考虑标签共现。这些权重根据训练集中观察到的样本比率进行初始化(例如,对于第𝑐类有𝑁ᶜ个训练样本,𝑤ᶜ = 𝑁/(𝐶 ∗ 𝑁ᶜ);𝑤ᴬ = 1/(𝐶+1))。权重被纳入模型训练的损失项中:
损失(𝑥ᶦ, 𝑦ᶦ) = (1/𝐶) ∑ᶜ₌₁ᶜ BCE(𝑦ᶜᶦ, 𝑤ᶜ𝑦̃ᶜᶦ) + MLCE(𝑦ᶦ, 𝑤ᴬ𝑦̃ᴬᶦ) + CL(𝛼[𝑤¹𝑦̃¹ᶦ, …, 𝑤ᶜ𝑦̃ᶜᶦ], 𝛽𝑤ᴬ𝑦̃ᴬᶦ)
提出的损失项对每个标签采用二元交叉熵(BCE)损失项,并结合跨标签的多标签交叉熵(MLCE)损失项,以保持对单个标签及其共现统计量的敏感性。等式(5)中的第一项表示针对每个单维输出变量的BCE损失:
BCE(𝑦, 𝑦̃) = -[𝑦 log(𝑦̃) + (1-𝑦) log(1-𝑦̃)]
其中𝑦和𝑦̃是反映给定类别真实和预测标签的二元标量。等式(5)中的第二项表示针对多维输出向量的MLCE损失:
MLCE(𝑦ᴬ, 𝑦̃ᴬ) = (1/𝐶) ∑ᶜ₌₁ᶜ BCE([𝑦ᴬ]ᶜ, [𝑦̃ᴬ]ᶜ)
其中𝑦ᴬ和𝑦̃ᴬ是反映跨𝐶类真实和预测标签的二元向量。等式(5)中的最后一项是强制执行单个和聚合输出变量预测之间的一致性的损失:
CL(𝑦̃ᴬ,¹, 𝑦̃ᴬ,²) = ||𝑦̃ᴬ,¹ - 𝑦̃ᴬ,²||²
其中𝑦̃ᴬ,¹通过将单个输出变量沿标签维度连接并将结果向量缩放因子𝛼形成,𝑦̃ᴬ,²则通过缩放因子𝛽从聚合输出向量导出。缩放因子作为可学习参数。基于等式(5)损失的HydraViT训练程序在算法1中描述。在测试CXR图像𝑥ᵠᶦ的推理过程中,使用来自单个输出变量的预测,即[𝑤¹𝑦̃¹ᵠᶦ, …, 𝑤ᶜ𝑦̃ᶜᵠᶦ],来生成类别预测。
算法1:HydraViT的训练程序
输入:数据集:{𝑥ᶦ, 𝑦ᶦ}ᶰᶦ₌₁,𝑥ᶦ:CXR图像,𝑦ᶦ:标签
𝑓ˢᴱ:空间编码器,参数为𝜃ˢᴱ
𝑓ᶜᴱ:上下文编码器,参数为𝜃ᶜᴱ
𝑦̃¹,…,ᶜ:单个输出变量
ᶦ𝑦̃ᴬ:聚合输出向量
ᴼᵖᵗ():用于计算参数更新的优化器
输出:𝜓:{𝑤¹, …, 𝑤ᶜ, 𝑤ᴬ, 𝛼, 𝛽, 𝜃ˢᴱ,ᶜᴱ}
初始化参数。
for 𝑖 = 1:𝑁 do
计算 𝑚ᶦ, 𝑓ˢᴱ(𝜃ˢᴱ): 𝑥ᶦ → 𝑚ᶦ
计算 𝐸ᶦ, 𝑓ᶜᴱ(𝜃ᶜᴱ): 𝑚ᶦ → 𝐸ᶦ
投影到单个分支,[𝑦̃¹ᶦ], [𝑦̃²ᶦ], …, [𝑦̃ᶜᶦ]
投影到聚合分支,𝑦̃ᴬᶦ
通过公式(6)计算单个分支的BCE
通过公式(7)计算聚合分支的MLCE
基于公式(5)计算损失
更新模型参数:𝜓 ← 𝜓 - ᴼᵖᵗ(▽ᵩ Loss)
返回 𝜓
- 实验设置
4.1 数据集
在ChestX-ray14数据集上进行了演示,该数据集包含来自30,805名不同患者(年龄1-95岁)的112,120张正面视图图像。其中,56.49%为男性,43.51%为女性。数据集包括每张CXR图像的15个类别标签,包括健康个体的“无发现”类别,以及14种不同的病理(肺不张、心脏肥大、积液、浸润、肿块、结节、肺炎、气胸、实变、水肿、肺气肿、纤维化、胸膜增厚和疝气)。注意,病理区域的平均尺寸约为图像尺寸的7.5%。除“无发现”外的类别可以在同一患者中同时出现,形成一个多标签分类问题。“无发现”类别占整个数据集的53.83%,有60,412个样本。主要的病理异常如“浸润”和“积液”的样本量分别为19,894和13,317,而次要的病理异常如“疝气”和“肺炎”的样本量分别为227和1,431。
在建模之前,为计算效率,所有CXR图像在空间上下采样至224×224网格。数据被分割为训练集和测试集,没有患者级别的重叠,同时保持各类别样本数量之间的比率。训练集包含86,524张图像,而测试集包含25,596张图像。
4.2 实现细节
HydraViT利用混合网络架构,包括空间编码器模块、上下文编码器模块和多分支输出层。空间编码器模块基于预训练的VGG16架构实现,其中𝑧=512,𝑟=7。该架构由13个卷积层(3×3核大小)、ReLU层、5个最大池化层(2×2核大小)和3个全连接层(FCL)组成。上下文编码器模块使用了预训练的ViT架构,具有12个Transformer块,投影维度为512,20个注意力头,𝑃=4得到𝑁ₚ=4,𝑑=25,088。多头输出块中的𝑤ᴬ值初始化为1/(𝐶+1)。𝛼和𝛽参数在[0 5]范围内随机初始化。HydraViT使用TensorFlow框架实现,并在NVidia RTX 3090 GPU上执行。模型通过Adam算法进行训练,批大小为35,学习率为10⁻⁴,共120个epoch。
4.3 对比方法
HydraViT与几种最先进的深度学习模型进行了多标签CXR分类对比。考虑了三个主要类别的对比方法:注意力引导、区域引导和语义引导方法。
4.3.1 注意力引导方法
- PCAN:逐像素分类和注意力网络(PCAN)通过CNN提取中级CXR图像特征,并使用逐像素分支进行分类。
- A3 Net:三重注意力学习(A3 Net)通过DenseNet121提取特征,并使用通道、元素、尺度注意力。
- CBAtt:基于类别的注意力(CBAtt)通过ResNet50提取特征,并学习类别特定的注意力图。
- ConsultNet:ConsultNet基于DenseNet121使用双分支架构、空间和通道注意力来学习判别性特征。
- DuaLAnet:双病灶注意力网络(DuaLAnet)由两个基于DenseNet169和ResNet152的非对称注意力网络组成。
- C-Tran:分类Transformer(C-Tran)采用Transformer骨干网络,通过捕捉视觉特征和标签之间的复杂关系进行多标签图像分类。
4.3.2 区域引导方法
- TSCN:双流协作网络(TSCN)通过U-Net创建分割掩码,并通过DenseNet169在掩码区域进行特征提取。
- WSLM:弱监督定位方法(WSLM)生成包含病理区域的掩码,并通过ResNet50进行特征提取。
- RpSal:RpSal通过金字塔网络提取特征,然后进行区域提议和显著性检测,用于同时定位和分类。
- LLAGnet:病灶位置注意力引导网络(LLAGnet)通过DenseNet169提取特征,并使用弱监督注意力定位CXR图像中的病灶。
4.3.3 语义引导方法
- SEMM:SEMM通过DenseNet121提取语义特征,这些特征通过多映射迁移学习被分成三个分支。特征在类别级池化后跨分支进行拼接。
- CheXGCN:基于图卷积网络的标签共现学习框架(CheXGCN)通过DenseNet169提取特征,并通过GCN捕获共现关系。
- SSGE:语义相似性图嵌入(SSGE)从学习到的图像特征构建相似性图,并使用知识蒸馏来捕获语义相似性。
- TNELF:三重网络集成学习框架(TNELF)基于DenseNet169、ResNet50和Efficient Net-B4骨干网络使用集成学习,并进行特征级拼接用于分类。
4.4 性能评估
模型性能通过曲线下面积(AUC)指标进行表征,该指标常用于多标签CXR分类结果的定量评估。为此,首先计算每个类别的受试者工作特征(ROC)曲线下的面积。然后将这些面积在类别间取平均。更高的AUC分数表明分类性能更好。给定一个测试集CXR图像𝑥ᵠ = {𝑥ᵠ1, 𝑥ᵠ2, …, 𝑥ᵠₙ},分类模型对于第c类的AUC计算为:
AUC = (∑ᵢ₌₁ₙ ∑ⱼ₌₁ₙ ξ(𝑦ᶜᵠᶦ < 𝑦ᶜᵠⱼ) ξ(𝑦̃ᶜᵠᶦ < 𝑦̃ᶜᵠⱼ)) / (∑ᵢ₌₁ₙ ∑ⱼ₌₁ₙ ξ(𝑦ᶜᵠᶦ < 𝑦ᶜᵠⱼ))
其中ξ(.)表示对其输入参数所表达条件的指示函数。AUC指标通过量化预测标签排序与真实标签排序一致的情况比例,反映了分类模型的判别能力。
我们还利用平均绝对误差(MAE)指标进一步分析所提出技术的性能。分类模型跨类别的MAE计算为:
MAE = (1/𝑁) ∑ᵠᶦ₌₁ₙ |𝑦ᵠᶦ - 𝑦̃ᵠᶦ|
其中𝑦ᵠᶦ是跨类别的真实标签向量,𝑦̃ᵠᶦ是第ᵠᶦ个测试图像跨类别的输出向量。注意,MAE作为跨类别的聚合性能指标报告。
- 结果
5.1 消融研究
在ChestX-ray14数据集上进行了多项消融研究,以展示HydraViT中各个组件对方法性能的贡献。首先,我们检验了空间编码器、上下文编码器和多分支输出模块的效果。为此,将包含所有三个模块的HydraViT与仅包含SE模块(用softmax输出层增强用于多标签分类)的变体、包含SE和CE模块(用softmax输出层增强)的变体𝑓ˢᴱ + 𝑓ᶜᴱ,以及包含SE和MBO模块的变体𝑓ˢᴱ + 𝑓ᴹᴮᴼ进行了比较。图2展示了比较模型的ROC曲线和相应的AUC指标,分别针对每个病理标签和跨标签的平均值。在跨标签的平均值上,HydraViT优于𝑓ˢᴱ 5.9% AUC,优于𝑓ˢᴱ + 𝑓ᶜᴱ 4.8% AUC,优于𝑓ˢᴱ + 𝑓ᴹᴮᴼ 3.1% AUC。我们还发现𝑓ˢᴱ + 𝑓ᴹᴮᴼ持续优于𝑓ˢᴱ,并且HydraViT持续优于𝑓ˢᴱ + 𝑓ᶜᴱ。在这些情况下,引入MBO模块带来的最显著改进体现在相对稀有的标签上,如经常与其他病理共现的“心脏肥大”、“浸润”和“肺炎”。这一发现表明,在多标签分类中,MBO模块相对于传统softmax分类层的重要性。我们还观察到HydraViT持续优于𝑓ˢᴱ + 𝑓ᴹᴮᴼ,在病理在局部和全局尺度上可能表现出非典型强度分布的标签(如“结节”、“肿块”、“纤维化”和“肺不张”)上,改进更为显著。这一结果表明了CE中的自注意力机制在捕获CXR图像局部和全局上下文特征方面的重要性。
接下来,我们检验了HydraViT中MBO模块多任务训练对多标签分类的益处。HydraViT与一个聚合变体(包含SE和CE模块,用基于聚合输出向量的softmax输出层增强)和一个集成变体(利用多个𝑓ˢᴱ + 𝑓ᶜᴱ模型,各自为每个单独标签训练的单维输出变量)进行了比较。图3展示了比较模型的分类性能。在这些变体中,聚合变体或集成变体在某些标签上表现更好,而两个变体在其余标签上表现相似。尽管如此,HydraViT在所有标签上持续优于这两个变体。平均而言,HydraViT优于聚合变体4.8%,表明基于单独输出分支的多任务训练有助于提高对单个标签的敏感性。HydraViT也优于集成变体9.4%,表明HydraViT中的聚合输出分支有助于改善对病理共现关系的捕捉。
我们还评估了HydraViT中MBO模块、CE模块、聚合输出向量和MBO权重初始化对单一标签与多标签的分类性能的影响。考虑了从HydraViT中排除MBO模块的变体(w/o 𝑓ᴹᴮᴼ)、排除CE模块的变体(w/o 𝑓ᶜᴱ)、排除聚合输出向量及相关多标签交叉熵和一致性损失项的变体(w/o 𝑦̃ᴬᶦ),以及MBO模块中权重为零初始化的变体(w/o 𝑖𝑛𝑖𝑡.)。表1列出了比较模型在仅包含单一标签的测试样本子集、包含多个共现标签的测试样本子集以及整个测试集上的分类性能。我们发现HydraViT在所有情况下均优于变体,尽管性能优势在多标签情况下更为显著。在单标签情况下,HydraViT优于w/o 𝑓ᴹᴮᴼ 2.8% AUC和2.3% MAE,优于w/o

