摘要
空间转录组学能够在完整组织中实现高分辨率的基因表达定位。Xenium因其可靠性、易用性和数据质量而被广泛采用,但Xenium衍生数据的特性和局限性仍未得到充分表征。在此,我们提出了迄今为止最全面的Xenium数据集之一,涵盖使用多种基因面板分析的40多个乳腺癌和肺癌肿瘤切片。利用这一资源,我们系统剖析了技术噪声——包括转录本溢出——以及检测特异性、面板性能和分割策略。我们证明单核RNA测序能够精确量化转录本污染。基于这些发现,我们介绍了SPLIT(空间分层细胞内转录本纯化)方法,该方法通过解析混合转录组信号来提高信号纯度。SPLIT增强了背景校正和细胞类型分辨率,并实现了T细胞耗竭特征与恶性细胞共定位的揭示——这些信号在未经处理的情况下会被掩盖。总体而言,我们的发现为Xenium性能提供了关键基准,并引入了一种可扩展的信号优化策略。
正文
近年来的技术进步催生了空间分辨转录组学的发展,能够对组织内的基因表达进行空间定量。这些技术为研究人员和临床医生提供了前所未有的能力来表征患者样本,包括存档的福尔马林固定、石蜡包埋(FFPE)标本,具有高空间分辨率。
基于成像的空间转录组学技术,如Xenium、MERSCOPE和CosMx,提供在细胞甚至亚细胞水平上的高分辨率转录定量。这些平台及其早期迭代已经产生了宝贵的生物学见解,并继续为增进对复杂组织的理解提供巨大潜力。然而,随着更多数据集的出现,我们对数据特征和变异源的理解仍在成熟中。关键的实验设计问题仍然存在,特别是在面板选择方面(例如靶向与5K Xenium面板)。更大的面板增加了多重性,但通常会降低灵敏度,增加成本并延长处理时间,而比较数据仍然有限。
Janesick等人首次展示了在Xenium平台上生成的数据,并使用来自两个样本的相邻组织切片与Visium和Chromium(单核RNA测序)进行了深入比较。他们的研究表明,Xenium平台提供了更高的分辨率和灵敏度,同时也突显了整合多个平台的潜力。Cook等人对来自一位患者的单个FFPE块的Xenium和CosMx进行了直接比较。他们的发现表明CosMx具有更好的分割效果,而Xenium则具有更高的灵敏度。Ren等人对Xenium 5K、CosMx 6K和Visium HD进行了深入比较,但同样只分析了三个样本。最近,Wang等人使用13个样本比较了Xenium(多种靶向面板,但无5K)、MERSCOPE和CosMx,但仅限于组织微阵列。虽然他们报告了类似的结果,但分析有限,没有涉及分割和转录本污染等关键因素,正如我们在下文中讨论的那样。迄今为止最全面的分析之一是Marco Salas等人的研究,他们通过分析25个主要来自多个组织的公共样本,对Xenium平台进行了系统的质量评估,并将其性能与其他空间转录组学技术进行了基准测试。他们的结果一致证实了Xenium的高灵敏度,并提供了有价值的分析策略建议。总体而言,现有研究在规模上仍然有限——通常只包括少数患者(或依赖于组织微阵列)——且没有直接比较靶向Xenium面板与新的5K面板在转录灵敏度和特异性方面的表现,这些因素对稳健的下游分析至关重要。
多项研究表明,单个转录本可能被错误地分配到细胞中,这可能是由于分割不准确或转录本溢出到相邻细胞中——导致背景污染,可能影响下游分析。转录本误分配可能导致人工转录组双细胞(或多细胞)的形成,其中来自不同细胞类型的基因表达特征变得混杂和模糊。正如我们在本研究中稍后展示的,这些混合谱并不对应于单细胞测序领域中定义的实际物理双细胞,而是源于空间数据中的信号级混合。虽然其中一些信号混合可归因于沿z轴重叠的细胞,在xy平面分割过程中造成溢出——但仅此并不能完全解释污染的程度,正如我们在本研究中探讨的那样。事实上,Marco Salas等人报告了与标准Xenium分割中细胞扩张相关的污染,表明xy平面内的转录本溢出对背景信号有实质性贡献。然而,除提供一种自动调整扩张参数的方法外,他们没有提出校正这种污染的机制。Mitchel等人证明转录本误分配可以生成人工细胞-细胞相关性(或通信信号),导致错误的生物学解释。为解决这一挑战,他们提出了一种校正方法,利用加权非负矩阵分解和条件随机场来减少信号污染。Ergen和Yosef将此问题框定为转录本扩散(或溢出)并引入了一种概率方法进行校正。Wu、Beechem和Danaher为CosMx数据提出了一种类似方法,将转录本重新分配到其最可能的细胞来源。这些发现表明转录本溢出是跨空间转录组学平台的普遍挑战。
利用转录本级数据的概率分割方法已成为改善细胞级基因表达定量的有力工具,无论是通过减少信号溢出还是增强形态学分割。Petukhov等人介绍的Baysor是这类方法中的先驱之一,对细胞分割建模了空间转录本分布。在此基础上,Jones等人开发了ProSeg,这是一种利用每个转录本空间坐标的三维分割方法。此外,还开发了几种其他算法,包括Segger、BIDCell和FastReseg,反映了向数据驱动分割策略的更广泛转变,以解决转录本误分配问题。正如我们稍后讨论的,我们的数据表明转录本误分配可能至少部分是由转录本溢出驱动的。由于转录本溢出和分割相关伪影通常使用类似的计算策略解决——且溢出似乎是我们的数据中信号失真的主要来源——我们在本研究中重点关注"转录本溢出"。
尽管最近取得了进展,但现有数据集仍然规模小且范围有限,缺乏更广泛应用所需的普适性。利用转录本级数据的计算方法已显示出信号纯度的明显改善;然而,许多方法仍然依赖于启发式校正或复杂、不可解释的模型,并且仅在有限数量的样本上得到验证。这些局限性突显了对更大、更具代表性的研究以及开发更简单、更可解释的空间转录组学数据校正方法的需要。
在此,我们提出了迄今为止生成的最全面的Xenium数据集之一,涵盖来自27名捐赠者的41个乳腺癌和肺癌组织切片。该资源旨在研究空间转录组学中的关键挑战,包括转录本溢出、检测特异性、面板性能(靶向与5K)、分割和细胞类型注释。我们还展示了如何利用snRNA-seq参考来简化细胞类型注释、评估数据质量和缓解转录本溢出。最后,我们介绍了SPLIT(空间分层细胞内转录本纯化),这是一种简单而有效的计算方法,将snRNA-seq与稳健细胞类型分解(RCTD)解卷积相结合,以提高信号纯度。SPLIT解析了由转录本溢出引起的混合信号,改善了细胞类型分离,并与任何分割策略兼容。
结果
数据和实验概述
我们从乳腺癌组织的19个FFPE块和非小细胞肺癌(NSCLC)组织的22个FFPE块生成了空间转录组学数据,分别对应17名和10名捐赠者。所有样本均使用靶向乳腺面板对乳腺癌样本进行Xenium分析,而NSCLC样本则使用靶向肺面板、定制免疫肿瘤学面板(Custom IO)和5K PRIME面板进行分析。此外,为选定的样本生成了匹配的snRNA-seq和免疫组织化学(IHC)数据(详见"方法"部分及补充表1和2)。
对所有Xenium数据进行了分割,以便进行后续的单细胞水平分析。对于使用靶向面板分析的样本,我们使用默认的分割方法,该方法在每个细胞核周围应用5微米半径扩张以近似细胞边界。相比之下,对于使用5K面板分析的样本,我们利用了多模态染色与5微米半径扩张,结合细胞核、细胞质和膜染色以增强分割准确性。
如下一节所述,snRNA-seq数据用于注释Xenium数据集,并作为评估数据质量(包括细胞类型基因表达特异性和分辨率)的参考。IHC用于进一步验证注释——特别是评估由于转录本溢出导致的特定细胞类型误注释的可能性(详见"方法"部分)。
图1a、b总结了实验设计,包括每个样本的细胞数、每个细胞的转录本数和每个面板的基因数。尽管样本间的细胞捕获存在显著变异性——可能是由于组织大小和保存质量的差异——但所有样本都产生了高质量的数据,在单细胞水平上具有稳健的转录本和基因检测。
snRNA-seq数据促进Xenium数据集的稳健注释
虽然Xenium数据本身提供单细胞分辨率,但我们利用部分匹配和注释的snRNA-seq数据集(详见"方法"部分)将细胞类型注释转移到每个Xenium样本。为此,我们应用了RCTD,这是一个最初为空间转录组学解卷积开发的框架,我们和其他人发现它对注释Xenium数据非常有效(详见"方法"部分)。重要的是,RCTD包括一种双细胞模式,有助于解释分割错误、重叠细胞或我们稍后讨论的转录本溢出引起的混合信号。
图1c显示了各个样本中标注的细胞群体分布。数据展示了技术重复之间强大的可重复性,同时揭示了患者之间和技术之间的显著变异性——即Chromium和Xenium。这种变异性是预期的:Chromium依赖于解离的单核,通常需要更大的输入数量,这一过程已知会引入细胞类型表征的偏差。虽然snRNA-seq已被证明可以减轻其中一些偏差,但它并不能完全消除它们。相比之下,Xenium分析完整的组织切片,保留了空间背景并减少了与解离相关的伪影。
我们使用不匹配的scRNA-seq参考探索了RCTD的稳健性(扩展数据图1)。总体而言,我们发现性能普遍一致,某些样本中的恶性细胞注释更具挑战性(扩展数据图1)。考虑到恶性细胞转录谱的显著患者间异质性,我们的发现突显了癌症研究中匹配参考的价值。
同样,注释在不同Xenium面板之间保持稳健,证明靶向基因面板有效捕获定义主要细胞类型的关键信息——我们将在下文中进一步探讨这一点。
Xenium数据在患者和技术重复间表现出极大一致性
为评估Xenium单细胞数据的质量和一致性,我们利用转移的细胞类型注释对所有样本进行了基于UMAP的联合分析。数据按面板和检测进行分层(图1d)。补充图1和2展示了按样本和细胞-细胞距离热图呈现的相同数据集,显示非恶性细胞群体在个体间一致对齐,而恶性细胞则以患者特异性方式聚类,正如预期的那样。批次整合指标(iLISI和Silhouette Batch;扩展数据图2)进一步证实了样本间细胞类型的强一致性,无需进行批次校正或数据整合(Seurat对数归一化除外)。这表明Xenium和Chromium平台引入的技术变异很小。两个指标之间的差异反映了它们的不同敏感性——iLISI捕获局部邻域混合且更敏感,而Silhouette Batch评估全局分离——这是一种预期且先前报道过现象。总体而言,来自相邻组织切片的技术重复数据表现出近乎完美的一致性(扩展数据图3a),证实了平台的高可重复性。
靶向基因面板在灵敏度方面优于5K面板
如预期所示,图1b显示5K面板检测到更高总数的转录本和基因。然而,这种增加并未转化为改进的细胞类型分离(图1d),这通过多种细胞类型分离指标进行量化,包括Calinski–Harabasz、Davies–Bouldin、Leiden调整兰德指数(ARI)、Silhouette分数等(扩展数据图2a)。为进一步调查,我们专注于跨面板共享的基因(n=194),以评估在控制基因内容时5K面板是否表现出降低的灵敏度。
图2a和扩展数据图2b显示,5K和肺面板在使用共享基因和匹配样本进行分析时产生相当的细胞类型分离。然而,5K数据集中约60%的细胞未能通过质量控制(QC),原因是转录本计数低,表明与肺面板相比灵敏度降低。一致地,对于相同的基因集,5K面板检测到的转录本明显较少(图2b)。这种观察到的灵敏度降低与5K面板的已知局限性一致,可能反映了协议修改,如减少探针计数以限制光学拥挤。
我们还使用共享基因评估了相邻组织切片之间的基因表达一致性。如图2c和扩展数据图3b、c所示,5K和靶向面板表现出合理的相关性,尽管5K面板始终显示出较低的灵敏度。值得注意的是,5K灵敏度与Chromium相当(图2b),突显了基因广度和检测深度之间的关键权衡。虽然5K面板覆盖了更广泛的基因集,但这些结果突显了灵敏度的重要局限性。
靶向和5K面板在细胞类型组成上表现出高度一致性
尽管5K面板灵敏度降低,但我们观察到使用不同面板分析的相邻切片之间的细胞类型组成具有良好的一致性(图2d),表明5K面板更广泛的基因覆盖可能有助于补偿其降低的灵敏度。与5K和Custom IO面板之间也观察到类似的关联(扩展数据图3d)。值得注意的是,两种靶向面板——Custom IO和肺——尽管基因重叠有限(n=87),仍表现出最高的关联性(扩展数据图3e)。这表明Xenium对基因面板设计的变异具有稳健性——至少在共享相同基础化学的靶向面板范围内。为测试靶向面板之间更好的一致性是否由分割差异解释,我们使用相同的5-μm扩张方法重新分析5K数据,但未发现相关性有明显改善(扩展数据图3f、g)。
为进一步评估Xenium平台(5K和靶向面板)与Chromium参考之间的细胞类型谱相似性,我们在匹配的供体样本上计算了相关性。两种Xenium面板均与Chromium衍生谱表现出良好的一致性,其中5K面板在灵敏度方面与Chromium数据更为相似(图2e和扩展数据图4)。
靶向基因面板为定义主要细胞类型提供了广泛信息
为评估基因集大小如何影响细胞类型分辨率,我们仅使用包含在靶向面板中的基因重新分析Chromium数据。如扩展数据图3h所示并由扩展数据图2c在分析上支持,Chromium数据在基因集减少的情况下仍能实现细胞类型的清晰分离。此外,即使分析进一步限制在194个共享基因(靶向肺和5K面板之间共享)上,这种分离仍然存在(图2a)。这些发现表明,Xenium数据中观察到的分辨率降低并非仅由分析的有限基因数量引起。
值得注意的是,在限制于共享基因后,肺和5K面板仍然未能达到Chromium数据所观察到的细胞类型分离水平(扩展数据图2b、c)。这支持了转录本在相邻细胞之间溢出可能模糊细胞类型边界、限制空间转录组学分辨率的观点。
Xenium数据表现出大量转录本溢出
我们将RCTD应用于双细胞模式以注释Xenium数据,将每个细胞建模为主要和次要细胞类型的混合物,权重为w₁和w₂,并将细胞分类为单细胞或双细胞(补充图3a和"方法"部分)。重要的是,Xenium中的RCTD"双细胞"很少代表真正的生物双细胞,而是反映信号混合(补充注释1);因此,我们将有证据次要的细胞称为"受污染的",没有证据的称为"纯的"。
一些研究将这种混合归因于领域特定背景噪声,另一些则主要将其归因于垂直(z轴)细胞重叠,其他报告则显示在同一z平面内频繁发生信号混合。由于我们的数据(补充注释2)和先前的工作报告在限制于核转录本时信号混合减少,我们进一步调查了水平转录本溢出对信号污染的贡献。
为此,我们比较了污染水平——由RCTD分配给每个细胞中次要细胞类型的权重(w₂)估计——与该细胞周围二维邻域中相同细胞类型的局部相对丰度——由归一化的对应此细胞类型的RCTD权重总和估计(图3a、b)。这些指标显示出强烈的余弦相似性(图3c),表明特定细胞类型的局部浓度升高与来自该类型的污染增加一致,符合转录本溢出。这种关系在来自多个组织的公开可用Xenium数据集和替代分割策略中可重现(补充注释3),支持转录本溢出的普遍性。
为评估细胞类型特异性污染倾向,我们定义了溢出指数。对于每对细胞类型,我们计算了主要(即受影响)细胞类型的污染水平(w₂)与其次要(即污染)细胞类型在其邻域中的局部丰度之间的余弦相似性。跨所有主要细胞类型平均这些成对分数,得出一个溢出指数,总结了每种细胞类型贡献污染信号的倾向(图3d、扩展数据图5和6,以及"方法"部分)。更丰富的细胞类型显示出更高的溢出指数,恶性细胞排名最高。因此,我们使用恶性细胞来说明肿瘤驱动的邻近细胞污染。图3e显示恶性细胞丰度与局部污染之间存在明确关联。
为进一步说明此效应并提供正交验证,我们在Xenium分析后对部分样本进行了多重IHC("方法"部分)。由于蛋白质染色不太容易受到溢出伪影的影响,IHC提供了验证空间转录组学信号和细胞类型注释的独立方式。特别是,IHC数据使我们能够自信地识别CD8⁺ T细胞(粉红色染色)和恶性细胞(红色染色)。与我们的物理转录本溢出假设一致,图3a、f、g显示肿瘤特异性转录本(小棕色点)延伸到相邻的CD8⁺ T细胞中,支持存在溢出污染。在某些情况下,这种污染足够强,以至于RCTD混淆了主要和次要细胞类型(图3f)。
信号分解减少溢出并增强细胞类型纯度
为解决空间溢出和更普遍的细胞级污染问题,我们引入了一种计算策略,通过分解混合表达谱来减轻这些影响("方法"部分)。我们的方法利用RCTD和细胞分解将混合信号分离为细胞类型特异性组分,从而最大限度地减少次要细胞类型的贡献。具体而言,RCTD用于将每个细胞的表达谱建模为参考细胞类型谱的加权组合(图3h)。然后,这些权重用于基于细胞类型分解将转录本按比例分配到其最可能的来源——主要或次要("方法"部分)。
使用此策略,我们引入了SPLIT,一个通过根据推断的细胞组成拆分每个细胞来分离混合信号的框架。SPLIT校正细胞的UMAP嵌入(扩展数据图7a、b)显示与原始混合信号相比,聚类和分离得到改善,这在所有面板和匹配及外部参考中都是一致的。以下部分提供了这些改进的定量验证。
默认情况下,SPLIT通过保留主要细胞类型的表达谱来分解所有受污染的细胞(图3h)。此外,SPLIT可以利用空间信息评估局部邻域中次要信号的丰度(即局部溢出潜力),仅在污染可能发生时选择性地进行分解,防止对可能在参考中代表性不足或缺失的表型进行过度校正。例如,我们的参考中缺失但在某些匹配的Xenium样本中存在的分裂肿瘤细胞,通常被分类为被分裂淋巴细胞污染的恶性细胞。SPLIT避免分解此类细胞,保留了独特且生物学相关的群体(扩展数据图8)。
除轮廓纯化外,SPLIT还通过基于转录本邻域同质性将主要表型分配转移到次要表型之一,实现表型精炼。我们将此过程称为SPLIT-shift(扩展数据图7c)。
SPLIT与其他校正方法相比表现优异
接下来,我们评估了SPLIT相对于其他校正方法的性能,即ResolVI和ovrlpy,以及各种分割方法。其中一些分割方法(即ProSeg)也直接对转录本溢出进行建模。由于SPLIT和其他信号增强技术可以与任何分割方法结合使用,我们在比较中评估了所有组合。
UMAP的视觉检查显示SPLIT改善了细胞类型分离(图4a)。为定量评估性能,我们基于细胞类型分离、批次整合以及细胞和转录本的保留,比较了不同分割输出的每种校正方法。最佳校正方法应增强细胞类型之间的分离,避免引入或放大批次效应,并尽可能保留细胞和转录本(图4b–d)。虽然这不是我们研究的主要重点,但这些相同指标也可用于分割算法之间的比较。
此外,为评估转录本溢出,我们采用了先前描述的基于邻域的逻辑回归方法,测试给定细胞类型中的基因表达是否预测与潜在污染细胞类型的接近程度。我们的分析集中在恶性细胞和T细胞上:恶性细胞具有更大的溢出指数并倾向于释放大量RNA,而T细胞较小且包含较少转录本,因此更容易受到污染(图3d–g)。我们有IHC数据用于这两种细胞类型,这使我们能够进行结果的视觉检查。
总体而言,所有校正方法均改善了细胞类型分离(图4b,顶部)并减少了污染(图4e)。我们还观察到核分割(0μm),有时假设为无污染,仍显示出污染迹象,这些迹象通过计数校正得到改善(图4e)。使用5K面板分析的样本显示的污染明显低于其他基因面板,特别是当使用多模态分割时(图4e)。然而,这种减少可能归因于每个基因检测到的转录本数量较低导致的统计功效降低。批次效应总体上不受校正方法影响,除了ResolVI,有时会导致iLISI略微恶化(图4b,底部)。
SPLIT实现了最佳的细胞类型分离(图4a、b,顶部)和与Chromium snRNA-seq谱的最高余弦相似性(图4f)。虽然考虑到SPLIT依赖Chromium参考来解决混合细胞类型信号,这是预期的,但这些结果证实了其在实践中的有效性。虽然所有校正方法都减少了污染(图4e),但ovrlpy和ResolVI显著减少了表达基因的数量,导致许多空或接近空的细胞(图4c)。一旦移除这些低表达细胞,剩余细胞表达的中位基因数高于原始分割数据(图4d)。
我们的数据进一步表明分割算法对细胞级转录本定量有强烈影响。ProSeg产生更高的中位基因计数,包括许多低表达值,可能反映其概率分配将非零表达基因分配给可能否则未检测到的细胞。总体而言,ProSeg优于Baysor、多模态和Segger(图4b),将ProSeg与SPLIT结合产生最大的整体改进,证明SPLIT可以与任何分割工具结合使用。
虽然我们的比较分析主要关注肺样本——由于多种基因面板的可用性——但在乳腺癌样本中进行的类似分析得出了相似的结论(扩展数据图9)。
靠近恶性细胞的T细胞表现出增加的耗竭特征
为进一步证明SPLIT对生物学洞察的实用性,我们检查了肺组织中靠近恶性细胞的T细胞与位置较远的T细胞之间的表型差异,包括校正前和校正后。在默认5μm分割中——以及在ProSeg中程度较轻——靠近肿瘤区域的T细胞在原始数据中表现出恶性细胞和上皮基因特征的虚假富集(图4g)。虽然ResolVI和Ovrlpy等方法减少了这种污染并部分恢复了T细胞特征,但它们的效果不一致;值得注意的是,ResolVI有时会抑制污染和T细胞程序。相比之下,SPLIT一致地去除了非特异性信号,同时在所有分割中保留或增强了T细胞特征。
SPLIT校正后,靠近肿瘤细胞的T细胞显示出更强的耗竭特征,包括经典标志物如HAVCR2(TIM-3)、CTLA4、PDCD1、LAG3和CXCL13的表达增加(扩展数据图10),这与先前研究一致。例如,Jones等人报告了在肾细胞癌中经过ProSeg分割后,靠近恶性细胞的T细胞中CXCL13的富集。我们的结果不仅证实了这一发现,还突显了SPLIT的附加价值,具有耗竭标志物的更大富集和非T细胞污染的更清晰去除。将ProSeg与SPLIT结合产生了进一步的改进,强调了它们的互补性。
讨论
在本研究中,我们利用广泛的Xenium空间转录组学数据集评估数据质量、评估分割和校正策略,并引入SPLIT,一种用于信号纯化的新方法。我们的分析证实Xenium产生高质量、高度可重复的数据,具有低技术变异,能够实现在组织切片和患者之间的可靠整合,为单样本和多样本空间研究提供了强大潜力。我们的几个发现已使用额外的公开可用Xenium数据集得到验证,支持其普适性。然而,由于我们的主要分析仅限于两种癌症类型,需要在更多数据集和肿瘤背景下进行进一步验证。
我们对面板设计的比较表明,靶向面板尽管覆盖的基因较少,但提供更高的灵敏度并足以解析主要细胞类型。相比之下,5K面板提供更广泛的覆盖但降低的每基因灵敏度和较弱的下游性能。这种权衡表明有机会通过微调面板内容或补充5K面板额外目标来优化探针组成,正如10x Genomics所建议的,并得到探针基因选择最近计算进展的支持。随着空间转录组学扩展到更大的发现研究,系统量化这种灵敏度-覆盖权衡并定义优化面板设计的标准将至关重要,特别是当降低的灵敏度在探索性环境中可以接受时。
我们还证实先前报告指出,Xenium衍生的单细胞表达数据容易受到转录本污染,源于分割不准确和转录本溢出——两个相互关联的错误源。使用互补的RCTD解卷积和IHC数据,我们表明这种伪影广泛存在,并不成比例地影响低RNA含量细胞,如T细胞。正如Mitchel等人指出的,这种污染可能显著扭曲细胞微环境推断——空间转录组学的关键目标之一。这些发现突显了开发稳健计算策略以校正污染的重要性,并强调研究人员应批判性地评估细胞-细胞相互作用推断工具的输出。这一关注对于基于大型空间转录组学数据集训练的新兴基础模型尤为重要,其中自监督任务通常涉及基于空间上下文预测掩码细胞表型。未经校正的污染可能引入系统偏差,通过下游预测传播,强调在解释模型输出时需要谨慎。
我们证明将snRNA-seq作为参考显著增强了细胞类型注释。此外,RCTD的双细胞模型通过估计贡献细胞类型及其相对比例,揭示了混合信号的组成。我们还在SPLIT中利用此模型分解混合信号并校正转录本溢出,从而提高细胞类型分辨率。虽然来自同一样本的匹配参考是首选——特别是用于区分恶性群体——但我们证明外部参考也表现良好,突显了基于参考方法的稳健性和普适性。随着人类细胞图谱等计划提供的参考数据集的可用性不断增加,我们预计基于参考的分析将变得越来越容易获取。尽管如此,未来工作将侧重于开发SPLIT的无参考版本,以进一步扩展其适用性。
我们还评估了背景校正和分割策略的性能和影响,包括我们的方法SPLIT。虽然许多校正技术可以独立于分割算法应用,但它们经常引发可解释性和过度校正风险的担忧——特别是当与ProSeg等已考虑溢出的转录空间分割方法结合使用时。这在Ovrlpy和ResolVI等方法中尤为明显,它们可能显著减少基因计数,从而可能损害统计功效。相比之下,SPLIT不太容易受到这些伪影的影响,因为它作为基于参考的信号分解方法运行,而不是直接的空间校正层。它的输出本质上更具可解释性,重要的是,SPLIT比替代方法更有效地保留基因检测水平。
在转录空间中的分割——特别是使用概率方法如ProSeg——改善了细胞类型分辨率,尤其是与靶向面板结合时。然而,这些收益在5K面板中较为温和,可能是由于其较低的灵敏度和在更高维空间中执行分割的复杂性。尽管如此,基于转录本的分割仍与SPLIT等校正方法完全兼容,允许它们有效结合以获得增强的分辨率。值得注意的是,将SPLIT应用于5K面板改善了细胞类型分离,即使使用默认的5-μm扩张,突显了其在标准分割条件下的实用性。这种优势在我们对靠近恶性区域的T细胞的分析中进一步显现,SPLIT在校正后显著增强了耗竭特征的检测。
使用SPLIT时的一个重要考虑是通过解卷积推断的混合细胞表型的解释,因为大量污染——特别是在低RNA含量细胞(如T细胞)中——可能导致将真实表型误分类为次要。这种基于解卷积方法的一般局限性促使了更好地解决混合信号的策略。在当前实现中,我们保留主要表型,但可选择允许表型转移,通过我们称为SPLIT-shift的简单程序,而未来的扩展可以结合更先进的标准,包括形态特征,以推断真实细胞身份。
虽然最初为RCTD开发,但SPLIT现在与解卷积无关,支持通用解卷积输出,并允许测试处理污染转录本的替代策略,包括重新分配给适当类型的邻近细胞,以在未来工作中测试。
同样重要的是要认识到,基于参考的细胞类型注释和SPLIT都假设所有相关细胞类型都存在于参考中。表型的缺失可能会损害注释,可能导致人工污染分配,因为模型试图解释未表示的变异。例如,分裂肿瘤细胞可能被错误地分解为分裂T细胞和非分裂肿瘤细胞的组合。这是用户在解释注释和分解结果时应考虑的关键注意事项。
【全文结束】

