基因组解析宏基因组学:微生物组医学的革命性变革Genome-resolved metagenomics: a game changer for microbiome medicine | Experimental & Molecular Medicine

环球医讯 / 硒与微生态来源:www.nature.com韩国 - 英语2026-07-24 12:31:26 - 阅读时长23分钟 - 11473字
本文综述了基因组解析宏基因组学技术在微生物组医学中的关键作用,详细阐述了宏基因组组装基因组(MAGs)的构建方法、功能注释和在微生物组研究中的应用。文章指出,这一技术突破能够直接从全宏基因组测序数据中重建微生物基因组,为研究人类肠道微生物群落提供了更精确的方法,有望推动个性化微生物组医学的发展,帮助理解微生物基因组变异与宿主健康的关系,并开发基于微生物的新型诊断工具和治疗方法。该技术被视为继人类基因组计划后,微生物组医学领域的重要里程碑,将加速实现这些科学和医疗目标的进程,为疾病的预防和治疗提供新思路。
微生物组医学健康微生物组肠道微生物组宏基因组组装基因组(MAGs)基因组解析宏基因组学疾病预防治疗剂代谢建模抗生素耐药基因抗菌肽
基因组解析宏基因组学:微生物组医学的革命性变革

摘要

近年来,大量证据表明共生细菌与人类疾病相关,这催生了生物医学研究的一个新领域:微生物组医学。这一新兴领域旨在理解和利用人类微生物群及其衍生分子进行疾病预防和治疗。尽管这一生态系统具有复杂的层次组织,但多年来的大多数研究依赖于16S rRNA基因序列分析,这是细菌系统发育和分类学的传统方法。该方法虽能揭示患病微生物组与健康微生物组之间的分类组成差异,但16S rRNA序列有限的分类学分辨率及其固有的功能分析障碍,限制了对微生物组中直接影响宿主生理的功能元素的进一步研究。这种情况类似于人类遗传学在人类参考基因组可获得之前的状态。在缺乏全面的人类基因组图谱的情况下,疾病基因的搜索基于稀疏的基因组标志物,只能确定与疾病相关的广泛染色体区域,往往需要后续多年的深入研究才能精确定位致病基因。人类基因组的解码和单核苷酸变异的编目加速了疾病相关基因和遗传变异的发现,从而开创了基因组医学时代。

在本综述中,我们提倡微生物组医学中进行类似的转变。解码所有共生微生物物种的完整基因组并编目其遗传成分将加快从人类微生物组开发新生物标志物和治疗剂的过程。对于尚未培养的物种而言,基因组组装在多年内面临技术挑战。然而,基因组解析宏基因组学的最新进展已带来重大变化。多种计算方法已开发用于从宏基因组鸟枪测序数据中进行从头基因组组装,导致以宏基因组组装基因组(MAGs)形式存在的草图基因组快速积累。本综述讨论了MAG构建的计算方法及其对人类微生物组研究的影响,特别关注肠道微生物组研究。此外,虽然同一研究框架可以应用于研究人体内各种微生物群落,但本综述主要关注原核共生微生物的研究,指出MAG重建也可以用于共生真菌和病毒。

引言

人体内栖息着大量共生微生物细胞,其数量超过了宿主自身的细胞,并对人类生理产生显著影响。随着共生微生物在人类疾病中作用的证据不断积累,微生物组医学已作为生物医学研究的一个新领域出现。该领域致力于利用人类微生物群及其衍生分子进行疾病预防和治疗。实现这一目标需要全面了解人类微生物组的分类和功能组织。

历史上,微生物群落研究属于微生物生态学范畴,最初聚焦于环境微生物。然而,发现人体内存在大量微生物群落扩展了该领域的范围。多年来,人类微生物组研究采用了基于细菌系统发育和分类学的方法,特别是16S rRNA基因序列分析,这对于揭示患病微生物组与健康微生物组之间的分类组成差异是足够的。然而,16S rRNA序列有限的分类学分辨率及其无法进行功能分析的内在局限,阻碍了进一步的进展,包括识别直接影响宿主生理的微生物组功能元素。这种情况类似于人类遗传学在人类参考基因组可获得之前的状态。缺乏全面的人类基因组图谱意味着疾病基因的搜索基于稀疏的基因组地标,只能确定与疾病相关的广泛染色体区域,往往需要后续多年的深入研究才能精确定位致病基因。人类基因组的解码和单核苷酸变异的编目加速了疾病相关基因和遗传变异的发现,从而开创了基因组医学时代。

在本综述中,我们提倡微生物组医学中进行类似的转变。解码所有共生微生物物种的完整基因组并编目其遗传成分将加快从人类微生物组开发新生物标志物和治疗剂的过程。对于尚未培养的物种而言,基因组组装在多年内面临技术挑战。然而,基因组解析宏基因组学的最新进展已带来显著变化。多种计算方法已开发用于从宏基因组鸟枪测序数据中进行从头基因组组装,导致以宏基因组组装基因组(MAGs)形式存在的草图基因组迅速积累。本综述讨论了MAG构建的计算方法及其对人类微生物组研究的影响,特别关注肠道微生物组研究。此外,虽然同样的研究框架可以应用于研究人体内各种微生物群落,但本综述主要关注原核共生微生物的研究,指出MAG重建也可以用于共生真菌和病毒。

16S rRNA基因测序的固有限制

16S rRNA基因测序因其成本效益和直接的生物信息学解释而成为微生物群落分类分析的流行方法,使其易于获得。然而,这种方法与分析目标(16S rRNA序列)相关的几个固有限制。

首先,16S rRNA序列的变化通常不允许进行物种水平的分类。最近的研究表明,即使是使用长读长测序分析完整的16S区域也可能不足以进行物种水平的分类学区分。此外,相同物种微生物之间的亚种水平差异可能对宿主生理产生重大影响,但这些细微差别在微生物组的分类分析中往往被忽视。其次,16S rRNA序列不提供微生物功能能力的信息。虽然像PICRUSt这样的工具可以根据16S rRNA序列预测代谢通路,但结果仅是基于少量与特定16S rRNA序列相关代表性基因组的推断。第三,16S rRNA序列仅对原核生物是独特的,使真菌、病毒和原生生物等非细菌共生体的检测变得不可能。第四也是最关键的是,研究被认为是"微生物暗物质"的新物种具有挑战性,因为16S rRNA序列的解释严重依赖于包含已知细菌物种的数据库。这种依赖可能会阻碍对先前未表征的微生物实体的发现和理解。

宏基因组分析与全宏基因组测序(WMS):新范式

人类微生物组计划(HMP)与人类基因组计划的不同之处在于,它没有从测序数据中产生参考基因组。这是由于从源自各种细菌来源的混合序列读数组装单个细菌基因组的复杂性。当时,计算算法还不足以有效分离和准确组装这些基因组。尽管如此,HMP在将微生物组研究转向WMS方面至关重要,WMS涉及对样本中的所有遗传物质进行测序,以提供对微生物组的更全面理解。

HMP通过向公众发布来自健康人类微生物组的WMS数据集,为人类微生物组研究做出了重要贡献。这些数据集包括541个肠道样本、215个阴道微生物组样本、1090个口腔微生物组样本和56个皮肤微生物组样本,突显了该计划的广泛范围及其对理解人类健康的影响力。这一发布促使众多用于分析的生物信息学工具得以开发。HMP的第二阶段,即HMP2或iHMP,旨在提供对宿主-微生物组相互作用的更全面理解。为HMP2生成了广泛的宏基因组数据,涵盖人类肠道和阴道微生物组在怀孕和早产期间、炎症性肠病和前糖尿病的人体宿主与微生物组相互作用。结果,公共数据库中增加了另外2000个肠道样本和930个阴道样本的WMS数据,进一步丰富了人类微生物组研究的资源。得益于这一大规模联盟项目和众多其他研究,人类肠道微生物组的公共WMS数据量已迅速增长,到2023年已超过11万个样本。然而,一个明显的问题是数据中显著的地理偏差。大多数公共WMS数据来自美国、中国和一些欧洲国家等少数国家,导致亚洲和非洲大部分国家的肠道微生物组数据代表性不足。这一差距至关重要,因为肠道微生物群组成受饮食和生活方式的强烈影响。因此,目前的人类肠道微生物组数据格局缺乏全面性。在未来的样本收集和分析中,将人口不足群体纳入是实现对人类肠道微生物组更准确的全球理解的关键。

基因组解析宏基因组学:使人类微生物组研究多样化

基因组解析宏基因组学是微生物组研究中的一种变革性方法,深入分析混合微生物群落的DNA,直接从宏基因组数据中组装和分析单个基因组。与传统的16S rRNA测序相比,这项技术标志着对人类微生物组理解的显著深化,提供了前所未有的见解。

在该方法的核心,基因组解析宏基因组学能够组装涵盖各种微生物(包括细菌、病毒和真菌)的新基因组。将这些新物种的基因组纳入系统发育树,将先前无法检测的物种带入焦点。此外,物种水平的基因组数据日益增多,促进了对物种内变异的深入研究。这一进展为全面泛基因组的构建奠定了基础,后者将提供物种内遗传多样性的更详细理解。研究人员现在能够发现大量新的编码序列,这可能导致识别新的宏基因组蛋白质家族。细菌物种内的基因组比较有助于追踪共生细菌的个体内和个体间传播,而以基因为中心的分析则通过基因突变和水平基因转移提供了对微生物组进化的窗口。物种内的遗传多样性反映了微生物组在特定宿主环境中的适应历程,揭示了微生物基因组的单核苷酸变体(SNVs)或结构变体(SVs)与宿主表型之间潜在的统计学关联。最后,MAGs使我们能够对未培养的细菌物种进行基因组尺度的代谢建模,这些物种构成人类肠道微生物组的很大一部分,最终能够实现对个体微生物组的代谢建模。

从宏基因组测序读数组装单个微生物基因组

从源自多种微生物的混合短读长序列生成MAGs是基因组解析宏基因组学的第一步。MAGs的构建包括两个步骤:组装和分箱(binning)。

在初始组装步骤中,短读长被拼接成更长的contigs,类似于拼图,其中这些短读长的重叠区域充当连接元素。通常有两种组装模型:重叠-布局-共识(OLC)模型和de Bruijn图。在OLC模型中,每个读长表示为图中的一个节点,读长间的重叠表示为边。然而,随着测序深度的增加,这种方法可能导致大型且复杂的图。相比之下,de Bruijn图模型通过将读长分割成k-mers来提高可伸缩性。短读长组装器如metaSPAdes和MEGAHIT通过将短读长分割成k-mer片段,然后使用de Bruijn图将这些片段组装成扩展contigs。组装过程可以通过两种方式执行:单组装,即每个样本独立进行组装;共组装,在合并多个样本后执行,即池化多个样本后进行组装。每种方法都有其优点和缺点。与海洋和土壤等相互连接的环境样本不同,人类肠道微生物组代表一个独特的环境,在个体间有所不同。因此,保存亚种特异性变异(如SNVs)至关重要。在de Bruijn图中,这种亚种特异性保存可以通过多种路径实现。然而,此过程导致产生大量碎片化的contigs。因此,我们推荐采用单组装方法。如果目标是捕获低丰度分类单元,建议增加测序深度,而不是进行共组装。

接下来是分箱步骤,将源自同一基因组的contigs归入一个bin,每个bin对应一个特定基因组。分箱涉及基于序列组成和覆盖深度聚类相似的contigs。序列组成指核苷酸特征,包括k-mers。鉴于物种通过基因组中k-mers和GC比率的恒定性来区分,这些特征可用于将contigs聚类到一个基因组bin中。四核苷酸频率(TNF)是此目的最常使用的指标,在与其他k-mer大小的比较中表现更佳。此外,来自同一基因组的contigs在样本中共丰度,因此具有相似覆盖深度的contigs更可能属于同一基因组。覆盖深度可从单个样本(单覆盖深度分箱)和样本组(多覆盖深度分箱)计算。这两种方法各有优缺点。基于单个样本中共丰度的单覆盖深度分箱可能将受污染的contigs引入到基因组bin中,影响下游分析。为缓解此问题,我们建议使用基于多个样本间共丰度的多覆盖深度分箱。实施此方法需要仔细考虑哪些样本应集体分析,以确保准确性并减少污染风险。

此外,在聚类源自同一物种的contigs时,各种工具在分箱中使用的特征和算法上存在差异。鉴于没有单一工具在所有场景中都普遍表现最佳,使用多种分箱工具并通过集成方法组合它们的结果是常见做法。合并步骤,也称为bin精细化,结合了多个分箱工具的结果,创建具有最高质量组合contigs的单个bin。用于此过程的工具已在补充表1d中总结。

生成的基因组序列可用于各种下游分析,因此我们需要衡量最终bin的质量,即单个基因组序列。虽然有N50和contigs数量等定量质量指标,但有两个绝对指标用于衡量基因组质量,普遍定义MAG质量:完整性和污染度。基因组序列的可靠性与完整性成正比,与污染水平成反比。根据广泛认可的宏基因组组装基因组(MIMAG)最小信息标准,完整性超过50%且污染度低于10%的基因组被分类为中质量草图基因组。相反,完整性超过90%且污染度低于5%的基因组被视为近完整草图基因组。完整性指组装的基因组序列覆盖实际基因组的程度。基因组序列的低完整性在推断功能能力或进行代谢建模时,可能导致对物种功能能力的低估。基因组序列中的污染表明存在不属于被测序基因组的外来片段。基因组序列中的污染可由多种来源引起,包括由于binning过程中相似序列组成而混合的亲缘关系密切的基因组。此外,由于各种原因,系统发育遥远的基因组可能变得受污染。各种计算工具可用于检测基因组中的污染,出于全面质量控制的目的,由于这些工具的不同优势,建议使用多种工具。

通过MAGs扩展系统发育及其分类

生物信息学的最新进展和宏基因组测序成本的降低,极大地促进了对细菌MAGs的大规模构建,这需要准确的分类。传统上,细菌基因组分类依赖于国家生物技术信息中心(NCBI)分类法,该系统基于原核生物国际命名法规。然而,这种共识基础的命名系统在快速识别和分类新物种方面往往难以跟上步伐。为解决这些挑战,一种自动客观的方法是将新的细菌和古菌基因组整合到参考系统发育树中。

基因组分类数据库(GTDB)是一个参考细菌分类数据库,为此提供了当代解决方案。与NCBI分类法不同,GTDB基于120个特定单拷贝标记蛋白对细菌基因组进行参考。GTDB还努力纠正传统分类法中的常见问题,如去除多系群以使系统发育与分类一致,以及标准化不平等的分类等级。GTDB工具包(GTDB-Tk)已开发出来,通过将新物种置于GTDB框架内,便于新基因组的准确分类。这种系统发育参考允许基于基因组序列进行新物种的分类学注释,即使对于新物种,通过推断其在系统发育中的位置。

许多MAGs已揭示了新的微生物物种,显著扩展了当前的系统发育树。这一进展在人类肠道微生物组研究中尤为明显,其中只有有限数量的物种被分离培养,留下绝大多数物种未培养。迄今为止,在人类参考肠道微生物组(HRGM)中编目的不到20%的原核物种至少有一个来自分离菌株的基因组(分离基因组),而大多数物种仅由MAGs定义。值得注意的是,几个大型细菌类群尚无任何分离基因组。随着通过MAGs组装未培养物种基因组的日益便捷,代表原核生命的系统发育树有望快速扩展。

MAGs的功能注释:理解新基因组

编目基因组的组成部分是理解细菌物种的基本步骤,包括在MAGs中预测开放阅读框(ORFs)及其功能注释。最近的基准研究表明,各种基因预测工具中没有一种普遍表现优于其他工具。然而,Prodigal作为一种在该领域广为人知的最流行工具,表现出稳健的性能。Prodigal通过无监督学习识别序列中的关键特征,如核糖体结合位点(RBS)基序、起始密码子使用和编码统计。这种方法允许在非模型细菌生物体中进行有效的基因预测。一旦预测ORFs,它们将经过自动功能注释,其中每个基因根据其与已知蛋白质的同源性分配功能术语。

eggNOG是用于此类同源功能注释的广泛使用数据库,包含数百万个直系同源群(OGs)。与其他注释工具相比,eggNOG-mapper因高准确性而特别值得注意,这是通过有效区分旁系同源物——具有潜在不同功能的相似序列而实现的。其他提供同源功能注释的工具包括InterProScan、Prokka、Bakta、DRAM和MicrobeAnnotator。功能注释工具利用各种数据库进行注释,突出包括KEGG(通路/直系同源)、基因本体、Pfam和碳水化合物活性酶数据库(CAZy)的注释。

基因组挖掘是识别原核基因组中具有特定功能基因的关键方法,特别是在抗生素耐药性背景下,由于抗生素的广泛使用,抗生素耐药性已成为人类健康日益关注的问题。这种过度使用导致了耐药病原体的出现。抗生素耐药基因(ARGs)可能起源于共生细菌,当它们通过水平基因转移(HGT)转移到病原体时,就成为重大风险。最近对人类肠道微生物组的研究表明,抗生素消费与微生物组中ARGs的流行率相关。ARGs的检测通常涉及将序列与已知ARG参考数据库对齐,以进行基于同源性的识别,使用RGI或ABRicate等工具。对于识别新ARGs,还使用了隐马尔可夫模型(HMM)方法,如ResFam或fARGene,以及深度学习技术如deepARG或PLM-ARG。

抗菌肽(AMPs)是由不到100个氨基酸组成的短肽,抑制包括细菌、真菌、寄生虫和病毒在内的多种微生物的生长。这些肽正被评估为潜在的抗生素替代品,主要归因于其抗炎和免疫调节特性。鉴于人类肠道微生物组的多样性,它有望成为新型AMPs的丰富来源。研究日益关注源自人类肠道微生物组的AMPs,因为它们可能对人类细胞无毒。机器学习方法在识别AMPs方面已被证明比同源方法更有效,这是由于其短长度。此外,最近的努力一直致力于利用深度学习技术在人类肠道微生物组中发现新型AMP候选物。

通过MAGs扩展泛基因组:揭示个体微生物物种的全部功能潜力

个体物种的MAGs集合为了解其功能潜力提供了洞见,通常被概念化为泛基因组,包括物种中所有基因,包含核心基因组(大多数菌株共有的基因)和辅助基因组(仅部分菌株中发现的基因)。MAGs的纳入已导致许多物种的泛基因组规模显著扩大,超过了仅从分离基因组构建的泛基因组。这一现象以人类参考肠道微生物组(HRGM)中Akkermansia muciniphila的泛基因组分析为例。

辅助基因组(对亚种内功能多样性至关重要)在适应不同宿主方面发挥关键作用,可与致病性状相关联。因此,开发一个区分核心和辅助基因组的全面泛基因组对于深入理解不同宿主人群中微生物物种内的多样性至关重要。

泛基因组分析的基本方法包括收集物种的所有蛋白质序列并聚类以识别同源基因。虽然这种方法有效,但它无法区分旁系同源物,即基因组内基因复制衍生的基因,通常具有不同的功能。更先进的技术使用基于基因邻域信息的图形方法将同源基因分组,同时保留共线性。这种策略广泛用于泛基因组分析工具,如Roary、PPanGGOLiN和panaroo。然而,这些工具在聚类基因时可能遇到困难,特别是在受水平基因转移影响的基因。

基因组质量在泛基因组分析中起着关键作用。MAGs虽然易于获取,但往往面临碎片化组装和分箱过程中潜在污染等质量问题。碎片化组装可能导致基因丢失,特别是在contig末端,这可能影响核心基因组。相反,污染可能导致辅助基因组中的假阳性,导致明显的扩展。panaroo是一种广泛用于MAGs泛基因组分析的工具,尽管并非专门为MAGs设计,但能够处理与MAGs相关的挑战,如截断末端和潜在污染。

为特定环境编目微生物基因组:迈向全面的参考微生物组

微生物组样本的分类和功能分析可通过基于组装或非组装方法实现。基于组装的方法涉及从contigs和物种bin中从头组装序列读数,虽然不依赖于参考微生物基因组,但耗时且计算密集。因此,对于像人类肠道这样常用的研究环境,首选方法是利用特定环境的参考微生物基因组的非组装方法。MAGs的大量收集促使了针对特定环境的参考数据库研究的深入发展。这些参考库为特定环境提供丰富的基因组和蛋白质序列源,有助于识别先前未知的基因组和蛋白质。对于像人类肠道微生物组这样的复杂环境,使用特定环境的参考库作为数据库非常有利,无需从头组装即可实现快速准确的微生物组样本分类和功能分析。

有几个人类肠道特定的参考微生物基因组目录。统一人类胃肠道基因组(UHGG)是一个综合目录,合并了三个先前的人类肠道细菌基因组大规模收集。UHGG提供了跨越4644个原核物种的204,938个非冗余基因组。然而,UHGG收集具有地理偏差,主要代表来自美国、中国、丹麦和西班牙的样本,因此缺乏来自亚洲和非洲大部分国家的肠道微生物数据。为减轻这一限制,引入了HRGM,其中增加了来自韩国、印度和日本三个东亚国家的粪便宏基因组样本。HRGM将范围扩展到跨越5414个原核物种的232,098个非冗余基因组,与UHGG相比,基因组和物种数量均增加了约10%。这些目录大大提高了对微生物组分类读数的分类能力,超过了传统目录(如参考序列(RefSeq)数据库)所提供的范围,强调了为研究人类肠道微生物组拥有综合目录的重要性。此外,还产生了额外的肠道微生物组目录,重点是代表性不足的地理区域,如以色列、新加坡和内蒙古。此外,对3岁以下儿童粪便宏基因组中MAGs的编目揭示了许多新的微生物物种,为早期人类肠道微生物组研究提供了宝贵见解。

序列解析微生物组分析:人类微生物组的群体遗传学视角

基因组解析微生物组分析的关键优势在于将基因组学应用于人类微生物组研究。通过访问各种亚种的大量基因组,已经可以探索人类微生物组中物种内的遗传多样性。这种遗传变异对于多种应用至关重要,包括追踪相同菌株、确定特定菌株与宿主表型之间的联系,以及发现与宿主表型相关的细菌遗传变异。利用菌株间的单核苷酸变异(SNVs)进行的菌株水平分析已证明具有关键作用。最近的研究表明细菌SNVs与宿主表型(如体重指数)相关,突显了微生物组研究中核苷酸水平多样性的重要性。对人类肠道微生物中细菌结构变异(SVs)的分析也已进行,研究了它们与人类健康的关系。例如,人类肠道细菌中的结构变异已与胆汁酸代谢和免疫检查点抑制剂反应相关,从而揭示了基因组解析分析在理解人类微生物组方面提供的深刻见解。

检测细菌遗传变异的传统方法涉及培养微生物、分离其基因组、对其进行测序,然后通过全基因组比对识别差异。然而,这种方法对人类肠道微生物组效果不佳,因为微生物组的很大一部分未被培养。另一种策略,宏基因分型,涉及将WMS读数与参考微生物基因组对齐,以识别遗传变异;该策略为分析人类肠道微生物组提供了可行解决方案。宏基因分型读数对齐的关键工具包括StrainPhlAn、metaSNV和MIDAS。这些方法虽然全面,但耗时且需要高读数覆盖深度,以准确区分实际遗传变异和测序错误。为了克服这些限制,已开发了使用精确k-mer匹配算法进行宏基因分型的新工具,如GT-Pro。k-mer基于的方法比读数比对基于的方法更快,尽管有时准确性较低。

宏基因分型已成为探索微生物群落菌株水平传播的关键工具。宏基因分型的应用范围从研究体内微生物转移(如从口腔到肠道),到调查特定疾病如何与口腔-肠道微生物传播相关联。除了个体层面的研究,宏基因分型对检查个体间微生物转移也很重要,包括从母亲到婴儿的垂直传播和在家庭或更大人口中的微生物共享。宏基因分型的另一重要应用是在粪便微生物组移植(FMT)后分析菌株水平变化,为这种治疗干预提供了宝贵见解。这些例子突显了宏基因分型在各种与传播相关研究领域的多功能性和潜在有用性。

宏基因分型在跟踪肠道微生物组的进化动态方面也已被证明有效,无论是在个体内还是跨个体。当应用于个体内纵向样本时,该技术允许比较个体内和个体间菌株的相似性。宏基因分型还使观察物种特定菌株在个体内随时间演变成为可能。此外,宏基因分型已被用于检测肠道微生物因抗生素治疗等外部影响而发生遗传变化的情况。这些应用表明,宏基因分型在更广泛的研究中具有相当大的潜力,特别是在检查各种因素如何诱导肠道微生物遗传变异方面。

MAGs的代谢建模:实现个性化微生物组的代谢模拟

随着个性化医学的进展,模拟宿主-微生物组代谢相互作用对于预测健康结果和定制治疗变得至关重要。过去,代谢工程领域主要使用为可培养物种重建的基因组规模代谢模型(GEMs)来预测遗传内容。目前,MAGs数量的激增为重建肠道共生微生物的GEMs打开了大门,而这些微生物尚未被培养。

重建GEMs的主要目标是描述特定生物体的行为并预测个体模型内的相互作用。基因组序列重建是一个细致且劳动密集型的过程,需要彻底校对。鉴于人类微生物组中微生物的巨大多样性,包括数千个物种,自动化这一过程至关重要。为此,已开发了多种用于自动GEM重建的工具,如RAVEN、Pathway Tools和merlin,这些工具大大有助于基于MAG的代谢建模。值得注意的是,ModelSEED、CarveMe和gapseq等工具特别引人注目。

ModelSEED是一个网络平台,简化了生成草图代谢模型的过程。该平台使用SEED框架流程,从组装基因组序列并将其提交到RAST注释服务器进行遗传内容预测开始。这个过程包括构建基因-蛋白质-反应关联、生成生物量反应、组装反应网络以及分析反应可逆性热力学。最终结果是一个优化的草图模型。AGORA项目使用ModelSEED流程,通过结合MAGs的自动草图模型生成和手动校对,为人类肠道细菌生产了7,300多个GEMs。

CarveMe是为快速自动重建GEMs设计的命令行工具。该过程从BiGG模型中的反应和代谢物创建通用草图模型开始,并通过添加细菌代谢的手动注释关键方面来完善,形成通用模型。CarveMe随后通过一个称为"雕刻"的过程定制该模型,包括填补空缺和移除每个物种不相关的反应和代谢物。此流程快速地从基因组序列重建代谢模型,同时保持关键代谢功能。

gapseq是另一种用于模型重建的自动工具,它利用多种生化数据库通过遗传内容预测通路。与其他工具不同,它从UniProt蛋白质序列数据库和转运蛋白分类数据库(TCDB)中获取反应数据库源,包含131,207个独特序列。这些序列对15,150个反应和8,446个代谢物有贡献,集成到通用模型中进行重建和填补空缺,从而提供模型构建的综合方法。

从GEMs推断生物体表型行为的主要技术是基于约束的重建和分析(COBRA)。COBRA采用系统生物学方法,数学和计算模型化生物体在各种约束下的表型行为。这些约束可以代表遗传变异、环境条件或不同行为之间的相互作用。在COBRA框架内,通量平衡分析(FBA)是一个广为人知的方法。FBA使用数学技术解决线性问题,确定特定约束下重建代谢模型内的最佳代谢通量(质量或速率)。FBA特别适用于模拟各种生物现象,包括最大生长率、代谢物产生率以及基因敲除的影响。

人类肠道细菌的GEMs通常用于预测微生物间代谢相互作用并进行群落代谢建模。像CASINO、BacArena和微生物组建模工具箱这样的工具是这些应用中最受欢迎的。肠道中的许多细菌物种在代谢上依赖其他物种,这种依赖性通常决定其在微生物群落中的共同出现。模拟这些代谢相互作用对理解包括人类肠道微生物组在内的微生物生态系统结构和弹性至关重要。此外,个性化肠道微生物组的代谢建模可以揭示特定代谢物在人类疾病中的作用。这方面的建模尤其重要,因为它可以揭示微生物组、疾病和潜在治疗之间的联系。此外,模拟宿主、微生物组和饮食之间的相互作用可以为个性化饮食建议或药物剂量提供信息。因此,利用MAGs和GEMs的群落范围代谢建模有望为精准微生物组医学做出重大贡献。

局限性和挑战

在当前的人类微生物组研究中应用基因组解析宏基因组学存在一些挑战和局限性。首先,现有数据库中的MAGs有很大一部分代表不完整基因组。这些基因组通常包含缺口。参考基因组的质量在后续基于基因组的微生物组分析中起着关键作用。因此,正在进行积极研究以开发能够重建完整MAGs(cMAGs)而无任何缺口的方法。传统短读长测序技术在组装不同物种间保守的序列区域(如16S rRNA基因)以及捕获通过水平基因转移在物种间转移的基因组区域方面存在不足。研究人员正在探索纳入长读长测序作为解决方案。最初,杂交测序结合了短读长测序的核苷酸级精度和长读长序列的模板,用于构建cMAGs。最近,仅使用高保真长读长测序也已成功用于构建cMAGs。高保真长读长宏基因组测序的使用有望使人体内共生细菌的完整基因组数量快速增加。

其次,MAGs主要从来自有限国家的宏基因组样本组装而成。这种微生物组数据中的不平等代表以及相应的组装基因组可能导致多种问题。这些问题包括对不同人口中微生物组多样性的理解不完整,以及参考微生物基因组编目不完整。潜在后果包括识别与疾病相关微生物时的不一致和在比较微生物组研究中的误解释。因此,未来MAG为基础的人类微生物组研究应优先考虑代表性不足的人群。

第三,将基因组解析宏基因组学应用于低生物量样本(如组织微生物组)具有挑战性。在这种情况下,鸟枪测序读数中只有一小部分源自微生物基因组。为解决这一挑战,已开发了各种用于去除宿主DNA的方法,并且目前有几种商用宿主DNA去除试剂盒。有效富集细菌DNA显著增加了从低生物量样本重建MAGs的可能性。这将基因组解析宏基因组学方法的适用性扩展到人体内更广泛的微生物群落。

【全文结束】