拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Cell|Metax 实现宏基因组跨域分类谱的准确刻画

Cell|Metax 实现宏基因组跨域分类谱的准确刻画 摘要分类学谱分析taxonomic profiling是微生物组研究的基础但在跨越细菌、病毒、真核微生物与古菌的复杂群落中实现高物种水平精度仍然具有挑战性而在低生物量、宿主占主导的样本中这些局限进一步被放大。作者提出Metax一种跨域cross-domain宏基因组分类谱工具其将基于覆盖度的概率建模与期望最大化expectation-maximizationEM框架相整合以区分真实微生物信号与伪影。在超过 600 份宿主相关、环境、废水及低生物量临床样本包括参考基因组代表性有限的基准中Metax 提高了分类谱准确性平均 F1 分数比其他方法高 55%Bray-Curtis 相异度低 45%。该广泛评估表明Metax 可解析口腔微生物组中种植体周围炎peri-implantitis的细菌与病毒特征并揭示血浆游离 DNAcell-free DNAcfDNA中提示试剂来源污染物与参考基因组错误组装的信号。通过利用全基因组覆盖度证据Metax 可在多样样本类型与测序深度下实现稳健的跨域分类谱分析包括参考数据库高度不完整的场景。keywords宏基因组分类谱跨域分析覆盖度证据期望最大化低生物量样本伪影识别病原体检测文献信息Deng, Z.-L., Safaei, N., McHardy, A. C. (2026). Metax enables accurate cross-domain taxonomic profiling of metagenomes.Cell, 189, 1–16. https://doi.org/10.1016/j.cell.2026.08.024期刊CellIF45.1发表时间2026 年 10 月 29 日研究总结Metax研究背景宏基因组分类谱低生物量宿主样本参考库不完整方法读段比对覆盖度统计期望最大化伪影过滤结果跨域物种水平提升浅测序稳健临床病原识别污染与参考错误识别应用口腔炎症疾病肿瘤血浆cfDNA废水病原监测背景介绍鸟枪法宏基因组学shotgun metagenomics可在不依赖培养的条件下同时检测细菌、古菌、病毒与微真核生物已成为表征群落组成、功能与宿主—微生物关系的关键手段。然而读段分配歧义、浅测序导致的基因组覆盖不足、参考基因组错装以及低生物量或宿主占优样本中的试剂来源 DNAkitome和残留宿主序列会严重损害物种水平分辨率与丰度估计。为解决上述问题作者开发Metax一种基于全基因组覆盖度信息的概率型跨域分类谱工具并在人类肠道、临床体液、海洋、土壤、废水、口腔与肿瘤相关数据中系统评估其性能。重要结果Metax 利用覆盖度信息进行分类谱分析的流程Metax 将序列同源性、概率读段分配与基因组覆盖度一致性整合。真实存在的分类单元不仅应有映射读段还应表现为全基因组范围的广泛覆盖而污染参考、试剂 DNA、保守位点与可移动遗传元件mobile genetic elementsMGEs常产生局部假阳性信号。流程包括读段比对与过滤、专属映射与多映射读段分离、SEM 物种间 EM 解析与 SNM 物种最低共同祖先lowest common ancestorLCA分配、观测覆盖广度与随机采样模型下期望广度的比较OEBR 与 COEBR、以及过滤后相对丰度计算。图 1. Metax 利用基因组覆盖度信息进行分类谱分析。Metax 将读段比对、概率分配与基因组覆盖度统计相结合在抑制局部假阳性信号的同时估计分类谱。读段被比对到参考基因组可用时利用物种特异性证据解析模糊读段并通过比较观测广度与期望广度来评估分类单元判定。(A) Metax 工作流程。(B) 基因组覆盖广度与深度的示意。(C–F) Metax 标记由参考污染、试剂 DNA 片段、共享保守直系同源基因或 MGE 的近缘物种引起的假阳性发现并识别真实分类单元。在人类肠道复杂群落中改善物种水平跨域分类谱在十个人类肠道模拟宏基因组中Metax 与其他工具使用相同参考集合进行比较。Metax 在物种水平 F1 分数上较其他分类器提高 4%–134%完整性recall达 0.75±0.018且不牺牲纯度precision。相对丰度方面加权 UniFrac 误差为 0.21±0.047物种水平 Bray-Curtis 相异度为 0.39±0.066丰度排序误差abundance rank errorARE为 0.21±0.019均显著优于基于标记基因、k-mer 草图或 k-mer 匹配的方法。图 2. 在物种水平上对 Metax 在模拟肠道与临床宏基因组样本上的性能评估。(A) 不同分类器在肠道宏基因组上的性能指标。(B) 在较低测序深度下不同分类器在腹水与脑脊液样本上预测分类谱的质量。© 不同分类器检测细菌、真菌与病毒类群的 F1 分数。(D) 不同方法恢复的分类谱完整性。(E) 不同测序深度下的丰度估计。浅测序深度下的稳健性能在腹水ascites与脑脊液cerebrospinal fluidCSF模拟样本中Metax 于 1k、10k、100k、1M 微生物读段下均保持 F1≈0.99。其他工具仅在 100k 或 1M 读段时对细菌接近 Metax而对真菌与病毒不稳定。Metax 的物种水平 Bray-Curtis 相异度为 0.016ARE 为 0.0079说明其在低生物量、宿主背景下仍可提供可靠鉴定与丰度估计。对深度测序海洋群落的准确物种水平估计在 CAMI II 海洋数据每样本 5 Gb 短读与长读中Metax 物种水平 F1 为 0.88加权 UniFrac 误差 0.015物种水平 Bray-Curtis 相异度 0.01与真实丰度 Pearson 相关 r0.97p2.2×10⁻¹⁶ARE 0.12均处于领先水平。图 3. (A) CAMI II 海洋数据上的 F1 分数、Bray-Curtis 相异度、ARE 与加权 UniFrac 误差。(B) Metax 预测的物种丰度与真实丰度对比图中给出 Pearson 相关系数 r 与 p 值。© Metax 在长读 LRI 样本中检出的病原体丰度排名。(D) LRI 样本中致病与非致病类群的预测丰度。(E) CAMI II 病原体检测数据集中的类群按预测丰度排序。高菌株多样性与参考不足的土壤宏基因组中的泛化性土壤模拟基准中 76% 物种不在参考库中且每物种含 3–10 株。所有方法物种水平均受限但 Metax 平均 F1 最高0.24属、科水平分别达 0.69 与 0.70科水平纯度 0.95。结果表明当许多真实物种缺失于数据库时Metax 在较高分类阶元仍稳健。真实临床感染样本中病原体的准确检测在 34 份下呼吸道感染lower respiratory tract infectionLRI纳米孔长读阳性样本与 7 份阴性样本中Metax 对阳性样本全部识别可能病原阴性样本无误报灵敏度与特异度均为 100%88% 阳性样本中原病原丰度排名第一。CAMI II 病原体数据中克里米亚—刚果出血热病毒由 Metax 判为最丰富类群28.16%而 Centrifuge 仅给 0.14%。废水宏基因组与宏转录组中确认病原的回收在含 qPCR 确认的胡椒轻斑驳病毒pepper mild mottle virusPMMV、SARS-CoV-2、番茄褐色皱果病毒ToBRFV、Mamastrovirus 与腺病毒的废水数据中Metax 从 10k 读段起回收 PMMV100k 起完整回收 Mamastrovirus原深度下 11 份 SARS-CoV-2 阳性全回收且无假阳性腺病毒在高子采样深度下亦全回收。通过覆盖度统计降低假阳性分类单元OEBRobserved-to-expected breadth ratio接近 1 的类群几乎全为真阳性明显偏离 1 者假发现率升高。广度异常假阳性breadth-outlier FPBO-FP多来自碎片化、低质量参考组装。人全基因组 GIAB 数据中Metax 将弓形虫等原虫判为 OEBR0.2 的假阳性并指其参考组装可能嵌入未表征人类序列。图 4. Metax 假阳性识别能力分析。(A) 不同观测广度与期望广度区间上的假发现率。(B) 真阳性与假阳性物种的参考基因组组装水平与质量。© 真阳性、假阳性与广度异常假阳性BO-FP物种的基因组组装碎片化程度。(D) 临床腹水样本中以低 OEBR 检出的弓形虫Toxoplasma gondii。(E) GIAB 数据中由极端 OEBR 判定的假阳性微生物类群。(F) (E) 中假阳性类群的高度碎片化参考组装。(G) 在受污染组装中假阳性物种的检出情况。(H) 由 OEBR、COEBR、pB、pBc 识别出的假阳性集合的重叠情况。肿瘤血浆 cfDNA 中提示污染与试剂来源的信号在克罗恩病Crohn’s diseaseCD、1 型糖尿病T1D肠道数据与黑色素瘤、非小细胞肺腺癌、胰腺癌血浆 cfDNA 比较中肠道与阳性对照类群 OEBR≈1肿瘤 cfDNA 中 Thermus、Delftia、Acidovorax、Polynucleobacter 等具极端 OEBR符合试剂来源或实验室污染模式。Metax 因此可抑制肿瘤微生物研究中的伪信号。图 5. (A) 肠道微生物组、肿瘤血浆 cfDNA 与阳性对照样本中类群的 OEBR。(B) 在 MN 与 PC 数据集中按读段数“检出”的前五个属。口腔微生物组中的跨域标志发现与表型预测在 317 份口腔样本健康、黏膜炎、种植体周围炎中Metax 显示病毒尤其 Redondoviridae、Papillomaviridae贡献显著。多维尺度MDS与 PCoA 清晰分开健康与种植体周围炎ANCOM-BC 找到红复合体red complex及 Redondo 病毒在炎症位点富集。Redondoviridae 与 Entamoeba gingivalis 18S rRNA 存在强共现OR22.3。随机森林区分健康与疾病 10 折交叉验证 AUC 0.94最佳模型 0.98。图 6. 使用 Metax 对口腔微生物组队列的分析。(A) 细菌、真核生物与病毒的丰度。(B) 病毒主导样本中病毒科的丰度与读段数。© 病毒科的检出率。(D) 健康与种植体周围炎位点的 MDS 分析。(E) 差异丰度物种。(F) E. gingivalis 与 Redondoviridae 的共现关系。(G) 交叉验证各折的 AUC。(H) 对分类重要的类群。方法学参考测序读段与分类注释参考基因组比对按一致度与映射长度过滤计算覆盖深度D与覆盖广度B及分块广度Bc区分SEM与SNM物种SEM多映射读段进入EM估计深度SNM读段用LCA分配计算OEBR与COEBR及广度概率过滤局部伪影与异常广度类群按最终深度计算相对丰度关键可复用方法包括基于随机采样模型的期望广度推导、OEBR/COEBR 伪影指标、EM 解析多映射读段、分数索引fractional index降低内存、以及将覆盖度统计用于参考污染审计。总结Metax 通过全基因组覆盖度证据与概率框架在复杂肠道、海洋、土壤、临床低生物量、废水与肿瘤相关样本中实现了准确的跨域分类谱。其核心贡献不在于单纯提高丰度相关性而在于用观测—期望覆盖广度不一致来甄别局部相似、参考污染、试剂 DNA 与 MGE 引起的假信号。由此Metax 既可作分类器也可作污染感知型质控工具。在口腔数据中它还能恢复超小基因组病毒与专性共生菌的跨域生态关系。其局限仍受参考库完整性、样品类型与读段支持度影响OEBR 指示全基因组支持但不证明生物学起源或活性。参考文献Deng, Z.-L., Safaei, N., McHardy, A. C. (2026). Metax enables accurate cross-domain taxonomic profiling of metagenomes.Cell, 189, 1–16. https://doi.org/10.1016/j.cell.2026.08.024Metax 代码库https://github.com/hzi-bifo/MetaxCAMI II 数据https://cami-challenge.org/datasets/GIAB 人类 WGShttps://www.nist.gov/programs-projects/genome-bottleOral microbiome cohortNCBI BioProject PRJNA547717废水数据NCBI BioProject PRJNA948850
返回列表