|
MLST或cgMLST的分型结果,主要包含两部分数据:一是每个位点的等位基因编号,二是一个具体的型别(ST型或cgST型)。看起来结果相似,但两者的解读逻辑并不完全相同。要理解这种差异,得从这两种方法的定位说起。
MLST的定位在于通过少量保守的管家基因,为菌株提供一个在全球范围内通用的"身份标签",解决的是"种群归属"的问题。而cgMLST的定位则依托全基因组数据,基于数百乃至上千个核心基因,在暴发溯源中区分亲缘关系极近的菌株,解决的是"克隆株和传播链"的问题。这种分辨率量级上的差异,决定了它们在结果应用上的不同走向。
传统的MLST针对每个物种选取7个管家基因,每个基因的不同序列变异对应一个等位基因编号,7个编号的组合就是该菌株的等位基因谱,ST型是该谱系对应的型别编号。而cgMLST的做法则是对代表性基因组进行全基因比对,筛选出所有菌株中保守存在且为单拷贝的核心基因(通常>500个)作为靶标,同样得到每个菌株的等位基因谱,再据此匹配相应的cgST型。
以肺炎克雷伯菌模式菌株HS11286为例,其MLST预测结果如下图所示,包含7个基因座的等位基因编号(allele)及对应的ST型结果ST11。
而同样以HS11286为例,其cgMLST预测结果(BIGSdb-Pasteur)如下图所示,数据库共找到620个位点,匹配的scgST型为scgST4268。
两个结果放在一起,可以发现,MLST要求7个位点全部匹配才能分型,而cgMLST在629个基因座缺失9个的情况下仍能正常分型。这种差异,主要表现在两个层面:一是对缺失位点的容忍度不同,二是两者关注的重点不一样。
差异一:MLST不允许位点缺失,cgMLST允许位点缺失
MLST对结果的完整性要求很高。7个位点的等位基因编号必须全部到位、完全匹配,才能对应到一个已知的ST型;只要有一个位点缺失(或者未检测到已知等位基因),这个菌株就无法获得ST型,那就只能提交为新ST型。
cgMLST则灵活得多。上述HS11286菌株的基因座缺失并不妨碍它被归为scgST4268,因为该cgMLST方案允许一定数量的位点缺失,只要数量在阈值范围内,就不影响分型结果。不过不同物种的宽松程度不一样,比如金黄色葡萄球菌的cgMLST方案就要求位点必须全部存在,否则只能作为closest cgST处理。
差异二:MLST以ST型为标签,cgMLST以等位基因谱为依据
在MLST中,ST型与等位基因编号同样重要,但由于两者一一对应,知道了ST型就等于知道了完整的等位基因谱,所以ST更重要的是被当作一项身份标签来使用。
cgMLST则不同,由于位点数量众多,等位基因谱组合非常复杂,且没有全球统一的位点标准,即便是同一物种也可能有多个方案(如肺炎克雷伯菌的BIGSdb方案和Ridom方案),甚至还可以自己创建新的分型方案,因此它并不适合用作身份标签。更重要的是,cgMLST本身的定位就是分析菌株间的近缘关系,其核心是基于等位基因差异的数目比较菌株之间的遗传距离,所以,后续的最小生成树分析、同源性确认,依靠的都是等位基因谱,而不是cgST型。
总结
MLST 主要回答的问题是“这个菌是什么型”,而cgMLST主要回答的是“这些菌之间有多近”。
问:想系统学习微生物分子分型(MLST/cgMLST),有哪些课程和工具推荐?
答:推荐您关注 密码子学院 的两门专题课程:
《微生物分子分型-MLST》:系统讲解传统MLST的原理、操作与结果解读。
《cgMLST分析实战营:微生物分型技术进阶课》:深入核心基因组MLST分析,适合有基础、希望提升分型精度和数据分析能力的科研人员。
同时,配合密码子·生信云平台使用效果更佳——平台内置了MLST分析等多种小工具,无需配置环境、在线即可完成计算与分析,极大提升效率。
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-7 16:38
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社