NiuXiangna的个人博客分享 http://blog.sciencenet.cn/u/NiuXiangna

博文

微生物比较基因组常见分析内容及方法

已有 118 次阅读 2026-8-17 09:22 |系统分类:科研笔记

微生物比较基因组分析(Comparative Genomics),简单来说就是,把多个微生物菌株的基因组放在一起比较,找出它们“共同拥有的东西”和“各自不同的东西”,进一步解释菌株之间的亲缘关系、遗传差异、表型差异以及进化过程。它是微生物基因组研究中非常核心的一类分析。

比较基因组有很多种具体的分析方法,但是专业的微生物分析绝对不是单纯的运行软件(什么是专业的微生物分析?),它是以解决科学问题、得到科研结论为导向的完整科研逻辑,以多个微生物基因组为研究对象,通过比较基因组结构、基因组成、序列变异和功能特征,解析菌株间的遗传差异、亲缘关系、进化历史及其与表型特征之间的潜在关联,也即

“找共同点→找差异→找关系→找原因”。

比较基因组分析还可以进一步划成 “基础比较基因组 → 泛基因组 → 进化分析 → 差异基因 → 表型关联(GWAS) → 专题功能分析”常见的六个常见层级,在密码子学院公众号中针对每个层级都有详细的学习资料,可点击学习。

今天主要给大家介绍一些入门级的比较基因组分析方法以及每个方法对应解决的科学问题。

图片

一、物种鉴定与总体基因组相似性

如果你拿到一批菌株,首先需要判断它们是否属于同一物种、哪些样本可以放在一起比较,或者哪一株适合作为参考基因组,那么你需要先做总体基因组相似性分析。ANI比较基因组间可比区域的平均核苷酸一致性,是原核生物物种界定和大规模基因组筛选的重要指标。当ANI接近物种边界、分类结论不一致或需要与传统DNA-DNA杂交标准衔接时,可进一步参考数字DNA-DNA杂交(dDDH)结果。

ANI和dDDH必须结合可比区域比例、组装完整性、污染水平及分类背景解释。较高ANI仅说明可比区域高度相似,不能证明基因内容完全一致,也不能排除质粒、基因岛和大片段插入缺失。对于种内菌株的高分辨率关系,应继续使用核心SNP或核心同源基因信息,而不能把ANI矩阵直接当作系统发育树。

二、同源基因、基因家族与泛基因组

如果你已经观察到耐药、毒力、代谢或环境适应性差异,想进一步判断这些差异可能与哪些基因、基因家族或基因获得—缺失有关,那么你需要开展同源基因、基因家族和泛基因组分析。BLAST适合目标基因、引物、功能区域和局部序列的相似性检索,可报告命中位置、方向、比对长度、覆盖度、一致性和E值[3]。BLAST命中只能说明局部序列相似,不能仅凭最高一致性就完成严格的同源关系判定;短片段、重复结构域和多个拷贝需要单独核查。

当研究目标扩展到多个基因组中的系统性同源关系时,可使用统一蛋白集开展OrthoFinder分析。其输出包括orthogroup、直系同源关系、基因树、物种树和基因复制事件。同一物种内的多菌株研究还可使用泛基因组聚类工具生成基因存在—缺失矩阵,并划分核心、附属和特有基因。以Panaroo为代表的图结构方法可降低注释碎片、污染和基因误分割对泛基因组结果的影响。

同源基因和泛基因组分析应尽量使用统一的组装、基因预测和注释流程,并预先过滤污染、异常短蛋白和质量明显偏低的基因组。orthogroup中的家族成员数不等于表达量或功能增强,特有基因也不自动等于新功能;候选基因还需结合保守结构域、基因位置、共线关系、表型和实验信息解释。

三、基于组装基因组、无统一参考时的

SNP鉴定与系统发育

如果你从公共数据库下载了一批组装基因组,拿不到原始reads,也找不到一株能够代表全部样本的统一参考基因组,但仍希望比较SNP并获得系统发育关系,那么kSNP才是适合考虑的路线。kSNP以共享的k-mer侧翼序列定义SNP位点,通过比较中心碱基识别等位差异,不要求预先完成全基因组多序列比对,也不要求指定单一参考基因组。

kSNP可输出SNP矩阵、SNP序列以及基于全部SNP或核心SNP构建的系统发育树,适合对大量完整或草图组装结果进行快速初筛。分析时应根据数据集选择合适的k值,并明确树使用的是全部SNP、核心SNP还是达到指定样本占比的SNP位点。

kSNP不能像reads比对方法一样利用碱基质量和测序深度,组装错误、污染和缺失区域会直接影响SNP识别;相距过近的变异、InDel、重复区域冲突和重组事件也需要额外处理。因此,有高质量原始reads和合适参考基因组时,参考比对路线通常更适合精细变异检测;kSNP不应被视为所有SNP项目的默认方法。

四、单拷贝核心同源基因系统发育

如果你的样本跨越多个近缘物种,或者种内SNP已经不足以回答较深层次的系统发育关系,那么可以考虑基于单拷贝核心同源基因构树。较近缘物种或多个物种之间的系统发育分析,可从OrthoFinder等同源关系结果中筛选在所有目标样本中均存在且每个样本仅保留一个成员的单拷贝核心orthogroup。筛选前应检查基因组完整性、注释一致性和旁系同源基因,避免把缺失、误注释或隐性多拷贝基因错误纳入。

常见处理流程是分别提取每个单拷贝orthogroup的蛋白或核酸序列,使用MAFFT等软件进行多序列比对[8],对低质量或歧义区域进行修剪,再将各基因比对串联为统一矩阵。随后可使用IQ-TREE或RAxML-NG等最大似然方法选择替换模型、构建系统发育树并计算分支支持率。

结果报告应说明同源基因筛选标准、比对和修剪方法、核酸或蛋白数据类型、分区策略、替换模型、外群和Bootstrap计算方法。串联树代表多个基因信号的综合结果,但不保证每个基因树完全一致;当不同基因之间存在明显冲突时,应进一步评估基因树一致性、水平转移和重组的影响。

五、全基因组共线性、结构差异与局部基因簇

如果你的研究问题是某个菌株为什么多了一段序列、某个基因簇是否发生重排,或者耐药和毒力基因周围的遗传环境是否不同,那么需要根据比较尺度选择Mauve、BRIG或EasyFig。Mauve及progressiveMauve适合多个基因组之间的全基因组比对,可识别局部共线区块(LCB),并展示区块顺序和方向变化。这些结果可用于提出大片段插入缺失、倒位和重排候选,但断点位置会受到组装连续性、重复序列和样本距离影响。

BRIG以一个参考基因组为中心,将多个原核基因组的BLAST相似性、覆盖度和注释显示为同心圆,适合展示多个菌株相对参考的整体差异。BRIG主要是比较展示工具,强烈依赖参考基因组;参考中不存在的非参考序列不会被完整呈现,圈图空白也不能直接等同于已验证的结构缺失。

EasyFig更适合比较局部基因簇、质粒片段、致病岛或代谢基因区域,可同时显示基因方向、注释和相邻序列的BLAST相似性。EasyFig同样以可视化为主,基因获得、缺失、替换或水平转移结论仍需结合序列边界、注释、共线证据及必要的reads支持。

六、基于原始reads的参考基因组变异检测

如果你保留了原始测序reads,希望准确定位突变体与野生型、暴发菌株或近缘分离株之间的SNP和InDel,那么优先考虑基于参考基因组的变异检测。具有高质量近缘参考基因组时,可优先使用Snippy等参考比对方法。Snippy将单倍体微生物样本的reads比对到参考基因组,检测SNP、InDel和其他小变异;多个样本使用同一参考后,可通过snippy-core汇总核心SNP比对。系统发育树仍需根据该比对结果使用构树软件生成。

参考基因组应与待测样本保持较近的遗传距离,并尽量具有完整序列和可靠注释。分析应检查测序深度、碱基质量、比对质量、混合样本、污染、重复区域和低可比区域;参考选择过远会导致reads无法稳定比对、核心区域缩小和变异数量异常增加。

若核心SNP比对用于推断细菌克隆关系或暴发传播,应评估同源重组对树拓扑和分支长度的影响。Gubbins等方法可在全基因组比对中识别重组片段并获得更接近克隆遗传信号的比对结果。被筛出的关键SNP还应回到覆盖深度、等位比例、基因位置和功能影响进行复核。

七、系统发育树展示与多维注释

如果你已经得到系统发育树,但还无法看清某个谱系对应哪些宿主、地区、耐药基因、毒力基因或表型,那么需要把树与多维元数据放在同一张图中。iTOL用于上传、显示、管理和注释已经由上游方法构建的系统发育树,可添加颜色条、符号、热图、柱状图、分支样式和clade分组。常见注释包括宿主、地区、分离时间、表型、耐药基因、毒力基因、质粒类型和基因存在—缺失信息。iTOL不负责从原始序列构建系统发育树。

树上聚集模式的解释应区分谱系效应与独立关联。候选基因集中于一个分支时,关联可能主要来自共同祖先;相同表型或基因在多个独立分支中重复出现时,才更值得开展进一步统计或实验验证。图中还应说明树的构建数据、支持率类型和关键元数据来源。

八、结果解释需要回到原始研究问题

不同软件输出可以相互支持,但不能简单叠加为机制结论。ANI较高不表示所有功能相同;泛基因组特有基因可能来自低频真实变异,也可能来自组装或注释误差;Mauve中的重排候选需要断点和reads证据;kSNP结果需结合组装质量,Snippy结果需检查深度和比对质量;iTOL上的聚集模式则需要区分表型关联与谱系效应。

一套严谨的分析路线应明确每一步的输入、输出、质量门槛和解释边界。先用总体相似性确认比较范围,再根据数据条件选择基因内容、无参考SNP、单拷贝核心基因、结构或reads变异分析,最后结合系统发育和表型信息组织证据,可以减少无效分析和过度解释。

结语

微生物比较基因组学的分析路线不应固定为单一软件组合。研究目标、样本关系、测序数据类型、组装水平和元数据完整性共同决定方法选择。只有在这些条件明确后,序列检索、同源关系推断、泛基因组、结构比较、变异检测、系统发育和综合可视化才能形成逻辑连续的分析体系。

如果你希望直接推进项目分析,唯那生物可根据现有数据和研究目标,协助判断草图或完整基因组是否满足分析要求,确定参考基因组和样本分组,并完成同源基因、泛基因组、结构比较、变异检测、系统发育及综合可视化等分析,减少因方法选择不匹配造成的重复工作。



https://blog.sciencenet.cn/blog-3447233-1548225.html

上一篇:高毒力肺炎克雷伯菌(hvKp)是如何鉴定的?
下一篇:肿瘤里真的有活菌吗?匹兹堡大学团队用「培养组学」给出答案



    
收藏 IP: 117.186.207.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-20 14:37

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部