lisw05的个人博客分享 http://blog.sciencenet.cn/u/lisw05

博文

从端粒到端粒(完整基因组测序):个体化基因组学之愿景!

已有 236 次阅读 2026-8-31 16:56 |个人分类:人类基因组计划|系统分类:科研笔记

这篇评论文章阐述了从端粒到端粒(T2T)完整基因组测序的愿景,标志着基因组学进入了一个新时代。文章回顾了人类基因组计划的历程,指出尽管该项目取得了成功,但由于技术限制,未能获得真正完整的人类基因组序列,留下了关键重复序列的空白。长读长测序技术的出现,特别是纳米孔超长测序和PacBio HiFi测序,结合专门的算法,最终实现了首个完整人类基因组T2T-CHM13的组装。这为人类泛基因组计划和技术发展奠定了基础,使得从个体供体生成近乎完美的二倍体基因组成为可能。文章展望了未来,将完整基因组与人工智能相结合,以实现个性化基因组医学,通过AI模型直接分析患者自身的完整基因组,从而改善诊断、风险建模和治疗规划。这需要建立在完整的、个性化的基因组与长读长功能数据配对的基础上,并收集多样化的训练数据。

完整基因组测序的技术发展历程

人类基因组计划的目标是获得完整的人类基因组序列,但由于克隆、测序和组装基因组重复序列的挑战,该项目未能实现真正完整的序列,遗漏了在基因组生物学、衰老、生育、癌症和遗传疾病中起关键作用的重复序列。

全基因组鸟枪法测序因其成本较低成为主导技术,但该方法在组装整个基因组时容易受到基因组重复序列的干扰,导致在随后的20年里,没有一株植物或动物基因组能够无间隙地完成,并且几乎所有额外的人类基因组都是“重测序”的,即短读长被映射到参考基因组以识别变异,这种方法引入了显著的参考偏差,并且无法映射约15%的基因组,包括端粒、着丝粒、卫星序列和多拷贝基因。

长读长测序技术是解决全基因组鸟枪法测序组装问题的关键,纳米孔超长测序能够达到数百万碱基对的读长,首次攻克了人类着丝粒α卫星阵列;受此进展推动,端粒到端粒联盟于2018年启动,并迅速利用长读长技术组合完成了人类X染色体的组装。

PacBio HiFi测序的出现,结合专门用于将其与纳米孔超长测序整合的错误校正和组装算法,提供了解锁第一个完整人类基因组序列T2T-CHM13的最后一把钥匙;这种T2T组装方案后来更新为包含三重或Hi-C数据用于二倍体基因组的定相,为人类泛基因组计划奠定了技术基础,并使得能够从个体供体重建近乎完美的“已完成”基因组。

T2T时代的现状与影响

为T2T-CHM13项目开发的测序和组装方法已推广至更广泛的社区,开启了一个完整基因组的新时代;“T2T”成为实际上完整的、定相的、无间隙的、两端都有端粒的染色体的有用简称。

当前的组装流程仍然会产生残留错误和间隙,尤其是在高度同质化的重复阵列内,因此准确传达T2T组装是如何生成、管理和验证的仍然很重要;目前只有少数已发表的T2T基因组达到了完成质量的高标准,但由于方法的快速改进,这种质量水平可能很快就能自动实现。

生成第一个T2T组装的行为本身,通过能够对先前无法访问的序列进行基础调用模型的重训练,提高了长读长测序的准确性;彻底验证的T2T“基因组基准”的发布将推动未来测序和组装方法的改进。

拥有可用T2T基因组的物种现在包括许多额外的灵长类物种和流行的模式生物,这些研究揭示了新的基因组结构和结构差异区域,如多拷贝基因家族和亚端粒卫星,这些区域以前无法进行基因组分析;这对于保护基因组学也是一个重要的里程碑,对于濒临灭绝的物种,现在可以实现基因组的完整数字保存。

在人类健康方面,我们实现了从梦想完成人类基因组,到计划构建包含许多完整人类基因组的泛基因组,再到能够完成任何人类基因组的飞跃;这场革命正在揭示基因组中未被充分探索的重复区域内的新生物学,包括与饮食、免疫、发育和认知相关的基因。

从完整基因组到完整理解

为了实现基因组学改善人类健康和福祉的最终承诺,我们必须接下来填补知识空白,并发展对基因组代码的全面理解;在T2T之前,我们缺失了“生命之书”8%的页面,其中许多页面来自基因组中最具适应性的区域——近期重复,这些区域难以组装,因此被排除在历史参考序列之外。

与GRCh38相比,T2T-CHM13在 pairwise 比对中(一致性超过95%)将节段性重复碱基的数量增加了一倍,其中许多涉及人类特异性的基因重复;现在手头有多个完整的基因组副本,并且还有数百个正在进行中,是时候加倍努力理解这些复杂区域了。

T2T时代与人工智能时代恰逢其时;基因组学的历史长期以来一直与计算历史交织在一起,DNA测序效率的指数级增长反映或超过了摩尔定律;计算和基因组学之间的这种密切关系看来将随着基于AI的蛋白质和DNA序列预测模型的出现而继续。

AlphaFold在蛋白质折叠问题上的成功证明了深度且经过充分验证的蛋白质序列和结构数据库的价值;为了有效模拟全基因组的复杂性,我们现在必须建立类似信息丰富的完整基因组及其相关组学的数据库,以训练能够从底层基因组和表观基因组预测高阶功能效应的序列到功能模型。

未来的序列到功能模型必须建立在完整的、个性化基因组与来自同一个体或细胞系的长读长功能数据配对的坚实基础上,以确保基于测序的读数能够准确映射到二倍体基因组;T2T基因组的完全定相性质确保了双等位基因变异被准确捕获,并且顺式调控元件被分配到正确的单倍型上;为了完全学习基因组的调控程序,必须注意收集信息丰富的训练数据,包括来自不同祖先、物种、细胞类型、发育阶段和高通量扰动研究的组学数据。

基因组医学的未来

技术进步的速度使得很容易想象基因组医学的新护理标准,即在AI模型的辅助下分析完整的二倍体基因组;“个性化基因组学”的愿景颠覆了当前基因组分析的模式,将解释直接带到患者自身的基因组上,而不是针对单一参考序列调用和解释变异。

这种方法的吸引力在于用对患者完整基因组序列的简单查询取代现在无数的个体panel和测试;测序完整基因组的最有效方法是一个活跃的研究领域,包括从头组装和基于泛基因组的方法,但无论哪种情况,目标都是推断个体的完整基因组,而不是针对参考的不完整变异集。

个性化基因组将减少参考偏差,并提高下游分析的准确性,如癌症筛查、肿瘤测序、表观遗传学和药物基因组学;鉴于基因组解释的复杂性和快速增长的知识体系,此类临床研究必然需要计算搜索、推理和总结的辅助。

完整的序列是预测建模最自然的底物;类似于基于Transformer的AI模型如何浓缩和组织自然语言,未来的DNA序列模型将封装我们基因组知识的总和,并促进将该信息直接转移到个性化基因组上;给定患者的完整基因组和其他可用的组学数据,此类AI模型将预测最有可能导致观察到的症状的基因组变异,并突出显示相关基因、通路和过程以供临床解释。

随着我们继续增长对基因组代码的理解,进展可以通过我们预测的准确性来衡量;我们已经可以凭借对三联体密码的知识以良好的准确性预测大多数蛋白质功能丧失变异,但对于破坏基因调控、剪接或RNA的非编码变异还不能这么说;这表明我们对基因组 vast 非编码部分的理解存在空白。

由于T2T基因组和能够将功能数据精确映射到整个二倍体基因组的新技术,解决这两个等位基因和旁系同源物,填补这一空白现在已经触手可及;这些进展已经在揭示基因组先前黑暗区域内基因组组织和调控的特征,并且无疑将提高未来预测模型的准确性,预示着一个我们可以超越测序全基因组并走向理解全基因组的光明未来。



https://blog.sciencenet.cn/blog-2636671-1550354.html

上一篇:衰老生物学中的溶酶体与溶酶体功能障碍!
下一篇:进化分子遗传学概述!



    
收藏 IP: 36.147.115.*| 热度|

2 周健 郑永军

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-3 05:44

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部