||
基因表达分析领域的变革
很少有分析框架像基因表达分析那样深刻地改变了生物学的研究。从 20 世纪 90 年代最早的规模化转录组调查到最近单细胞和空间技术的爆炸式发展,基因表达分析塑造了我们理解细胞身份、发育过程和疾病机制的方式。最初,基因表达分析主要集中于平均基因丰度的批量测量,如今已成为系统生物学的核心支柱,使研究人员能够绘制细胞异质性,推断基因调控网络,并直接从基因组序列预测基因表达模式或调控活性。重要的是,能够确定基因在哪些位置被表达的能力,有助于将转录组学的见解转化为调控基因表达的治疗策略,涵盖基因和RNA药物,例如RNA干扰(siRNA疗法)和反义寡核苷酸(ASOs)。
最近的视角论文《The changing landscape of gene expression analysis》通过结合文献计量趋势与关键技术里程碑,总结了基因表达分析的发展历程。重点阐述了方法、数据规模和分析策略的变化如何塑造了基因表达分析,旨在改变转录组数据解读和使用方式的计算范式奠定了基础。讨论追溯了这一领域中的四次关键革命:表达序列标签(ESTs)和微阵列、RNA 测序(RNA-seq)、单细胞转录组学和空间与多模态整合(图 1)。然后,考察了当前时代所具有的挑战和机遇,并激发了本视角中讨论的未来方向。

图1 过去 25 年基因表达分析概述,包括 20 世纪 90 年代的基础里程碑;显示了四次主要的技术转型:(i) 表达序列标签和微阵列,(ii) RNA 测序,(iii) 单细胞 RNA 测序,以及(iv) 空间转录组学和多模态整合;每个转型都标明了里程碑论文,并在时间轴上列出了代表性生物信息学工具
转录组技术及分析方法的飞速发展,不仅彻底改变了基因表达的测量与解读方式,还开辟了新的研究领域。在这里,有三个将会产生重大影响的新兴研究方向。
联盟规模的、可搜索的转录组知识库
存储在公共数据库中的高通量测序数据量已经达到了 PB级别,这些数据涵盖了 DNA、RNA 和蛋白质序列,以及所有生命领域中的其他分子信息。然而,这些数据中的大部分仍然处于“暗物质”的状态:虽然它们被存储了下来,但却无法以进行综合分析所需的精度来被检索。传统的工作流程仍然将各项新实验视为独立的研究单元,而很少系统地利用现有的海量数据。推动这一变革的主要因素是各种大型合作项目的兴起,这些项目旨在创建可被广泛利用的标准化数据集,而非仅为某项单一研究服务。例如,“人类细胞图谱”项目就致力于构建人类细胞的全面参考图谱,同时制定统一的采样、元数据和注释标准。与此同时,像“基因型-组织表达项目”这样的大规模数据资源也在不断涌现。这些资源为 eQTL 分析提供了系统化、涵盖多种组织的基因型-表达数据参考,同时也有助于解读全基因组关联研究的结果,从而帮助确定潜在的致病基因。作为联盟级别的资源,它们为构建可检索的转录组知识库提供了标准化的数据基础。
在 PB 级序列搜索领域,最近取得了显著进展。例如,基于带注释的德布鲁因图和压缩全文索引的搜索框架,表明现在从技术上来说,完全可以将数千万个序列数据集进行索引处理,并对数 PB 级的原始序列数据进行全文搜索。这些发展表明,大规模序列搜索的技术障碍已不再是主要瓶颈。因此,将数据生成与系统的、有组织的数据搜索和再利用结合起来,不再是一种难以实现的想法。
在接下来的十年里,很可能会出现规模庞大的、能够覆盖全球范围的转录组知识库。这些知识库能够整合来自不同组织、物种和实验条件下的多模态数据。在基因表达分析方面,这样的基础设施将使得转录组知识库具有可扩展性和可查询性。研究人员不必再单独研究某个基因在某项研究中的表达情况,而是可以查询数千项研究的结果,从而确定类似的表达模式何时、何地、在何种条件下出现。通过分析从统一表达谱中得到的数据,还可以识别出特定细胞类型的特征、稀有细胞状态或调控模块。这样一来,基因表达分析就从以单个研究为中心的方式,转变为以查询为中心、可在不同数据库之间共享的方式。新的数据集可以被整合到现有的转录组知识库中,从而形成共享的数据库结构。这种易于查询的数据结构非常重要。这样的基础设施对于充分发挥基础模型的潜力至关重要,同时也有助于确保未来的分析成果能够被转化为可被整个社区重复使用的资源。
用于基因表达分析的基础模型
近年来,人工智能技术发展迅速,开始重新定义基因表达分析的方式。诸如深度生成模型、基于 Transformer 的模型以及图神经网络等深度学习架构,如今已能够实现多模态数据的整合,捕捉基因调控网络中的非线性关系,预测各种扰动带来的影响,还能支持跨物种的基因表达分析。这些模型为基因表达分析提供了强大的计算工具。不过,目前的这些模型都是针对特定任务在有限的数据集上训练出来的,因此还无法作为通用的基因表达分析基础模型来使用。
最近在基因扰动效应预测方面的研究结果表明,基于深度学习的模型并不总能优于简单的线性模型。需要注意的是,这一结论是针对特定任务得出的,不能简单地推广到深度学习在基因表达分析中的所有应用场景。诸如跨数据集整合和多模态整合等任务,往往涉及复杂的非线性结构,仅靠线性模型难以准确描述。不过,这些结果再次强调了建立严格评估框架的必要性,包括使用多样化的基准数据集,以及透明地报告各项指标的测试结果,从而更好地反映模型的生物学实用性。
更广泛地说,基础模型在基因表达分析中的实际应用价值取决于能否克服若干关键挑战。首先,训练数据的偏差问题依然值得重视。大规模的转录组数据往往偏向于特定的组织、物种、疾病背景或实验平台,这可能限制了这些模型的普适性。要解决这一问题,需要精心处理数据、统一预处理流程、规范元数据格式,同时还要明确说明训练数据的构成,以确保其能够代表不同实验条件下的实际情况。其次,不确定性量化对于实际决策非常重要。基础模型得出的预测结果这些模型还应配有经过精确校准的置信度估计值。包括贝叶斯近似、集成建模和概率预测框架在内的新兴方法,为不确定性量化提供了有效的策略。不过,如何在大规模基础模型中实现精确的不确定性估计,仍然是一个亟待研究的领域。第三,生物可解释性对于这些模型的实际应用至关重要。基础模型不应像“不可理解的预言机器”那样运作,而应能够提供具有生物学意义的分析结果,比如识别出那些影响预测结果的关键因素,如调控因子和代谢途径。同时,这些模型还应与实验设计紧密结合,帮助研究人员确定下一步应该测量哪些指标或数据。通过这种方式,基础模型就能将基因表达分析从单纯的描述性分析转变为能够指导实验策略的预测工具。
与此同时,随着人工智能模型的不断发展与更广泛的应用,那些与预训练模型库的长期可持续性相关的问题也将会变得越来越重要。目前,虽然许多模型都是通过商业代码托管平台或特定项目的网站来发布的,但真正有长期、公开支持机制来维护这些模型的却很少。像 Kipoi 这样的社区驱动型平台的关闭,恰恰凸显了那些缺乏持续制度支持的模型共享机制的脆弱性。随着对大规模预训练模型的依赖程度不断增加,来自国家卫生研究院等国内资助机构以及类似的国际组织的协调性公共投资,将有助于建立可持续的模型库。这样的模型库将有助于确保研究的可重复性、便于进行性能评估,并促进模型的长期应用。
展望未来,预计将出现用于基因表达分析的基础模型,类似于自然语言处理中的大型语言模型。联盟规模的转录组知识库,整合不同组织、物种、扰动和实验平台的数据,可能会形成训练此类模型的关键基础。通过从这些数据中学习基因调控状态的可推广表示,这些模型可以超越特定任务的优化,并支持新数据集的零样本注释、跨物种的细胞类型映射以及预测未见过的扰动组合的反应。随着数据标准化、不确定性量化以及生物学可解释性的持续进步,基础模型可能最终为跨生物系统建模基因表达提供一个统一的计算框架,连接描述性图谱与预测性和实验可操作的见解。
从分析到控制:基于基因表达的可编程调控设计
基因表达分析的进步使得基因调控程序的理性工程成为可能。这一转变正伴随着合成生物学和核酸疗法的快速发展,这两者共同将可控干预的范围从 DNA 水平的调控元件工程和基因治疗扩展到能够直接调节转录本的 RNA 药物。例如,细胞类型选择性调控 DNA 元件可用于将转基因表达限制在特定谱系或状态,从而在基因递送环境中提高疗效和安全性。在 RNA 靶向方法中,反义寡核苷酸(ASOs)提供了一条具有临床吸引力的途径,因为它们的效果通常可以调节,并且在许多情况下是可逆的。总体而言,它们支持这样一种观点,即基因表达在治疗中成为了一个可工程的法规设计为连接分子方法与临床目标提供了通用语言。
随着转录组知识库和预测模型的成熟,基因表达分析将能够指导如何设计细胞状态。这种“分析到控制”的转变是由两种趋同趋势驱动的。首先,大规模的批量、单细胞和空间资源提供了越来越精确的基因表达位置和决定细胞身份的调控程序的地图。其次,人工智能赋能的模型和整合多模式框架开始将这些观察模式转化为关于哪些扰动最有可能以可预测的方式将细胞从一个转录状态转变为另一个转录状态的行动性假设。这些发展使得定义基因表达的控制目标以及设计针对特定细胞环境的干预措施成为可能。在实践中,转录组状态描述可以被重新定义为工程规范,其中期望差异表达水平、细胞类型选择性以及安全约束被视为设计标准,而不是事后读数。成功部署将取决于可解释性和因果基础。该领域将受益于包含不确定性、脱靶风险和生物学可行性约束(如染色质可及性和细胞状态依赖性调控逻辑)的设计目标。
总体而言,转录组学通过实现靶点筛选、情境化优先级排序以及在DNA水平调控元件工程、基因治疗和RNA医学中的干预设计,从而创造价值。然而,功能验证仍是一个主要的速率限制步骤。尽管转录组知识库和预测模型有助于优先选择干扰操作并降低实验失败的风险,但要建立因果关系,仍需依靠严格的实验室验证。经过验证的结果随后可用于不断优化模型,并提升预测性能。因此,实现分析与控制之间的衔接,需要紧密耦合的计算与实验循环、标准化的基准数据以及能够将表达表型与干扰结果连接起来的共享资源。
参考文献
[1] Zhao, Q., Shen, S., Shim, W. J., & Palpant, N. J. (2026). The changing landscape of gene expression analysis. Briefings in bioinformatics, 27(2), bbag185. https://doi.org/10.1093/bib/bbag185
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-7-23 18:26
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社