||
基于深度学习的多组学融合的图设计
现代的高通量技术使我们能够从多个分子层面来分析生物系统,包括基因组、表观基因组、转录组、蛋白质组以及代谢组。这些分析通常是在同一组样本中进行。这些多组学数据有助于我们更全面地了解调控机制、信号传导过程以及代谢过程是如何相互作用,从而影响细胞状态和疾病表型的。不过,这些数据也带来了相当大的分析挑战。不同的组学数据具有不同的噪声特性和动态范围:mRNA 测序数据属于计数型数据,其结果会受到测序深度、数据分散程度以及数据缺失等因素的影响。染色质可及性数据通常比较稀疏,且在各个位点上往往接近二进制状态。蛋白质组学数据可能受到抗体背景信号、肽段检测偏差或数据缺失的影响。甲基化信号通常以 0 到 1 之间的数值来表示,这种数值范围有限,且具有不同的方差特性。而代谢组学数据的浓度范围则可能跨越几个数量级。因此,不同组学数据之间的差异可能反映了技术手段、检测灵敏度或测量方法的差异,而非生物学结构的共同特征。此外,各组学数据的特征空间既庞大又具有异质性。而且,这些样本往往只是被部分地分析了特征,或者来自规模较小的样本群体。简单地将不同来源的特征拼接在一起,很难保留生物学的本质结构。此外,这种做法还会因为过分强调那些具有高变异性的技术因素,而忽视了那些具有共同生物学意义的特征,从而降低后续分析的准确性。
因此,人们提出了各种各样的多组学整合策略,这些策略涵盖了传统的统计方法、矩阵分解、基于核函数和图论的方法,以及最新的深度学习模型。这些方法在信息整合的时机和方式、所采用的分析单元、以及对先验生物学知识的依赖程度方面各不相同。尽管存在这些差异,但一个共同点在于:分子生物学本质上是一种相互关联的学科,基因之间相互调控,蛋白质在复合体和代谢途径中相互作用,染色质区域在三维空间中相互关联,细胞在组织内部进行交流。明确地把握这些相互关系,对于实现有效的信息整合和有意义的分析至关重要。
图为描述此类关联结构提供了一种自然的语言方式。在图中,节点可以代表基因、蛋白质、代谢物、细胞或样本,而边则可以表示各种物理相互作用、调控关系、通路归属关系、共同表达现象、相似性或空间上的邻近性。基于图的深度学习技术,尤其是图神经网络及相关架构,可以直接在图上进行处理:通过边来传递信息、整合来自相邻节点的信号,并生成能够反映已知或推断出的结构特征的表示形式。这些框架具有足够的灵活性,既能够处理同一组学数据之间的关联,也能处理不同组学数据之间的关联,同时还能结合基于知识和基于数据的连接方式,适用于大规模数据、单细胞数据以及空间多组学数据的分析。
近年来,许多基于图的深度学习方法被提出用于多组学数据的整合。不过,这些方法在图的构建方式以及图在模型中的运用方式上存在很大差异。有些方法侧重于使用同质图,即所有节点都属于同一类型,各种关系也都在同一个范围内进行建模。而另一些方法则采用异质图,通过明确区分不同类型的节点和边,从而更准确地捕捉各种复杂的生物相互作用。边的定义方式也多种多样,从预先定义的交互网络到基于数据学习的相似性度量方法都有。在整合策略方面,有的方法采用紧密耦合的联合图结构,而有的则采用模块化架构,后者会在后续步骤中将不同类型的图相互关联起来。这些设计选择会显著影响模型的可解释性、数据需求、可扩展性、对噪声的鲁棒性,以及模型能够解决的生物学问题类型。
在最近的综述中,Alif等人从以图为中心的角度来探讨多组学深度学习的相关问题(图1)。作者们并非主要关注各种模型架构的详细信息,而是着重分析图的定义、构建方式以及相关设计因素如何影响模型的性能。根据图的结构粒度、边的语义、交互类型、整合策略、图的环境背景以及模型架构等关键因素,对现有的方法进行了分类。通过在这个统一框架下比较各种方法,旨在揭示其中的共同规律,明确各种方法之间的权衡关系,并发现那些尚未被充分探索的设计领域。

图1 该研究的概念框架。该研究通过图结构设计、深度学习架构、实证研究方法以及实际应用流程等方面的考量,将基于图的多组学整合方法应用于大规模数据、单细胞数据以及空间数据分析中
最后,基于这些比较结果,作者们提出了一套用于多组学数据整合的实用流程。该流程包括明确科学目标与数据节点的构成、构建数据连接关系并确保数据质量、以及模型的训练与评估等环节。目标是为该领域提供系统的指导,同时为那些希望将自己多组学数据与基于图的深度学习方法相结合的实践者提供具体的操作指南。
参考文献
[1] Alif, M. N., Tanvir Ahmed, K., Baul, S., & Zhang, W. (2026). Graph designs for deep learning-based multi-omics integration. Briefings in bioinformatics, 27(4), bbag410. https://doi.org/10.1093/bib/bbag410
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-3 14:08
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社