||
连续多组学通路富集分析揭示隐藏的功能异质性
通路富集分析(PEA)是一种通过降低复杂性同时保持生物学相关性的稳健策略来简化高通量数据的方法。在健康与疾病的研究中,PEA 可以发挥重要作用,用于识别相关的生物学过程。这反过来有助于理解疾病机制、其对治疗的耐药性,以及发现潜在的药物靶点。
PEA 通常作为差异分析(DA)后续步骤进行。它利用 DA 的结果,将其纳入统计指标(例如检验统计量、调整后的 P 值和/或倍数变化)来阐明和巩固这些预定义的生物学通路。
在 PEA 领域,已经开发了大量的计算工具,每个工具都从不同的角度提供了关于生物学通路复杂相互作用的独特视角。通路富集方法的两种主要类别是过表达分析(ORA)和功能类别评分(FCS)。
ORA 基于统计方法,评估特定生物学通路是否在显著特征中过表达。ORA 的主要限制源于其对差异分析中显著性分数(例如 P 值或调整 P 值)的特定阈值依赖,这决定了特征分类为显著或非显著。标准的 ORA 方法将所有显著值同等对待(例如基于 Fisher 精确检验),忽略了基因和通路之间的潜在依赖关系,并忽视了每个特征的个体显著性水平。FCS 采取不同的方法来克服 ORA 的局限性。它不依赖于 DA 结果的任意固定显著性阈值,也不将所有显著和非显著值同等对待,而是根据其倍数变化、检验统计量和/或分析中的统计显著性分数等量对单个基因进行评分。这些分数是结合计算整体通路得分,使用置换检验或类似的统计技术评估其显著性。结果是根据得分排序的通路列表。然而,基于 FCS 的方法没有考虑通路依赖性。这两种主要 PEA 方法的局限性通常导致特异性问题,导致许多通路被报告为富集,使得结果难以解释。此外,大多数工具仅限于处理单组学数据,随着多组学数据的出现,这个问题变得越来越严重。最近,一些工具出现了以应对这种多组学挑战。这些工具可以分为三大类:在基因层面整合数据的工具、在生物通路层面整合数据的工具以及使用机器学习技术全面整合数据的工具。基因层面的数据整合相比通路层面的整合具有优势,因为它考虑了不同类型数据之间的关系,而不是将每种类型独立处理。然而,无论是基因层面还是通路层面的整合方法,由于其通路富集阶段的基础方法,最终都面临着源自 ORA 和 FCS 的局限性。
此外,多组学数据的 PEA 引入了一个与整合相关的挑战,即管理缺失值,其中不同数据模态中的某些条目可能缺乏测量值。在这项工作中,Amerifar等人引入了一种新的算法,用于 FCS 范式下的多模态数据的 PEA。该算法称为 JOANA(联合连续多组学富集分析,图1,https://github.com/MLO-lab/joanapy)。JOANA 采用贝叶斯推理技术来确定通路活性的概率,并借鉴底层贝叶斯网络。与 ORA 方法不同,它不会将所有特征一视同仁;相反,它评估其统计显著性得分(例如调整后的 P 值),而不是简单地将其归类为不显著或显著(即 0 或 1)。这种无阈值建模方法通过拟合 DA 产生的显著性得分连续分布来实现。与现有的 FCS 方法不同,JOANA 明确建模了通路依赖关系。此外,JOANA 能够处理单组学和多组学数据,同时考虑不同数据模态之间的依赖关系。最后,它可以有效管理跨各种数据模态的缺失数据。
总之,JOANA 通过以下方式改进了现有的 PEA 方法:
l 考虑基因特异性显著性水平:JOANA 明确建模了来自 DA 的显著性分数的连续分布,而不是依赖于将不显著或显著进行严格分类。它从而消除了对任意固定阈值的依赖。
l 建模基因和通路依赖性:JOANA 模型在同一通路中基因之间的依赖关系,并通过贝叶斯网络考虑不同通路之间的相互作用和依赖关系。
l 处理多组学数据:JOANA 集成来自多个组学层的数据,并自然地允许缺失值。
l 提高特异性:通过其联合建模范式,JOANA 一直减少富集通路中的假阳性,从而提高结果的解释性。

图1 JOANA 概述。JOANA 首先以 DA 的结果作为输入。在步骤 I 中,它将此输入数据建模为 Beta 分布的混合。步骤 II 的输入是 DA 结果的此参数化以及预定义的通路。然后,它被用于贝叶斯网络中,以计算与每个数据模态相关的基因集的活动概率,以及所有层共享的活性
参考文献
[1] Amerifar S, Kopf A, Sass S, Moslehi Z, Hecker D, Enssle JC, Schulz MH, Oellerich T, Theis FJ, Buettner F. Continuous multi-omics pathway enrichment analysis resolves hidden functional heterogeneity. Brief Bioinform. 2026 May 4;27(3):bbag328. https://doi.org/10.1093/bib/bbag328
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-7-23 19:19
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社