||
PLNFGL:多条件基因网络的联合估计
概率图模型是一种通过图结构表示变量依赖关系的统计框架,已在生物信息学中得到了广泛应用。高斯图模型(GGM)是用于多元数据条件独立性建模的一种经典方法。在 GGM中,节点表示变量,边编码条件依赖关系。在联合正态性假设下,如果精确矩阵(协方差矩阵的逆矩阵)中相应项为零,则两个变量在给定其他所有变量时是条件独立的。因此,网络结构被编码在精确矩阵的稀疏模式中。已开发出许多方法来估计稀疏精确矩阵。包括使用套索正则化的邻域选择、惩罚对数似然最大化方法以及 D-trace 损失最小化。协变量调整的 GGM 已被提出用于在遗传基因组学中学习有向无环图(DAG),采用两阶段估计策略,能够在考虑测量协变量的同时进行网络推断。此外,已开发出集成图约束建模策略,用于将已知网络结构纳入统计学习过程,主要目的是在结构约束下增强表型相关基因选择,而不是明确关注精度矩阵估计。
近年来,单细胞 RNA 测序(scRNA-seq)技术通过提供前所未有的分辨率。然而,数据复杂性带来了显著的解析挑战,主要由于技术噪声、低表达水平和 dropout 事件。scRNA-seq 的一个主要限制是缺失值的高发生率,这些缺失值可以代表“真实零”(未表达的基因)或由于测序失败产生的“假零”。由测序失败引起的这种零被称为“dropout 事件”。因此,高斯假设不适用于 scRNA-seq 计数数据,从 GGM 推断出的精度矩阵可能无法准确反映实际变量间的相互依赖性。虽然存在替代分布,如泊松和负二项模型,已被提出以适应计数数据和过度分散,但它们通常缺乏多变量灵活性或在分层混合模型中的稳健理论证明。尽管dropout 事件和零膨胀是突出的挑战最新研究表明,经过适当的标准化处理后,那些多余的零值往往可以通过那些能够妥善处理过度离散现象和潜在相关结构的计数模型来加以解释。这样一来,就无需再设置专门的参数来处理“零值膨胀”现象了,同时也能避免相关识别性问题。为了解决这些建模问题,多元泊松对数正态分布提供了一种解决方案:该模型假设,在给定潜在高斯变量的条件下,观测到的计数数据遵循泊松分布。这种双层结构能够有效捕捉与特定基因相关的过度离散现象和潜在的依赖关系,而无需假设各变量之间相互独立。通过利用这种分层计数生成机制,PLN 框架隐式地考虑了许多与 dropout 相关的零,而无需进行单独的零膨胀过程。
重要的是,scRNA-seq 数据通常是在多个生物学上相关但不同的条件下收集的,例如不同的细胞类型、疾病状态或组织背景。每个条件都可能表现出既共享又条件特定的基因相互作用模式,这是由于保守性生物学过程和依赖于上下文的调节重排。因此,跨条件的联合建模可以通过借用力量来提高统计效率,增强稀疏数据下的鲁棒性,并促进识别共同和差异的相互作用结构。尽管现有的一些方法解决了高斯假设下的网络估计或结合了结构约束,但仍需要一种统一的框架,用于联合推断基于计数的 scRNA-seq 数据的跨条件基因相互作用网络。
最近,Zhai等人提出了 PLNFGL(泊松对数正态融合图拉索,https://github.com/jijiadong/PLNFGL)框架,用于从 scRNA-seq 数据中联合估计无向基因相互作用网络。它采用两步法:(1)使用 PLN 分布对 scRNA-seq 数据进行建模以考虑技术噪声,并通过矩估计法估计协方差矩阵(图 1A);以及(2)推断在不同条件下(如不同细胞类型)的基因相互作用网络(图 1B)。通过整合跨条件的信息,联合图模型提高了鲁棒性和准确性,从而全面展示了细胞类型特异性相互作用网络。为了解释这些网络,作者们对识别出的相互作用边应用了边集富集分析(ESEA)(图 1C),类似于基因集富集分析(GSEA)。在模拟和真实 scRNA-seq 数据集上验证了 PLNFGL,证明了它在恢复真实相互作用方面的优越性,以及它识别阿尔茨海默病(AD)和非小细胞肺癌(NSCLC)中细胞特异性网络的能力。

图1 PLNFGL 框架的示意图。A. scRNA-seq 数据的采样以及 dropout 事件下的协方差矩阵估计。B. 使用 PLNFGL 框架跨条件联合估计多个基因相互作用网络,该框架同时捕获共享和条件特定的网络结构。C. 基于推断的基因网络识别显著富集通路中 ESEA 程序的示意图
参考文献
[1] Wenli Zhai, Dan Zhou, Zhongshang Yuan, Jiadong Ji, PLNFGL: Joint Estimation of Multi-Condition Gene Networks from Single-cell RNA-seq Data, Bioinformatics, 2026;, btag485, https://doi.org/10.1093/bioinformatics/btag485
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-7-26 10:55
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社