||
Nextflow:推断和评估网络医学的疾病模块
疾病通常源于不同生物分子间复杂的相互作用紊乱。这些分子相互作用共同构成了人类相互作用组,它可以被表示为一个网络,其中节点对应蛋白质、DNA 或代谢物,边则模拟它们之间的相互作用。研究相互作用组最常关注的是蛋白质-蛋白质相互作用(PPI),及其与疾病相关的扰动是网络医学的核心领域。该领域的一个关键见解是,与疾病相关的基因,或者更精确地说,它们的蛋白质产物,并非随机散布在整个相互作用组中。相反,它们倾向于在局部邻域内聚集,形成所谓的疾病模块。疾病模块可以根据其分子机制来表征疾病,而不是传统的基于器官或症状的定义。结合网络药理学,它们可以支持发现针对潜在病理过程的新型药物靶点和药物候选物,这可能通过协同药物作用得到进一步增强。
已经提出了许多用于识别疾病相关模块的算法,这些方法也被称为“主动模块识别方法”。这些方法通常以一组已知的与疾病相关的基因或蛋白质作为起点,然后通过将互作网络中的其他节点纳入其中来逐步扩展这些模块的规模(见图 1A)。不过,选择合适的方法并非易事,因为各种方法在如何识别疾病相关模块方面有着不同的原理。例如,“第一邻域法”是通过添加那些与至少一个初始节点有直接互作的节点来扩展初始集合。DIAMOnD 算法则是通过反复添加与当前初始节点有最多互作的节点来扩展初始集合。DOMINO 算法则首先将互作网络划分为若干不重叠的簇,然后再筛选出那些包含的初始节点数量高于预期的簇。ROBUST 算法则多次将种子节点连接成一个单一连通分量。在足够多的解决方案中出现的节点被纳入最终模块。其研究偏差感知实现工作方式类似但惩罚过度研究的蛋白质的包含。网络传播方法,如重启随机游走(RWR),同时向所有方向扩展种子集。
需要采用多种不同的方法,因为最有效的处理方式可能取决于疾病机制的拓扑结构。比如,该机制是围绕某个核心节点构成的,还是呈现出某种特定的路径结构,又或是更复杂的形态。同时,已知的“种子基因”的数量和可靠性也会影响最佳处理方式的选择。例如,如果某种疾病机制由多个相互独立的子网络构成,那么基于连接这些“种子基因”的方法就不适用。如果已知的与疾病相关的基因数量很少,那么采用更具探索性的方法可能会比保守的方法取得更好的效果。对于大多数疾病机制而言,我们只能对这些特性进行推测,因此需要一个能够有效评估各种方法并加以比较的框架。
应用和比较多个 AMIM受到特定于方法的安装过程、输入要求和输出格式的阻碍,使得手动执行变得繁琐。此外,基于输入扰动的评估在计算上是要求高的,并且需要高效的并行化才能保持实用性。此外,尽管 AMIM已经在多项研究中进行了基准测试,但这些评估是基于预定义的基准测试数据集,因此不允许在特定用户上下文中评估方法。
作为地平线欧洲项目 REPO4EU(https://repo4.eu)的一部分在欧洲范围内,该流程包括疾病模块的识别、系统评估、结果可视化以及候选药物的优先级排序。为此,Kersting等人开发了一种名为 Nextflow 的新流程框架(图1,https://github.com/nf-core/diseasemodulediscovery)。该框架能够自动执行所有这些步骤,尽可能地并行处理各项任务,并通过容器来管理各种依赖关系。这样一来,流程的设置变得更加简单,同时也确保了结果的可重复性。该流程作为独立模块被纳入 nf-core 平台中。nf-core 是一个由社区共同开发的生物信息学流程集合,所有流程都是使用 Nextflow 开发的。为了展示该流程的分析能力,作者们将其应用于十个不同的输入数据集和五个种子数据集。这一测试不仅展示了单个流程所能产生的大量且多样化的结果,得出了几个重要结论:(i) 由于采用了不同的建模方法,不同的 AMIM所生成的疾病模块在结构上存在显著差异;(ii) 大多数 AMIM产生的疾病模块对其对应的疾病具有特异性,尽管这种特异性很大程度上源于种子集;(iii) 输入网络的选择对生成的模块有重大影响;(iv) 大多数 AMIM对小输入扰动表现出鲁棒性;(v) 通常难以可靠地重新发现被省略的种子;(vi) 没有哪个 AMIM 在所有类别中始终优于其他方法,这突显了仔细选择方法的必要性。

图1 (A) 基于一组种子节点和交互网络推断疾病模块。(B) 流程接受多个种子文件和网络作为输入。种子文件必须由用户提供;网络可以由用户提供或从可用选项列表中选择。该流程基于提供的输入运行六个广泛使用的 AMIM,包括 DOMINO、DIAMOnD、ROBUST 及其偏差感知实现、第一种邻近方法以及随机游走重启(RWR)。这导致每个种子文件、网络文件和指定的 AMIM 组合产生一个模块。生成的模块通过超代表(g: Profiler)和功能一致性(DIGEST)分析、网络拓扑度量以及成对节点集重叠进行评估。应用度保持网络重连以评估潜在的节点度偏差。对种子集的留一分析评估 AMIM对小输入的鲁棒性。扰动并计算重新发现率。药物候选物通过接口与 Drugst.One 交互,使用各种基于网络的算法进行优先级排序。该流程还生成模块的网络可视化,用补充生物学信息(从 NeDRex 查询)进行注释,保存为多种标准化输出格式,并使用 MultiQC 提供整个运行的 HTML 摘要报告
参考文献
[1] Kersting, J., Bucheron, C., Spindler, L. M., Aguirre-Plans, J., Manz, Q., Pock, T., Tan, M., Delgado-Chaves, F. M., Nogales, C., Schmidt, H. H. H. W., Menche, J., Maier, A., Baumbach, J., Guney, E., & List, M. (2026). Inferring and evaluating network medicine-based disease modules with nextflow. Bioinformatics (Oxford, England), 42(Supplement_1), btag223. https://doi.org/10.1093/bioinformatics/btag223
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-7-26 10:56
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社