||
NLCD:发现基因之间非线性因果关系
在由多个变量构成的复杂系统中,确定各变量之间的因果关系一直是许多领域的研究重点,生物信息学领域也不例外,因为这一研究方向具有广泛的实用价值。例如,区分那些导致某种疾病的基因与那些仅受该疾病影响的基因,对于寻找新药物/疗法的靶点或疾病的诊断生物标志物来说非常重要。不过,两个特征之间的相关性并不一定意味着因果关系,因为这种相关性也可能由同时影响这两个特征的某个共同因素所导致。
在存在混杂因素的情况下,检测因果关系的理想方法是随机对照试验。不过,随机对照试验并不总是可行,而且在人体实验环境中还存在诸多挑战。作为另一种解决方案,孟德尔随机化方法可以被用来发现两个基因之间的因果关系。这类方法利用与两个基因都相关的遗传变异作为工具变量,从而仅通过观察性数据就能控制混杂因素的影响。这类方法包括 CIT、Findr、Trigger和 MRPC等。
尽管针对上述用于基因-基因因果关系研究的磁共振方法,人们已经进行了二十年的研究,但大多数方法的局限性在于:它们都假设被研究的两个基因或临床特征之间存在线性关系。实际上,许多基因对或临床特征对并不符合线性关系(例如,在所有被研究的基因对中,有 84%都不符合线性关系)。英国生物银行的数据表明,那些会随着昼夜节律而周期性变化的基因,也可能呈现出非线性关系。有一些研究试图将非线性因素纳入分析范围,但这些研究都假设各种特征之间呈分段线性或多项式关系。因此,有必要开发出一种更通用的非线性因果关系分析方法。
这项工作通过提出一种名为 NLCD (图1,https://github.com/BIRDSgroup/NLCD)的非线性因果发现新方法,推动了因果发现研究的发展。NLCD 在一般的非线性回归模型中,运用了基于条件重要性的特征评分方法。这一方法的目的是将线性模型中的因果关系判断方法推广到非线性模型中。具体而言,NLCD 通过一系列基于排列的统计检验来扩展线性因果关系分析方法 CIT。这些检验得出的最大 p 值有助于判断:对于给定的三个变量(两个基因特征变量和一个工具变量),数据更支持它们之间存在因果关系,还是独立关系。NLCD 可以灵活地应用于各种非线性回归模型,包括核岭回归、支持向量回归以及人工神经网络模型。

图1 NLCD 方法示意图。a. 给定关于基因型变量 L 以及两个基因表达变量 A 和 B 的观测数据(这些数据都是从同一组个体中获得的),NLCD 方法会将这组数据(L,A,B)归类为属于因果关系模型、反应关系模型或独立关系模型中的某一种。b. 为了判断某组数据是否属于因果关系模型,NLCD 会进行四项统计检验:一项关联检验(测试 1)、两项条件关联检验(测试 2-3),以及一项关键的条件独立性检验(测试 4)。NLCD 的主要创新之处在于:它利用非线性回归模型来进行上述三项检验。同时,还提出了条件特征重要性得分这一指标,用于实施测试 4。NLL 指的是负对数似然检验统计量
NLCD 在范围和假设方面也不同于那些基于机器学习的因果发现方法。那些基于分数的连续优化算法,用于处理有向无环图结构的因果关系,比如 NOTEAR、GraNDAG以及 DAG-GNN,这些方法都能够在因果充分性条件下恢复出包含 n 个变量的 DAG 结构。不过,这种假设在观察性基因表达数据中往往不成立。而像 PC 算法这样的基于约束的方法,虽然使用了基于核函数的条件独立性检验,但它们只能从纯观察性数据中推断出具有马尔可夫等价性的因果结构,因此无法确定那些存在混杂因素的二元变量之间的因果方向。在双变量分析中,诸如加性噪声模型和后非线性模型这样的函数因果模型虽然能够确定 A 和 B 之间的因果关系方向,但前提是必须不存在任何隐藏的混杂因素。 有一些基于机器学习的算法,能在某些限制性假设下,为从观测数据中识别非线性因果关系提供可靠的统计和/或计算上的保证。例如,DeFuSE 算法在函数因果关系的增长速度为次线性这一假设下,以及混杂因素表现为相关的高斯误差这一假设下,能够识别出非线性因果结构。而Gao等人提出的 NPVAR 算法则能在多项式时间内识别出无模型的非参数(包括非线性)因果结构,但前提是必须满足残差方差相等这一条件(即,图中某个变量在其父节点条件下的条件方差对所有变量来说都是相同的),同时还要确保不存在未被测量的混杂因素。这些算法并非通过假设来排除潜在的混杂因素,也不是通过调整参数来处理这些问题。与上述方法类似,NLCD 也在参数约束条件下进行操作。不过,NLCD 采用遗传算法来检验无混杂因素的因果模型所蕴含的条件独立性假设。这样一来,那些存在混杂因素的三元组会被排除,而不会被当作有效的候选组合。与 Trigger 和 CIT 等基于遗传算法的方法类似,NLCD 通过逐一分析每个三元组来确认不存在混杂因素,这一过程符合因果等价定理的要求。
在那些包含模拟数据的基准测试中,NLCD 在识别非线性因果关系方面表现更佳。例如,在一个非线性锯齿形数据集上,NLCD、CIT、Findr 和 MRPC 的 AUPRC 值分别为 0.72、0.57、0.51 和 0.71。当在酵母基因组数据集的非线性子集上进行测试时,NLCD 在识别与转录因子相关的因果关系方面的表现与 CIT 相当,优于 Findr 和 MRPC。将 NLCD 应用于人类多组织基因组数据集(即 GTEx 数据集)后,研究人员发现了一些在肌肉组织中活跃的因果基因对。这一研究结果也表明,在筛选所发现的因果关系时需要格外小心,同时体现了基于数据的方法在探索人体内因果基因网络方面的优势。
参考文献
[1] Easwar, A., & Narayanan, M. (2026). NLCD: A method to discover nonlinear causal relations among genes. PLoS computational biology, 22(7), e1014570. https://doi.org/10.1371/journal.pcbi.1014570
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-3 14:08
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社