||
IC2:潜在混杂因素影响下的干预性动态因果关系预测
厘清因果关系是科学发现的核心所在,它有助于推动科学认知与技术创新的发展。通过探究各种因果关系,我们可以更深入地理解复杂系统的内部机制,并从而改善各个领域的结果,比如社交网络、生物信息学、神经科学和金融领域。
因果关系的本质在于:某个因素能够对另一个因素产生影响。要想确定某个系统中的真正因果关系,第一步就是区分“干预性因果关系”与“观察性因果关系”。因为,通过干预措施可以获取关于系统动态的更关键的信息。必须区分从被动收集的观测数据中发现的统计关联,以及通过干预措施所揭示的因果关系。虽然观测数据能够反映自然条件下的各种关联,即“观察到的现象”。但仅凭这些数据,如果不做额外的假设,就无法确定真正的因果关系。而干预数据则能直接证明因果关系,因为它能揭示有针对性地施加干预后的结果,也就是“我们所看到的变化”。不过,要通过干预措施来推断因果关系,通常需要进行比单纯观测数据更复杂的实验,比如随机对照试验、基因敲除实验以及药物干预实验。而这些实验往往成本高昂、具有侵入性,或在伦理上存在争议。在临床研究和地球科学等领域,由于各种实际或伦理方面的限制,观测得到的时间序列数据往往是唯一可用的信息来源。因此,如何从纯粹的观测数据中推断出因果关系,仍然是理解复杂系统动态过程中的一个重要且尚未解决的难题。解决这一难题不仅有助于我们更好地理解这些系统,还能为实验设计提供依据,同时减少许多科学领域中那些成本高昂或难以实施的干预措施的需要。
在干预性情境下进行因果推断的现有方法,大致可以分为两类:用于横截面数据的统计分析方法,以及用于时间序列数据的动态分析方法。统计学家们长期以来认为,因果关系源于随机变量之间的结构性依赖关系,而这些依赖关系可以通过随机化处理或外部干预来识别。在这一领域,最早的开创性工作可以追溯到 20 世纪 20 年代的 Splawa-Neyman 等人,他们首次提出了随机实验中“平均处理效应”的概念。在此基础上,Pearl 发展了基于有向无环图(DAG)的因果推断理论:在因果图中,各种干预效应可以通过截断马尔可夫分解或后门调整公式来计算。最近提出的不变因果预测(ICP)方法则能够量化在因果推断过程中各种置信概率。该方法能够构建因果结构模型,并通过观测数据和干预措施来预测其外部效应。另一种方法是高效神经因果发现算法,该算法将因果发现问题视为对独立边概率的优化过程,从而确定有向无环图结构。不过,这种方法要求对所有变量进行干预处理。可微分因果发现算法则利用高斯非线性低秩结构方程模型来大规模识别因果结构,同时还能预测那些未被观察到的干预效果。不过,那些基于随机对照试验、do 演算或类似框架的方法,比如 ICP、ENCO 和 DCD-FG,都需要从额外的实验中获取观测数据和干预数据。而在许多现实场景中,比如生物系统中,这种做法往往不可行或存在伦理问题。为克服这一限制,人们开发了 scTenifoldKnk、GenKI和 CellOracle等模型,这些模型能够从未经干扰的单细胞组学数据中推断出基因调控网络,从而为基因敲除实验提供了替代方案。不过,这些方法仅适用于特定的生物学场景,比如单细胞 RNA 测序数据。更重要的是,这些方法依赖于静态数据,因此无法捕捉数据中蕴含的动态信息。KOCMI是一种基于“敲除”操作的条件互信息方法,它无需事先了解网络结构即可推断出因果关系。不过,该方法假设不存在未被观察到的混杂因素,因此在处理动态数据时可能存在局限性。因此,目前仍然缺乏一种通用的因果推断方法,能够仅凭观测数据来推断出干预措施所带来的因果效应。
为了解决这些限制,人们从动态学的角度提出了多种因果推断方法。典型的动态学方法包括基于预测的方法,如格兰杰因果关系分析,以及基于信息论的方法,如传递熵法。格兰杰因果关系分析能够有效识别强耦合系统中的线性相互作用。传递熵法则将这一方法扩展到了非线性情况。不过,这两种方法及其衍生方法都面临着非线性动态系统的“不可分离性”问题:即系统内部各组成部分之间相互交织,无法将每个组成部分的动态特性单独提取出来。为了解决这一难题,人们提出了基于嵌入的方法,如收敛交叉映射法、部分交叉映射法、储能器交叉映射法,以及它们的衍生方法,如交叉映射评估法、交叉映射基数法、嵌入熵法。这些方法旨在将复变量之间的相互作用与非线性动力系统区分开来。不过,这些方法在处理涉及间接关联、非线性相互作用的情况时存在固有难题。更严重的是,当存在不可见或潜在的混淆因素时,这些方法也难以发挥作用。除了这些基于动力系统的因果推断方法外,还有其他方法也被提出,例如基于微分方程的方法,以及因果消息传递和因果分解方法等。尽管这些方法推动了动力系统中的因果推断技术的发展,但它们通常仅根据观察到的时间序列数据来估计因果关系,而无法考虑外部干预因素的影响。
为了超越单纯的关联分析,从而在受到干扰的情况下量化因果效应,人们提出了多种方法,这些方法都将干预信号纳入动态模型中。例如,干扰级联推断法通过系统地干扰动态网络的各个组成部分来推断该网络的结构。CAnDOIT则通过在已知目标上施加人为干预,从而改进了潜在的 Peter-Claude 条件独立性分析方法。干预型储备计算法通过构建原始系统的神经网络副本,并对其施加干预,从而在数字孪生环境中观察系统的变化情况,进而实现可控的实验。MACE则基于部分信息分解以及协同-唯一-冗余分解法的原理,将干预效应分解为协同效应、冗余效应和独特效应,从而量化真正的因果效应。不过,这些基于动态机制的方法仍然需要外部干预操作来辅助分析(例如 IRC 和 PCI 方法),或者需要使用 do-演算工具来进行分析(例如 MACE 方法)。这些限制使得这些方法难以在许多实际场景中得到应用。此外,大多数现有方法都假设了因果关系的充分性,即不存在未被观察到的混杂因素。但在生物学等复杂系统中,这一假设往往不成立。最近,人们提出了“干预动态因果关系”框架,并引入了一个定量指标——即“干预嵌入熵”。该指标系统地描述了在动态系统中,某个变量的微小扰动如何随着时间推移影响其他变量。与以往的方法不同,IEE 直接利用纯粹的观测时间序列数据,通过延迟嵌入和信息论原理来估算 IntDC。不过,IEE 无法消除基于配对变量的间接因果关系,因此需要引入一种新的条件性分析方法,此时,第三方变量 z 必须是可观测的。尽管在统计和动态分析方法上取得了显著进展,但从观测数据中推断出干预层面的因果关系仍然是一个难题,尤其是在存在隐藏变量的情况下。这些限制因素继续阻碍着可靠、可推广且可重复的因果关系分析。
为应对这些挑战,Yan等人提出了“在不可见/潜在混杂因素影响下的干预性动态因果关系分析方法”(ICIC 或 IC2,)。该方法仅基于观测到的时间序列数据,就能确定变量 x 与 y 之间的干预性动态因果关系。该方法的理论严谨性及在实际应用中的表现都得到了验证。IC2 的核心思想是一种新颖的双正交分解框架:通过从观测时间序列数据中构建干预数据,再利用双正交分解神经网络进行处理,从而能够在存在潜在混杂因素的情况下有效识别干预性因果关系。首先,IC2 将包含时间延迟的观测数据分解为两个正交子空间:公共子空间和私有子空间,这有助于确定因果关系并分离出那些无法直接观测到的混杂因素。其次,IC2还将从流形中通过交叉映射得到的干预数据进行了分解。公共子空间和私有子空间相结合,使得对各种干预措施所带来的因果效应进行量化成为可能。IC2方法能够从间接的因果关系、混杂因素的影响中准确推断出直接的因果关系,即便存在潜在的混杂因素或其他非因果性因素,该方法依然有效。与那些基于预测的方法不同,IC2是通过从效应变量反向推导出原因来进行分析的。通过交叉映射邻居节点所获得的干预数据,可以替代那些成本高昂或难以实施的实验,从而完全依靠观察数据来进行因果推断。相关的双重正交分解定理进一步帮助我们从观察和干预的角度,将嵌入在因变量中的因果信息分离出来。这一方法克服了“纠缠变量无法分离”的问题,而这正是格兰杰因果关系等方法的根本局限性。 一种变分推断算法能够支持对偶分解和逆向重建过程。在揭示复杂生物系统中的动态因果机制方面,该方法既具备良好的可扩展性,又具有较高的可解释性。

图1 存在潜在混杂因素时的干预性动态因果关系分析框架。(A) 动机:对于那些难以进行实验性干预的系统,如何仅基于现有的观测数据来揭示其中的干预性因果关系呢?为此,基于延迟嵌入空间,提出了针对观测数据和干预后数据的双正交分解定理,以此来解决非干预系统中的相关问题。(B) 从延迟嵌入空间构建干预后数据(C) 理论架构图:观测数据与干预后数据的双正交分解定理.(D) IC2 计算框架:该计算框架通过整合双重正交分解技术来推断在潜在混杂因素影响下的干预效应。(E) 应用领域:IC2 可以被用来通过节点敲除实验来估算真实的干预效应;还可以利用各种现实世界数据来重建生物网络;此外,仅基于对照数据,IC2也能用来预测单细胞 CRISPR 干预实验所带来的影响
作者们在九种不同的场景中验证了 IC2 的有效性,这些场景包括经典的基准测试系统、模拟的基因网络以及真实世界的数据集。其中,有两个大规模的高通量单细胞 CRISPR 干扰数据集被纳入了研究范围,这些数据集有助于了解神经前体细胞在分化过程中的转录动态,以及大脑皮层发育的过程。在所有这些场景中,IC2都展现出了出色的效果。
在数据集方面,IC2能够仅凭观测数据,比如来自对照组的基因表达谱数据,就能准确推断出因果关系网络。同时,它还能有效预测各种干扰或基因敲除所带来的影响。其中,真实的干预数据仅用于验证目的。IC2能够从被动观测数据中推断出干预层面的因果效应,这一能力意味着它可以成为一种强大的工具,用于计算机模拟筛选,从而指导实验设计,进而减少对昂贵或具有侵入性的检测手段的需求。
参考文献
[1] Yan, J., Zhang, S. W., Shi, J., Zhang, C., & Chen, L. (2026). IC2: interventional dynamical causality under latent confounders. Journal of the Royal Society, Interface, 23(240), 20251289. https://doi.org/10.1098/rsif.2025.1289
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 14:41
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社