||
只需保持数据的稀疏性即可:重新思考以生物学原理为基础的神经网络架构
基因和分子实体组织成通路、生物过程和调控机制。这种结构化知识可以指导生物信息学和生物医学应用中的神经网络设计。将该结构直接编码到神经网络架构中,似乎提供了一种超越黑箱预测的方式,并且结合了强大的预测性能与内置的生物学解释性。这一前提推动了生物知情神经网络(BINN)的快速采用,其中来自《京都基因与基因组百科全书》(KEGG)和 Reactome等数据库的策划注释,可以约束模型架构或输入表示。在多组学应用中,BINN越来越多地被用于分类、回归和生存分析,通常明确声称嵌入生物知识既能提升泛化性,也能提升可解释性。
早期的研究在多层感知器中引入了单一的通路层,并结合了诸如“丢弃”机制、以及基于精心整理的注释数据进行的网络结构优化等稀疏编码技术。后续的研究则进一步发展了这一理念:将生物学信息融入到多个层次中,模拟通路之间的相互作用,或将各通路视为独立的子网络来处理。更近期的模型则引入了注意力机制、transformer或变分自编码器,从而在保持通路结构的同时进一步提升网络的表示能力。在所有这些设计中,通路相关的注释信息都决定了网络的拓扑结构,从而确保了功能上相关的元素能够相互连接。
在基于精心整理的知识来筛选各种相互作用关系的同时,也有其他策略利用通路信息来进行数据转换,从而使得这些架构能够适用于非表格形式的数据。图神经网络将基因或通路视为根据特定通路关系相互连接的节点,或者通过图卷积或注意力机制来模拟不同通路之间的相互作用。混合式方法则将图神经网络与通路聚合模块相结合,或者通过共享的图神经网络层和元图表示来整合各种相互作用关系,以便进行后续的预测分析(见图 1)。

图1 神经网络中用于处理组学数据的通路整合方法的示意图,以及这些方法的随机化处理方式。通路信息可以通过两种方式被纳入神经网络中:(a) 神经网络通过建立结构化的连接来利用通路信息,从而在模型中引入稀疏性。(b) 另一种方法是基于结构的随机化处理方式:在保持网络稀疏性的同时,连接关系的确定不依赖于通路信息。(c) 还有一种数据转换策略,即利用通路信息将表格形式的组学数据转换为图表或图像。(d) 最后是一种随机化数据转换方法:通过随机化处理来生成图表或图像,而非依据预定义的通路结构来生成
尽管这些方法各不相同,但它们都有一个共同的特点:通路标注实际上起到了“稀疏性先验”的作用。这样一来,需要训练的参数数量就会减少,同时也能限制可表示函数的范围。从学习理论的角度来看,这种设计体现了“组合稀疏性”的原理,即复杂的函数可以被分解为对有限输入子集的简单操作。这一原理正是卷积神经网络、图神经网络和 Transformer 神经网络能够取得成功的关键所在,因为这些网络都利用了这种结构化的稀疏性来有效应对“维度灾难”问题。
因此,BINN可以被看作是这一原理的具体体现。通过将基因分组到不同的通路中,或对各种通路进行有序的组织,就能实现这一目标。在分层模块结构中,特征之间的相互作用被赋予了结构性稀疏性,这一过程利用了生物学知识来构建相应的结构。不过,架构上的限制虽然决定了假设空间的范围,但并不能唯一确定内部的表示方式。因此,即使预测结果准确,这些内部表示也可能会偏离其原本的生物学含义。这就引出了一个至关重要但尚未得到充分探讨的问题:BINN 模型是否真正利用了生物学知识,而不仅仅是利用了其所施加的结构性稀疏性?或者,BINN 模型之所以有效,主要是因为生物学注释本身就具有结构性稀疏性,而与生物学含义无关?要回答这个问题,仅仅将 BINN 模型与其全连接模型进行比较是不够的。为此,需要通过引入适当的“零模型”来将生物学上的注释与结构上的影响区分开来。这些零模型能够在保留数据的稀疏性和结构特性的同时,消除其中与生物学意义无关的信息。
在最近的一项研究中,Caranzano等人系统地评估了 29 种最先进的基于生物通路的神经网络。具体而言,作者们将生物注释与网络的架构结构明确地分开来进行分析。对于那些可以进行实验评估的模型,还构建了相应的随机化模型:在这些随机化模型中,生物通路注释被替换为随机关联,同时仍保留了网络的稀疏性和结构约束。这一框架有助于我们验证一个重要假设:如果生物通路信息除了能体现网络的稀疏性之外,还能提供额外的预测信息,那么在保留网络结构的前提下,如果去除这些生物通路信息,模型的性能和可解释性就会下降。相反,如果随机化模型的表现与原始模型相当,那么就需要重新评估生物通路信息的价值了。最后,作者们提出了一种结构化的评估方案,通过具体的工作流程来判断在何种情况下整合生物通路信息才是有益的。该方法适用于各种 BINN 架构、不同的预测任务以及各种类型的数据。它为系统地比较基于生物学原理的模型与其结构相似的随机模型提供了可靠的基准。
在各种预测任务、数据集和评估指标中,随机模型始终能够与基于生物学知识的模型相媲美,甚至表现更佳。此外,基于生物学通路信息的模型在可解释性方面并没有明显优势:随机模型能够以类似的准确率识别出与疾病相关的生物标志物,并能生成高度相关的特征排序结果。研究结果表明,人们通常认为的、归因于生物学通路整合的性能提升,其实主要源于稀疏性带来的正则化效应,而非生物学知识本身。作者们提供了一种通用的评估方法(https://github.com/compbiomed- unito/Pathway_Randomization),用于判断生物学先验信息是否真的能带来超出稀疏性之外的预测价值,从而为开发具备生物学意识的神经网络提供实用指导。
参考文献
[1] Caranzano, I., Pancotti, C., Rollo, C., Sartori, F., Liò, P., Fariselli, P., & Sanavia, T. (2026). Sparsity is all you need: rethinking biologically informed neural networks. Briefings in bioinformatics, 27(4), bbag425. https://doi.org/10.1093/bib/bbag425
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-3 14:08
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社