||
基于上下文感知的人类基因调控的序列到功能模型
基因组学的一个核心目标,是了解基因组是如何产生各种功能性结果的,比如基因表达和表观遗传状态。为此,基于 DNA 序列来预测功能的方法已经取得了巨大成功。这些模型在人类和小鼠的参考基因组以及大量的功能基因组数据集上进行了训练,从而能够理解基因调控的规律,并准确预测那些以前从未见过的 DNA 序列的功能。这些模型在预测非编码变异的影响以及生成合成序列方面也很有用。不过,目前的先进模型还无法应用于那些尚未被研究的细胞类型和条件。由于这些模型仅依据 DNA 序列来进行分析,因此它们无法考虑到该序列所处的生物学环境。
具备上下文感知能力的序列到功能模型通过能够对以前未曾见过的细胞环境进行泛化处理,从而克服了这一根本性限制。这些模型不仅利用了 DNA 序列信息,还利用了上下文向量。上下文向量是根据关于细胞状态的信息计算得出的,通常包括基因表达情况或染色质的可及性。以往的模型则使用了转录因子表达数据、ATAC-seq 数据以及单细胞多组学数据(包括 RNA 和 ATAC 数据)。不过,这些模型的预测能力有限,能够预测的检测类型较少,而且还需要依赖已知的转录因子结合位点信息。
Aksu等人开发了Corgi模型(图1,https://github.com/ekinda/corgi)。Corgi 是一种具备情境感知能力的序列到功能预测模型,能够全面分析人类细胞中的 16 种不同生物学指标,包括 RNA 测序结果、染色质可及性、DNA 甲基化程度以及组蛋白修饰情况。值得一提的是,Corgi 的架构设计旨在模拟细胞内的基因调控机制。在细胞中,转录调控蛋白会与 DNA 和 RNA 结合,从而调控基因转录、改变染色质状态并控制 mRNA 的降解过程。因此,Corgi 在构建其情境向量时,会考虑各种转录调控蛋白的表达情况。这些转录调控蛋白包括转录因子、转录共激活因子、染色质修饰蛋白以及 RNA 结合蛋白。

图1 Corgi 架构模仿了细胞中的基因调控机制。设计了这种架构试图模仿细胞如何利用转录因子来解读调控基因组。该模型首先通过卷积层提取顺式调控特征,再通过多层感知器来分析转录因子的表达情况,从而得到反式调控特征。最后,这些特征通过 FiLM 层进行整合,该层能够对各种特征进行仿射变换。这些转换过程类似于生物物理学中的“亲和力×浓度”模型。与其说这些特征是由单个转录因子构成的,不如说它们是模型所识别的各种转录调节因子的组合体。随后,带有 FiLM 层的 Transformer 模块能够以特定于细胞类型的方式,捕捉基因组中的长程相互作用
Corgi解决了上下文感知型序列到功能模型中的一个核心难题:由于 DNA 序列与上下文向量的维度不同,将两者结合起来并非易事。上下文向量是一维的,而 DNA 序列则具有两个维度:长度和各种特征。现有的方法通过特征拼接(如 ChromDragoNN、EpiGePT、EnformerCelltyping)或针对特定细胞类型的解码器(如 scooby)来将上下文向量与 DNA 序列信息相结合。有些方法则利用染色质可及性信息作为上下文信息,这样处理起来更简单,因为可及性信息可以直接作为新的维度添加到序列信息中(如 EPCOT 方法)。在Corgi模型中,作者们充分利用了各特征之间的关联性来进行处理。线性调制技术被用来将这两种信息源结合起来。该技术此前已被广泛应用于图像生成和语音识别等任务中,从技术和概念上来看,它都非常适合用于这项任务。重要的是,使用线性调制技术可以克服 EpiGePT 的局限性:它允许所有的转录调节因子影响那些已学到的特征,而无需依赖于任何已知的转录因子结合模式。
在经过针对各种人类细胞类型和单细胞数据的训练后,Corgi 能够准确地将所学知识应用到之前未曾见过的场景中。Corgi 在预测新细胞类型中的基因表达方面表现优异,同时也能准确预测 DNase-seq、ATAC-seq、DNA 甲基化以及各种组蛋白标记的相关数据。值得注意的是,即使在最严格的测试条件下,Corgi 的表现依然十分出色。在这些测试中,Corgi 的表现远远优于 EpiGePT。作者们还推出了一个更先进的模型版本:Corgi+,该模型专门用于利用 RNA-seq 数据来预测未知细胞类型中的表观基因组信息。将 Corgi+与 EpiGePT 以及基于张量分解的预测工具 Avocado 进行了对比测试。结果表明,Corgi+的表现远远优于这两种模型,堪称利用 RNA-seq 数据进行表观基因组预测领域的最佳模型。最后,作者们证明了 Corgi 能够以“零样本”的方式识别出各种细胞类型所特有的关键转录因子,并能预测这些基因组变异对其他未被训练过的细胞类型的影响。
参考文献
[1] Aksu, E. D., & Vingron, M. (2026). Context-aware sequence-to-function model of human gene regulation. Nature communications, 17(1), 6200. https://doi.org/10.1038/s41467-026-75527-2
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-17 13:17
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社