||
SPIDER:通过嵌入正则化和单细胞监督进行空间集成去噪
空间转录组学技术极大地提升了我们研究原始组织结构中基因表达的能力。借助这些技术,我们可以了解细胞的排列方式、细胞之间如何相互作用,以及组织的不同区域如何发挥功能。诸如 10x Visium、Slide-seq、Slide-seqV2 和 Stereo-seq 之类的新平台,能够生成包含数千个空间数据点的大型数据集,这些数据来自多种类型的组织。10x Genomics Visium 是目前最受欢迎的空间转录组学分析平台之一。该平台能够在保持组织结构原有空间布局的同时,对整个基因组进行表达分析。该平台通过直径为 55 微米的空间编码点来检测 mRNA,每个编码点可检测数千个基因。此外,该平台还能将组织学图像与分子数据相结合,从而将分子层面的信息与组织的形态结构联系起来。在捕获技术方面取得的最新进展,使得 Slide-seq 和 Slide-seqV2 等高分辨率分析方法成为可能。这些方法利用带有条形码的微珠,实现了不超过 10 微米的分辨率,同时还能确保对转录组的全面覆盖。Stereo-seq 技术则进一步提升了空间分辨率,它利用密集的 DNA 纳米球阵列,使得在亚细胞尺度上对大范围区域或甚至整个器官进行成像成为可能。像 10x Xenium 这样的成像技术则通过多重荧光检测实现了真正的亚细胞分辨率,不过这种情况下,可分析的基因数量会有所减少。总的来说,这些互补的技术体现了单细胞技术的飞速发展,同时也凸显出对能够准确解析基因在空间上的表达情况的计算方法的需求。不过,单细胞数据往往存在诸多技术上的挑战。基因表达数值通常非常稀疏,许多基因的检测结果为“缺失”,整体检测率也很低。因此,原始数据往往存在噪声且不完整,这使得后续的分析工作——如识别空间结构、研究细胞间的相互作用以及重建组织结构——变得极为困难。这就迫切需要有效的计算方法来处理这些数据:既能去除噪声、填补缺失值,又能保留数据的真实生物学特征。
大量研究都集中在单细胞 RNA 测序数据的去噪与聚类分析上。这是因为单细胞 RNA 测序技术的发展时间早于空间转录组学技术。在现有的工具中,Seurat 框架功能十分强大,可用于各种单细胞 RNA 测序分析,同时也能用于空间转录组学数据中的聚类或空间结构分析。不过,包括 DCA 在内的许多机器学习方法,虽然都是为单细胞 RNA 测序数据而设计的,但并未充分利用空间转录组学数据中的空间信息。为了解决这一局限,BayesSpace通过马尔可夫随机场模型来利用数据中的空间邻接关系,从而让相邻的样本被归入同一个簇中。最近,还有几种基于深度学习的方法被提出,例如 DUSTED、STAGATE、SEDR以及 stGRL。2025 年提出的方法,以及 Cui 等人于 2024 年提出的 DenoiseST,都采用了基于图的技术来捕捉空间关系,并为后续的聚类和去噪等任务生成有意义的特征向量。这些方法通常将每个检测点视为一个节点,利用空间坐标来构建图结构,同时以基因表达向量作为节点的属性。尽管取得了这些进展,但有些方法并未充分考虑数据缺失和数据稀疏性问题,而这些正是 ST 分析中的主要挑战。DUSTED、STAGATE、SEDR、stGRL 和 DenoiseST 等方法解决了这些问题,因此取得了更好的性能。不过,这些方法大多直接处理其算法生成的低维潜在特征向量。虽然这些特征向量能够反映有用的结构,但由于它们包含了来自多个基因的信息,因此难以进行生物学上的解读。因此,将聚类结果与特定的基因或信号通路联系起来仍然是个难题。
在这项研究中,Ansari等人提出了 SPIDER(图1,https://github.com/compbiolabucf/SPIDER)这一新型的半监督式、空间集成型去噪框架。该框架利用了与 ST 数据集来自同一组织类型的 scRNA-seq 参考数据。这些参考数据包含了每个细胞的表达谱信息,以及通过聚类和标记基因分析得到的细胞类型信,。通过将已知类型的细胞合并为“伪样本”,并利用这些样本的细胞类型信息作为监督信号,模型能够在其潜在空间中学习到具有生物学意义的混合模式。这种监督机制有助于推断未标记 ST 数据中的细胞类型组成,同时也能提升去噪后的表达谱质量。作者们采用了零膨胀负二项损失函数来描述 ST 数据的关键统计特性,包括数据的分散程度和缺失值现象。作者们在多个数据集上对 SPIDER 进行了测试,并与几种基准方法进行了比较。与许多现有方法不同,后续分析是在经过去噪处理后的最终表达矩阵上进行的,而非在低维的潜在特征向量上进行分析。这种设计保持了基因层面的可解释性,使得生物信号可以直接追溯到具体的基因上,从而有助于更准确地验证生物学现象。

图1 SPIDER框架概览。SPIDER 通过结合空间结构、转录相似性以及伪 ST 数据,将单细胞转录组数据与参考 scRNA-seq 信息相整合。该框架首先构建三个图结构:一个是基于细胞位置的时空邻域图,另外两个则是基于同一组织类型的 scRNA-seq 数据所生成的真实 ST 数据和伪 ST 数据所构建的转录相似性图。接着,三分支图注意力编码器从这些图中提取低维潜在特征。伪 ST 数据分支通过优化细胞类型比例的预测来提供监督信息;同时,嵌入正则化机制则确保真实 ST 数据和伪 ST 数据的嵌入结果保持一致,从而将参考域中的细胞类型结构有效传递过来。最后,统一的图注意力解码器利用零膨胀负二项式概率模型来重建基因表达数据。经过去噪处理后的表达矩阵可以用于后续分析,包括空间域的识别、标记基因模式的恢复,以及提升聚类分析的效率
参考文献
[1] Ansari, M. I., Alif, M. N., & Zhang, W. (2026). SPIDER: spatially integrated denoising via embedding regularization with single cell supervision. Bioinformatics (Oxford, England), 42(Suppl 2), btag430. https://doi.org/10.1093/bioinformatics/btag430
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-20 20:19
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社