||
SPCC:通过整合单细胞和空间转录组数据来推断空间细胞相互作用
单细胞转录组测序能够以单个细胞的分辨率分析基因表达,以了解特定场景中的细胞状态和分子机制。如果没有空间信息来解释特定场景中存在的空间模式,则无法补充清晰的细胞图谱。空间转录组学可以捕捉空间基因表达的特征,完美地弥补了单细胞数据空间信息缺乏的限制。然而,当前的空间测序技术仍然存在一些局限性。一些空间技术在测序过程中无法实现细胞分辨率,而一些空间技术在测序数据中产生的基因远少于单细胞测序。一般来说,单细胞转录组仅限于测量一百个基因中的一小部分,同时获得清晰的空间信息,例如osmFISH、STARMap 和MERFISH。当前空间转录组技术(Slide-seq、Visium)的分辨率范围为 10 μm 至 100 μm(对于点),其中一个点可能包含多个细胞。
由于这两种数据类型存在相应的缺点,从单细胞 RNA 测序 (scRNA-seq) 计算出的细胞-细胞相互作用通常包含不准确之处,因为距离限制影响了某些配体-受体相互作用的捕获。此外,依赖空间转录组数据缺乏详细的细胞类型注释,使得计算准确的细胞-细胞相互作用具有挑战性。因此,整合scRNA-seq数据和空间转录组数据可以实现这两种不同数据类型的互补优势,从而能够在单细胞分辨率水平上拟合细胞距离。这实现了更精确的细胞通讯推断。
计算解决方案是使用集成框架或工具来集成空间数据和scRNA-seq数据,以弥补这两种数据类型的缺陷。单细胞和空间数据之间的比对可以概括为两类问题。一种是前向映射,这是一种通过使用映射矩阵(例如相关矩阵)将空间信息映射到scRNA-seq 数据的方法,以将空间坐标信息传递到各个细胞。NovoSpaRc 是第一个使用最佳传输将空间转录组数据映射到单细胞数据的方法。SpaOTsc 采用最佳传输并生成映射矩阵来推断细胞通讯。然而,该方法在很大程度上依赖于先前的相似性指标,并且没有明确解决 scRNA-seq 和空间数据之间的批次效应或模态特异性偏差,从而导致比对准确性降低。Tangram 引入了深度学习框架,通过从表达谱学习映射矩阵来对齐单细胞和空间数据。它通过最大化表达谱之间的 余弦相似性来优化细胞点分配。然而,其目标仅关注表达比对,而没有明确解决scRNA-seq和空间数据之间模态特异性差异。 CellTrek使用 Seurat框架来传输空间坐标。虽然在许多情况下有效,但它依赖于潜在空间中的最近邻匹配,当不同的细胞类型具有相似的转录组图谱或空间分辨率较粗时,这可能会产生不明确的匹配。尽管这些方法引入了跨模式标签转移的创新策略,但它们都有一些关键局限性。这些方法在处理模态特定噪声以及在单细胞水平提供细粒度、可解释的空间分辨率方面仍然面临挑战。
另一种是使用反卷积从单细胞数据生成空间数据的细胞类型标签。该方法将生成 空间数据的每个点的细胞类型组成。后向方法还包含许多空间反卷积方法。 Cell2location构建了一个贝叶斯模型,使用参考 scRNA-seq 数据集来估计每个点的每种细胞类型的丰度。然而,该方法不提供单细胞水平的空间分辨率,并且不能直接映射单个细胞。 RCTD应用概率框架来重建细胞类型分布,但与 Cell2location 一样,它仅关注比例估计,缺乏对单个细胞的空间细化。
为了克服这些限制,Wang等人开发了 SPCC(图1,https://github.com/ploughhh/SPCC),这是一种新颖的基于映射的计算框架,它将集成任务制定为几次对抗性的域适应问题。SPCC方法的核心是联合变分自动编码器 (JVAE),它对 scRNA-seq 和空间转录组数据执行共同表示学习。通过结合文库大小标准化和对抗性训练策略,JVAE有效地最小化了特定于模态的技术差异,例如测序噪声和批次效应,从而提取反映真实生物变异的共享潜在表示。一旦获得共享表示,就根据共同嵌入空间中的距离计算细胞点相似度矩阵。该相似性矩阵是生成将 scRNA-seq 细胞映射到空间位置的分配矩阵的基础。为了稳健地捕获基因表达和空间坐标之间的非线性关系,仅使用少量匹配的细胞点对来训练随机森林回归模型。该模型不仅输出每个单细胞的空间坐标,而且还充当映射器,在两种模态之间建立高分辨率对齐。与以前的方法不同,SPCC 能够处理跨平台数据异构性,同时保留细粒度的空间结构。它支持可解释的细胞级空间投影,并支持伪空间重建、细胞通讯推理和微环境模式发现等下游应用,所有这些都具有增强的鲁棒性和分辨率。

图1 SPCC 模型概述。A. SPCC 模型综合框架概述,说明其组件及其相互关系。 SPCC 模型利用联合深度学习框架来执行数据嵌入。使用一组带注释的 scRNA-seq 数据和未注释的空间数据作为输入。SPCC 利用模型中获取的嵌入数据的映射策略来生成概率矩阵,该矩阵表示两种数据模态之间的相似性。B. 获得嵌入数据后,SPCC 采用随机森林模型来学习空间数据和空间信息之间的关系。该模型用于预测 scRNA-seq 和空间数据之间的相似性,生成相似性矩阵。 C. SPCC 的数据收集包含来自不同来源的数据集,包括小鼠体感皮层、乳腺癌和黑色素瘤脑转移数据。D.SPCC 涉及的后续应用和验证包括空间反卷积和细胞通讯推理
根据基准测试结果,SPCC方法与以前的工具相比具有更高的准确性,包括Cytospace、CellTrek、Tangram、SpatialPrompt、STEM。然后,通过在多个物种的不同数据集上使用 SPCC 来验证空间细胞间相互作用的生物学相关性,包括大脑发育、以及癌症亚型和转移。结果发现, SPCC 可以识别具有调控效应的关键相互作用。例如,发现 PECAM1 与 SOX4 相互作用,可能促进黑色素瘤的转移。 总之,SPCC 可以作为组学数据整合和关键细胞间相互作用推断的潜在工具。
参考文献
[1] Tiangang Wang, Yu Zhou, Xi Liu, Sijia Wu, Liyu Huang, Kexin Huang, Xiaobo Zhou, SPCC: Inferring Spatial Cell–Cell Interaction by Integrating Single-cell and Spatial Transcriptomics, Genomics, Proteomics & Bioinformatics, 2026;, qzag083, https://doi.org/10.1093/gpbjnl/qzag083
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-18 20:01
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社