||
SpCAST:有效整合单细胞数据与单细胞空间转录组数据
单细胞 RNA 测序技术几乎能够全面覆盖整个转录组,从而精确地分析细胞的多样性。不过,细胞在分离过程中会脱离其原有的空间和微环境。相比之下,单细胞分辨率的空间转录组学技术则能够保留组织的结构,从而让研究人员能够直接在原位分析各个细胞。不过,尽管具有空间分辨率,这种技术仍无法确保分子信息的完整性:因为该技术依赖于成像手段来获取数据。
通常,这些平台仅能处理预先定义好的基因组序列,而基于测序的方法在细胞层面的分辨率往往较低。因此,将单细胞 RNA 测序所获得的分子层面信息与详细的细胞类型信息相结合,再结合那些较为稀疏或针对特定区域的空间测量数据,就能有助于确定细胞的身份,并恢复那些与特定细胞类型相关的表达信号。
越来越多的计算方法将单细胞分析结果与空间转录组学数据相结合。这些数据可用于空间细胞类型标注、跨模态比对以及表达重建。不过,大多数方法的优化都是围绕某个主要的推理目标来进行的,因此细胞类型识别或表达重建则需依靠单独的模型、组件或后续处理步骤来完成。另一个挑战是计算成本。随着空间分析的范围从有限的视野范围扩展到整个组织切片、整个器官、多组样本以及细胞图谱,同时参考数据集在规模和分类精度上也有所提升,那些需要构建完整的参考-查询映射矩阵、进行迭代后验推理或反复整合细胞邻域信息的方法,会带来相当大的计算和内存成本。这些计算上的考虑进一步推动了可扩展的参考引导框架的发展。该框架能够同时实现细胞类型的转换和表达信号的恢复,而无需明确构建完整的参考-查询映射关系。
然而,仅仅依靠准确高效的预测,还无法揭示支撑某个整合模型决策的分子层面的证据。细胞类型标签、后验概率、映射矩阵以及潜在表征虽然能够描述模型所预测的结果,但并不能直接解释为何某个特定的空间位置上的细胞会被归类为某种特定的类型。现有的可解释性方法则从不同的角度来阐释模型的行为,比如通过信号通路、调控因子、基因程序、单个基因的重要性评分,或是空间表达的差异等因素来分析。不过,这些表征方式并不一定能够明确地解释某个特定现象的成因。
将单个空间细胞的类别判定与那些受表达水平影响的基因贡献联系起来,是一项具有挑战性的任务。如何将预测出的空间身份与这些基因层面的信息相联系,并确定这些信息在组织中的具体位置,仍然是个难题。这种以决策为中心和空间解析的解释在有针对性的、稀疏的、跨平台或跨物种的环境中特别相关,其中意外的预测可能反映生物变异、不完整的面板覆盖、参考查询不匹配、技术效应或模型不确定性。
在这里,Zhang等人推出了 SpCAST(图1,https://github.com/sijimochou/SpCAST-1.0.0),一个统一、可扩展且易于理解的框架,专为基于参考信息的集成任务而设计。该模型结合了 scRNA-seq 数据以及单细胞分辨率的空间转录组数据。其训练模型能够同时处理细胞类型分类、参考细胞与查询细胞的分布对齐问题,以及空间上各细胞表达水平的重建。通过这种机制,该模型将细胞类型的识别与细胞表达水平的分析有机地结合在了一起。SpCAST 模型采用独立采样的小数据集进行训练,无需显式地构建完整的参考细胞与查询细胞的对应关系。

图1 SpCAST 框架的概览。a,SpCAST 首先使用带有标签的 scRNA-seq 数据作为参考,再结合无标签的单细胞分辨率空间转录组数据。该系统将这两种数据限制在相同的输入基因集范围内,然后分别对参考细胞和查询细胞进行采样,以便进行联合训练。b,通过共享的线性投影机制以及 Kolmogorov–Arnold 网络编码器,参考细胞和查询细胞被映射到同一个潜在空间中。训练过程中,系统会同时优化基于监督学习的参考细胞分类结果、跨模态分布对齐效果,以及针对查询细胞的表达重建结果。该系统的决策函数被进一步转化为 SAGA,一种稀疏的、单层的加性 Kolmogorov–Arnold 网络模型。SAGA 能够生成基因与细胞类型之间的对应关系、相应的标记分数以及空间决策信息图。c,SpCAST 具备三种主要的分析功能:空间上的细胞类型转换、基于 SAGA 的基因水平分析。转录与空间表达模式的重建。通过转移的细胞类型预测,可以了解细胞在空间上的分布情况,并确定那些原本未被标记的细胞的身份。而 SAGA 则有助于确定哪些标记基因最为重要,同时还能比较不同参考条件下的基因表达情况,包括跨物种的比较
该细胞映射矩阵适用于处理大型空间数据集。为了揭示与预测相关的分子层面的决策依据,作者开发了“空间感知基因归因”算法。该算法利用知识蒸馏技术,训练出一个稀疏的、单层的 Kolmogorov–Arnold 网络模型,以此来近似决策函数。在 SAGA 算法中,每个类别的逻辑概率值都被表示为各基因所对应的非线性响应函数之和。这些函数进一步被转化为与特定细胞类型相关的标记值,然后在这些细胞中进行评估,从而生成空间证据图谱。作者们在 53 个单细胞分辨率的空间转录组数据上测试了 SpCAST。这些数据来自五种不同的技术,涵盖了多种组织和物种,总共有 413,404 个空间细胞。在七种被评估的方法中,SpCAST 的细胞类型识别准确率最高。此外,该技术在随机初始化的情况下仍能保持稳定性,且处理速度较快,即便在处理一千万个模拟空间细胞时也是如此。在控制性掩蔽实验中,该框架能够有效恢复与细胞类型相关的表达信号,同时提升了所选标记基因模式与其对应细胞群之间的匹配度。
SAGA 技术有助于解析与下丘脑和皮质区域中细胞类型相关的、受表达水平影响的基因反应以及空间分布特征。在 Xenium 乳腺肿瘤样本中,SpCAST 技术还帮助确定了那些原本未被标记的细胞的身份,这些结果得到了与细胞类型相关的标记基因表达情况的验证。当应用相同的技术来分析人类样本时,该查询是通过人类基因组数据以及与人类基因组同源的小鼠基因组数据进行比对分析的。SAGA 算法能够识别出在两种参考数据集中都存在的基因反应模式,而那些在用小鼠基因组数据替换后不再出现的基因反应模式则被忽略。总的来说,SpCAST 构建了一个统一的框架,将可扩展的空间细胞类型转换、表达信号分析以及基于空间分辨率的基因层面分析结果联系在了一起。
参考文献
[1] Zhang Y, Zhao B, Zhang X, et al. SpCAST: Decoding spatial transcriptomics at single-cell resolution with fast and interpretable analysis. arXiv preprint arXiv:2605.26904, 2026. https://doi.org/10.48550/arXiv.2605.26904
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-18 20:01
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社