||
scTACL:单细胞转录组学分析的多任务、拓扑感知型对比学习方法
作为生命的基本单位,细胞会根据其所处的组织环境和生理状态来执行各种生物功能。虽然传统的批量 RNA 测序方法能够提供较高的测序深度,但它只能反映大量细胞的平均转录情况,因此难以揭示细胞间的差异性。近年来,单细胞 RNA 测序技术的突破性进展使得我们能够精确地了解单个细胞的基因表达情况。这一技术极大地加深了我们对细胞异质性的理解。除了改变细胞生物学和表观遗传学领域的研究方法外,单细胞 RNA 测序还极大地影响了对各种复杂生物系统的分析,比如肿瘤微环境。
尽管单细胞 RNA 测序在揭示细胞异质性方面取得了突破性进展,但它仍然面临着诸多挑战。从技术层面来看,测序的灵敏度与通量之间存在不可避免的权衡。例如,高灵敏度的测序平台(如 Smart-seq2)能够准确检测到各种转录本,尤其是那些含量较低的基因和非编码 RNA。不过,这类平台的样本处理能力有限,且成本较高。相反,高通量的测序平台,例如Drop-seq 技术非常适合大规模细胞测序,但往往会牺牲每个细胞的测序深度。此外,不同测序平台或实验批次所带来的系统偏差,即所谓的“批次效应”,可能会掩盖真实的生物学信号,或导致假阳性结果,从而影响生物学分析的准确性。
更严重的问题是 scRNA-seq 数据的高维性和稀疏性。在基因表达缺失的情况下,这一问题尤为突出:由于技术限制,那些本应被检测到的基因表达数据却无法被识别出来。为了解决这些问题,人们提出了各种计算方法。在 scRNA-seq 领域,“去噪”指的是消除在测序和数据预处理过程中产生的技术性噪声,从而提高数据的准确性。而“插补”则旨在弥补因数据捕获效率低下而导致的基因表达值缺失问题。虽然这两种方法都能提升数据质量,但它们针对的是不同的数据失真原因。由于基因表达缺失所导致的数据稀疏性,会从多个方面影响后续分析:(i) 细胞聚类是 scRNA-seq 分析中的关键步骤,其结果在很大程度上取决于原始数据的质量。由于速率效应导致的基因表达稀疏性,会显著降低聚类分析的准确性。(ii) “丢弃”现象会掩盖真实的基因表达差异,从而降低分析的灵敏度,增加出现假阳性的风险。这一效应在那些表达水平较低的基因上尤为明显,而这些基因往往包含重要的调控因子和细胞特异性标记物。(iii) 细胞类型的识别依赖于对标记基因的准确检测。如果由于“丢弃”现象导致某些标记基因无法被检测到,那么细胞类型就会被错误识别,尤其是在那些在转录水平上相似的细胞亚型之间。(iv) 配体与受体的共同表达对于理解细胞间的信号传递至关重要。如果某些基因的表达被丢失,那么关键的信号通路就可能被遗漏,从而影响我们对细胞间相互作用和组织功能的全面理解。
在处理数据缺失问题方面,最近出现了多种用于填补 scRNA-seq 数据空缺的方法。其中比较著名的方法包括 SAVER、scImpute以及 MAGIC。具体而言,SAVER 利用贝叶斯回归和共表达网络技术,通过分析基因间的相似性来构建预测模型,从而估算出每个细胞中各个基因的真实表达水平。而 scImpute 则首先将细胞分组,再根据同一组内细胞的表达模式来判断那些值为零的细胞是否因为数据缺失而产生的。MAGIC 则基于流形学习理论,构建细胞相似性图谱,并利用扩散过程在图谱中传递信息,从而平滑并补全基因表达矩阵。随着深度学习的快速发展,由于其强大的学习能力和可扩展性,一些研究人员开始将深度学习技术应用于这一领域。用于去除单细胞转录组数据中噪声的各种方法。例如,scVGAE将图卷积网络整合到变分自编码器(VAE)框架中。该模型采用零膨胀负二项分布损失函数来确保数据的精确恢复。AcImpute也是类似的算法。2025 年的研究认为,同一细胞类型中,基因表达水平越低,细胞死亡的概率就越高。该研究构建了细胞之间的转换概率矩阵,并通过对该矩阵进行加权处理,从而恢复了缺失的基因表达数值。
在细胞聚类方面,Seurat和 Scanpy分别是 R 语言和 Python 语言中最为常用的两个工具。Seurat 将单细胞 RNA 测序数据与细胞内的 RNA 表达模式相结合,从而确定细胞的类型和位置;而 Scanpy 则是一个基于 anndata 库开发的、用于分析单细胞 RNA 测序数据的可扩展工具。这两种工具都采用了基于最近邻算法的聚类方法,同时也会使用 Leiden 或 Louvain 算法来进行聚类处理。除了这些传统工具外,深度学习技术也被越来越多地应用于提升单细胞 RNA 测序分析的聚类效果。scSimGCL 则利用多头注意力机制来整合基因表达信息和图结构信息,再通过图神经网络提取特征,从而实现细胞聚类。GraphSCC 将图 GCN 与去噪自编码器相结合,并通过双重自监督机制对模型进行优化,从而提升聚类性能。
受这些进展的启发,Zhou等人提出了一个具有拓扑结构感知能力的对比学习scTACL 框架(图 1,https://github.com/doriszmr/scTACL)。scTACL 是一个统一的模型,能够支持多种后续分析任务,包括数据插补、细胞聚类、批次效应校正、差异表达分析、轨迹推断以及细胞间相互作用/通讯分析。与传统将插补和聚类作为独立步骤来处理的流程不同,scTACL 直接利用训练过程中生成的插补后的表达矩阵作为所有后续任务的共同输入。这一设计提升了模型的可解释性,同时通过减少任务间的依赖关系和不必要的预处理步骤,简化了整个分析流程。

图1 scTACL 的总体结构。(a)在选定 HVG之后,scTACL 通过整合基因表达谱数据,以及利用 K 最近邻算法在 PCA 空间中计算出的欧几里得距离,来构建原始图 G。随后,对原始图 G 应用数据增强技术,从而生成相应的增强图G’。最后,scTACL 将原始图 G 和增强图G’作为输入数据,从而得到相应的中间嵌入向量 Z 和Z’。(b)scTACL 的引入旨在提升模型在潜在空间中捕捉细胞间关系的能力。(c)基因解码器采用与编码器对称的架构,而拓扑解码器则使用内积解码方式,并利用 ZINB 模型来拟合重构后的基因表达矩阵。(d) 对于通过 scTACL 处理后得到的重构矩阵,还进行了后续的分析处理
在建模策略和学习目标方面,scTACL 与现有的基于 GCN 或 ZINB 的方法有本质区别。首先,scTACL 不仅能够重建基因表达数据,还引入了拓扑解码器,从而同时重建基因表达模式和细胞间的连接结构。这一策略有助于确保潜在表示与生物学上的邻域关系保持一致。其次,scTACL 采用了基于拓扑结构的对比损失函数,从而在保留拓扑约束的同时,使从原始图和增强图中学到的表示保持一致。相比之下,大多数基于 GCN 或 VAE 的传统模型主要依赖重建损失函数来处理数据,而没有像 scTACL 那样对潜在空间进行显式约束。这些组件共同作用,使得 scTACL 能够在同一个框架内同时模拟基因表达、细胞拓扑结构以及数据的稳定性。从而为多方面的单细胞转录组分析提供了高效的分析手段。
为了全面评估 scTACL 的性能,作者们对 20 个单细胞和空间转录组学数据集进行了系统性的实验分析。这些数据集涵盖了多种组织和不同的测序平台。其中,17 个数据集被用作定量评估的基准,另外 3 个数据集则用于后续分析。所评估的任务包括数据插补、细胞聚类、批次效应校正、差异表达分析、伪时间轨迹推断以及细胞通讯预测。这些评估方式有助于全面、多维度地验证该方法的有效性。实验结果表明,scTACL 在插补、聚类和消除批次效应等关键领域,始终优于现有的各种先进方法,展现了更高的准确性和稳定性。这一优势在差异表达分析中尤为明显。scTACL 成功识别了肺腺癌数据集中不同上皮细胞亚型之间的转录差异,从而证明了其能够检测出细微的细胞变化。值得注意的是,即便没有空间位置数据,scTACL 仍能准确推断出肝细胞癌空间转录组数据中的上皮-间充质转化过程,进一步体现了其强大的分析能力。具备捕捉生物系统中复杂的时空功能关系的能力。
参考文献
[1] Zhou M, Lu X, Liang Y, Kow AWC, Wang G, Liu Q, Zhao Y. scTACL: a multitask topology-aware contrastive learning approach for single-cell transcriptomics analysis. Bioinformatics. 2026 Jun 1;42(6):btag361. https://doi.org/10.1093/bioinformatics/btag361
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-7-23 20:14
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社