||
lncRNA筛选中的干扰因素:成因、后果及可能的解决方案
最初,lncRNA 被定义为长度超过 200 个核苷酸的非编码转录本。现在,人们建议以 500 个核苷酸作为更严格的分类标准,从而将 lncRNA 与中等长度的 Pol III 转录本区分开来。lncRNA 参与了多种生物学过程,包括染色质重塑、转录调控、RNA 加工、核糖核蛋白复合物的形成以及相分离结构的形成。因此,lncRNA 具有多种生物学功能。尽管 lncRNA 的重要性越来越受到重视,但其具体功能仍有许多未知之处。目前,只有少数 lncRNA 得到了深入研究,而且往往只是在其特定的功能背景下被研究。
这一知识空白尤为重要,因为 lncRNA 是人类基因组中数量最多的基因类型:目前已鉴定出约10万个 lncRNA 位点,这一数字是蛋白质编码基因对应位点的 4.5 倍左右。解决这一挑战的关键在于,利用高通量筛选技术,在各种生物学背景下系统地研究lncRNA的功能,就像研究蛋白质编码基因时所使用的“癌症依赖性图谱”方法一样。不过,由于lncRNA的功能与蛋白质编码基因不同,它们不受开放阅读框的调控,因此对插入或缺失突变也不敏感。所以,研究 lncRNA 的功能需要采用与研究蛋白质编码基因不同的方法。RNA 干扰技术在细胞核内的效果有限,而大多数 lncRNA 正是细胞核内发挥作用的。虽然基于反义寡核苷酸的筛选技术已成功用于研究数百种 lncRNA,但这种技术的规模化应用仍面临挑战。由于反义寡核苷酸无法通过基因编码来产生,因此它们无法被整合到基于条形码的高通量筛选流程中。目前,已经开发出几种适用于高通量筛选的 lncRNA 干扰方法,包括利用 Cas9 进行 lncRNA 的删除或剪接位点的编辑、CRISPR 干扰技术以及 CRISPR 激活技术来调节 lncRNA 的转录功能。此外,还可以利用基于 Cas13d 的系统直接靶向 lncRNA 分子。
高通量检测技术用于分析 lncRNA 时,容易出现较高的假阳性结果
虽然这些方法使得大规模的筛选成为可能,但与针对蛋白质编码基因的筛选相比,lncRNA 的筛选更容易产生相互矛盾的结果。例如,Weissmann 及其同事发现,在一项利用 Cas9 技术进行筛选的研究中,有30%到39%的 lncRNA 被误判为阳性结果。同样,另一项最近的分析也显示,利用 Cas13d 技术进行的 lncRNA 筛选中,误判率甚至更高。该研究后来被撤回了。
不过,正如利用 CRISPRi 和 Cas13d 进行的研究所表明的那样,高通量的 lncRNA 筛选方法仍然能够产生可靠的结果。因此,个别干扰技术的局限性并不能完全解释为何有些研究会出现如此高的假阳性率。实际上,这个问题源于人们忽视了 lncRNA 筛选容易受到技术及分析因素影响的特性。首先,与蛋白质编码基因相比,lncRNA 中属于“必需基因”的比例要低得多(在各个细胞系中,这一比例仅为0.2%到1.3%;而在 DepMap 数据库中,有9.9%的蛋白质编码基因被列为“必需基因”)。这就导致 lncRNA 筛选中,真阳性的比例远远低于假阳性比例。其次,干扰 lncRNA 所导致的表型变化通常比干扰蛋白质编码基因时更为微弱,这就增加了混淆因素掩盖真实信号的可能性。第三,许多 lncRNA 位于基因组的重复区域,或者与其他基因组元件存在重叠。这些因素进一步加剧了原有问题。进行高通量的 lncRNA 筛选时,需要精心设计实验和分析方法,以克服这些影响因素。以下将重点介绍 lncRNA 筛选中常见的假阳性来源,并提出相应的策略来识别这些假阳性结果,从而将其带来的负面影响降到最低。
误报现象仅限于特定技术使用过程中出现
有些导致假阳性的因素在各种筛选技术中都会出现,而有些则是由特定干扰手段所导致的。与技术相关的干扰因素中,一个常见的问题就是对邻近或重叠的遗传元素的意外干扰,比如蛋白质编码基因或增强子。这使得我们难以确定观察到的表型究竟是由目标 lncRNA 引起的,还是由对邻近遗传元素的意外干扰所导致的。对于那些依赖 DNA 靶向核酸酶的筛选方法来说,这个问题尤为突出——因为这类核酸酶可能会造成插入或缺失,从而直接影响那些与之重叠的基因组区域。CRISPRi 和 CRISPRa 介导的转录调控也受到类似限制,因为某些 lncRNA 的转录起始位点可能与蛋白质编码基因的转录起始位点非常接近,甚至完全重合。此外,这些系统还会影响增强子的活性,从而进一步增加产生混淆效应的风险。
为了监测可能出现的各种干扰因素,有必要列出那些其功能受到干扰后会引发相应影响的蛋白质编码基因。需要研究的是相关表型,同时还要评估在 lncRNA 筛选过程中所使用的引导 RNA 是否会对这些表型产生影响。一种策略是同时筛选与蛋白质编码基因相关的目标。正如 Liu 等人通过 CRISPRi 筛选所证明的,这种方法有助于识别并消除各种干扰因素。在他们的研究中,25.6%到54.9%的筛选结果实际上是由于对必需蛋白质编码基因的间接抑制所导致的。通过考虑这一因素,他们最终得到了一份可靠的、包含真正必需的 lncRNA 的清单。另一种策略则是利用现有的资源,比如那些已经记录下来的必需蛋白质编码基因的清单。不过,这种间接干扰不可避免地会限制能够被准确分析的 lncRNA 的数量,尤其是那些通过顺式调控机制发挥作用的 lncRNA。解决这个问题的一个有效方法,是采用那些能够直接针对 lncRNA 转录本进行检测的技术,比如基于 Cas13d 的系统,而不是去检测编码 DNA。
CRISPR 核酸酶的毒性作用。在 lncRNA 筛选过程中,出现假阳性的另一个原因是一些干扰机制所导致的细胞毒性,尤其是由 CRISPR DNA 核酸酶引起的双链断裂。双链断裂的修复过程会延缓细胞增殖,从而在基于适应度的筛选中产生虚假信号。当 gRNA 同时靶向多个基因组位点时,这种效应会更加明显,因为多个双链断裂会共同导致更严重的适应性缺陷。例如,针对被扩增的基因组区域的 gRNA,在蛋白质编码相关的研究中尤其容易产生假阳性结果。在以 Cas9 的剪接受体/供体位点为靶点的 lncRNA 筛选中,这种效应被证实是导致假阳性的主要因素,即便在排名靠前的结果中也是如此。值得注意的是,这个问题并不仅限于被扩增的基因组区域,因为那些靶向基因组上多个位点的 gRNA 也可能会产生类似的虚假结果。因此,目前大多数针对蛋白质编码基因组的新型 CRISPR 文库在设计时都采用了各种策略来尽量减少多靶点效应。这一原则在设计针对 DNA 的 lncRNA 文库时尤为重要。
此外,由于 lncRNA 靶向作用所引发的生物信号往往很微弱,因此仅由 Cas9 本身带来的毒性就可能成为一个重要的干扰因素。例如,在针对 Cas9 的剪接受体/供体靶点的筛选中,大多数被设计的用于靶向 lncRNA 的 gRNA 都会导致可测量的生物学缺陷,即便这些 lncRNA 实际上并不表达。如果该筛选实验主要使用那些不靶向目标序列的 gRNA 作为阴性对照,那么要有效控制这种非特异性毒性就相当困难。此时,就必须使用那些靶向基因组中“安全位点”的 gRNA 作为对照。
虽然其他干扰机制通常不会被视作导致假阳性的主要因素,但它们同样可能引发细胞毒性。例如,Cas13 RNA 核酸酶在完成目标序列的切割后,还可能无差别地切割其他 RNA 分子。不过,属于 Cas13d 家族的 CasRx 则有所不同:它在哺乳动物细胞中表现出很强的目标序列切割能力,而伴随的 RNA 切割现象则极为轻微。尽管也有报告指出 CasRx 也会引发伴随切割现象,但现有证据表明,这种情况主要发生在目标 RNA 含量较高、且由于外源载体而使 CasRx 表达过量的情况下。因此,通过使用表达水平较低的载体,就可以将这种伴随切割现象降到最低,从而更准确地反映在具有稳定基因组整合的细胞中,CasRx 的实际作用情况。在 lncRNA 的筛选过程中,采用了基于转座子的递送方式。这种方式既能确保足够的活性,又能有效避免对其他 RNA 的破坏。虽然在 CasRx 的筛选过程中,这类副反应比较少见,但仍然需要通过适当的对照实验来加以监测。其中包括那些并非针对特定目标基因的 gRNA,以及那些针对那些虽然被表达但并非必需的基因的 gRNA。
与技术无关的误报/假阳性结果
在所有干扰策略和筛选方法中,导致假阳性结果的最常见原因之一就是脱靶效应。与 TALENs 或 RNAi 等早期技术相比,基于 CRISPR 的系统通常具有更低的脱靶效应。不过,如果 gRNA 的设计不当,仍然可能产生脱靶效应。在构建 CRISPR 文库时,需要权衡三个主要因素:最大化 gRNA 的活性、确保对目标区域的全面覆盖,以及最小化脱靶效应。lncRNA 的筛选尤其容易受到脱靶效应的干扰。例如,Liang 等人报告的 Cas13d 筛选结果中,有 63.3%到 76.0%的 gRNA 在编码重要蛋白质的基因中引发了脱靶效应(其中,48%的 gRNA 有 0 个错配,37%的 gRNA 有 1 个错配,15%的 gRNA 有 2 个错配)。因此,最小化脱靶效应应是设计过程中的最关键环节。对于那些以lncRNA 为靶点的基因编辑工具来说,这一标准是不可或缺的,即便这样做会减少可被靶向的lncRNA 的数量。这一点在那些位于重复序列区域或假基因上的lncRNA 上尤为明显,因为这些lncRNA 与蛋白质编码基因的序列相似度很高。在这两种情况下,要设计出真正“无脱靶效应”的基因编辑工具往往是不可能的。
过于宽松的统计分析方法。在 lncRNA 筛选中,导致假阳性结果的另一个原因是过于宽松的统计分析方法。针对蛋白质编码基因的 CRISPR 筛选所使用的分析方法,未必能直接应用于 lncRNA 筛选,因为两者在数据特征上存在差异。例如,lncRNA 中属于“必需基因”的比例远远低于蛋白质编码基因。此外,lncRNA 被干扰后产生的表型通常比那些针对蛋白质编码基因的筛选所观察到的表型要弱得多,因为蛋白质编码基因大多具有重要的生理功能。另外,蛋白质编码基因的筛选通常使用 Cas9 工具,目前已有大量经过精心设计的 gRNA 可供使用;而 lncRNA 筛选则使用较新的工具,这类工具的相关信息尚不完善,或者需要设计出活性极高的 gRNA 才能进行筛选。与 Cas9 相比,CRISPRi 系统通常需要使用更多的 gRNA 分子,因为其中许多 gRNA 的效率较低。所有这些因素都会降低在 lncRNA 筛选中的统计功效。为弥补这一缺陷,人们通常会降低统计要求的严格程度。
虽然放宽这些严格标准是合理的,但若采用过于宽松的统计标准,就可能导致虚假的阳性结果。例如,在一项基于 Cas9 的 lncRNA 删除筛选研究中,研究人员使用了 MAGECK α-RRA 分析框架来处理数据。在进行多重比较校正之前,他们先对数据进行了筛选,只保留那些至少有两条有效的 gRNA 与之对应的 lncRNA。通过这种方法,研究人员发现了 43 个阳性结果。而当使用相同的方法重新分析数据时(假发现率阈值仍设为<0.25),但省略了筛选步骤后,仅发现了 2 个阳性结果。
另一个例子来自 Liang 等人。他们在排除了脱靶效应后,重新分析了 CasRx 筛选的结果。经过修正后的结果已以预印本的形式发表。不过,即便在经过修正后的数据中,仍有 37.1%到 54.9%的“阳性结果”实际上是lncRNA ,而这些 RNA 在相应的细胞系中根本不会表达。由于根本不存在的lncRNA 既不可能成为 CasRx 的靶标,也不对细胞的功能至关重要,因此这些“阳性结果”很可能是假阳性。这一问题的根源很可能在于,在对这些数据进行分析时没有进行适当的假阳性率校正。
这些例子表明,为了提升发现效率而放宽统计标准时,必须同时严格控制假阳性的比例。例如,在分析结果时,作者们使用了 MAGeCK 工具中的α-RRA 算法,并在经过多重检验校正后,将假阳性阈值设定为 0.25。不过,还使用了没有 CRISPR 核酸酶活性的细胞系作为对照组。在这种情况下,所有被检测到的“阳性结果”都应属于统计上的假阳性。通过这种方法,得出的实际假阳性率为 0.022。另一种策略是全面验证所有具有统计显著性的结果,而不仅仅是排名靠前的结果。这样做可以增强人们对那些虽然统计显著性较低但仍然具有合理依据的 lncRNA 相关性的信任度。如果仅验证排名靠前的结果,就无法做到这一点。
影响筛选的那些干扰因素,同样也会影响命中率的验证结果
在论文发表之前无法检测出假阳性的原因之一是,验证过程同样会受到那些影响初步筛选结果的干扰因素的影响。例如,对于那些通过 Cas9 切割技术筛选出来的候选序列,人们试图用同样的 Cas9 技术来验证其有效性。然而,后来发现,其中有一些候选序列其实是假阳性结果,这是由于 Cas9 在切割扩增后的基因组区域时产生了毒性反应所导致的。由于筛选和验证过程都使用了 Cas9 技术,这一干扰因素也就没有被发现。
另一个例子是Liang等人所做的研究。他们利用 Cas13d gRNA 和 DsiRNA 来验证通过 Cas13d 筛选得到的目标序列。不过,在许多情况下,验证实验中重复使用了相同的靶向序列。因此,筛选过程中出现的脱靶效应也同时被带入了验证结果中。重新分析这些数据后发现:在验证实验中,有 75.5%的 lncRNA 至少被一种 gRNA 或 Dicer 切割产生的小干扰 RNA(DsiRNA)所靶向,而这些 gRNA 或 DsiRNA 的脱靶效应可能影响到那些编码重要蛋白质的基因。
这些例子充分体现了适当验证措施的重要性:只有通过有效的验证,才能避免因技术因素而产生的干扰。同时,这些例子也表明,即便采用了不同的方法,如果不能有效控制那些与技术无关的干扰因素,那么这些方法也可能无法达到预期的效果。理想情况下,验证策略应针对原始筛选方法中的各种局限性来进行调整。例如,在针对 DNA 的筛选过程中,相邻元素的相互影响会带来干扰,因此,验证过程应充分考虑这些潜在的干扰因素。或者,可以采用直接针对 RNA 的方法,从而将真正的信号与各种干扰效应区分开来。
展望
与针对蛋白质编码基因的筛选相比,lncRNA 的筛选更容易受到各种干扰因素的影响。出现假阳性的原因多种多样:有些是特定于某种筛选技术的,而有些则普遍存在于各种筛选方法中。这就导致了那些被错误认定为“必需”的 lncRNA 列表的发布,而这些错误信息会妨碍后续研究,因为人们会基于这些错误数据来提出新的假设。鉴于目前只有少数 lncRNA 被确认为真正必需的,那些高通量筛选产生的大量假阳性结果可能会误导整个研究领域的发展方向。
随着高通量实验的迅速发展,同行评审制度作为确保质量的一种机制,所承受的压力越来越大。要确定那些有问题的检测结果,往往需要对原始数据进行仔细检查或重新分析。而在审查过程中,这往往很难做到。因此,科学界在论文发表后的重新评估就显得尤为重要,它既是一种纠错机制,也有助于推动方法论的进步。因此,鼓励各期刊发表相关研究报告,以提高科学透明度,让科研人员能够从错误中吸取教训,同时激励研究人员投入时间和精力来重新分析已发表的数据。
参考文献
[1] Montero, J. J., Trozzo, R., & Rad, R. (2026). Confounders of lncRNA screens: sources, consequences and possible solutions. Nature methods, 10.1038/s41592-026-03226-3. Advance online publication. https://doi.org/10.1038/s41592-026-03226-3
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库
Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-9-20 19:34
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社