zhangjunpeng的个人博客分享 http://blog.sciencenet.cn/u/zhangjunpeng

博文

生物信息学的十项简单准则:非视觉化、可重复且易于访问

已有 120 次阅读 2026-9-5 12:34 |个人分类:科普|系统分类:科普集锦

生物信息学的十项简单准则:非视觉化、可重复且易于访问 

从计算生物学分析中提取生物学见解需要检查数据和分析结果。在单细胞和批量 RNA 测序中,分析人员检查降维图以评估聚类和整合或热图以注释细胞身份。因此,人们非常重视阅读图形。对于盲人和低视力研究人员来说,这造成了障碍,因为光栅化图对于屏幕阅读器来说是不透明的。更大的问题是,此类图支持的分析判断通常不会在其他地方记录:虽然图形标题可以描述完成的图形显示的内容,但它们很少解释选择了哪个阈值、考虑了哪些替代方案、哪些数据支持决策或相关的不确定性。 

这个问题是结构性的而不是轶事性的。最近对生命科学资源的大规模评估发现,74.8% 的数据门户和 69.1% 的期刊网站存在严重的可访问性问题。在同一评估中,使用屏幕阅读器执行的手动数据发现任务的成功率仅为 53.3%。存在使基于网络的生物医学数据资源可访问的建议。本文解决计算分析本身的日常实践:检查数据、证明阈值、将绘图和其他诊断工具转化为决策,并将整个过程暴露给不进行视觉工作的研究人员。 

这些规则源于生活经验,即使在人工智能 (AI) 时代,障碍仍然存在。第一作者是一名盲人生物信息学家,使用屏幕阅读器、盲文和音频反馈来导航代码、数据和科学文献。其余的作者通过合作了解了许多这些限制,因为他们注意到其他人仍然无法获得计算意义上的可重复分析。有些建议得到已发表的无障碍研究的支持,而其他建议则反映了个人经验。 

可重复的研究需要跟踪每个结果的产生方式,避免手动数据操作,将数据存储在图、版本控制脚本后面,以及自动管理软件环境。 FAIR 数据管理同样强调人类和机器的可查找性、可访问性、互操作性和可重用性。可重复的研究和可及性是相辅相成的。非视觉可访问性更彻底地应用了这些原则。例如,如果结果取决于视觉判断,建议写下该判断。同样,如果一个数字支持某个主张,则应以结构化表格的形式提供相同的数据。 

作者们使用单细胞 RNA-seq (scRNA-seq) 数据分析作为运行示例,因为它是一项复杂且绘图繁重的任务。标准 scRNA-seq 工作流程涉及质量控制、标准化、降维、聚类和注释。几乎每一步,研究人员都会检查并做出决定。为了展示如何将可访问和可重复的实践纳入工作流程,作者们提供了 Seurat分析的常用 3k PBMC 数据集的可访问分析,展示了分析过程中的决策记录。图 1 将十个规则排列为五个需求级别,从研究人员必须能够驱动的计算环境,到保持实践持续进行的共享基础设施,以及在每个级别遇到的障碍和促进因素。 

image.png

1 十条规则按需求层次结构进行排列。每一层都依赖于其下一层:首先,研究人员必须能够利用辅助技术来启动、操作计算机环境,才能进行任何分析(第 1 层);否则,就根本无法获取数据(第 2 层),以此类推,直到达到共享基础设施这一层面(第 5 层)。在每一层旁边,都列出了该层面所面临的障碍以及消除这些障碍的途径。这些规则沿用了文中的编号方式,分别用 R1 R10 表示。这些规则是按照逻辑顺序排列的,同时在图中也按照相互依赖的关系进行布局。各层的标签都是文字形式,而非像素形式。屏幕阅读器会按顺序读取每一层的内容、该层所面临的障碍以及解决这些障碍的途径,最终达到整体目标 

准则1:将图视为决策记录,而非单纯的插图而已

准则2:对人工智能的描述要持保留态度/不要完全相信人工智能的说法

准则3:先打造一个无障碍的环境

准则4:依靠规范的编程方式来确保结果的可重复性

准则5:为非可视化分析目的而整理数据与元数据的结构

准则6:便于数据的检查与识别/便于对数据进行特征分析

准则7:以易于获取的格式进行发布

准则8:在各项工作中都要考虑到无障碍性需求

准则9:建立社区与共享基础设施

准则10:确保研究的可访问性,从而实现公平的研究成果 

参考文献

[1] Kientsch J G, Neuhauss S C F, Mallona I. Ten simple rules for non-visual, reproducible and accessible bioinformatics. arXiv preprint arXiv:2608.14400, 2026. https://doi.org/10.48550/arXiv.2608.14400 

以往推荐如下:

1. 分子生物标志物数据库MarkerDB

2. 细胞标志物数据库CellMarker 2.0

3. 细胞发育轨迹数据库CellTracer

4. 人类细胞互作数据库:CITEdb

5. EMT标记物数据库:EMTome

6. EMT基因数据库:dbEMT

7. EMT基因调控数据库:EMTRegulome

8. RNA与疾病关系数据库:RNADisease v4.0

9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target

10. 非编码RNA与免疫关系数据库:RNA2Immune

11. 值得关注的宝藏数据库:CNCB-NGDC

12. 免疫信号通路关联的调控子数据库:ImmReg

13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM

14. AgeAnno:人类衰老单细胞注释知识库

15. 细菌必需非编码RNA资源:DBEncRNA

16. 细胞标志物数据库:singleCellBase

17. 实验验证型人类miRNA-mRNA互作数据库综述

18. 肿瘤免疫治疗基因表达资源:TIGER

19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA

20. 首个全面的耐药性信息景观:DRESIS

21. 生物信息资源平台:bio.tools

22. 研究资源识别门户:RRID

23. 包含细胞上下文信息的细胞互作数据库:CCIDB

24. HMDD 4.0miRNA-疾病实验验证关系数据库

25. LncRNADisease v3.0lncRNA-疾病关系数据库更新版

26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA

27. CellSTAR:单细胞转录基因组注释的综合资源

28. RMBase v3.0RNA修饰的景观、机制和功能

29. CancerProteome:破译癌症中蛋白质组景观资源

30. CROST:空间转录组综合数据库

31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具

32. Open-ST3D高分辨率空间转录组学

33. CanCellVar:人类癌症单细胞变异图谱数据库

34. dbCRAF:人类癌症中放射治疗反应调控知识图谱

35. DDID:饮食-药物相互作用综合资源可视化和分析

36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源

37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源

38. LncPepAtlas:探索lncRNA翻译潜力综合资源

39. SPATCH:高通量亚细胞空间转录组学平台

40. MirGeneDB 3.0miRNA家族和序列数据库

41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库

42. CircTarget:多种细胞类型circRNA调控综合数据库

43. GreenCells:植物lncRNA单细胞分析资源

44. RM2Target 2.0RNA修饰的写入者、擦除者和读取者靶基因数据库

45. SDMap:空间药物扰动图谱数据库

image.png

 



https://blog.sciencenet.cn/blog-571917-1551107.html

上一篇:基于深度学习的多组学融合的图设计
下一篇:MiRQuery:对miRNA测序数据进行交互式分析和可视化处理



    
收藏 IP: 39.128.49.*| 热度|

1 王三根

该博文允许注册用户评论 请点击登录 评论 (1 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-9-5 15:56

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部