||
AI4Life公开征集与挑战项目:为何要这么做、具体如何操作,以及我们从中获得了哪些经验
AI4Life 是一个由“地平线欧洲”计划资助的项目(2022-2025 年)。该项目的目标是利用最先进的基于人工智能的图像分析技术,为生命科学领域的研究人员提供支持。为此,AI4Life 联盟开展了多项活动:不仅开发了深度学习模型的新格式及相应的公共数据存储库,还举办了各种研讨会以推动相关工具的普及应用。此外,该联盟还致力于促进计算科学家与生命科学工作者之间的交流,从而弥合方法开发者与实际应用者之间的差距。为此,AI4Life共举办了三次生物图像分析项目征集活动以及三次计算挑战赛。
这些公开征集项目为那些在图像分析方面面临挑战的生命科学工作者提供了有效的深度学习解决方案。这些解决方案是由联盟中的 AI 和图像分析专家团队共同开发的。被选中的项目都着眼于整个领域都感兴趣的问题,因此,通过解决方案和开源工具的再利用,这些项目能够惠及多个研究小组。在六个月的时间内,这些项目为研究人员提供了技术支持。项目完成后,所开发的解决方案会被记录下来,移交给用户,并在网络上公开发布。
在开放挑战赛中提出的各种技术解决方案,都是特定分析团队辛勤工作的成果。因此,该领域的其他专家可以对这些方案进行进一步研究,提出更好的分析方法或替代方案。以往的经验表明,公开挑战赛有助于将生物学问题转化为易于处理的机器学习问题,从而推动相关技术的进步。基于这些经验,AI4Life举办了三项以图像恢复为主题的公开挑战赛。每项挑战赛都针对显微镜图像去噪中的不同方面,每项挑战赛持续了两个月时间。
在这份报告中,AI4Life对各种公开征集和公开挑战活动进行了分析,总结了在组织这些活动过程中所获得的经验教训,同时也指出了其中遇到的种种难题。这些经验能够反映生物图像分析领域的现状,以及方法开发者与潜在用户之间的互动情况。通过总结那些有助于避免曾经遇到的问题的最佳实践,希望能为未来的类似项目提供帮助,同时也能激励更多人致力于提升用户培训水平、改善工具之间的互操作性,以及确保数据的公平性和可重复性。
公开征集的经验总结
这些公开征集活动有助于了解生命科学领域所面临的各类图像分析问题、这些问题的典型处理流程,以及目前业界所提出的各种解决方案的现状。
首要的挑战在于建立一套筛选机制,从而将支持重点放在那些已经具备启动条件、能够在规定时间内完成的项目上。此外,这些项目的解决方案还应基于深度学习技术,并且能够被应用到其他项目中。筛选流程如图 1 所示。

图1 三项公开招募项目的筛选流程与分析支持流程。上栏显示了参与资格审核、申请材料评审、咨询环节的专家人数,以及评选委员会的成员构成。OC1 项目不包含咨询环节
在这三个试点项目中,逐步从纯粹的远程评分方式,过渡到了基于专家互动的解决方案。在第一个试点项目中,无论是数据准备情况,还是深度学习在解决该问题时的实际效果,都存在很大的不确定性。许多问题最终是通过传统的图像分析方法或现有的工具来解决的,其中包括预训练好的深度学习模型。不过,也有一些项目因为数据传输问题或需要重新收集数据而不得不推迟进度。
为减少这种不匹配现象,OC2 和 OC3 采取了三项关键措施:强制要求提交具有代表性的数据、采用模板化申请流程,以及与专家进行咨询。虽然这些咨询工作需要投入大量精力,但却是确定哪些项目可以立即启动、调整那些目标过高的项目方案、以及为那些未被选中的申请者提供有用反馈的最可靠方式。最后,评估标准被简化为三个类别,以提高评分的透明度:项目的可行性、深度学习的适用性,以及项目的科学价值。
在开放科学实践中所面临的挑战,其实也是图像分析领域所常见的问题。这些挑战凸显了建立更完善的社区资源的必要性,以便让用户了解那些易于使用的工具。作者们发现,许多常用的工具仍然无法被用户所使用(例如 Cellpose、CellProfiler、QuPath、ilastik、Labkit 以及 napariecosystem 等)。同时,用户过度依赖专有软件,这阻碍了可重复性分析和数据共享的实现。由于显微镜图像的特性以及科学研究的需要,往往需要复杂的处理流程,这就需要将多种工具组合起来使用,或者编写自定义的脚本。正如为开放科学实践而开发的处理流程所示。
在所开发的分析流程中,某些工具被反复使用,这表明它们是生物图像分析中的核心要素。值得注意的是,Cellpose 和 StarDist 在图像分割方面,Noise2Void 在去噪处理方面,都属于此类工具。同样,尽管在科学计算和深度学习的推动下,该领域正逐渐转向 Python 平台,但 ImageJ2/Fiji 仍然是一个重要的工具生态系统。ImageJ2/Fiji 的多个插件能够有效解决各种常见问题,而且非专业人士也能轻松使用这些插件(如 BigWarp、Labkit、TrackMate)。那些成功的工具,往往既具备高效性,又便于用户使用。而那些最先进的技术,往往因为安装和使用过程过于复杂而难以被广泛接受。不过,像Transformer、基础模型、基于扩散的技术等新架构,正在逐渐被业界所接受。该技术具有选择性应用的特点。在评估新方法时,关键标准在于它是否能够减轻用户的数据处理和标注负担,而非单纯看其能否让各项基准测试成绩提升几个百分点。SAM/SAM2 在图像分割领域的成功就体现了这一点:随着该模型的广泛应用,越来越多基于它的预训练模型被开发出来。这些工具被广泛应用于各种研究项目中,这也预示着:在生物图像分析领域之外开发出的大型基础模型时代,工具开发正朝着新的方向发展。
从各种申请和咨询中可以明显看出,另一个需要解决的问题是:必须让人们对深度学习算法的能力和要求有更现实的认知。在深度学习的两个方面,人们普遍存在误解:一是训练深度学习模型所需的标注质量标准;二是深度学习方法目前的实际能力水平。在后者方面,通过咨询环节,有助于调整用户的期望值,并根据更现实的目标来重新界定项目的范围。另一方面,数据标注是一项耗时较长的工作,而用户往往高估了标注的质量标准。
在 22 个被选中的项目中,只有 8 个项目在支持期开始时已经完全准备就绪:拥有完整、可用的数据以及足够的注释信息,从而可以立即开始项目的工作。更令人惊讶的是,其中只有 2 个项目拥有足够多的真实数据,因此可以直接采用深度学习技术来开展项目。对于那些需要大量数据标注的项目,分析流程通常会采用其他方法,或者尝试利用有限的标注数据来继续分析。
虽然有些项目比预想的要困难得多,但大多数延误都是由于数据交换方面的问题造成的,尤其是处理大型数据集时。通常,数据交换需要依赖那些属于科研机构之外的私人服务提供商来完成。这不仅带来了安全风险,也反映出欧洲各公共科研机构之间缺乏共享数据基础设施的问题,以及各种本地化解决方案的普遍存在。
此外,虽然大多数申请者原则上都同意公开自己的数据,但实际上,当需要公开数据时,通常是在项目接近尾声、人们的注意力已经转移到其他地方时,用户很难立刻看到这种做法带来的好处。因此,数据公开往往被忽视:在 22 个获得支持的项目中,只有 17 个项目的数据被存储在公共数据库中;还有 1 个项目的数据尚未上传,4 个项目则根本无法提供数据。此外,大多数项目在公开数据方面都出现了相当大的延迟:有 11 个项目的数据是在项目正式结束 6 个月之后才被上传的,总体而言,从项目结束到数据公开的平均延迟时间为 8 个月左右。数据共享并非在项目发表时才进行的一次性操作,而是一项需要持续投入的努力,其影响远远超出了项目的结束阶段。然而,目前的激励机制并不能有效奖励这种付出。具体而言,最好能尽早确定可以共享的数据部分,在分析流程完成之前就开始上传数据。同时,应将数据提交视为项目完成过程中的一个环节,而非最后的步骤。即便采取了这些措施,数据丢失的情况仍然相当严重。
导致数据共享率低下的根本问题,并非人们不愿意共享数据,而在于共享数据所带来的好处难以被明确体现。那些共享图像数据的研究人员,很少能因此获得直接认可:所有的引用都归功于方法论论文和生物学研究成果,而非那些使数据能够被利用的基础数据集。只要这种不对称性存在,公平的数据共享就只能是一种出于个人意愿而主动采取的行为,而非一种自然而然的结果。与其他人观点一致,作者们认为,要改变这一状况,应从两个方面入手。首先,加强培训:大多数生命科学家将“公平数据共享”原则视为一种必须遵守的规范,而非关于如何处理、标注和存储可重复使用数据的实际指导。因此,人们愿意共享数据的程度与数据真正能被他人利用的程度之间存在着巨大差距。其次,给予相应的认可:数据集的发表、存储以及可重复使用的标注都应该得到应有的认可。在招聘、晋升和资金分配方面,应给予这些方法与已发表的论文同等的待遇。这两项改变都并非某个单一项目所能决定的,而是取决于那些负责资助、招聘和评估项目成员的机构或团体。
综合来看,这三次公开征集活动所反映出的情况是:该群体在技术上具备相应能力,在理念上积极支持开放科学,在文化层面也与开放科学的理念相契合。不过,该群体在基础设施、培训资源以及共同规范方面还存在不足,而这些正是人工智能应用所必需的条件。
公共挑战的经验教训
这些公开挑战从另一个角度提供了参考,为方法开发者们提供了可以用来探索各种解决方案的基准标准。
从这些公开挑战中可以得到的核心启示是:阻碍生物成像技术发展的瓶颈,并非是人们对该技术的兴趣不足,而是那些适合用于基准测试的问题的稀缺性。作者们最初的设想是从各种公开征集的挑战任务中挑选出合适的任务来开展测试,但实际上,这比预想的要困难得多。许多数据集在质量或数量上都不符合深度学习基准测试的要求。除了数据方面的问题之外,许多提案要么过于局限于某个特定的生物学领域,难以引起广泛的关注;要么描述的实验流程过于复杂,难以被简化为一个个易于处理的任务。而这两点,正是开展任何可靠且公平的基准测试所必需的条件。
这一缺陷促使作者们转而使用那些公开可用的数据集以及人工合成数据作为挑战赛设计的基础。虽然没有任何数据集能够完美地反映现实世界中生物成像数据的多样性,但这些经过精心整理的公共数据源仍然是一个实用且透明的起点:数据的来源清晰可查,可以据此建立基准标准,参与者也能轻松获取训练数据。这种方法还有助于确保研究的可重复性。未来的挑战赛组织者不妨借鉴这一做法。在生物成像领域,应将数据的可用性视为核心标准,同时,合适公共数据集的可用性也应被视为前提条件,而非事后才考虑的因素。
这三个挑战分别针对三种不同的场景下的图像去噪问题(见图 2):无监督场景(PC1)、有监督场景(PC2)以及特定领域的钙成像处理场景(PC3)。这些挑战共同反映了在不同训练条件下,参与者们通常会采用哪些方法。在所有三种场景中,参与者们大多使用的是成熟的算法:Noise2Void 及其衍生版本是最常被采用的算法,这体现了该算法的广泛适用性和易用性。不过,在无监督场景下(PC1),COSDD 在四个排行榜中的三个排名第一,仅在第四个排行榜上以 0.01 分之差屈居第二。这一结果表明,那些尚未被广泛采用的算法也具有很大的潜力。在有监督场景下(PC2),参与者们采用了更多种不同的算法,包括 U-Net 架构以及生成对抗网络等。在所测试的模型中,NAFNet-GAN 表现最为出色:它在四个排行榜中均位列前三。这一结果表明,基于监督学习的去噪方法既更容易被人们所接受,也更适合进行各种实验性尝试。而 PC3 模型则适用于要求更高的钙成像任务,但其提交速度最慢。在这一任务中,基于Transformer 的 Restormer3D 模型在四个排行榜中均名列前茅;经过精心调优的 N2V 3D 模型也表现优异,始终位列前三。总体而言,这些结果表明:虽然传统方法仍是参与者的首选,但在技术要求较高的场景下,其他架构则能展现出明显的优势。

图2 挑战组织过程
通过这些测试,还发现:通过社区间的对比,可以揭示出那些仅从单个方法的描述中难以察觉的性能差异。某个方法可能广为人知,但它在不同数据集和不同噪声环境下的实际表现如何,只有通过直接比较才能了解。
参与者的地域多样性是一个积极的迹象,说明该领域受到了广泛的社会关注。不过,与计算机视觉或医学成像领域的知名挑战赛相比,此次挑战赛的成功提交数量仍然有限。这主要是因为缺乏金钱或与会议相关的激励措施:许多知名挑战赛会提供奖金、硬件设备,或者让获胜者能在重要场合发表演讲,优秀参与者还能获得论文发表的机会。如果没有这些激励措施,人们的参与动机就主要取决于对科学的兴趣本身,因此参与范围也会受到限制。由此可见,未来的生物成像相关挑战赛若能提供有力的激励措施,比如奖金、硬件设备、让优秀参与者能发表论文并公开代码,同时通过图像处理领域的各种渠道进行更广泛的宣传,将会更有助于吸引更多人参与。利用论坛和社交媒体,同时加强与各类会议或期刊的合作,从而让更广泛的群体能够更容易地参与其中。
这三项公开挑战表明,我们面临着诸多限制:首先,可用于作为基准测试的生物学问题数量有限;其次,可公开重复使用的数据集也相当匮乏;最后,要想让更多人参与其中,还需要相应的激励措施。
讨论
这两项举措所带来的结果并非是两套截然不同的问题,而是从两个不同角度所看到的同一个根本性瓶颈。通过对 22 个生物图像分析项目为期三年的系统性支持,以及三项公开的去噪挑战,作者们得以了解该领域所提出的各种方法与实际应用条件之间的差距。这一差距正是本研究的核心发现。虽然各种算法确实存在,其中一些是由社区共同开发的,有些则是经过精心设计的工具,但存在的问题是:数据量太少、标注质量太差、标准化程度太低、共享成本太高,而且不同机构之间的数据也难以整合。
这些公开征集项目表明,只要有专家的协助,就能逐个项目缩小这一差距。在 22 个项目中,有 18 个项目成功开发出了可重复使用、并已公开发布的分析流程。这说明,即便初始条件不尽理想,只要能得到有针对性的生物图像分析支持,依然能够创造持久的价值。相比之下,那些公开挑战则表明,要将实际的生物学需求转化为既具有明确范围、又拥有足够资源、同时还能被广泛使用的评估标准,仍然相当困难。综合来看,这两点都说明了一个道理:除非相关的数据和基础设施足够完善,否则单纯的方法论进步是无法产生实际效果的。
这些现象如果单独来看,或许容易被人忽视。在 151 个应用中,有 8 个仍然使用 TIFF 和专有格式的图像文件;尽管有成熟的开源替代方案,但专有的分析软件仍然被广泛使用;在 22 个项目中,数据传输需要通过 14 种不同的服务来完成;此外,许多已经被广泛采用的开放源代码工具,却未被那些最需要它们的人所知晓。单独来看,这些问题都还算容易解决。但综合起来看,这些现象表明:该领域的数据基础设施、工具生态系统以及文化规范,都远远没有达到当前人工智能领域所期望的成熟水平。
这并不是一个令人悲观的理由。那些在海量文本数据上训练出来的前沿 AI 系统之所以能够被开发出来,是因为相关的训练数据早已存在。而生物成像领域目前还远远没有达到这样的条件,现在正通过各种努力来逐步实现这一目标,比如利用图像数据资源、生物图像档案、生物图像模型库、OME-NGFF 等资源,以及 AI4Life 等项目所建立的规范和标准。这项工作表明,我们还有很长的路要走,但同时也说明了这些目标是可以具体实现的。所需的社区资源其实并不复杂:只需要有各机构共同使用的数据传输基础设施即可。需要持续支持对具有生物学意义的数据库进行标注工作,需要提供能够帮助用户明确深度学习能力范围的训练材料,还需要建立相应的激励机制,以鼓励人们将数据库的成果与研究方法的成果同等对待并予以发表。这些都不属于传统意义上的研究问题。它们属于基础设施层面的工作,虽然看似平凡,但却至关重要。同时,这些也是决定未来十年中,生物学领域的科学人工智能能够取得何种成果的关键因素。
建议
如果这些限制主要源于基础设施方面的原因,那么应对措施也必须具有实用性。从三次公开征集意见和三次公众挑战中得到的经验教训,都可以转化为具体的行动建议。这些建议按最有可能采取行动的群体进行了分类。
供生命科学领域的项目申报者使用
深度学习通常需要质量极高的标注数据才能发挥最佳效果。在开始任何与人工智能相关的合作之前,务必牢记:这些标注数据很可能需要大量的修改或补充。应在项目初期就规划好标注工作,同时要将数据和标注视为人工智能项目中进展最慢的环节之一。
在可能的情况下,对于那些涉及大量数据、多通道信息或大规模成像的项目,应采用下一代文件格式。TIFF 格式以及各种专有格式在处理少量数据时仍然适用,但会增加后续数据的再利用和扩展的难度。
在开始定制开发之前,建议先了解各种开源的生物图像分析工具和平台(如 ImageJ2/Fiji、CellProfiler、QuPath、Cellpose、ilastik、Labkit、napari 等)。在很多情况下,已经存在能够解决大部分问题的方法,只要稍加指导或培训就能加以使用。生物成像领域的专家们会在 Image.sc 论坛上乐于帮助你找到合适的解决方案,而这些解决方案也会对其他人有所帮助。
最后,对待深度学习时,应保持现实的期望:它并非是一种可以广泛应用于各种图像处理的通用智能技术,而是一类需要结合具体数据和标注要求来运用的方法。如果从一开始就明确这些要求,项目的推进就会顺利得多。
适用于从事图像分析工作的相关人员/团队
在确定具体方法之前,务必先验证相关数据及注释是否已准备就绪。从以往的实践来看,仅依靠远程评分往往无法准确区分那些已经准备就绪的项目和那些还需要进一步准备的项目。结合样本数据进行有条理的评估,才是最经济有效的筛选方式。
在任何一个项目中,都需投入相当一部分精力用于数据传输、格式转换以及数据标注等工作。请务必为此安排相应的预算。
从第一次提交开始,就应默认使用 FAIR 标准的数据处理流程,而不是在之后才添加这些功能。事后上传数据是导致数据质量下降的最常见原因。只要有可能,就应该选择最适合该项目的工具,即便这些工具并非自己开发的。当然,也必须认识到,有些工具和方法(如 Cellpose、StarDist、Noise2Void、ilastik、Labkit)之所以被广泛使用,肯定有其道理,因此在自行开发之前,不妨先考虑使用这些工具。
最后,要与他人合作。有很多机会可以利用,比如“I2K:从图像到知识”之类的会议,以及 GloBIAS 这样的图像分析平台,都是加强国际分析人士之间联系的好途径。
面向生物图像分析相关设施及社区的组织者们
许多被广泛使用的工具仍然无法有效地送达那些最需要它们的人手中。这说明,主要的障碍在于工具的易发现性和使用培训,而不仅仅是工具本身的设计问题。
应保持由社区共同维护的、定期更新的文档,详细说明各种现有工具的功能、所需的数据以及它们在典型工作流程中的位置。
对于公开招募或类似的支持项目,应在申请材料中附上样本数据;在描述项目时,应使用统一的格式模板;在最终确定人选之前,至少应进行一轮咨询。
请保持评分方案的简洁性和可理解性,最好将评分标准分为三到四个类别,以便于清晰地解释。根据数据量大小,选择两到三种最合适的数据传输方式(如有可能,可寻求机构支持,比如 Globus)。最好在流程最终确定之前就开始数据发布工作,而不是等到流程完成后才进行。
这些改进显著提升了筛选的准确性,同时也减少了从 OC1 阶段到 OC3 阶段的项目流失率。
适用于方法开发者、研究软件工程师以及竞赛组织者
当这些最先进的方法能够被实际应用、能够用于处理真实数据,并且有明确的适用场景说明时,它们对生物学研究来说才最有用。
Cellpose 和 Noise2Void 的成功,既得益于其算法的优越性,也离不开其易用性。同样地,SAM2 的衍生版本在系统中得到了迅速应用,这表明:只要这些模型能减轻用户的数据处理负担,该领域就会很快接受它们。
在发布某种方法时,要考虑到其他研究人员在将其应用于自己的数据时可能需要的条件,并采取必要的措施来简化这一过程。如果是在开发工具,那么必须确保该工具易于使用、有完善的文档说明,并且能够与现有的生态系统顺利兼容。
在开展基准测试时,应把数据的准备情况视为前提条件,而非事后才考虑的因素:许多实际的生物学问题并不符合理想中的“易于处理的挑战”形态。因此,经过精心整理的公共数据集仍然是最可靠的基准数据来源。
在这一领域,未来的挑战可以通过更有力的激励措施来克服。这些激励措施包括奖金、硬件设备、对优秀作品的论文发表机会,以及与各类会议和期刊的更紧密合作,从而帮助该领域的影响力超越现有的范围。
致各资助机构和单位
在所有的公开征集和挑战赛中,一个普遍存在的现象是:制约各项工作的关键因素,都是共享基础设施的不足。应将碎片化的数据传输问题视为基础设施方面的缺陷,而非某个环节的单独故障。
投资于跨机构数据传输基础设施、公共生物图像存储库、针对社区优先处理的数据集进行的标注工作,以及那些为整个生态系统提供支持的开源工具的维护者。
应将这项工作视为生物领域中科学人工智能领域的战略性能力建设举措,而不仅仅是某种辅助性的服务功能。虽然相关团队已经在努力开发这些资源,但问题在于,资金支持机制是否能够认识到这些工作的真正价值,将其视为具有前瞻性的重要研究。
参考文献
[1] Vera Galinova, Mehdi Seifi, Beatriz Serrano Solano, Kristína Lidayová, Damian Dalle Nogare, Agustín Andrés Corbat, Joshua Talks, Edoardo Giacomello, Estibaliz Gómez-de-Mariscal, Mariana G. Ferreira, Caterina Fuster-Barceló, Juan Manuel Battagliotti, Carlos García-López-de-Haro, Benjamin Salmon, Melisande Croft, Si Young Yie, Guillermo Rey-Paniagua, Xiaotian Hu, Sungjun Cho, Aagam Sheth, Chhayansh Porwal, Xiaomeng Li, AI4Life Consortium, Ricardo Henriques, Xinyang Li, Alexander Krull, Anna Klemm, Arrate Muñoz Barrutia, Anna Kreshuk, Wei Ouyang, Florian Jug, Joran Deschamps. AI4Life Open Calls and Public Challenges: why, how, and what we have learned. bioRxiv 2026.07.21.739486; doi: https://doi.org/10.64898/2026.07.21.739486
以往推荐如下:
5. EMT标记物数据库:EMTome
8. RNA与疾病关系数据库:RNADisease v4.0
9. RNA修饰关联的读出、擦除、写入蛋白靶标数据库:RM2Target
13. 利用药物转录组图谱探索中药药理活性成分平台:ITCM
19. 基因组、药物基因组和免疫基因组水平基因集癌症分析平台:GSCA
22. 研究资源识别门户:RRID
24. HMDD 4.0:miRNA-疾病实验验证关系数据库
25. LncRNADisease v3.0:lncRNA-疾病关系数据库更新版
26. ncRNADrug:与耐药和药物靶向相关的实验验证和预测ncRNA
28. RMBase v3.0:RNA修饰的景观、机制和功能
29. CancerProteome:破译癌症中蛋白质组景观资源
30. CROST:空间转录组综合数据库
31. FORGEdb:候选功能变异和复杂疾病靶基因识别工具
33. CanCellVar:人类癌症单细胞变异图谱数据库
36. SCancerRNA:肿瘤非编码RNA生物标志物的单细胞表达与相互作用资源
37. CancerSCEM 2.0:人类癌症单细胞表达谱数据资源
38. LncPepAtlas:探索lncRNA翻译潜力综合资源
40. MirGeneDB 3.0:miRNA家族和序列数据库
41. RegNetwork 2025:人类和小鼠基因调控网络整合数据库
42. CircTarget:多种细胞类型circRNA调控综合数据库
43. GreenCells:植物lncRNA单细胞分析资源
44. RM2Target 2.0:RNA修饰的写入者、擦除者和读取者靶基因数据库

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )
GMT+8, 2026-8-24 14:41
Powered by ScienceNet.cn
Copyright © 2007- 中国科学报社