aBIOTECH分享 http://blog.sciencenet.cn/u/aBIOTECH

博文

aBIOTECH | 贵州大学王崎/肖源源团队提出视觉-文本语义对齐的统一粮食作物器官计数框架

已有 215 次阅读 2026-8-17 11:59 |个人分类:论文|系统分类:论文交流

aBIOTECH | 贵州大学王崎/肖源源团队提出视觉-文本语义对齐的统一粮食作物器官计数框架

bc2e1fad-6116-475d-8549-c8751a355be2.png

小麦、玉米、水稻和大豆为人类提供了约60%的热量,其穗、雄穗、稻穗和豆荚等产量相关器官的准确计数,是作物育种、产量评估和田间管理的重要基础。传统人工计数效率低且易受主观误差影响;现有深度学习方法又多面向单一作物定制,面对不同作物的形态差异、尺度变化、密集遮挡和复杂田间背景时,往往需要重新训练。通用少样本计数虽然能够借助视觉示例迁移到新的作物类别,但示例图像中的背景信息容易造成特征混淆。因此,如何利用一个模型稳定完成多种粮食作物器官计数,仍是高通量表型分析亟待解决的问题。

近日,贵州大学王崎/肖源源团队联合电子科技大学、贵阳学院及东京大学研究人员aBIOTECH 发表了题为VT-SCC: Visual-text semantic alignment via multimodal guidance for unified staple crop organ counting研究论文。该研究提出了视觉-文本统一粮食作物器官计数框架VT-SCC,将类别文本提示与视觉示例共同引入视觉表征学习,并构建了包含小麦、玉米、水稻和大豆4类作物、13,474幅图像的M2-Crop多模态数据集。在综合测试中,VT-SCC取得了3.28的平均绝对误差(MAE)和4.48的均方根误差(RMSE),优于现有通用计数模型,同时保持了与作物专用模型相当或更好的性能。

92d301a2-602d-44d5-a881-3d517b4fb9a9.png

作者首先从计数范式出发分析了现有方法的局限(图1)。作物专用模型形成了彼此割裂的“孤岛”,难以跨物种复用;依赖视觉示例的少样本模型虽然能够计数新的作物类别,却容易将叶片、枝条等背景纹理误识别为目标。VT-SCC利用小麦穗、玉米雄穗、水稻稻穗和大豆豆荚的文本提示明确任务语义,并结合视觉示例提供实例级参照,在统一特征空间中实现从物种专用隔离、视觉相似性纠缠到文本引导的多粒度对齐,为多种作物共用一个计数框架奠定了基础。

ae5f0ad6-b1c6-4de8-b324-0e590c434bc9.png

图1. 从作物专用模型和少样本计数到统一粮食作物器官计数范式

VT-SCC以Grounding DINO为基础,由尺度自适应特征聚合器(SAFA)、语义引导通道调制器(SGCM)、视觉-文本深度对齐编码器和跨模态解码器组成(图2)。SAFA通过多分支结构分离并校准不同尺度的视觉特征;SGCM则利用BERT编码的类别文本,动态激活与计数目标相关的特征通道并抑制背景干扰。文本标记与视觉示例标记经过深度对齐后,由跨模态解码器输出目标框及计数结果。

cc1befd1-01ad-4cba-b416-f5315a547801.png

图2. VT-SCC整体架构及SAFA与SGCM核心模块

为了直接验证VT-SCC的统一多作物计数能力,作者在包含小麦穗、玉米雄穗、水稻稻穗和大豆豆荚的M2-Crop数据集上,将VT-SCC与多种通用计数模型进行了比较(表1)。与依赖视觉示例的CACViT和SAFECount相比,VT-SCC显著降低了计数误差;与视觉-语言计数模型VLCounter和CountGD相比,VT-SCC也表现出更高的准确性和稳定性。相较于面向跨物种植物计数的TasselNetV4,VT-SCC将MAE由3.36进一步降低至3.28,同时取得4.48的最低RMSE和10.37%的最低NRMSE。VT-SCC在三项指标上均达到最优结果,表明文本语义引导与尺度自适应特征聚合能够有效缓解不同作物器官在形态、尺度和田间背景方面的差异,使一个统一模型能够稳定完成多种粮食作物器官计数。

de925b5d-5739-4b91-a395-fa9059e4bb2c.png

为进一步评估统一模型的预测一致性,作者对模型预测数量与真实数量进行了回归分析(图3)。结果显示,各单作物专用模型的决定系数R²均高于0.95,VT-SCC统一模型在综合测试集上的R²达到0.9755,表明该模型在统一处理不同作物器官时,仍能保持较高的预测一致性和拟合精度。

1c8592a9-c050-4219-a070-2f8af23342b5.png

图3. VT-SCC统一模型与作物专用模型的预测值—真实值回归分析

跨作物可视化结果进一步表明,VT-SCC的特征响应主要集中于目标器官,在叶片遮挡、器官黏连、尺度变化及高密度场景下仍能保持稳定定位(图4)。在极端拥挤样本中,VT-SCC的预测值与真实数量保持接近,而多种通用计数模型出现了明显漏计。这些结果表明,视觉-文本语义引导能够有效抑制复杂背景干扰,提高模型在密集遮挡场景下的计数准确性和稳定性。

8f171efa-6635-442b-aa6e-a41366819706.png

图4. VT-SCC在不同作物及高密度遮挡场景中的计数结果与特征响应

该研究以文本语义作为“任务过滤器”,结合视觉示例和尺度自适应表征,缓解了传统通用计数模型在复杂田间环境中的视觉歧义问题,并将小麦、玉米、水稻和大豆的器官计数统一到同一模型中。VT-SCC及M2-Crop数据集为可扩展的高通量作物表型分析提供了新的技术路径,也为进一步拓展至更多作物种类、栽培环境及智能育种应用奠定了基础。相关代码和数据集已公开:https://vt-scc.samlab.cn

该研究得到国家重点研发计划(2024YFD2001100)、国家自然科学基金(62506089)、贵州省科技创新平台项目、贵州省科技计划项目、贵州省青年科技人才项目及贵阳贵安农业科研与技术服务发展分析研究项目等资助。王岚颖刘正波为共同第一作者,肖源源王崎为共同通讯作者。

引用本文:Wang L, Liu Z, Dong X, Wang H, Guo W, Xiao Y, et al. VT-SCC: Visual-text semantic alignment via multimodal guidance for unified staple crop organ counting. aBIOTECH 2026:100082.

https://doi.org/10.1016/j.abiote.2026.100082

aBIOTECH已于2026年1月正式转至Elsevier以金色OA模式出版,最新投稿地址:

https://www.sciencedirect.com/journal/abiotech

相关阅读:

aBIOTECH重磅 | 重塑基因编辑!AI设计的OpenCRISPR-1首次在植物中实现高效定向诱变与引导编辑

aBIOTECH | 姚斌院士团队构建知识图谱增强大模型MEPAM,实现微生物产酶与催化的精准解析

aBIOTECH | AI赋能TnpB进化:基于生成模型+能量优化,打造高活性“迷你基因剪刀”

aBIOTECH | 刘唯真/兰彩霞团队合作研发基于计算机视觉技术的小麦赤霉病小穗率智能测量方法

aBIOTECH | 杨万能团队基于深度学习开发了植物叶片与角果高通量表型自动分析系统APTES

aBIOTECH | 刘羽飞团队基于高光谱与深度学习技术实现水稻恶苗病早期高效监测

aBIOTECH | 中国农科院作科所牵头建立玉米农艺性状遗传互作网络图谱

aBIOTECH | 李广存团队开发用于bin标记与基因组分型的BacPhase新方法



https://blog.sciencenet.cn/blog-3458049-1548263.html

上一篇:aBIOTECH | 薛彦团队揭示辣椒TC48对黄瓜花叶病毒兼具部分抗性与耐受性的协同防御机制
下一篇:aBIOTECH | 华中农业大学多维基因组团队绘制杂交水稻单倍型分辨三维基因组图谱并揭示RNAPII介导的等位基因调控



    
收藏 IP: 175.169.177.*| 热度|

0

该博文允许注册用户评论 请点击登录 评论 (0 个评论)

数据加载中...

Archiver|手机版|科学网 ( 京ICP备07017567号-12 )

GMT+8, 2026-8-25 18:29

Powered by ScienceNet.cn

Copyright © 2007- 中国科学报社

返回顶部