基于程序化合成数据的文本条件分割用于番茄表型分析
本研究提出了一种从模拟到现实的番茄植株分割框架,通过合成数据生成与基础模型微调相结合,显著提升了温室作物器官的分割性能和模型置信度。
自动化温室作物生产中的视觉表型分析对于减少人力劳动至关重要,但高质量标注数据的缺乏一直阻碍该领域的发展。尽管近年来视觉基础模型在零样本泛化到新领域方面取得了显著成果,但在复杂的农业环境中,其性能往往会下降。针对这一问题,研究团队提出了一种基于程序化合成数据生成与基础模型微调相结合的“模拟到现实”框架,专门用于番茄植株的文本条件分割。
在该框架中,研究人员首先对商业樱桃番茄温室进行了精确建模,并在此基础上生成了大规模的合成数据集。这一数据集涵盖了不同的视角、光照条件以及植物形态变化,从而模拟了真实温室中可能出现的各种复杂情况。数据集的生成过程利用了程序化建模工具,确保能够灵活调整植物生长阶段、器官形状以及环境参数,从而生成高度多样化的训练样本。与传统的基于手动标注的数据收集方法相比,这种方法大大降低了成本和时间投入。
随后,团队基于该合成数据集对最新发布的Segment Anything Model 3(SAM 3)进行了微调。微调的目标是让模型在保留支持零样本迁移的通用视觉先验知识的同时,专门针对温室作物器官的文本条件分割任务进行优化。具体而言,他们采用了文本提示机制,使得模型能够根据自然语言描述(如“番茄果实”或“茎”)来分割对应的器官。这种设计不仅提高了分割的灵活性,也为后续的人机交互应用打下了基础。
通过在多个真实温室数据集上进行评估,研究团队证明,将合成数据与SAM 3微调相结合,能够显著提升分割性能,同时增强模型输出的置信度。具体来说,模型在识别和分割番茄的茎、叶、果实等不同器官时表现出更高的准确性和鲁棒性。值得一提的是,该方法的有效性不仅体现在与基线模型的对比上,而且在面对不同品种、不同生长阶段的番茄植株时,也展现出了良好的泛化能力。实验结果显示,微调后的模型在多个指标上均取得了大幅提升,例如平均交并比(mIoU)和像素准确率。
为了推动社区内的基准测试和进一步研究,研究团队公开了其程序化温室模型、生成的合成数据集以及微调后的SAM 3权重。这些资源的开放将有助于其他研究者复现实验结果,并在此基础上开发更先进的农业视觉自动化系统。该工作的相关论文已被提交至arXiv平台,并提供了详细的实现细节和实验结果分析。此外,团队还计划将该框架扩展到其他作物种类,并探索在更复杂的户外环境中的应用。