基於程序化合成數據的文本條件分割用於番茄表型分析
本研究提出了一種從模擬到現實的番茄植株分割框架,通過合成數據生成與基礎模型微調相結合,顯著提升了温室作物器官的分割性能和模型置信度。
自動化温室作物生產中的視覺表型分析對於減少人力勞動至關重要,但高質量標註數據的缺乏一直阻礙該領域的發展。儘管近年來視覺基礎模型在零樣本泛化到新領域方面取得了顯著成果,但在複雜的農業環境中,其性能往往會下降。針對這一問題,研究團隊提出了一種基於程序化合成數據生成與基礎模型微調相結合的“模擬到現實”框架,專門用於番茄植株的文本條件分割。
在該框架中,研究人員首先對商業櫻桃番茄温室進行了精確建模,並在此基礎上生成了大規模的合成數據集。這一數據集涵蓋了不同的視角、光照條件以及植物形態變化,從而模擬了真實温室中可能出現的各種複雜情況。數據集的生成過程利用了程序化建模工具,確保能夠靈活調整植物生長階段、器官形狀以及環境參數,從而生成高度多樣化的訓練樣本。與傳統的基於手動標註的數據收集方法相比,這種方法大大降低了成本和時間投入。
隨後,團隊基於該合成數據集對最新發布的Segment Anything Model 3(SAM 3)進行了微調。微調的目標是讓模型在保留支持零樣本遷移的通用視覺先驗知識的同時,專門針對温室作物器官的文本條件分割任務進行優化。具體而言,他們採用了文本提示機制,使得模型能夠根據自然語言描述(如“番茄果實”或“莖”)來分割對應的器官。這種設計不僅提高了分割的靈活性,也為後續的人機交互應用打下了基礎。
通過在多個真實温室數據集上進行評估,研究團隊證明,將合成數據與SAM 3微調相結合,能夠顯著提升分割性能,同時增強模型輸出的置信度。具體來説,模型在識別和分割番茄的莖、葉、果實等不同器官時表現出更高的準確性和魯棒性。值得一提的是,該方法的有效性不僅體現在與基線模型的對比上,而且在面對不同品種、不同生長階段的番茄植株時,也展現出了良好的泛化能力。實驗結果顯示,微調後的模型在多個指標上均取得了大幅提升,例如平均交併比(mIoU)和像素準確率。
為了推動社區內的基準測試和進一步研究,研究團隊公開了其程序化温室模型、生成的合成數據集以及微調後的SAM 3權重。這些資源的開放將有助於其他研究者復現實驗結果,並在此基礎上開發更先進的農業視覺自動化系統。該工作的相關論文已被提交至arXiv平台,並提供了詳細的實現細節和實驗結果分析。此外,團隊還計劃將該框架擴展到其他作物種類,並探索在更復雜的户外環境中的應用。