AI News HubLIVE
站內改寫2 分鐘閱讀

基於程式化合成資料的文本條件分割用於番茄表型分析

本研究提出了一種從模擬到現實的番茄植株分割框架,透過合成資料生成與基礎模型微調相結合,顯著提升了溫室作物器官的分割效能和模型置信度。

來源arXiv Computer Vision作者: Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

自動化溫室作物生產中的視覺表型分析對於減少人力勞動至關重要,但高質量標註資料的缺乏一直阻礙該領域的發展。儘管近年來視覺基礎模型在零樣本泛化到新領域方面取得了顯著成果,但在複雜的農業環境中,其效能往往會下降。針對這一問題,研究團隊提出了一種基於程式化合成資料生成與基礎模型微調相結合的“模擬到現實”框架,專門用於番茄植株的文本條件分割。

在該框架中,研究人員首先對商業櫻桃番茄溫室進行了精確建模,並在此基礎上生成了大規模的合成資料集。這一資料集涵蓋了不同的視角、光照條件以及植物形態變化,從而模擬了真實溫室中可能出現的各種複雜情況。資料集的生成過程利用了程式化建模工具,確保能夠靈活調整植物生長階段、器官形狀以及環境引數,從而生成高度多樣化的訓練樣本。與傳統的基於手動標註的資料收集方法相比,這種方法大大降低了成本和時間投入。

隨後,團隊基於該合成資料集對最新發布的Segment Anything Model 3(SAM 3)進行了微調。微調的目標是讓模型在保留支援零樣本遷移的通用視覺先驗知識的同時,專門針對溫室作物器官的文本條件分割任務進行最佳化。具體而言,他們採用了文本提示機制,使得模型能夠根據自然語言描述(如“番茄果實”或“莖”)來分割對應的器官。這種設計不僅提高了分割的靈活性,也為後續的人機互動應用打下了基礎。

透過在多個真實溫室資料集上進行評估,研究團隊證明,將合成資料與SAM 3微調相結合,能夠顯著提升分割效能,同時增強模型輸出的置信度。具體來說,模型在識別和分割番茄的莖、葉、果實等不同器官時表現出更高的準確性和魯棒性。值得一提的是,該方法的有效性不僅體現在與基線模型的對比上,而且在面對不同品種、不同生長階段的番茄植株時,也展現出了良好的泛化能力。實驗結果顯示,微調後的模型在多個指標上均取得了大幅提升,例如平均交併比(mIoU)和畫素準確率。

為了推動社群內的基準測試和進一步研究,研究團隊公開了其程式化溫室模型、生成的合成資料集以及微調後的SAM 3權重。這些資源的開放將有助於其他研究者復現實驗結果,並在此基礎上開發更先進的農業視覺自動化系統。該工作的相關論文已被提交至arXiv平臺,並提供了詳細的實現細節和實驗結果分析。此外,團隊還計劃將該框架擴充套件到其他作物種類,並探索在更復雜的戶外環境中的應用。