基於殘差U-Net和文本提示SAM 3精細化的1米NAIP影像農田範圍與可見邊界映射
本研究提出了一種可重複的工作流程,利用1米NAIP RGB影像繪製農田範圍和可見邊界。使用殘差U-Net網絡和Dice主導損失函數,在測試集上實現了0.8808的準確率、0.8605的IoU和0.9234的Dice係數。通過融合文本提示的SAM 3分支,在困難場景(如果園林行、碎片化地塊)中Dice係數分別提升至0.955和0.903。該產品為語義農田範圍層,支持當前無可用田塊層的農業監測應用。
近日,一篇發表在arXiv上的研究提出了一種創新的可重複工作流,利用1米分辨率的NAIP RGB影像自動繪製農田範圍與可見邊界。該研究由Mohammadreza Narimani等人完成,旨在解決農業田塊地圖通常為專有、不完整或過時的問題,為作物監測、產量核算和土地用途轉換分析提供空間框架。
研究團隊從美國農業部NAIP計劃獲取了37景影像,涵蓋開闊農田、城鄉結合部、半乾旱灌溉區以及碎片化拼圖等多樣化場景。這些影像在CVAT工具中由人工標註,並轉換為二值掩膜。通過將影像分割為不重疊的256×256像素圖塊,共獲得5698個樣本。按原始場景劃分後,訓練集、驗證集和測試集分別包含3850、770和1078個圖塊。
模型採用殘差U-Net(ResUNet)架構,並訓練使用Dice主導的損失函數:L = 2.5(1 - Dice) + BCE。在測試集上,模型取得了0.8808的精度、0.8605的IoU、0.9234的Dice係數、0.8766的精確率和0.9794的召回率。此外,研究引入了一個凍結的SAM 3分支,通過文本提示“agricultural farmland field”進行引導,並與ResUNet輸出通過邏輯OR融合。在選定的困難圖塊中,該融合策略大幅提升了性能:如果園林行圖塊Dice從0.858提升至0.955,碎片化地塊圖塊Dice從0.804提升至0.903。
為了生成連續的區域掩膜,研究採用了滑動窗口拼接方法,在示例圖塊上獲得了0.898和0.919的Dice係數。研究強調,最終產品是語義農田範圍層,而非地籍意義上的田塊圖,但能在現有田塊層缺失的情況下,有效支持農業監測應用。研究還公開了代碼和數據集,為遙感與農業領域的進一步探索提供了基礎。