AI News HubLIVE
站內改寫2 分鐘閱讀

Planktonzilla:用於理解浮游生態系統的多模態數據集與模型

研究人員發佈了Planktonzilla-17M,這是迄今最大最全面的浮游生物圖像數據集,包含1740萬張圖像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在性能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。

來源arXiv Computer Vision作者: Alan Gerson Contreras Montanares, Luis Valenzuela, Luis Mart\'i, Nayat Sanchez-Pi

海洋浮游生物是水生食物網的基礎,並在全球二氧化碳封存中發揮關鍵作用。它們通過光合作用吸收大量大氣中的二氧化碳,並將其轉移至深海,對氣候調節意義重大。然而,準確識別浮游生物物種是理解海洋健康和氣候變化反饋的關鍵,但這一任務面臨諸多挑戰。

現有的分類模型在單一數據集上表現良好,但由於訓練數據孤立且標籤不一致,它們難以在跨儀器和跨環境進行泛化。不同的成像系統(如顯微鏡、水下相機等)產生的圖像差異巨大,加上缺乏統一的標準,使得模型的實際應用受到限制。

為解決這一問題,研究團隊推出了Planktonzilla-17M,這是一個統一的數據集,整合了來自13種成像系統的公開浮游生物圖像集合。數據集包含1740萬張圖像,均附有標準化的分類學和地理環境元數據。其中,374萬張浮游生物圖像跨越602個分類類別,201個達到物種級別。這使得Planktonzilla-17M成為目前最大、最全面的浮游生物圖像數據集,為研究者提供了寶貴的資源。

基於這一大規模數據集,研究團隊在共享的ViT骨幹網絡上對監督學習和CLIP式圖像-文本訓練進行了受控比較。實驗結果令人關注:當使用分類學譜系作為文本描述時,傳統的監督分類器在性能上匹配甚至超越了CLIP式訓練方法。這表明,在特定領域任務中,精細的標籤結構可能比大規模弱監督預訓練更為有效。

此外,研究者還評估了現有的生物基礎模型,如BioCLIP和BioCLIP2。他們發現,這些模型在零樣本和少樣本設置下對浮游生物圖像的識別表現不佳,遠遠無法滿足實際應用需求。這揭示了當前生物基礎模型在海洋成像領域的侷限性,暗示了領域特異性預訓練的必要性。

Planktonzilla-17M的引入顯著提升了浮游生物分類性能,為海洋生態監測和氣候變化研究提供了更可靠的技術支持。該研究發表在arXiv預印本平台上,涉及計算機視覺、人工智能、機器學習等多個領域。研究者表示,他們將繼續擴展數據集,並探索更高效的模型架構,以推動海洋生態系統研究的自動化進程。