Planktonzilla:用於理解浮游生態系統的多模態資料集與模型
研究人員釋出了Planktonzilla-17M,這是迄今最大最全面的浮游生物影像資料集,包含1740萬張影像,涵蓋13種成像系統、602個分類類別。他們發現,使用分類學譜系作為文本的監督分類器在效能上匹配或超越CLIP式訓練,而現有生物基礎模型(如BioCLIP)在浮游生物識別上表現不佳。
海洋浮游生物是水生食物網的基礎,並在全球二氧化碳封存中發揮關鍵作用。它們透過光合作用吸收大量大氣中的二氧化碳,並將其轉移至深海,對氣候調節意義重大。然而,準確識別浮游生物物種是理解海洋健康和氣候變化反饋的關鍵,但這一任務面臨諸多挑戰。
現有的分類模型在單一資料集上表現良好,但由於訓練資料孤立且標籤不一致,它們難以在跨儀器和跨環境進行泛化。不同的成像系統(如顯微鏡、水下相機等)產生的影像差異巨大,加上缺乏統一的標準,使得模型的實際應用受到限制。
為解決這一問題,研究團隊推出了Planktonzilla-17M,這是一個統一的資料集,整合了來自13種成像系統的公開浮游生物影像集合。資料集包含1740萬張影像,均附有標準化的分類學和地理環境後設資料。其中,374萬張浮游生物影像跨越602個分類類別,201個達到物種級別。這使得Planktonzilla-17M成為目前最大、最全面的浮游生物影像資料集,為研究者提供了寶貴的資源。
基於這一大規模資料集,研究團隊在共享的ViT骨幹網路上對監督學習和CLIP式影像-文本訓練進行了受控比較。實驗結果令人關注:當使用分類學譜系作為文本描述時,傳統的監督分類器在效能上匹配甚至超越了CLIP式訓練方法。這表明,在特定領域任務中,精細的標籤結構可能比大規模弱監督預訓練更為有效。
此外,研究者還評估了現有的生物基礎模型,如BioCLIP和BioCLIP2。他們發現,這些模型在零樣本和少樣本設定下對浮游生物影像的識別表現不佳,遠遠無法滿足實際應用需求。這揭示了當前生物基礎模型在海洋成像領域的侷限性,暗示了領域特異性預訓練的必要性。
Planktonzilla-17M的引入顯著提升了浮游生物分類效能,為海洋生態監測和氣候變化研究提供了更可靠的技術支援。該研究發表在arXiv預印本平臺上,涉及計算機視覺、人工智慧、機器學習等多個領域。研究者表示,他們將繼續擴充套件資料集,並探索更高效的模型架構,以推動海洋生態系統研究的自動化程序。