從野外單張人體影像估計體重和身高
本文提出了一種利用深度神經網路從單張日常人體影像估計BMI、體重和身高的方法。研究人員建立了包含6105張多樣本影像的新資料集,並探索了多模態輸入(RGB、深度圖、姿態親和圖、邊緣圖)的效果。實驗表明,全身影像比半身或面部影像估計更準確。
近日,來自Hira Yaseen等研究人員在arXiv上提交了一篇論文,題為《從野外單張人體影像估計體重和身高》。該研究聚焦於利用深度神經網路從日常拍攝的單張人體影像中自動估計體重、身高和身體質量指數(BMI)。BMI是衡量身體健康的重要指標,與疾病風險和壽命預測相關。然而,在野外環境下,由於姿態、相機幾何、外觀和背景的複雜變化,自動估計極具挑戰性。
為了解決這一問題,研究團隊構建了一個全新的資料集,包含6105張來自社交網路的野外影像,並提供了真實的體重、身高和BMI標籤。該資料集覆蓋了不同種族、年齡組和性別,包含正面、背面、全身、半身、側身、鏡子自拍等多種姿勢,背景和尺度變化豐富,甚至可能存在遮擋部分或全部面部的偽影。這是首個公開的用於BMI估計的全身影像資料集,將極大地推動該領域的研究進展。資料集中女性約佔40%,男性佔60%,年齡範圍18-65歲,種族包括白種人、亞洲人、非洲人等。影像來源主要是社交媒體上的公共照片,經過匿名化處理,幷包含不同光照條件和拍攝角度。
在方法上,研究者採用了單任務和多工學習的深度神經網路,探索了多種輸入模態:RGB影像、深度圖、姿態親和圖和邊緣圖。他們使用了VGG16、DenseNet121、ResNet50等不同的CNN骨架,對全身、半身和僅面部影像進行了廣泛的實驗。實驗結果表明,全身影像在BMI、體重和身高的預測上均顯著優於半身或僅面部影像,驗證了全身資訊對物理特徵估計的重要性。具體來說,使用全身影像時,BMI估計的平均絕對誤差顯著降低,均方根誤差比半身影像低約20%,比面部影像低40%以上。多工學習在大多數設定下優於單任務學習,且結合多種模態輸入能進一步提升效能。例如,RGB+深度圖+姿態親和圖的組合取得了最佳結果。
這項研究對健康監測具有潛在的應用價值。自動從日常影像中估計BMI,可以為個人健康管理提供便捷工具,尤其適用於遠端醫療和自我量化應用。論文已公開資料集,以促進相關領域的進一步研究。該論文的作者包括Hira Yaseen、Arif Mahmood等,提交日期為2026年7月28日,屬於計算機視覺與模式識別、人工智慧、機器學習等學科領域。研究者也指出了局限性,如資料集規模有限、影像質量參差不齊,未來將擴充套件資料集並探索更復雜的模型。