從野外單張人體圖像估計體重和身高
本文提出了一種利用深度神經網絡從單張日常人體圖像估計BMI、體重和身高的方法。研究人員創建了包含6105張多樣本圖像的新數據集,並探索了多模態輸入(RGB、深度圖、姿態親和圖、邊緣圖)的效果。實驗表明,全身圖像比半身或面部圖像估計更準確。
近日,來自Hira Yaseen等研究人員在arXiv上提交了一篇論文,題為《從野外單張人體圖像估計體重和身高》。該研究聚焦於利用深度神經網絡從日常拍攝的單張人體圖像中自動估計體重、身高和身體質量指數(BMI)。BMI是衡量身體健康的重要指標,與疾病風險和壽命預測相關。然而,在野外環境下,由於姿態、相機幾何、外觀和背景的複雜變化,自動估計極具挑戰性。
為了解決這一問題,研究團隊構建了一個全新的數據集,包含6105張來自社交網絡的野外圖像,並提供了真實的體重、身高和BMI標籤。該數據集覆蓋了不同種族、年齡組和性別,包含正面、背面、全身、半身、側身、鏡子自拍等多種姿勢,背景和尺度變化豐富,甚至可能存在遮擋部分或全部面部的偽影。這是首個公開的用於BMI估計的全身圖像數據集,將極大地推動該領域的研究進展。數據集中女性約佔40%,男性佔60%,年齡範圍18-65歲,種族包括白種人、亞洲人、非洲人等。圖像來源主要是社交媒體上的公共照片,經過匿名化處理,幷包含不同光照條件和拍攝角度。
在方法上,研究者採用了單任務和多任務學習的深度神經網絡,探索了多種輸入模態:RGB圖像、深度圖、姿態親和圖和邊緣圖。他們使用了VGG16、DenseNet121、ResNet50等不同的CNN骨架,對全身、半身和僅面部圖像進行了廣泛的實驗。實驗結果表明,全身圖像在BMI、體重和身高的預測上均顯著優於半身或僅面部圖像,驗證了全身信息對物理特徵估計的重要性。具體來説,使用全身圖像時,BMI估計的平均絕對誤差顯著降低,均方根誤差比半身圖像低約20%,比面部圖像低40%以上。多任務學習在大多數設定下優於單任務學習,且結合多種模態輸入能進一步提升性能。例如,RGB+深度圖+姿態親和圖的組合取得了最佳結果。
這項研究對健康監測具有潛在的應用價值。自動從日常圖像中估計BMI,可以為個人健康管理提供便捷工具,尤其適用於遠程醫療和自我量化應用。論文已公開數據集,以促進相關領域的進一步研究。該論文的作者包括Hira Yaseen、Arif Mahmood等,提交日期為2026年7月28日,屬於計算機視覺與模式識別、人工智能、機器學習等學科領域。研究者也指出了局限性,如數據集規模有限、圖像質量參差不齊,未來將擴展數據集並探索更復雜的模型。