AI News HubLIVE
站内改写2 分钟阅读

从野外单张人体图像估计体重和身高

本文提出了一种利用深度神经网络从单张日常人体图像估计BMI、体重和身高的方法。研究人员创建了包含6105张多样本图像的新数据集,并探索了多模态输入(RGB、深度图、姿态亲和图、边缘图)的效果。实验表明,全身图像比半身或面部图像估计更准确。

来源arXiv Computer Vision作者: Hira Yaseen, Arif Mahmood, Waqas Sultani

近日,来自Hira Yaseen等研究人员在arXiv上提交了一篇论文,题为《从野外单张人体图像估计体重和身高》。该研究聚焦于利用深度神经网络从日常拍摄的单张人体图像中自动估计体重、身高和身体质量指数(BMI)。BMI是衡量身体健康的重要指标,与疾病风险和寿命预测相关。然而,在野外环境下,由于姿态、相机几何、外观和背景的复杂变化,自动估计极具挑战性。

为了解决这一问题,研究团队构建了一个全新的数据集,包含6105张来自社交网络的野外图像,并提供了真实的体重、身高和BMI标签。该数据集覆盖了不同种族、年龄组和性别,包含正面、背面、全身、半身、侧身、镜子自拍等多种姿势,背景和尺度变化丰富,甚至可能存在遮挡部分或全部面部的伪影。这是首个公开的用于BMI估计的全身图像数据集,将极大地推动该领域的研究进展。数据集中女性约占40%,男性占60%,年龄范围18-65岁,种族包括白种人、亚洲人、非洲人等。图像来源主要是社交媒体上的公共照片,经过匿名化处理,并包含不同光照条件和拍摄角度。

在方法上,研究者采用了单任务和多任务学习的深度神经网络,探索了多种输入模态:RGB图像、深度图、姿态亲和图和边缘图。他们使用了VGG16、DenseNet121、ResNet50等不同的CNN骨架,对全身、半身和仅面部图像进行了广泛的实验。实验结果表明,全身图像在BMI、体重和身高的预测上均显著优于半身或仅面部图像,验证了全身信息对物理特征估计的重要性。具体来说,使用全身图像时,BMI估计的平均绝对误差显著降低,均方根误差比半身图像低约20%,比面部图像低40%以上。多任务学习在大多数设定下优于单任务学习,且结合多种模态输入能进一步提升性能。例如,RGB+深度图+姿态亲和图的组合取得了最佳结果。

这项研究对健康监测具有潜在的应用价值。自动从日常图像中估计BMI,可以为个人健康管理提供便捷工具,尤其适用于远程医疗和自我量化应用。论文已公开数据集,以促进相关领域的进一步研究。该论文的作者包括Hira Yaseen、Arif Mahmood等,提交日期为2026年7月28日,属于计算机视觉与模式识别、人工智能、机器学习等学科领域。研究者也指出了局限性,如数据集规模有限、图像质量参差不齐,未来将扩展数据集并探索更复杂的模型。