Scale-Gest:面向设备端手势检测的可扩展模型空间合成与运行时选择
Scale-Gest提出一种运行时自适应手势检测框架,通过扩展tiny-YOLO架构家族、引入设备校准的ACE(精度-复杂度-能量)配置文件以及轻量级运行时控制器,在电池供电设备上实现高效手势检测。相比单一检测器,每帧能耗降低4倍(从6.9mJ降至1.6mJ),同时保持事件级F1分数0.8-0.9和平均延迟6ms。该工作还引入了时间标注的驾驶员模拟手势数据集DSG-18。
在移动设备和边缘计算场景中,基于机器学习的手势检测面临着实时性、能效和内存等多重严峻挑战。特别是当设备电池电量波动时,传统的固定检测器部署方式难以根据实时的资源约束动态调整,导致性能与能耗之间的权衡无法最优。为解决这一问题,研究人员提出了一种名为Scale-Gest的新型运行时自适应手势检测框架。
Scale-Gest的核心创新在于将单一的检测器空间扩展为一个密集的tiny-YOLO架构家族。这一家族包含多种不同深度、分辨率和步长配置的模型变体。通过系统性地分析这些模型在不同操作点下的精度、复杂度和能量消耗,研究团队为每个设备生成了多个校准的ACE(精度-复杂度-能量)配置文件。这些配置文件为用户提供了在不同电池电量和性能需求下优化检测性能的灵活选择。
在运行时,一个轻量级的控制器会根据用户预先定义的约束条件(如最低精度要求)和当前电池电量,动态选择最合适的ACE模式。这一选择过程能够实时平衡精度、延迟和能耗。此外,Scale-Gest还引入了一个运动感知的手势追踪ROI门控模块,该模块可以识别并裁剪出包含手势的区域,从而进一步降低后续检测的计算复杂度。
为了评估系统的实际性能,研究人员在真实的驾驶模拟场景中进行了实验,并引入了时间标注的驾驶员模拟手势数据集DSG-18。该数据集包含了多种常见驾驶手势,并提供了精准的时间标注。实验结果表明,与使用单一检测器的传统方法相比,Scale-Gest在保持高事件级F1分数(0.8-0.9)的同时,显著降低了能耗和延迟。在一台电池供电的笔记本电脑上运行手势识别任务时,ACE控制器将每帧能耗从6.9mJ降低至1.6mJ,降幅达到4倍,同时平均检测延迟仅为6毫秒。
这一研究成果已被设计自动化会议(DAC 2026)接收。相关代码和数据集已经公开发布,为边缘设备上的高效手势检测提供了一种新颖且实用的解决方案。该框架不仅适用于驾驶员手势识别,还可推广至其他需要动态资源适配的边缘AI应用场景。