AI News HubLIVE
站内改写1 分钟阅读

StepX-Edge:端侧UI视觉语言模型的架构-训练-部署协同设计

StepX-Edge是一款仅有0.9B参数的端侧UI视觉语言模型,通过架构、训练和部署的三层协同设计,在OCR、屏幕理解、视觉问答和元素定位等任务上实现了高精度与高效率的平衡。其创新包括UI感知分层视觉编码(ULVE)、渐进维度投影连接器(PDP)、五阶段课程学习框架以及模块化两阶段量化方案。在多个基准测试中,StepX-Edge超越了同尺寸模型,甚至媲美2B参数级别的模型。量化后可在骁龙8 Gen5设备上稳定运行,首令牌延迟约0.84秒,解码速度98 tok/s,峰值内存1.4GB。代码和模型将开源。

来源arXiv Computer Vision作者: Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang

长期以来,在端侧设备上部署具有全面UI理解能力的视觉语言模型一直面临着精度与效率的两难困境。一方面,OCR、屏幕理解、视觉问答和元素定位等任务对精度要求极高;另一方面,移动芯片的计算、内存和功耗预算极为严格。现有工作要么牺牲一方换取另一方,要么止步于仿真而未在实际设备上验证。

StepX-Edge的出现打破了这一僵局。该模型仅有0.9B参数,通过架构、训练和部署的三层协同设计,在极小的参数预算下实现了全面UI理解。在架构上,模型引入了UI感知分层视觉编码(ULVE)和渐进维度投影连接器(PDP),专门应对屏幕的极端宽高比和细粒度感知需求。ULVE通过分层处理保留高分辨率细节,PDP则逐步降低视觉特征维度以减少计算开销。同时,全程采用标准全注意力机制,确保与主流移动NPU算子的原生兼容性,避免了自定义算子的部署障碍。

训练方面,研究团队基于对UI子任务间相互促进效应的观察,设计了五阶段StepX-Curriculum框架。该框架使得OCR、屏幕理解、视觉问答和元素定位四种能力在参数紧张的情况下协同增长,而非相互干扰。每个阶段逐步增加任务难度,并从之前阶段的知识中受益。部署方面,模型采用了模块级差异化的两阶段量化方案:先进行PTQ(训练后量化)初始化,再对关键层进行QAT(量化感知训练)微调,将量化后的精度损失控制在1%以内。最终模型以W4A16+KV8的量化配置运行。

StepX-Edge在多个基准测试中展现了卓越性能。在ScreenQA上达到88.76 F1,在中文OCRBench v2上达到57.25,均超越所有2B-2.3B基线模型。在RefCOCO(92.0%)和OCRBench v1(831)上,以更少的参数匹配了1.3B-2.3B通用视觉语言模型的水平。量化后,模型可在骁龙8 Gen5设备上稳定运行,首令牌延迟约0.84秒,解码速度98 tok/s,峰值内存仅1.4GB。研究团队表示,他们将开源训练数据、完整的训练流程以及量化部署管线,以推动端侧UI理解技术的发展。