StreamPro:从被动感知到主动决策的流式视频理解
流式视频理解要求模型在部分观测下主动决定响应时机,而非仅仅响应内容。现有基准多采用“先看后答”模式,无法评估模型在信息不完整时的及时可靠决策能力。本文提出StreamPro-Bench基准,从感知理解、时间推理和主动决策三个维度评估模型,并推出StreamPro两阶段训练框架,通过CB-Stream损失和分组相对策略优化显著提升主动性能。在StreamPro-Bench上达到41.5,远超此前最佳10.4,同时在实时流式基准上保持78.9的高分。
传统流式视频理解模型大多遵循“先看后答”的被动范式,即在观察到明确证据后才触发响应,这实际上将主动推理降级为延迟感知。然而,现实应用(如自动驾驶、实时监控)要求模型能在信息不完整的情况下做出及时且可靠的决策。为此,Ao Li等研究者提出了StreamPro-Bench基准和StreamPro训练框架,旨在推动流式视频模型从被动感知迈向主动决策。
StreamPro-Bench从三个互补维度评估模型:感知理解(Perception Understanding)衡量目标识别能力,时间推理(Temporal Reasoning)评估时序关系理解,而主动决策(Proactive Agency)则测试模型在部分观测下提前但可靠决策的能力。这一设计填补了现有基准在主动决策评估上的空白。
训练主动模型面临两大挑战:流式轨迹中静默与响应信号的极端不平衡,以及正确性与时机的联合优化。StreamPro采用两阶段方案:首先,CB-Stream损失通过类别平衡策略缓解监督不平衡;其次,应用分组相对策略优化(GRPO),结合回合级和轨迹级多粒度奖励,同时优化响应正确性与时机。
在StreamPro-Bench上,StreamPro达到41.5分,远超此前最优方法的10.4分;在实时流式基准StreamingBench-RTVU上,也取得78.9分,证明其在主动性与实时性上的双重优势。该研究为流式视频理解提供了新的评估标准与训练范式,有望推动相关应用的发展。
此外,研究者还探讨了StreamPro在不同视频场景下的泛化能力,包括复杂背景、多目标跟踪和长时序列处理等。实验结果显示,StreamPro不仅在新基准上表现优异,还在传统实时流式任务中保持了高水平的性能,表明其方法的通用性和有效性。这项工作的代码和模型已计划开源,以促进学术界和工业界的进一步研究与应用。