AI News HubLIVE
站内改写1 分钟阅读

COPRA:基于强化学习的条件参数自适应视频异常检测

COPRA是一种新型的视频异常检测框架,通过为每个视频片段生成特定的参数更新,动态调整冻结的视觉-语言模型,解决了训练与推理之间的数据分布和模型配置不匹配问题。在标准基准测试中,COPRA在域内和跨域场景下均优于静态基线方法,并泛化到视频问答和密集描述等未见任务。

来源arXiv Computer Vision作者: Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

近年来,视觉-语言模型(VLM)在视频异常检测(VAD)中展现出强大的性能,同时能够提供可解释的预测。然而,现有基于VLM的VAD方法存在一个根本性问题:训练和推理阶段在数据分布和模型配置上存在不匹配。大多数方法依赖静态的后训练适应策略,这限制了模型在遇到未见环境或异常类型等分布偏移时的泛化能力。此外,这些方法在训练时使用长视频中的稀疏帧,但在推理时却对密集采样的短片段进行预测,导致训练和测试之间的不一致。为了解决这些问题,来自研究团队(作者包括Darryl Cherian Jacob等人)提出了COPRA,一个用于基于VLM的VAD的条件参数自适应框架。该框架的核心思想是:不再使用固定的提示或共享的参数更新,而是为每个视频片段生成输入特定的参数更新,从而在训练和推理过程中动态地调整一个冻结的VLM。这种方法允许模型根据当前输入的具体情况自适应地调整其行为,从而更好地应对分布偏移。实验表明,在标准的VAD基准测试中,COPRA在域内和跨域场景下都持续优于静态基线方法。更重要的是,COPRA的泛化能力不仅限于VAD,还能扩展到多个未见任务,例如多项选择视频问答和密集字幕生成。这些结果突显了COPRA作为一种有效的权重空间生成框架,可以实现可扩展、自适应且上下文感知的视频理解。该论文于2026年5月14日提交至arXiv,目前正在审稿中。代码将在GitHub上公开(仓库地址:THE-MALT-LAB/COPRA)。研究团队表示,COPRA有望成为视频理解领域的基础性方法,为未来更广泛的适应性模型奠定基础。