AI News HubLIVE
站内改写1 分钟阅读

StrAD:面向长视频音频描述生成的流式方法与基准

研究者提出 StrAD,一个针对完整长视频的音频描述(AD)生成基准和流式方法。它无需真实时间戳,通过滑动窗口将 AD 插入现有字幕,并支持微调模型和零样本视觉语言模型。StrAD-FT 在多个基准上取得领先结果,且是首个全视频流式 AD 生成方法。

来源arXiv Computer Vision作者: Julian Spravil, Sebastian Houben, Sven Behnke

视觉内容是当今最主要的沟通媒介,但如果没有音频描述(AD),视障和低视力人群就无法充分获取这些内容。AD 会在自然的音频停顿处,用语言叙述与情境相关的视觉事件。然而,人工制作 AD 成本高昂,导致现有内容中只有极小一部分配备了描述。目前大多数自动 AD 生成方法都把任务视为视频片段描述(video clip captioning),不仅需要真实的时间戳,还依赖角色数据库等额外上下文线索。现有基准也强化了这种设定,通常只包含短视频片段,并配以自动生成或与任务不匹配的标注。

为了解决这些问题,研究者提出了 StrAD,一个面向完整长视频的 AD 生成基准,覆盖电影、纪录片、短片、表演和电子游戏等多种类型。StrAD 将 AD 生成重新定义为流式密集视频描述(streaming dense video captioning)。具体来说,系统使用滑动窗口处理整段视频,在无需真实时间戳的情况下,将 AD 插入到已有的对白/字幕文本中。该方法既支持经过微调的专用模型,也支持对视觉语言模型进行零样本提示。

在给定时间戳的片段级任务上,微调模型 StrAD-FT 在 CMD-AD 上取得了 36.3 CIDEr 的新高水平,比 Shot-by-shot 高出 10.0 分;在 StrAD 基准上建立了 51.0 CIDEr 的参考点;在 MAD-Eval 上也以 24.9 CIDEr 保持了竞争力。在完整视频的流式任务上,StrAD-FT 的 SODA 得分为 2.4,而零样本基线 StrAD-Zero 为 1.1。不过,两种方法在时间定位和叙事连贯性方面都表现出局限。

此前的研究虽然已经尝试以离线、多阶段方式处理全视频 AD 生成,但 StrAD 是第一个流式方法,能够在没有真实时间戳的情况下即时生成 AD。它让全视频 AD 生成的进展变得可测量,而这是扩大无障碍覆盖范围的前提。该论文于 2026 年 8 月提交至 arXiv,归属于计算机视觉与模式识别方向。