StrAD:面向長視頻音頻描述生成的流式方法與基準
研究者提出 StrAD,一個針對完整長視頻的音頻描述(AD)生成基準和流式方法。它無需真實時間戳,通過滑動窗口將 AD 插入現有字幕,並支持微調模型和零樣本視覺語言模型。StrAD-FT 在多個基準上取得領先結果,且是首個全視頻流式 AD 生成方法。
視覺內容是當今最主要的溝通媒介,但如果沒有音頻描述(AD),視障和低視力人羣就無法充分獲取這些內容。AD 會在自然的音頻停頓處,用語言敍述與情境相關的視覺事件。然而,人工製作 AD 成本高昂,導致現有內容中只有極小一部分配備了描述。目前大多數自動 AD 生成方法都把任務視為視頻片段描述(video clip captioning),不僅需要真實的時間戳,還依賴角色數據庫等額外上下文線索。現有基準也強化了這種設定,通常只包含短視頻片段,並配以自動生成或與任務不匹配的標註。
為了解決這些問題,研究者提出了 StrAD,一個面向完整長視頻的 AD 生成基準,覆蓋電影、紀錄片、短片、表演和電子遊戲等多種類型。StrAD 將 AD 生成重新定義為流式密集視頻描述(streaming dense video captioning)。具體來説,系統使用滑動窗口處理整段視頻,在無需真實時間戳的情況下,將 AD 插入到已有的對白/字幕文本中。該方法既支持經過微調的專用模型,也支持對視覺語言模型進行零樣本提示。
在給定時間戳的片段級任務上,微調模型 StrAD-FT 在 CMD-AD 上取得了 36.3 CIDEr 的新高水平,比 Shot-by-shot 高出 10.0 分;在 StrAD 基準上建立了 51.0 CIDEr 的參考點;在 MAD-Eval 上也以 24.9 CIDEr 保持了競爭力。在完整視頻的流式任務上,StrAD-FT 的 SODA 得分為 2.4,而零樣本基線 StrAD-Zero 為 1.1。不過,兩種方法在時間定位和敍事連貫性方面都表現出侷限。
此前的研究雖然已經嘗試以離線、多階段方式處理全視頻 AD 生成,但 StrAD 是第一個流式方法,能夠在沒有真實時間戳的情況下即時生成 AD。它讓全視頻 AD 生成的進展變得可測量,而這是擴大無障礙覆蓋範圍的前提。該論文於 2026 年 8 月提交至 arXiv,歸屬於計算機視覺與模式識別方向。