LVSum:時間戳感知的長視頻摘要基準
LVSum是一個人工標註的基準,用於評估多模態大模型在長視頻摘要中的時間對齊能力。包含72個視頻,平均時長16分鐘,每個視頻有最多10個人工生成的含時間參考的摘要。研究發現,轉錄文本比視覺幀貢獻更大,模型與人工摘要差距顯著,且MLLMs在時間定位、指令遵循和跨模態一致性方面存在系統性弱點。
多模態大語言模型(MLLMs)在長視頻摘要任務中面臨重大挑戰,尤其是在保持長時間跨度的時間忠實度以及生成既在語義上又在時間上有根據的摘要方面。為此,Apple Machine Learning Research團隊推出了LVSum——一個用於評估長視頻摘要且具有細粒度時間對齊能力的人工標註基準。該基準包含72個來自13個領域(如體育、新聞、紀錄片等)的多樣化視頻,平均時長為16分鐘,每個視頻配有最多10個包含時間參考的人工摘要,總計超過700個人工摘要。這些摘要不僅描述了視頻內容,還精確標註了事件發生的時間戳,從而能夠評估模型對時間信息的利用能力。
團隊利用新提出的基於LLM的指標(涵蓋內容相關性和模態一致性)以及標準自動指標(如ROUGE、METEOR),對領先的專有和開源MLLMs(包括GPT-4V、Gemini、LLaVA等)進行了全面評估。實驗揭示三個關鍵發現:首先,轉錄文本對摘要質量的貢獻遠大於僅依賴視覺幀,這説明當前的MLLMs更擅長處理文本信息而非視覺時間序列;其次,模型生成的摘要與人工撰寫的摘要之間仍存在顯著的性能差距,最高端的模型也遠未達到人類水平;最後,當前MLLMs在時間定位、指令遵循以及跨模態一致性方面表現出系統性弱點,例如無法準確識別事件順序、忽略時間約束,以及視覺與語言信息整合不佳。
該研究強調了改進MLLMs時間理解能力的必要性,併為未來長視頻摘要研究提供了標準化評估工具。代碼和數據集已在GitHub上開源,可供研究人員使用。此外,論文還指出,當前許多模型依賴於幀級別的空間信息,而忽略了時間動態,這限制了它們在視頻理解任務中的表現。LVSum的發佈有望推動該領域的發展,促使研究者開發更具時間感知能力的多模態模型。