AI News HubLIVE
站內改寫1 分鐘閱讀

LVSum:時間戳感知的長影片摘要基準

LVSum是一個人工標註的基準,用於評估多模態大模型在長影片摘要中的時間對齊能力。包含72個影片,平均時長16分鐘,每個影片有最多10個人工生成的含時間參考的摘要。研究發現,轉錄文本比視覺幀貢獻更大,模型與人工摘要差距顯著,且MLLMs在時間定位、指令遵循和跨模態一致性方面存在系統性弱點。

多模態大語言模型(MLLMs)在長影片摘要任務中面臨重大挑戰,尤其是在保持長時間跨度的時間忠實度以及生成既在語義上又在時間上有根據的摘要方面。為此,Apple Machine Learning Research團隊推出了LVSum——一個用於評估長影片摘要且具有細粒度時間對齊能力的人工標註基準。該基準包含72個來自13個領域(如體育、新聞、紀錄片等)的多樣化影片,平均時長為16分鐘,每個影片配有最多10個包含時間參考的人工摘要,總計超過700個人工摘要。這些摘要不僅描述了影片內容,還精確標註了事件發生的時間戳,從而能夠評估模型對時間資訊的利用能力。

團隊利用新提出的基於LLM的指標(涵蓋內容相關性和模態一致性)以及標準自動指標(如ROUGE、METEOR),對領先的專有和開源MLLMs(包括GPT-4V、Gemini、LLaVA等)進行了全面評估。實驗揭示三個關鍵發現:首先,轉錄文本對摘要質量的貢獻遠大於僅依賴視覺幀,這說明當前的MLLMs更擅長處理文本資訊而非視覺時間序列;其次,模型生成的摘要與人工撰寫的摘要之間仍存在顯著的效能差距,最高階的模型也遠未達到人類水平;最後,當前MLLMs在時間定位、指令遵循以及跨模態一致性方面表現出系統性弱點,例如無法準確識別事件順序、忽略時間約束,以及視覺與語言資訊整合不佳。

該研究強調了改進MLLMs時間理解能力的必要性,併為未來長影片摘要研究提供了標準化評估工具。程式碼和資料集已在GitHub上開源,可供研究人員使用。此外,論文還指出,當前許多模型依賴於幀級別的空間資訊,而忽略了時間動態,這限制了它們在影片理解任務中的表現。LVSum的釋出有望推動該領域的發展,促使研究者開發更具時間感知能力的多模態模型。