如今視頻生成模型可以生成看起來非常流暢的畫面,但“看起來合理”並不等於符合物理規律。一個整體的畫質分數也無法回答更關鍵的問題:一個片段到底違背了提示詞中的哪項物理要求,以及它是在何時、何處開始出錯的。為了把這類問題變成可驗證、可追溯的過程,來自 arXiv 的新研究提出 VeriPhy,一種面向世界模型評測與改進的智能體式物理驗證系統。
VeriPhy 的運行思路與直接讓模型打分不同。在查看任何視頻幀之前,一個純文本規劃器會先把提示詞編譯為帶類型的物理義務,並生成一份經過靜態驗證的執行計劃。真正執行時,系統只會根據觀察結果來調度有限的底層專家工具,例如目標分割與跟蹤、計數、對軌跡進行的 11 類物理量測量、深度估計、OCR 以及音頻事件檢測。這些專家模型是凍結的,每次調用都會返回攜帶來源信息的證據記錄;記錄中的有效負載要麼是類型化測量值,要麼是明確標記的學習狀態。接着,類型化解析器與固定的組合規則會把這些可用的記錄映射為三值狀態:supported、contradicted 或 unknown,並分別呈現為 plausible、implausible 或 abstain。由於每個判定都保留完整 provenance,用户可以逐條回溯結論究竟來自哪些證據,而不是隻得到一個難以解釋的分數。
為了評估系統,作者構建了一個包含 1500 個視頻片段的人工標註語料庫,其中的缺陷記錄精確標出了真實生成失敗在提示詞引用、空間和時間上的位置。在一個包含 149 個片段、304 條缺陷記錄的核心集合上,VeriPhy 成功解釋了 228 條缺陷;相比之下,一個已發表的基於問題分解的評估器在同樣的片段和聲明下只能解釋 164 條。值得注意的是,單純的召回率並不能把 VeriPhy 與一次性提示同一個骨幹模型的方法拉開差距——後者也能達到 222 條。真正的區別在於:VeriPhy 的每一個決定都保留證據記錄與 provenance,可以逐條審計,並且能夠作為接口,把評論者或批評者的判定寫回生成過程,用於進一步修正世界模型。
這項工作的意義不在於給出另一個“視頻質量評分”,而在於建立一種可審計的中間層:它把物理常識檢驗拆成清晰、有類型的子任務,並用可驗證的證據鏈連接文本提示、視頻內容和最終判定。正是這種可追溯性,讓生成模型不僅知道自己哪裏不好,還能借助外部驗證結果進行有針對性的修正,為更可靠的世界模型提供了一條實用路徑。