跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

VeriPhy:用於世界模型評估與改進的智慧體式物理推理系統

文章摘要

生成影片的畫面流暢並不等於物理可靠,單一評分也無法說明片段違反了哪項物理約束或在哪一時刻失敗。VeriPhy 是一個可審計的物理驗證系統:它先用文本規劃器把提示詞編譯為型別化物理約束和靜態驗證後的執行計劃,再透過分割追蹤、深度估計、OCR、音訊事件檢測等凍結專家模型收集帶來源的證據記錄,最終給出可追溯的 plausible/implausible/abstain 判定。在含 1500 個片段的人工標註語料上,VeriPhy 比問答分解式評估器識別出更多區域性化生成缺陷,且每條結論都保留證據鏈,可望作為批評訊號回寫至生成模型。

來源arXiv Computer Vision作者: Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Guti\'errez, Jiuxiang Gu
VeriPhy:用於世界模型評估與改進的智慧體式物理推理系統
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

如今影片生成模型可以生成看起來非常流暢的畫面,但“看起來合理”並不等於符合物理規律。一個整體的畫質分數也無法回答更關鍵的問題:一個片段到底違背了提示詞中的哪項物理要求,以及它是在何時、何處開始出錯的。為了把這類問題變成可驗證、可追溯的過程,來自 arXiv 的新研究提出 VeriPhy,一種面向世界模型評測與改進的智慧體式物理驗證系統。

VeriPhy 的執行思路與直接讓模型打分不同。在檢視任何影片幀之前,一個純文本規劃器會先把提示詞編譯為帶型別的物理義務,並生成一份經過靜態驗證的執行計劃。真正執行時,系統只會根據觀察結果來排程有限的底層專家工具,例如目標分割與跟蹤、計數、對軌跡進行的 11 類物理量測量、深度估計、OCR 以及音訊事件檢測。這些專家模型是凍結的,每次呼叫都會返回攜帶來源資訊的證據記錄;記錄中的有效負載要麼是型別化測量值,要麼是明確標記的學習狀態。接著,型別化解析器與固定的組合規則會把這些可用的記錄對映為三值狀態:supported、contradicted 或 unknown,並分別呈現為 plausible、implausible 或 abstain。由於每個判定都保留完整 provenance,使用者可以逐條回溯結論究竟來自哪些證據,而不是隻得到一個難以解釋的分數。

為了評估系統,作者構建了一個包含 1500 個影片片段的人工標註語料庫,其中的缺陷記錄精確標出了真實生成失敗在提示詞引用、空間和時間上的位置。在一個包含 149 個片段、304 條缺陷記錄的核心集合上,VeriPhy 成功解釋了 228 條缺陷;相比之下,一個已發表的基於問題分解的評估器在同樣的片段和宣告下只能解釋 164 條。值得注意的是,單純的召回率並不能把 VeriPhy 與一次性提示同一個骨幹模型的方法拉開差距——後者也能達到 222 條。真正的區別在於:VeriPhy 的每一個決定都保留證據記錄與 provenance,可以逐條審計,並且能夠作為介面,把評論者或批評者的判定寫回生成過程,用於進一步修正世界模型。

這項工作的意義不在於給出另一個“影片質量評分”,而在於建立一種可審計的中間層:它把物理常識檢驗拆成清晰、有型別的子任務,並用可驗證的證據鏈連線文本提示、影片內容和最終判定。正是這種可追溯性,讓生成模型不僅知道自己哪裡不好,還能借助外部驗證結果進行有針對性的修正,為更可靠的世界模型提供了一條實用路徑。

展開要點與分析

文章情報

工程師進階

要點

  • VeriPhy 在檢視影片幀之前,將提示詞編譯為帶型別的物理義務和經過靜態驗證的執行計劃。
  • 執行時只呼叫凍結的底層專家工具,例如分割與跟蹤、計數、軌跡上的 11 類物理測量、深度、OCR 和音訊事件檢測。
  • 每條證據都會產生帶來源的記錄,並被對映為 supported、contradicted 或 unknown,分別以 plausible、implausible 或 abstain 呈現。
  • 在 149 個片段、304 條缺陷記錄的核心集合上,VeriPhy 解釋 228 條,優於問題分解式基線的 164 條,同時保持逐條可審計的 provenance。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。