AI News HubLIVE
站內改寫2 分鐘閱讀

Gemini Omni演示顯示AI影片在文書處理上取得進步

一位Reddit使用者在Gemini應用中發現了一個名為Gemini Omni的新影片生成模型,其生成的粉筆板書影片在文字可讀性和自然度上表現出色,但其他場景(如義大利麵測試)仍有不足。該模型可能基於Veo,預計將在下週的Google I/O大會上正式釋出。

來源Hacker News AI作者: steveharing1

Google尚未正式宣佈Gemini Omni,但一位Reddit使用者在Gemini應用中發現了一個新的影片生成模型。該使用者開啟Gemini應用後收到彈窗,提示使用“Gemini Omni”進行創作,描述稱其為一種新的影片生成模型,能夠混合影片、直接在聊天中編輯以及使用模板。使用者生成的影片在過去幾天內引發了廣泛關注,尤其是其中一段粉筆板書影片。

在這段影片中,一位教授在黑板前用粉筆書寫完整的數學證明,同時進行講解,文字清晰可讀,動作自然,物理效果也基本令人信服。AI影片一直以來在文書處理上表現不佳,而這段演示表明Omni在這方面取得了顯著進步。除了文字,音訊、動作和真實性也達到了新的高度,讓許多人感到不安,尤其是與以往的AI影片演示相比。

關於Omni的官方資訊很少。Max Weinbach透過後設資料發現,Omni似乎是Veo的擴充套件,而非完全從頭構建。Veo是Google一直在開發的影片生成模型,而Omni的輸出質量比Veo有了明顯提升。Google I/O大會將於下週舉行,屆時Omni很可能正式釋出,並公佈更多細節。

儘管粉筆板書結果令人印象深刻,但義大利麵測試則展示了另一面。原始提示(Will Smith吃義大利麵)被Omni的安全限制阻止,使用者改寫了提示:兩位男士在海濱餐廳,白色桌布,走近桌子,一邊交談一邊吃義大利麵。影片中義大利麵憑空出現在空盤子上,進餐動作與咬合不匹配。其他Reddit使用者用ByteDance的Seedance 2執行相同提示,得到了更一致的結果。因此,Omni並非在所有方面都領先,文書處理是真正的突破,但在複雜物理互動上仍存在粗糙之處。

另一個被忽視的問題是使用成本。這兩段影片(粉筆板書和義大利麵)消耗了該使用者Google AI Pro計劃每日配額的86%。影片生成在配額上非常昂貴,這將成為正式釋出後將面臨的嚴峻問題。

Google此前在OpenAI關閉Sora後表示影片領域將長期發展。Omni似乎證明了這一承諾。粉筆板結果顯示了文字渲染問題的真正進展,儘管模型並非在所有提示下都能保持一致。下週我們將看到完整的圖景。在此之前,這段粉筆板影片值得多看兩遍。