AI News HubLIVE
站內改寫2 分鐘閱讀

Gemini Omni演示顯示AI視頻在文字處理上取得進步

一位Reddit用户在Gemini應用中發現了一個名為Gemini Omni的新視頻生成模型,其生成的粉筆板書視頻在文字可讀性和自然度上表現出色,但其他場景(如意大利麪測試)仍有不足。該模型可能基於Veo,預計將在下週的Google I/O大會上正式發佈。

來源Hacker News AI作者: steveharing1

Google尚未正式宣佈Gemini Omni,但一位Reddit用户在Gemini應用中發現了一個新的視頻生成模型。該用户打開Gemini應用後收到彈窗,提示使用“Gemini Omni”進行創作,描述稱其為一種新的視頻生成模型,能夠混合視頻、直接在聊天中編輯以及使用模板。用户生成的視頻在過去幾天內引發了廣泛關注,尤其是其中一段粉筆板書視頻。

在這段視頻中,一位教授在黑板前用粉筆書寫完整的數學證明,同時進行講解,文字清晰可讀,動作自然,物理效果也基本令人信服。AI視頻一直以來在文字處理上表現不佳,而這段演示表明Omni在這方面取得了顯著進步。除了文字,音頻、動作和真實性也達到了新的高度,讓許多人感到不安,尤其是與以往的AI視頻演示相比。

關於Omni的官方信息很少。Max Weinbach通過元數據發現,Omni似乎是Veo的擴展,而非完全從頭構建。Veo是Google一直在開發的視頻生成模型,而Omni的輸出質量比Veo有了明顯提升。Google I/O大會將於下週舉行,屆時Omni很可能正式發佈,並公佈更多細節。

儘管粉筆板書結果令人印象深刻,但意大利麪測試則展示了另一面。原始提示(Will Smith吃意大利麪)被Omni的安全限制阻止,用户改寫了提示:兩位男士在海濱餐廳,白色桌布,走近桌子,一邊交談一邊吃意大利麪。視頻中意大利麪憑空出現在空盤子上,進餐動作與咬合不匹配。其他Reddit用户用ByteDance的Seedance 2運行相同提示,得到了更一致的結果。因此,Omni並非在所有方面都領先,文字處理是真正的突破,但在複雜物理交互上仍存在粗糙之處。

另一個被忽視的問題是使用成本。這兩段視頻(粉筆板書和意大利麪)消耗了該用户Google AI Pro計劃每日配額的86%。視頻生成在配額上非常昂貴,這將成為正式發佈後將面臨的嚴峻問題。

Google此前在OpenAI關閉Sora後表示視頻領域將長期發展。Omni似乎證明了這一承諾。粉筆板結果顯示了文字渲染問題的真正進展,儘管模型並非在所有提示下都能保持一致。下週我們將看到完整的圖景。在此之前,這段粉筆板視頻值得多看兩遍。