AI News HubLIVE
站內改寫2 分鐘閱讀

谷歌全新Omni AI工具讓你能視頻克隆自己——我既好奇又擔憂

谷歌宣佈推出Gemini Omni,這是一款革命性的AI視頻工具,能夠從文本、圖像、音頻或視頻輸入生成高質量視頻。特色功能包括創建數字分身、物理模型理解、自然語言編輯等。該工具旨在大幅提升視頻創作效率,但也引發了關於信任和濫用風險的討論。

來源ZDNet AI

今天,谷歌宣佈推出Gemini Omni,這是一款將AI視頻生成能力提升到全新水平的工具。該公司將這一發布與之前Nano Banana對圖像生成領域的革新相提並論。Omni將從今天開始逐步推出,但作者在發佈前並未獲得試用機會。

谷歌將Omni描述為“Gemini的推理能力與創作能力的結合”。據該公司稱,“通過Omni,你可以將圖像、音頻、視頻和文本作為輸入,生成基於Gemini現實世界知識的高質量視頻。”雖然Omni從視頻開始,但谷歌表示這款新模型可以“從任何輸入創建任何內容”,因此預計未來還會支持其他媒體類型。

Omni將提供多個模型層級,從Gemini Omni Flash開始。該能力將集成到Gemini應用、Google Flow和YouTube Shorts中。目前尚不清楚網頁版Gemini是否支持Omni,或者是否需要通過瀏覽器使用Flow界面。

克隆自己 作者對這一功能既感興趣又擔憂。谷歌表示,你可以通過Avatars創建自己的數字版本,從而生成看起來和聽起來都像你的視頻。作為定期製作YouTube視頻的創作者,作者認為這很有吸引力——在狀態不佳時,可以用數字替身代替自己出鏡。但同時也擔心這會減少自己的演講練習機會。谷歌謹慎地表示,它正在這些視頻中集成SynthID數字指紋技術,以便驗證它們是用Omni生成的。

物理模型 Omni現在將物理規律融入其生成的視頻中。谷歌表示它“對重力、動能和流體動力學等力的直觀理解得到了改進”,並利用Gemini的知識“在遠超模式匹配的層面上連接語言、圖像和意義”。該公司稱,Omni可以從簡短提示構建詳細視頻,並生成能夠解釋複雜概念的解説視頻。

輸入多樣性 Nano Banana的早期特色之一是對圖像進行重新語境化。Omni將此能力擴展到視頻,將圖像、文本、視頻或音頻轉化為“連貫的輸出”。目前它只接受語音錄音作為音頻輸入,但該公司表示“很快將推出其他類型的音頻輸入”。用户還可以創建場景、匹配風格、用自然語言描述需求,並保持角色一致性。

對話式編輯 Omni允許用户通過自然語言進行視頻編輯。谷歌表示,“每條指令都建立在前一條指令之上。角色保持一致,物理規律成立,場景記住之前的內容。”用户還可以更改視頻中的元素。作者指出,如果能夠導入視頻並移除障礙物或更改物體和背景,將帶來巨大好處。目前尚不清楚每個計劃下視頻剪輯的長度限制和編輯能力範圍。

其他兩個關鍵功能是:更改特定內容或更改一切。視頻成為你永遠無法親自拍攝的起點;或者你拍攝一段視頻後,只需要求Omni更改發生的事件——編輯動作、添加新角色或物體、將瞬間轉變為意想不到的事情。

尚未明確的細節 谷歌尚未指定視頻格式或分辨率。作者猜測這究竟是面向專業工具(支持16:9、4K/8K視頻),還是為YouTube Shorts一代設計的工具。當OpenAI推出Sora時,它更像一個新奇事物,未能真正融入專業工作流程。作者希望Omni能集成到Final Cut、Premiere Pro或DaVinci Resolve中,或者至少這些工具能使用Omni創建的編輯內容。Omni的功能將通過Google API逐步向企業客户和開發者開放。

作者還好奇Omni是否會在視頻角落嵌入類似Nano Banana的鑽石水印。這種水印可能會妨礙專業使用。我們是否會看到無水印的授權層級?或者第三方工具是否會移除水印?時間會告訴我們答案。