谷歌全新Omni AI工具讓你能影片克隆自己——我既好奇又擔憂
谷歌宣佈推出Gemini Omni,這是一款革命性的AI影片工具,能夠從文本、影像、音訊或影片輸入生成高質量影片。特色功能包括建立數字分身、物理模型理解、自然語言編輯等。該工具旨在大幅提升影片創作效率,但也引發了關於信任和濫用風險的討論。
今天,谷歌宣佈推出Gemini Omni,這是一款將AI影片生成能力提升到全新水平的工具。該公司將這一發布與之前Nano Banana對影像生成領域的革新相提並論。Omni將從今天開始逐步推出,但作者在釋出前並未獲得試用機會。
谷歌將Omni描述為“Gemini的推理能力與創作能力的結合”。據該公司稱,“透過Omni,你可以將影像、音訊、影片和文本作為輸入,生成基於Gemini現實世界知識的高質量影片。”雖然Omni從影片開始,但谷歌表示這款新模型可以“從任何輸入建立任何內容”,因此預計未來還會支援其他媒體型別。
Omni將提供多個模型層級,從Gemini Omni Flash開始。該能力將整合到Gemini應用、Google Flow和YouTube Shorts中。目前尚不清楚網頁版Gemini是否支援Omni,或者是否需要透過瀏覽器使用Flow介面。
克隆自己 作者對這一功能既感興趣又擔憂。谷歌表示,你可以透過Avatars建立自己的數字版本,從而生成看起來和聽起來都像你的影片。作為定期製作YouTube影片的創作者,作者認為這很有吸引力——在狀態不佳時,可以用數字替身代替自己出鏡。但同時也擔心這會減少自己的演講練習機會。谷歌謹慎地表示,它正在這些影片中整合SynthID數字指紋技術,以便驗證它們是用Omni生成的。
物理模型 Omni現在將物理規律融入其生成的影片中。谷歌表示它“對重力、動能和流體動力學等力的直觀理解得到了改進”,並利用Gemini的知識“在遠超模式匹配的層面上連線語言、影像和意義”。該公司稱,Omni可以從簡短提示構建詳細影片,並生成能夠解釋複雜概念的解說影片。
輸入多樣性 Nano Banana的早期特色之一是對影像進行重新語境化。Omni將此能力擴充套件到影片,將影像、文本、影片或音訊轉化為“連貫的輸出”。目前它只接受語音錄音作為音訊輸入,但該公司表示“很快將推出其他型別的音訊輸入”。使用者還可以建立場景、匹配風格、用自然語言描述需求,並保持角色一致性。
對話式編輯 Omni允許使用者透過自然語言進行影片編輯。谷歌表示,“每條指令都建立在前一條指令之上。角色保持一致,物理規律成立,場景記住之前的內容。”使用者還可以更改影片中的元素。作者指出,如果能夠匯入影片並移除障礙物或更改物體和背景,將帶來巨大好處。目前尚不清楚每個計劃下影片剪輯的長度限制和編輯能力範圍。
其他兩個關鍵功能是:更改特定內容或更改一切。影片成為你永遠無法親自拍攝的起點;或者你拍攝一段影片後,只需要求Omni更改發生的事件——編輯動作、新增新角色或物體、將瞬間轉變為意想不到的事情。
尚未明確的細節 谷歌尚未指定影片格式或解析度。作者猜測這究竟是面向專業工具(支援16:9、4K/8K影片),還是為YouTube Shorts一代設計的工具。當OpenAI推出Sora時,它更像一個新奇事物,未能真正融入專業工作流程。作者希望Omni能整合到Final Cut、Premiere Pro或DaVinci Resolve中,或者至少這些工具能使用Omni建立的編輯內容。Omni的功能將透過Google API逐步向企業客戶和開發者開放。
作者還好奇Omni是否會在影片角落嵌入類似Nano Banana的鑽石水印。這種水印可能會妨礙專業使用。我們是否會看到無水印的授權層級?或者第三方工具是否會移除水印?時間會告訴我們答案。