谷歌釋出Gemini Omni:從任何輸入生成影片的多模態模型
谷歌推出Gemini Omni系列,首個模型Gemini Omni Flash能夠從影像、音訊、影片和文本組合輸入生成高質量影片,支援透過自然語言對話編輯影片,並具備物理理解和世界知識。該模型已整合到Gemini應用、Google Flow和YouTube Shorts中。
谷歌近日推出了其最新的人工智慧模型系列Gemini Omni,旨在將推理能力與創造力相結合。該系列的首個模型名為Gemini Omni Flash,現已面向全球Google AI Plus、Pro和Ultra訂閱使用者開放,透過Gemini應用和Google Flow使用。此外,該模型本週起也免費在YouTube Shorts和YouTube Create應用中提供。
Gemini Omni Flash的核心能力是能夠接受影像、音訊、影片和文本中的任意組合作為輸入,並生成高質量的影片輸出。這一功能建立在Gemini原生多模態架構之上,使其能夠利用真實世界的知識來生成符合物理規律和邏輯的影片內容。使用者可以透過自然語言對話來編輯影片,每次指令都會基於前一次的結果進行改進,從而保持角色、物理特性和場景的連貫性。
谷歌展示了多種應用場景:例如,使用者可以將一個現實中的雕塑轉換為氣泡材質,或者讓房間的燈光隨音樂同步亮起。Omni還能夠處理更復雜的請求,比如將一個包含特定動作的影片轉換為不同視覺風格,同時保持環境不變,並精確同步到音訊節拍。此外,模型可以結合多個輸入參考——如影像、文本、影片甚至音訊(初期僅支援語音參考)——生成一個統一的輸出。
Gemini Omni Flash不僅在視覺上追求真實感,還融入了對物理學的直觀理解,如重力、動能和流體動力學,從而建立出更逼真的場景。它還能利用Gemini的知識將語言、影像和意義聯絡起來,實現超越簡單模式匹配的創意表達。例如,使用者可以透過簡單的提示生成關於蛋白質摺疊的黏土動畫解說影片,或者建立包含字母表每個字母獨特物體的快速閃示影片。
為了確保負責任的使用,谷歌在Omni生成的影片中嵌入了不可見的SynthID數字水印,使用者可以透過Gemini應用、Chrome中的Gemini或谷歌搜尋輕鬆驗證影片是否由Gemini Omni生成。此外,初期使用者可以透過“數字分身”(Avatars)功能使用自己的聲音生成影片,但對於更廣泛的音訊和語音編輯功能,谷歌表示將繼續測試以確保安全。
谷歌還計劃在未來幾周內透過API向開發者和企業客戶提供Omni模型。隨著Omni系列的逐步擴充套件,將支援影像和音訊等其他輸出模態。