谷歌發佈Gemini Omni:從任何輸入生成視頻的多模態模型
谷歌推出Gemini Omni系列,首個模型Gemini Omni Flash能夠從圖像、音頻、視頻和文本組合輸入生成高質量視頻,支持通過自然語言對話編輯視頻,並具備物理理解和世界知識。該模型已集成到Gemini應用、Google Flow和YouTube Shorts中。
谷歌近日推出了其最新的人工智能模型系列Gemini Omni,旨在將推理能力與創造力相結合。該系列的首個模型名為Gemini Omni Flash,現已面向全球Google AI Plus、Pro和Ultra訂閲用户開放,通過Gemini應用和Google Flow使用。此外,該模型本週起也免費在YouTube Shorts和YouTube Create應用中提供。
Gemini Omni Flash的核心能力是能夠接受圖像、音頻、視頻和文本中的任意組合作為輸入,並生成高質量的視頻輸出。這一功能建立在Gemini原生多模態架構之上,使其能夠利用真實世界的知識來生成符合物理規律和邏輯的視頻內容。用户可以通過自然語言對話來編輯視頻,每次指令都會基於前一次的結果進行改進,從而保持角色、物理特性和場景的連貫性。
谷歌展示了多種應用場景:例如,用户可以將一個現實中的雕塑轉換為氣泡材質,或者讓房間的燈光隨音樂同步亮起。Omni還能夠處理更復雜的請求,比如將一個包含特定動作的視頻轉換為不同視覺風格,同時保持環境不變,並精確同步到音頻節拍。此外,模型可以結合多個輸入參考——如圖像、文本、視頻甚至音頻(初期僅支持語音參考)——生成一個統一的輸出。
Gemini Omni Flash不僅在視覺上追求真實感,還融入了對物理學的直觀理解,如重力、動能和流體動力學,從而創建出更逼真的場景。它還能利用Gemini的知識將語言、圖像和意義聯繫起來,實現超越簡單模式匹配的創意表達。例如,用户可以通過簡單的提示生成關於蛋白質摺疊的黏土動畫解説視頻,或者創建包含字母表每個字母獨特物體的快速閃示視頻。
為了確保負責任的使用,谷歌在Omni生成的視頻中嵌入了不可見的SynthID數字水印,用户可以通過Gemini應用、Chrome中的Gemini或谷歌搜索輕鬆驗證視頻是否由Gemini Omni生成。此外,初期用户可以通過“數字分身”(Avatars)功能使用自己的聲音生成視頻,但對於更廣泛的音頻和語音編輯功能,谷歌表示將繼續測試以確保安全。
谷歌還計劃在未來幾周內通過API向開發者和企業客户提供Omni模型。隨着Omni系列的逐步擴展,將支持圖像和音頻等其他輸出模態。