AI News HubLIVE
站内改写2 分钟阅读

谷歌发布Gemini Omni:从任何输入生成视频的多模态模型

谷歌推出Gemini Omni系列,首个模型Gemini Omni Flash能够从图像、音频、视频和文本组合输入生成高质量视频,支持通过自然语言对话编辑视频,并具备物理理解和世界知识。该模型已集成到Gemini应用、Google Flow和YouTube Shorts中。

来源Hacker News AI作者: Lucasoato

谷歌近日推出了其最新的人工智能模型系列Gemini Omni,旨在将推理能力与创造力相结合。该系列的首个模型名为Gemini Omni Flash,现已面向全球Google AI Plus、Pro和Ultra订阅用户开放,通过Gemini应用和Google Flow使用。此外,该模型本周起也免费在YouTube Shorts和YouTube Create应用中提供。

Gemini Omni Flash的核心能力是能够接受图像、音频、视频和文本中的任意组合作为输入,并生成高质量的视频输出。这一功能建立在Gemini原生多模态架构之上,使其能够利用真实世界的知识来生成符合物理规律和逻辑的视频内容。用户可以通过自然语言对话来编辑视频,每次指令都会基于前一次的结果进行改进,从而保持角色、物理特性和场景的连贯性。

谷歌展示了多种应用场景:例如,用户可以将一个现实中的雕塑转换为气泡材质,或者让房间的灯光随音乐同步亮起。Omni还能够处理更复杂的请求,比如将一个包含特定动作的视频转换为不同视觉风格,同时保持环境不变,并精确同步到音频节拍。此外,模型可以结合多个输入参考——如图像、文本、视频甚至音频(初期仅支持语音参考)——生成一个统一的输出。

Gemini Omni Flash不仅在视觉上追求真实感,还融入了对物理学的直观理解,如重力、动能和流体动力学,从而创建出更逼真的场景。它还能利用Gemini的知识将语言、图像和意义联系起来,实现超越简单模式匹配的创意表达。例如,用户可以通过简单的提示生成关于蛋白质折叠的黏土动画解说视频,或者创建包含字母表每个字母独特物体的快速闪示视频。

为了确保负责任的使用,谷歌在Omni生成的视频中嵌入了不可见的SynthID数字水印,用户可以通过Gemini应用、Chrome中的Gemini或谷歌搜索轻松验证视频是否由Gemini Omni生成。此外,初期用户可以通过“数字分身”(Avatars)功能使用自己的声音生成视频,但对于更广泛的音频和语音编辑功能,谷歌表示将继续测试以确保安全。

谷歌还计划在未来几周内通过API向开发者和企业客户提供Omni模型。随着Omni系列的逐步扩展,将支持图像和音频等其他输出模态。