AI News HubLIVE
站内改写2 分钟阅读

谷歌全新Omni AI工具让你能视频克隆自己——我既好奇又担忧

谷歌宣布推出Gemini Omni,这是一款革命性的AI视频工具,能够从文本、图像、音频或视频输入生成高质量视频。特色功能包括创建数字分身、物理模型理解、自然语言编辑等。该工具旨在大幅提升视频创作效率,但也引发了关于信任和滥用风险的讨论。

来源ZDNet AI

今天,谷歌宣布推出Gemini Omni,这是一款将AI视频生成能力提升到全新水平的工具。该公司将这一发布与之前Nano Banana对图像生成领域的革新相提并论。Omni将从今天开始逐步推出,但作者在发布前并未获得试用机会。

谷歌将Omni描述为“Gemini的推理能力与创作能力的结合”。据该公司称,“通过Omni,你可以将图像、音频、视频和文本作为输入,生成基于Gemini现实世界知识的高质量视频。”虽然Omni从视频开始,但谷歌表示这款新模型可以“从任何输入创建任何内容”,因此预计未来还会支持其他媒体类型。

Omni将提供多个模型层级,从Gemini Omni Flash开始。该能力将集成到Gemini应用、Google Flow和YouTube Shorts中。目前尚不清楚网页版Gemini是否支持Omni,或者是否需要通过浏览器使用Flow界面。

克隆自己 作者对这一功能既感兴趣又担忧。谷歌表示,你可以通过Avatars创建自己的数字版本,从而生成看起来和听起来都像你的视频。作为定期制作YouTube视频的创作者,作者认为这很有吸引力——在状态不佳时,可以用数字替身代替自己出镜。但同时也担心这会减少自己的演讲练习机会。谷歌谨慎地表示,它正在这些视频中集成SynthID数字指纹技术,以便验证它们是用Omni生成的。

物理模型 Omni现在将物理规律融入其生成的视频中。谷歌表示它“对重力、动能和流体动力学等力的直观理解得到了改进”,并利用Gemini的知识“在远超模式匹配的层面上连接语言、图像和意义”。该公司称,Omni可以从简短提示构建详细视频,并生成能够解释复杂概念的解说视频。

输入多样性 Nano Banana的早期特色之一是对图像进行重新语境化。Omni将此能力扩展到视频,将图像、文本、视频或音频转化为“连贯的输出”。目前它只接受语音录音作为音频输入,但该公司表示“很快将推出其他类型的音频输入”。用户还可以创建场景、匹配风格、用自然语言描述需求,并保持角色一致性。

对话式编辑 Omni允许用户通过自然语言进行视频编辑。谷歌表示,“每条指令都建立在前一条指令之上。角色保持一致,物理规律成立,场景记住之前的内容。”用户还可以更改视频中的元素。作者指出,如果能够导入视频并移除障碍物或更改物体和背景,将带来巨大好处。目前尚不清楚每个计划下视频剪辑的长度限制和编辑能力范围。

其他两个关键功能是:更改特定内容或更改一切。视频成为你永远无法亲自拍摄的起点;或者你拍摄一段视频后,只需要求Omni更改发生的事件——编辑动作、添加新角色或物体、将瞬间转变为意想不到的事情。

尚未明确的细节 谷歌尚未指定视频格式或分辨率。作者猜测这究竟是面向专业工具(支持16:9、4K/8K视频),还是为YouTube Shorts一代设计的工具。当OpenAI推出Sora时,它更像一个新奇事物,未能真正融入专业工作流程。作者希望Omni能集成到Final Cut、Premiere Pro或DaVinci Resolve中,或者至少这些工具能使用Omni创建的编辑内容。Omni的功能将通过Google API逐步向企业客户和开发者开放。

作者还好奇Omni是否会在视频角落嵌入类似Nano Banana的钻石水印。这种水印可能会妨碍专业使用。我们是否会看到无水印的授权层级?或者第三方工具是否会移除水印?时间会告诉我们答案。