Gemini Omni演示显示AI视频在文字处理上取得进步
一位Reddit用户在Gemini应用中发现了一个名为Gemini Omni的新视频生成模型,其生成的粉笔板书视频在文字可读性和自然度上表现出色,但其他场景(如意大利面测试)仍有不足。该模型可能基于Veo,预计将在下周的Google I/O大会上正式发布。
Google尚未正式宣布Gemini Omni,但一位Reddit用户在Gemini应用中发现了一个新的视频生成模型。该用户打开Gemini应用后收到弹窗,提示使用“Gemini Omni”进行创作,描述称其为一种新的视频生成模型,能够混合视频、直接在聊天中编辑以及使用模板。用户生成的视频在过去几天内引发了广泛关注,尤其是其中一段粉笔板书视频。
在这段视频中,一位教授在黑板前用粉笔书写完整的数学证明,同时进行讲解,文字清晰可读,动作自然,物理效果也基本令人信服。AI视频一直以来在文字处理上表现不佳,而这段演示表明Omni在这方面取得了显著进步。除了文字,音频、动作和真实性也达到了新的高度,让许多人感到不安,尤其是与以往的AI视频演示相比。
关于Omni的官方信息很少。Max Weinbach通过元数据发现,Omni似乎是Veo的扩展,而非完全从头构建。Veo是Google一直在开发的视频生成模型,而Omni的输出质量比Veo有了明显提升。Google I/O大会将于下周举行,届时Omni很可能正式发布,并公布更多细节。
尽管粉笔板书结果令人印象深刻,但意大利面测试则展示了另一面。原始提示(Will Smith吃意大利面)被Omni的安全限制阻止,用户改写了提示:两位男士在海滨餐厅,白色桌布,走近桌子,一边交谈一边吃意大利面。视频中意大利面凭空出现在空盘子上,进餐动作与咬合不匹配。其他Reddit用户用ByteDance的Seedance 2运行相同提示,得到了更一致的结果。因此,Omni并非在所有方面都领先,文字处理是真正的突破,但在复杂物理交互上仍存在粗糙之处。
另一个被忽视的问题是使用成本。这两段视频(粉笔板书和意大利面)消耗了该用户Google AI Pro计划每日配额的86%。视频生成在配额上非常昂贵,这将成为正式发布后将面临的严峻问题。
Google此前在OpenAI关闭Sora后表示视频领域将长期发展。Omni似乎证明了这一承诺。粉笔板结果显示了文字渲染问题的真正进展,尽管模型并非在所有提示下都能保持一致。下周我们将看到完整的图景。在此之前,这段粉笔板视频值得多看两遍。