谷歌Gemini 3.5 Flash超越前沿模型
在谷歌I/O开发者大会上,谷歌发布了两个新AI模型:Gemini 3.5 Flash和Gemini Omni Flash。Gemini 3.5 Flash在多项基准测试中超越了前代Pro模型,甚至与GPT-5.5等旗舰模型竞争,且速度更快、成本更低。该模型在工具使用和代理任务方面表现突出。此外,Gemini Omni是一款多模态视频生成模型,支持创建和编辑视频,现阶段仅限视频内容,并包含安全保护措施。
在近日举行的谷歌I/O开发者大会上,谷歌发布了两个新的人工智能模型:Gemini 3.5 Flash和Gemini Omni Flash。其中,Gemini 3.5 Flash是Gemini 3.5系列的首个模型,虽然Pro版本仍在开发中并计划下月推出,但3.5 Flash已经在大多数基准测试中超越了现有的3.1 Pro模型。例如,在TerminalBench 2.1测试中,3.1 Pro使用Gemini CLI解决编码问题的得分为70.3%,而3.5 Flash则达到了76.2%。尽管这一成绩仍不及OpenAI的GPT-5.5,但对于一个Flash模型来说已经非常出色。
在其他基准测试中,3.5 Flash同样表现出色:在GDPval-AA中获得1656 Elo分(3.1 Pro为1314),MCP Atlas得分83.6%(3.1 Pro为78.2%),CharXiv推理测试得分84.2%。更令人关注的是,它在很多测试中甚至能与OpenAI的GPT-5.5和Anthropic的Opus 4.7等旗舰模型一较高下,尤其是在工具使用基准测试中。谷歌CEO Sundar Pichai在发布会上表示,Gemini 3.5 Flash是“一系列结合前沿智能与行动的模型中的首个”。他提到,Flash模型接近最佳前沿模型,同时速度极快——Artificial Analysis的数据显示,其速度约为280 tokens/秒,而GPT-5.5和Opus 4.7仅为60-70 tokens/秒。
Pichai还强调:“Flash模型以不到一半的价格(在某些情况下仅为三分之一)提供了前沿级别的能力。”谷歌指出,3.5 Flash在运行长周期代理任务(包括代理编码)方面尤为强大,因此它成为谷歌新推出的个人AI代理Gemini Spark的核心(目前仅向可信测试者开放)。鉴于Flash模型的能力,预计Pro版本将至少与OpenAI和Anthropic的同类模型相当,甚至在某些基准测试中超越它们。
Gemini 3.5 Flash现已通过Gemini API、Google AI Studio、Android Studio、Vertex AI、Google Enterprise以及Google Antigravity提供。消费者还可以在Gemini应用和Google搜索的AI模式中使用它。
与此同时,谷歌还推出了Gemini Omni模型,这是一款多模态模型,目前主要专注于视频生成。与Veo类似,Omni能够根据用户输入创建和编辑视频,例如更改场景中的特定元素、添加新角色或物体、改变环境和风格等。谷歌表示,Omni的世界模型能够“直观”理解重力、动能和流体动力学,从而生成逼真的场景。由于其多模态特性(未来将支持图像、文本、音频),Omni可以接受多种输入组合来构建最终场景。
为防止滥用,谷歌承诺负责地开发AI。目前,用户只能使用自己的声音和形象创建数字头像,而编辑视频中的音频和语音功能仍在测试中。所有由Omni生成的视频都将包含SynthID水印以确保可追溯性。