谷歌Gemini 3.5 Flash超越前沿模型
在谷歌I/O開發者大會上,谷歌釋出了兩個新AI模型:Gemini 3.5 Flash和Gemini Omni Flash。Gemini 3.5 Flash在多項基準測試中超越了前代Pro模型,甚至與GPT-5.5等旗艦模型競爭,且速度更快、成本更低。該模型在工具使用和代理任務方面表現突出。此外,Gemini Omni是一款多模態影片生成模型,支援建立和編輯影片,現階段僅限影片內容,幷包含安全保護措施。
在近日舉行的谷歌I/O開發者大會上,谷歌釋出了兩個新的人工智慧模型:Gemini 3.5 Flash和Gemini Omni Flash。其中,Gemini 3.5 Flash是Gemini 3.5系列的首個模型,雖然Pro版本仍在開發中並計劃下月推出,但3.5 Flash已經在大多數基準測試中超越了現有的3.1 Pro模型。例如,在TerminalBench 2.1測試中,3.1 Pro使用Gemini CLI解決編碼問題的得分為70.3%,而3.5 Flash則達到了76.2%。儘管這一成績仍不及OpenAI的GPT-5.5,但對於一個Flash模型來說已經非常出色。
在其他基準測試中,3.5 Flash同樣表現出色:在GDPval-AA中獲得1656 Elo分(3.1 Pro為1314),MCP Atlas得分83.6%(3.1 Pro為78.2%),CharXiv推理測試得分84.2%。更令人關注的是,它在很多測試中甚至能與OpenAI的GPT-5.5和Anthropic的Opus 4.7等旗艦模型一較高下,尤其是在工具使用基準測試中。谷歌CEO Sundar Pichai在釋出會上表示,Gemini 3.5 Flash是“一系列結合前沿智慧與行動的模型中的首個”。他提到,Flash模型接近最佳前沿模型,同時速度極快——Artificial Analysis的資料顯示,其速度約為280 tokens/秒,而GPT-5.5和Opus 4.7僅為60-70 tokens/秒。
Pichai還強調:“Flash模型以不到一半的價格(在某些情況下僅為三分之一)提供了前沿級別的能力。”谷歌指出,3.5 Flash在執行長週期代理任務(包括代理編碼)方面尤為強大,因此它成為谷歌新推出的個人AI代理Gemini Spark的核心(目前僅向可信測試者開放)。鑑於Flash模型的能力,預計Pro版本將至少與OpenAI和Anthropic的同類模型相當,甚至在某些基準測試中超越它們。
Gemini 3.5 Flash現已透過Gemini API、Google AI Studio、Android Studio、Vertex AI、Google Enterprise以及Google Antigravity提供。消費者還可以在Gemini應用和Google搜尋的AI模式中使用它。
與此同時,谷歌還推出了Gemini Omni模型,這是一款多模態模型,目前主要專注於影片生成。與Veo類似,Omni能夠根據使用者輸入建立和編輯影片,例如更改場景中的特定元素、新增新角色或物體、改變環境和風格等。谷歌表示,Omni的世界模型能夠“直觀”理解重力、動能和流體動力學,從而生成逼真的場景。由於其多模態特性(未來將支援影像、文本、音訊),Omni可以接受多種輸入組合來構建最終場景。
為防止濫用,谷歌承諾負責地開發AI。目前,使用者只能使用自己的聲音和形象建立數字頭像,而編輯影片中的音訊和語音功能仍在測試中。所有由Omni生成的影片都將包含SynthID水印以確保可追溯性。