AI News HubLIVE
站內改寫2 分鐘閱讀

谷歌Gemini 3.5 Flash超越前沿模型

在谷歌I/O開發者大會上,谷歌發佈了兩個新AI模型:Gemini 3.5 Flash和Gemini Omni Flash。Gemini 3.5 Flash在多項基準測試中超越了前代Pro模型,甚至與GPT-5.5等旗艦模型競爭,且速度更快、成本更低。該模型在工具使用和代理任務方面表現突出。此外,Gemini Omni是一款多模態視頻生成模型,支持創建和編輯視頻,現階段僅限視頻內容,幷包含安全保護措施。

來源The New Stack AI作者: Frederic Lardinois

在近日舉行的谷歌I/O開發者大會上,谷歌發佈了兩個新的人工智能模型:Gemini 3.5 Flash和Gemini Omni Flash。其中,Gemini 3.5 Flash是Gemini 3.5系列的首個模型,雖然Pro版本仍在開發中並計劃下月推出,但3.5 Flash已經在大多數基準測試中超越了現有的3.1 Pro模型。例如,在TerminalBench 2.1測試中,3.1 Pro使用Gemini CLI解決編碼問題的得分為70.3%,而3.5 Flash則達到了76.2%。儘管這一成績仍不及OpenAI的GPT-5.5,但對於一個Flash模型來説已經非常出色。

在其他基準測試中,3.5 Flash同樣表現出色:在GDPval-AA中獲得1656 Elo分(3.1 Pro為1314),MCP Atlas得分83.6%(3.1 Pro為78.2%),CharXiv推理測試得分84.2%。更令人關注的是,它在很多測試中甚至能與OpenAI的GPT-5.5和Anthropic的Opus 4.7等旗艦模型一較高下,尤其是在工具使用基準測試中。谷歌CEO Sundar Pichai在發佈會上表示,Gemini 3.5 Flash是“一系列結合前沿智能與行動的模型中的首個”。他提到,Flash模型接近最佳前沿模型,同時速度極快——Artificial Analysis的數據顯示,其速度約為280 tokens/秒,而GPT-5.5和Opus 4.7僅為60-70 tokens/秒。

Pichai還強調:“Flash模型以不到一半的價格(在某些情況下僅為三分之一)提供了前沿級別的能力。”谷歌指出,3.5 Flash在運行長週期代理任務(包括代理編碼)方面尤為強大,因此它成為谷歌新推出的個人AI代理Gemini Spark的核心(目前僅向可信測試者開放)。鑑於Flash模型的能力,預計Pro版本將至少與OpenAI和Anthropic的同類模型相當,甚至在某些基準測試中超越它們。

Gemini 3.5 Flash現已通過Gemini API、Google AI Studio、Android Studio、Vertex AI、Google Enterprise以及Google Antigravity提供。消費者還可以在Gemini應用和Google搜索的AI模式中使用它。

與此同時,谷歌還推出了Gemini Omni模型,這是一款多模態模型,目前主要專注於視頻生成。與Veo類似,Omni能夠根據用户輸入創建和編輯視頻,例如更改場景中的特定元素、添加新角色或物體、改變環境和風格等。谷歌表示,Omni的世界模型能夠“直觀”理解重力、動能和流體動力學,從而生成逼真的場景。由於其多模態特性(未來將支持圖像、文本、音頻),Omni可以接受多種輸入組合來構建最終場景。

為防止濫用,谷歌承諾負責地開發AI。目前,用户只能使用自己的聲音和形象創建數字頭像,而編輯視頻中的音頻和語音功能仍在測試中。所有由Omni生成的視頻都將包含SynthID水印以確保可追溯性。