AI News HubLIVE
站內改寫3 分鐘閱讀

谷歌發佈三款新Gemini模型,但眾人期待的旗艦仍未現身

谷歌發佈了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及針對網絡安全的 3.5 Flash Cyber 模型,但備受期待的 3.5 Pro 旗艦模型仍未發佈。3.6 Flash 在多數基準測試中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任務,性價比突出。3.5 Flash Cyber 目前僅限政府及合作伙伴試用。

來源The New Stack AI作者: Frederic Lardinois

谷歌於週二發佈了三款新的 Gemini 模型:Gemini 3.6 Flash、一款更便宜更快的 3.5 Flash-Lite,以及針對網絡安全用例優化的 3.5 Flash Cyber,後者在整體性能上超越了 Anthropic 的 4.6 Opus 模型。

然而,這一陣容中明顯缺失了谷歌最新的旗艦模型 3.5 Pro,該模型已推遲發佈數週。谷歌在五月的 I/O 大會上首次宣佈 3.5 Pro,並承諾在六月推出。谷歌表示,Pro 模型“目前正在與合作伙伴進行測試”,並計劃“一旦準備就緒”就廣泛提供。谷歌還透露,已經開始對 Gemini 4 進行預訓練。

3.6 Flash

大多數人沒想到會在 Gemini 3.5 Pro 之前看到 Flash 模型的更新,但事實如此。好消息是,3.6 Flash 相比前代有顯著提升,而且成本更低。輸入價格保持每百萬 token 1.50 美元,但輸出價格從每百萬 token 9 美元降至 7.50 美元。谷歌特別指出,3.6 Flash 在代理工作流中需要更少的推理步驟和工具調用來實現目標,從而更具成本效益。據 Artificial Analysis 稱,它使用的 token 減少了 17%。

在大多數基準測試中,3.6 Flash 輕鬆超越前代,尤其是在編碼方面。在全新的 DeepSWE 軟件工程基準測試中,3.6 Flash 得分為 49%,而 3.5 Flash 為 37%。然而,這並非最佳成績:Anthropic 的 Claude Sonnet 5 達到 54%,頂級前沿模型則超過 70%。團隊還在 MLE Bench 機器學習研究基準測試(63.9% 對 49.7%)和 OSWorld-Verified 計算機使用測試(83% 對 78.4%)中看到了大幅提升。大多數現代模型在此範圍內得分相近,這對於像 3.6 Flash 這樣的中檔模型來説相當令人印象深刻。相比之下,Claude Fable 僅略高,為 85%。

在知識工作方面,3.6 Flash 在 GDPval-AA v2 上達到 1421,遠高於 3.5 Flash 的 1349,但遠低於其他前沿實驗室的中檔模型,如 Anthropic 的 Claude Sonnet 5(1600)和 OpenAI 的 GPT-5.6 Terra(1581)。需要注意的是,谷歌也在價格上競爭,但情況複雜。例如,3.6 Flash 並不總是優於 GPT 5.6 Luna,後者輸入/輸出價格為每百萬 token 1/6 美元(但僅在上下文窗口低於 272,000 個 token 時)。Anthropic 的 Sonnet 5 在八月底前以介紹性價格每百萬 token 2/10 美元提供。

可用性

3.6 Flash 和 3.5 Flash Lite 現已在 Gemini API 中通過 Google AI Studio 和 Android Studio 提供,而 3.6 Flash 也可在谷歌的 Antigravity 代理編碼工具以及面向企業用户的 Gemini Enterprise Agent Platform(原 Vertex AI)中使用。對於消費者,3.5 Flash-Lite 將進入 Google 搜索。

3.5 Flash-Lite

3.5 Flash-Lite 是谷歌最新的低端模型。鑑於最舊的‘Lite’版本 3.1 Flash Lite 已發佈近半年,3.5 Flash 全線提升並不意外。但它也稍貴:輸入/輸出價格為每百萬 token 0.3/2.5 美元(原為 0.25/1.5 美元)。在基準測試方面,它不會打破任何記錄,但也不是此模型的目的。它適用於高吞吐量任務,如代理搜索和文檔處理,而非推理和規劃代理工作負載。儘管如此,它比 3.1 Flash Lite 顯著更好:GDPval-AA v2 得分從 642 升至 1140,SWE-Bench Pro 從 49.6% 升至 54.2%,OSWorld-Verified 達到 74%。對於許多公司來説,它將在延遲敏感的工作負載中找到甜蜜點,正如 Ramp 的應用 AI 主管 Veeral Patel 所指出的:“Gemini 3.5 Flash-Lite 在我們的收據提取基準測試中達到了帕累託前沿,在準確性、延遲和成本之間提供了我們測試過的最佳權衡之一。”

3.5 Flash Cyber

通過 Gemini 3.5 Flash Cyber,谷歌更深入地利用 AI 進行網絡安全用例——且避免了類似 Fable 5 的風險。谷歌指出,如今“AI 模型發現安全漏洞的速度已快於當前系統修復它們的能力”。該公司基於常規 3.5 Flash 模型構建了 3.5 Flash Cyber,並收取相同費用,從而有理由聲稱它“提供了一種經濟高效且功能強大的替代方案,替代大型昂貴的網絡安全模型”。但你現在還無法獲得 Cyber 模型:它僅以有限訪問試點形式向政府和受信任合作伙伴提供,且僅在谷歌自己的 CodeMender 工具中。谷歌計劃隨着時間的推移擴大訪問。3.5 Flash Cyber 在發現和利用軟件漏洞方面可能還達不到 Anthropic Mythos 的水平,但這表明前沿實驗室對推出這些模型有多謹慎。谷歌表示:“這將給前線防禦者一個先發優勢,在漏洞被利用之前發現並修復關鍵漏洞,同時減輕更廣泛的濫用。”與此同時,許多中文開源模型如 Kimi K3 可能已達到與 3.5 Flash Cyber 相同的水平。谷歌稱其性能達到 Opus 4.6 的水平,並指出“由於護欄,較新的競爭對手模型表現不如 Claude Opus 4.6”。