Gemini 3.6 Flash登場:效率優先的釋出
2026年7月21日,谷歌釋出了Gemini 3.6 Flash,這是一個注重效率的中期更新,而非突破性模型。它保留了與3.5 Flash相似的推理能力,但顯著降低了token消耗和成本。程式碼生成、機器學習任務和計算機使用效能得到提升,而知識截止日期更新至2026年3月。該模型定價為每百萬輸入token 1.50美元,輸出7.50美元,比前代更便宜。文章包含壓力測試,供讀者自行評估模型表現。
2026年7月21日,當眾人仍在等待多次延遲的Gemini 3.5 Pro時,谷歌悄然推出了其速度層級的中期更新:Gemini 3.6 Flash。這次釋出沒有前沿宣稱或戲劇性展示,而是旨在以更少的token、更少的工具呼叫和更低的成本完成與3.5 Flash大致相同的思考任務。
對於在大量生產環境中執行Flash的使用者而言,這一更新意義重大。本文詳細解析了變化點、與前代模型的對比結果,並提供了可複製的壓力測試,供讀者自行判斷。
實際變化
Gemini 3.6 Flash是2025年I/O大會上釋出的Gemini 3.5 Flash的漸進式繼承者。谷歌坦誠地將其定位為基於開發者與客戶反饋的效率最佳化版本:更高效的token使用。根據Artificial Analysis Index,輸出token減少約17%,在DeepSWE某些執行中減少高達65%。
生產程式碼能力提升:DeepSWE準確率從37%升至49%,MLE Bench從49.7%升至63.9%。計算機使用能力增強:OSWorld-Verified從78.4%升至83%。知識截止日期從2025年1月更新至2026年3月。上下文視窗仍為100萬token,支援文本、影像、語音和影片輸入及文本輸出。
值得注意的是,原始智慧方面並未大幅提升——Artificial Analysis Intelligence Index評分約為50,與3.5 Flash持平。
定價與Flash系列
谷歌同時推出了三款Flash模型:Gemini 3.6 Flash(主打平衡的編碼、知識與多模態工作流,定價每百萬輸入token 1.50美元,輸出7.50美元),Gemini 3.5 Flash-Lite(高吞吐量、低延遲,用於代理搜尋和文件處理,輸入0.30美元,輸出2.50美元),以及Gemini 3.5 Flash Cyber(漏洞查詢與修復,有限試點)。3.6 Flash的輸出價格從每百萬token 9美元降至7.50美元。
基準測試對比
與3.5 Flash相比,3.6 Flash在應用類任務(編碼、機器學習、計算機使用)上取得穩步提升,而綜合推理評分基本持平。這表明該模型專注於以更低成本執行已知任務,而非解鎖新能力。
壓力測試
文章提供了六項可複製的測試,涵蓋視覺紀律、測試用例檢查、畫布構建迭代、指令遵循和矛盾發現。測試結果顯示,模型在視覺分析方面表現出色,但在重複元素處理和誠實度方面存在不足。例如,在欺騙性提示下,模型可能依賴檢索而非自身知識誠實回應,但透過調整提示可糾正。
總體而言,Gemini 3.6 Flash是一次務實的效率更新,適合追求成本效益的生產環境,而非尋求前沿推理能力的使用者。