AI News HubLIVE
站內改寫3 分鐘閱讀

谷歌釋出Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber:更便宜、更高效的Flash層,專為代理工作負載設計

谷歌於2026年7月21日釋出了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash輸出token減少17%,價格降至每百萬輸出7.50美元;Flash-Lite速度達350 token/秒;Flash Cyber專為漏洞查詢設計,在CodeMender中表現出色。旗艦模型3.5 Pro仍推遲釋出。

來源MarkTechPost作者: Asif Razzaq

開發者需要更高的token效率、更低的延遲和更可靠的效能來構建生產級代理。今天,谷歌釋出了三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。這三款模型均屬於Flash層級,谷歌對其進行了速度和成本最佳化,適用於高容量的代理工作,而非追求極致的推理深度。

Gemini 3.6 Flash:更高品質,更少token,更低價格

Gemini 3.6 Flash是新的預設工作馬。它基於3.5 Flash構建,專注於編碼、知識工作和多模態任務。其核心優勢在於效率。根據Artificial Analysis Index,3.6 Flash比3.5 Flash少用17%的輸出token。在Datacurve的DeepSWE基準測試中,谷歌報告稱減少高達65%。該模型在每步多步驟工作流中所需的推理步驟和工具呼叫也更少。

定價隨效率提升而降低。Gemini 3.6 Flash定價為每百萬輸入token 1.50美元,每百萬輸出token 7.50美元。輸出價格從此前的3.5 Flash的9.00美元下降。更低的冗長度和更低的輸出價格降低了每個代理任務的總成本。

質量提升伴隨效率提升。在DeepSWE上,3.6 Flash得分為49%,而3.5 Flash為37%。在MLE Bench上,達到63.9%對49.7%。在OSWorld-Verified上,達到83.0%對78.4%。在GDPval-AA v2(知識工作基準)上,得分為1421對1349。計算機使用現在透過Gemini API和Gemini Enterprise成為內建的客戶端工具。早期客戶包括Hebbia和Harvey,他們在文件解析、圖表和資料分析以及報告起草方面受益。

谷歌為3.6 Flash配備了增強的前沿安全防護措施,涵蓋化學、生物、放射性和核(CBRN)以及網路攻擊濫用。詳細資訊見3.6 Flash模型卡。

互動式說明工具允許您將每個模型與其前身進行比較,並根據您的使用量估算token成本。

Gemini 3.5 Flash-Lite:3.5系列中最快的模型

Gemini 3.5 Flash-Lite專為低延遲和高吞吐量任務而設計。目標用例包括代理搜尋和文件處理。根據Artificial Analysis的測量,它每秒可輸出350個token。定價為每百萬輸入token 0.30美元,每百萬輸出token 2.50美元。

該模型大幅超越了之前的3.1 Flash-Lite。在Terminal-Bench 2.1上,得分為54%對31%。在GDM-MRCR v2(長上下文基準)上,達到72.2%對60.1%。在GDPval-AA v2上,得分為1140對642。值得注意的是,Flash-Lite在某些評估中甚至超越了舊的3 Flash。在SWE-Bench Pro上以54.2%對49.6%領先,在OSWorld-Verified上以74.0%對65.1%領先。

Flash-Lite提供可配置的思考級別:最小、低和高。開發者可以優先考慮低成本、低延遲的高容量任務執行。他們也可以針對多步驟子代理工作負載使用更高的思考級別。計算機使用同樣是內建工具。

Gemini 3.5 Flash Cyber in CodeMender:廉價代理找出並修補漏洞

Gemini 3.5 Flash Cyber是最專門的版本。它基於3.5 Flash構建,經過微調以發現、驗證和修補軟體漏洞。其設計前提是搜尋空間問題。找到深層漏洞意味著探索巨大的執行搜尋空間。單次呼叫單個大規模模型成為瓶頸。

解決方案是多次呼叫廉價模型。在谷歌的程式碼安全代理CodeMender內部,多個3.5 Flash Cyber代理並行執行。CodeMender最多呼叫模型五次,然後將子代理的結果合併成一份報告。在CyberGym基準測試中,這種設定達到了與更大模型相競爭的效能。

內部評估結果引人注目。在谷歌的Big Sleep評估中,Flash Cyber顯著超越了主線3.5 Flash和3.6 Flash。在V8 JavaScript引擎上,它在固定呼叫次數下發現了55個獨特確認問題,而主線3.5 Flash為47個,Claude Opus 4.6為36個。它發現了另外兩個模型遺漏的10個問題。在一次實際測試中,谷歌的雲漏洞研究團隊利用它在兩小時內發現了公共API中的遠端程式碼執行漏洞。

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/

社群反應

反應可預測地分裂。開發者歡迎價格和效率的提升。推遲釋出的旗艦模型引發了最強烈的批評。在Hacker News上,一些人認為谷歌過度宣傳其無法可靠提供的容量,並引用了令人沮喪的實際編碼會話。受限制的Flash Cyber釋出引發了關於誰應該擁有自動漏洞發現工具的雙重用途辯論。

以下儀表板按平臺彙總了討論內容。這是定性的編輯綜合,並非抓取的資料集,並附有方法說明。

可用性

Gemini 3.6 Flash和3.5 Flash-Lite即日起可用。開發者可以透過Google AI Studio和Android Studio中的Gemini API訪問。Gemini 3.6 Flash也在Google Antigravity中,並正在GitHub Copilot中推出。企業使用者在Gemini Enterprise Agent平臺中獲得這兩款模型,3.6 Flash在Gemini Enterprise應用中。所有使用者都可以透過Gemini應用使用它們,3.5 Flash-Lite正在Google搜尋中推出。從開發者指南開始。

要點總結

Gemini 3.6 Flash輸出token減少17%(DeepSWE上最高65%),輸出價格從9.00美元降至7.50美元每百萬token。

Gemini 3.5 Flash-Lite以每秒350 token執行,價格為輸入0.30美元/輸出2.50美元每百萬token,在SWE-Bench Pro和OSWorld-Verified上擊敗了舊版3 Flash。

Gemini 3.5 Flash Cyber透過廉價多代理掃描驅動CodeMender;在V8引擎中發現55個獨特問題,而3.5 Flash和Opus 4.6分別為47和36個。

由於雙重用途風險,Flash Cyber僅限政府及可信合作伙伴的有限訪問試點。

這篇文章首次出現在MarkTechPost上。