AI News HubLIVE
站內改寫2 分鐘閱讀

Google Gemini 3.6 Flash 旨在降低企業代理的Token成本

Google釋出了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企業AI代理的延遲和Token成本。3.6 Flash在多項基準測試中效能提升顯著,而3.5 Flash-Lite則專注於高吞吐量、低延遲的場景。此外,Google還推出了針對網路安全的3.5 Flash Cyber模型,並整合了客戶端計算機使用工具。

來源Artificial Intelligence News作者: Ryan Daws

Google釋出了Gemini 3.6 Flash和3.5 Flash-Lite,作為其最新的企業級AI模型,旨在顯著降低延遲和Token成本,從而最佳化自主軟體代理在生產環境中的執行效率。

企業執行自主代理的經濟性取決於一個簡單的公式:模型需要高效地完成多步驟任務,但每生成一個額外Token都會增加成本和延遲,尤其是在工作流每小時執行數千次的情況下。Google的新模型系列正是為了解決這一問題而設計。

Gemini 3.6 Flash專注於編碼和多模態推理,在多個基準測試中表現優異。根據Google的開發文件,該模型在Artificial Analysis Index中的輸出Token比前代3.5 Flash減少了17%。在Datacurve DeepSWE等特定合成測試中,Token使用量甚至下降了65%。定價方面,輸入Token為每百萬個1.50美元,輸出Token為每百萬個7.50美元,適合持續執行的推理迴圈。

在效能上,3.6 Flash在DeepSWE基準測試中成功率達到49%,高於前代的37%;在MLE Bench上從49.7%提升至63.9%;在衡量實際知識工作的GDPval-AA v2測試中,得分從1349升至1421。

企業使用者已開始受益。Figma將3.6 Flash整合到其原型設計基礎設施中,據產品工程總監Matt Colyer稱,該模型加快了設計迭代速度且不影響質量。法律科技平臺Harvey和研究工具Hebbia則利用該模型處理多模態文件,包括解析金融檔案、圖表和生成報告草稿。

Google還在Gemini API和企業平臺中整合了客戶端計算機使用工具,無需中間軟體即可讓模型直接作業系統。該工具在OSWorld-Verified測試中得分83.0%(前代78.4%),並增強了防濫用能力。

對於高吞吐量的後臺代理,3.5 Flash-Lite提供了一種更經濟的選擇。它在Artificial Analysis Index中達到每秒350個輸出Token,是3.5系列中最快的。定價為輸入每百萬個0.30美元,輸出每百萬個2.50美元,適合簡單、高頻的子代理任務。在GDM-MRCR v2長上下文測試中,其成功率為72.2%(前代60.1%),GDPval-AA v2得分近乎翻倍至1140。

此外,Google推出了3.5 Flash Cyber模型,專門用於驗證和修復程式碼漏洞。該模型在CyberGym基準測試中達到與前沿模型競爭的水平,但具體資料未公開。它透過試點專案僅限於政府和認證合作伙伴,以防止被用於生成攻擊程式碼。在Google的CodeMender安全代理中,多個3.5 Flash Cyber例項並行執行,相互驗證後生成報告供人工稽核。

這些新模型可透過Gemini API、Google AI Studio、Android Studio或Gemini Enterprise Agent Platform訪問。消費者也可在Gemini應用中體驗,而3.5 Flash-Lite正在Google搜尋中逐步推出。Google還透露,3.5 Pro仍在合作伙伴測試中,下一代Gemini 4架構的預訓練已經開始。