AI News HubLIVE
站內改寫2 分鐘閱讀

Google Gemini 3.6 Flash 旨在降低企業代理的Token成本

Google發佈了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企業AI代理的延遲和Token成本。3.6 Flash在多項基準測試中性能提升顯著,而3.5 Flash-Lite則專注於高吞吐量、低延遲的場景。此外,Google還推出了針對網絡安全的3.5 Flash Cyber模型,並集成了客户端計算機使用工具。

來源Artificial Intelligence News作者: Ryan Daws

Google發佈了Gemini 3.6 Flash和3.5 Flash-Lite,作為其最新的企業級AI模型,旨在顯著降低延遲和Token成本,從而優化自主軟件代理在生產環境中的運行效率。

企業運行自主代理的經濟性取決於一個簡單的公式:模型需要高效地完成多步驟任務,但每生成一個額外Token都會增加成本和延遲,尤其是在工作流每小時執行數千次的情況下。Google的新模型系列正是為了解決這一問題而設計。

Gemini 3.6 Flash專注於編碼和多模態推理,在多個基準測試中表現優異。根據Google的開發文檔,該模型在Artificial Analysis Index中的輸出Token比前代3.5 Flash減少了17%。在Datacurve DeepSWE等特定合成測試中,Token使用量甚至下降了65%。定價方面,輸入Token為每百萬個1.50美元,輸出Token為每百萬個7.50美元,適合持續運行的推理循環。

在性能上,3.6 Flash在DeepSWE基準測試中成功率達到49%,高於前代的37%;在MLE Bench上從49.7%提升至63.9%;在衡量實際知識工作的GDPval-AA v2測試中,得分從1349升至1421。

企業用户已開始受益。Figma將3.6 Flash集成到其原型設計基礎設施中,據產品工程總監Matt Colyer稱,該模型加快了設計迭代速度且不影響質量。法律科技平台Harvey和研究工具Hebbia則利用該模型處理多模態文檔,包括解析金融文件、圖表和生成報告草稿。

Google還在Gemini API和企業平台中集成了客户端計算機使用工具,無需中間軟件即可讓模型直接操作系統。該工具在OSWorld-Verified測試中得分83.0%(前代78.4%),並增強了防濫用能力。

對於高吞吐量的後台代理,3.5 Flash-Lite提供了一種更經濟的選擇。它在Artificial Analysis Index中達到每秒350個輸出Token,是3.5系列中最快的。定價為輸入每百萬個0.30美元,輸出每百萬個2.50美元,適合簡單、高頻的子代理任務。在GDM-MRCR v2長上下文測試中,其成功率為72.2%(前代60.1%),GDPval-AA v2得分近乎翻倍至1140。

此外,Google推出了3.5 Flash Cyber模型,專門用於驗證和修復代碼漏洞。該模型在CyberGym基準測試中達到與前沿模型競爭的水平,但具體數據未公開。它通過試點項目僅限於政府和認證合作伙伴,以防止被用於生成攻擊代碼。在Google的CodeMender安全代理中,多個3.5 Flash Cyber實例並行運行,相互驗證後生成報告供人工審核。

這些新模型可通過Gemini API、Google AI Studio、Android Studio或Gemini Enterprise Agent Platform訪問。消費者也可在Gemini應用中體驗,而3.5 Flash-Lite正在Google搜索中逐步推出。Google還透露,3.5 Pro仍在合作伙伴測試中,下一代Gemini 4架構的預訓練已經開始。