AI News HubLIVE
站內改寫2 分鐘閱讀

Gemini 3.7 Flash:處於智慧與單任務耗時帕累託前沿

谷歌DeepMind釋出Gemini 3.7 Flash,在Artificial Analysis智慧指數上較前代提升4分,以更高輸出速度和更低任務成本躋身智慧與單任務耗時帕累託前沿。

來源Hacker News AI作者: frozenseven

谷歌DeepMind今日釋出第三代Flash系列最新模型Gemini 3.7 Flash。這是三個月內推出的第三款Flash模型。在Artificial Analysis的智慧指數中,Gemini 3.7 Flash(高推理)獲得56分,僅次於GPT-5.6 Terra(最高推理,57分)和Muse Spark 1.2(極高推理,57分)。相比Gemini 3.6 Flash提升了4分。

我們在釋出前對所有三個推理等級(高、中、低)進行了基準測試。高推理模式下,Gemini 3.7 Flash平均單任務耗時為1.7分鐘,比GPT-5.6 Terra(最高推理)快40%。憑藉這一速度,該模型進入了智慧與單任務耗時的帕累託前沿,也進一步強化了谷歌在Flash系列上主打速度的策略。

從智慧指數得分看,Gemini 3.7 Flash(高推理)為56分,較3.6 Flash的52分提高4分,主要得益於智慧體評測的提升:Tau3 Banking上漲3分,Terminal-Bench v2.1上漲8分,GDPval-AA v2上漲103個Elo。中推理模式下得53分,與DeepSeek V4 Pro 0813(最高,53分)和GLM-5.2(最高,53分)持平;低推理模式下得51分,稍低於DeepSeek V4 Flash 0731(最高,52分)。

在輸出速度方面,Gemini 3.7 Flash每秒可生成約340個token,幾乎是GPT-5.6 Terra和GLM-5.2的3倍。結合高推理模式,其平均單任務耗時為1.7分鐘,使其處於智慧-耗時帕累託前沿。價格方面,Gemini 3.7 Flash延續了3.6 Flash的標準定價(每百萬輸入/輸出token 1.50/7.50美元),但谷歌在年底前提供折扣價(0.75/3.75美元)。以折扣價計算,高推理模式下每個智慧指數任務的成本為0.40美元,比3.6 Flash低30%,與Muse Spark 1.2(極高,0.40美元)持平;中推理模式下任務成本降至0.26美元,使其同時進入智慧-成本帕累託前沿。

在專項基準中,Gemini 3.7 Flash(高推理)在AA-AnalystAgent上取得60%的pass^5最高分,超過Claude Opus 5(最高,54%)和Fable 5(49%);在模擬SaaS環境的AutomationBench-AA中得分62.7%,領先Kimi K3(最高,53%)和GPT-5.6 Sol(最高,51.2%)。在智慧體知識工作方面,AA-Briefcase評測中該模型達到1132 Elo,較前代提升169點,略高於Minimax-M3;在GDPval-AA v2上提升103點至1525,與GLM 5.2(最高,1506)和DeepSeek V4 Flash 0731(最高,1558)處於同一水平。

模型規格方面,Gemini 3.7 Flash保持100萬token上下文視窗不變,支援文本、影像、影片和語音輸入,輸出文本。標準定價為每百萬輸入/輸出token 1.50/7.50美元,年底前折扣價為0.75/3.75美元,快取輸入token繼續享受90%折扣。