Gemini 3.7 Flash:处于智能与单任务耗时帕累托前沿
谷歌DeepMind发布Gemini 3.7 Flash,在Artificial Analysis智能指数上较前代提升4分,以更高输出速度和更低任务成本跻身智能与单任务耗时帕累托前沿。
谷歌DeepMind今日发布第三代Flash系列最新模型Gemini 3.7 Flash。这是三个月内推出的第三款Flash模型。在Artificial Analysis的智能指数中,Gemini 3.7 Flash(高推理)获得56分,仅次于GPT-5.6 Terra(最高推理,57分)和Muse Spark 1.2(极高推理,57分)。相比Gemini 3.6 Flash提升了4分。
我们在发布前对所有三个推理等级(高、中、低)进行了基准测试。高推理模式下,Gemini 3.7 Flash平均单任务耗时为1.7分钟,比GPT-5.6 Terra(最高推理)快40%。凭借这一速度,该模型进入了智能与单任务耗时的帕累托前沿,也进一步强化了谷歌在Flash系列上主打速度的策略。
从智能指数得分看,Gemini 3.7 Flash(高推理)为56分,较3.6 Flash的52分提高4分,主要得益于智能体评测的提升:Tau3 Banking上涨3分,Terminal-Bench v2.1上涨8分,GDPval-AA v2上涨103个Elo。中推理模式下得53分,与DeepSeek V4 Pro 0813(最高,53分)和GLM-5.2(最高,53分)持平;低推理模式下得51分,稍低于DeepSeek V4 Flash 0731(最高,52分)。
在输出速度方面,Gemini 3.7 Flash每秒可生成约340个token,几乎是GPT-5.6 Terra和GLM-5.2的3倍。结合高推理模式,其平均单任务耗时为1.7分钟,使其处于智能-耗时帕累托前沿。价格方面,Gemini 3.7 Flash延续了3.6 Flash的标准定价(每百万输入/输出token 1.50/7.50美元),但谷歌在年底前提供折扣价(0.75/3.75美元)。以折扣价计算,高推理模式下每个智能指数任务的成本为0.40美元,比3.6 Flash低30%,与Muse Spark 1.2(极高,0.40美元)持平;中推理模式下任务成本降至0.26美元,使其同时进入智能-成本帕累托前沿。
在专项基准中,Gemini 3.7 Flash(高推理)在AA-AnalystAgent上取得60%的pass^5最高分,超过Claude Opus 5(最高,54%)和Fable 5(49%);在模拟SaaS环境的AutomationBench-AA中得分62.7%,领先Kimi K3(最高,53%)和GPT-5.6 Sol(最高,51.2%)。在智能体知识工作方面,AA-Briefcase评测中该模型达到1132 Elo,较前代提升169点,略高于Minimax-M3;在GDPval-AA v2上提升103点至1525,与GLM 5.2(最高,1506)和DeepSeek V4 Flash 0731(最高,1558)处于同一水平。
模型规格方面,Gemini 3.7 Flash保持100万token上下文窗口不变,支持文本、图像、视频和语音输入,输出文本。标准定价为每百万输入/输出token 1.50/7.50美元,年底前折扣价为0.75/3.75美元,缓存输入token继续享受90%折扣。