Gemini 3.6 Flash登场:效率优先的发布
2026年7月21日,谷歌发布了Gemini 3.6 Flash,这是一个注重效率的中期更新,而非突破性模型。它保留了与3.5 Flash相似的推理能力,但显著降低了token消耗和成本。代码生成、机器学习任务和计算机使用性能得到提升,而知识截止日期更新至2026年3月。该模型定价为每百万输入token 1.50美元,输出7.50美元,比前代更便宜。文章包含压力测试,供读者自行评估模型表现。
2026年7月21日,当众人仍在等待多次延迟的Gemini 3.5 Pro时,谷歌悄然推出了其速度层级的中期更新:Gemini 3.6 Flash。这次发布没有前沿宣称或戏剧性展示,而是旨在以更少的token、更少的工具调用和更低的成本完成与3.5 Flash大致相同的思考任务。
对于在大量生产环境中运行Flash的用户而言,这一更新意义重大。本文详细解析了变化点、与前代模型的对比结果,并提供了可复制的压力测试,供读者自行判断。
实际变化
Gemini 3.6 Flash是2025年I/O大会上发布的Gemini 3.5 Flash的渐进式继承者。谷歌坦诚地将其定位为基于开发者与客户反馈的效率优化版本:更高效的token使用。根据Artificial Analysis Index,输出token减少约17%,在DeepSWE某些运行中减少高达65%。
生产代码能力提升:DeepSWE准确率从37%升至49%,MLE Bench从49.7%升至63.9%。计算机使用能力增强:OSWorld-Verified从78.4%升至83%。知识截止日期从2025年1月更新至2026年3月。上下文窗口仍为100万token,支持文本、图像、语音和视频输入及文本输出。
值得注意的是,原始智能方面并未大幅提升——Artificial Analysis Intelligence Index评分约为50,与3.5 Flash持平。
定价与Flash系列
谷歌同时推出了三款Flash模型:Gemini 3.6 Flash(主打平衡的编码、知识与多模态工作流,定价每百万输入token 1.50美元,输出7.50美元),Gemini 3.5 Flash-Lite(高吞吐量、低延迟,用于代理搜索和文档处理,输入0.30美元,输出2.50美元),以及Gemini 3.5 Flash Cyber(漏洞查找与修复,有限试点)。3.6 Flash的输出价格从每百万token 9美元降至7.50美元。
基准测试对比
与3.5 Flash相比,3.6 Flash在应用类任务(编码、机器学习、计算机使用)上取得稳步提升,而综合推理评分基本持平。这表明该模型专注于以更低成本执行已知任务,而非解锁新能力。
压力测试
文章提供了六项可复制的测试,涵盖视觉纪律、测试用例检查、画布构建迭代、指令遵循和矛盾发现。测试结果显示,模型在视觉分析方面表现出色,但在重复元素处理和诚实度方面存在不足。例如,在欺骗性提示下,模型可能依赖检索而非自身知识诚实回应,但通过调整提示可纠正。
总体而言,Gemini 3.6 Flash是一次务实的效率更新,适合追求成本效益的生产环境,而非寻求前沿推理能力的用户。