谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber:更便宜、更高效的Flash层,专为代理工作负载设计
谷歌于2026年7月21日发布了三款新的Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber。3.6 Flash输出token减少17%,价格降至每百万输出7.50美元;Flash-Lite速度达350 token/秒;Flash Cyber专为漏洞查找设计,在CodeMender中表现出色。旗舰模型3.5 Pro仍推迟发布。
开发者需要更高的token效率、更低的延迟和更可靠的性能来构建生产级代理。今天,谷歌发布了三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。这三款模型均属于Flash层级,谷歌对其进行了速度和成本优化,适用于高容量的代理工作,而非追求极致的推理深度。
Gemini 3.6 Flash:更高品质,更少token,更低价格
Gemini 3.6 Flash是新的默认工作马。它基于3.5 Flash构建,专注于编码、知识工作和多模态任务。其核心优势在于效率。根据Artificial Analysis Index,3.6 Flash比3.5 Flash少用17%的输出token。在Datacurve的DeepSWE基准测试中,谷歌报告称减少高达65%。该模型在每步多步骤工作流中所需的推理步骤和工具调用也更少。
定价随效率提升而降低。Gemini 3.6 Flash定价为每百万输入token 1.50美元,每百万输出token 7.50美元。输出价格从此前的3.5 Flash的9.00美元下降。更低的冗长度和更低的输出价格降低了每个代理任务的总成本。
质量提升伴随效率提升。在DeepSWE上,3.6 Flash得分为49%,而3.5 Flash为37%。在MLE Bench上,达到63.9%对49.7%。在OSWorld-Verified上,达到83.0%对78.4%。在GDPval-AA v2(知识工作基准)上,得分为1421对1349。计算机使用现在通过Gemini API和Gemini Enterprise成为内置的客户端工具。早期客户包括Hebbia和Harvey,他们在文档解析、图表和数据分析以及报告起草方面受益。
谷歌为3.6 Flash配备了增强的前沿安全防护措施,涵盖化学、生物、放射性和核(CBRN)以及网络攻击滥用。详细信息见3.6 Flash模型卡。
交互式说明工具允许您将每个模型与其前身进行比较,并根据您的使用量估算token成本。
Gemini 3.5 Flash-Lite:3.5系列中最快的模型
Gemini 3.5 Flash-Lite专为低延迟和高吞吐量任务而设计。目标用例包括代理搜索和文档处理。根据Artificial Analysis的测量,它每秒可输出350个token。定价为每百万输入token 0.30美元,每百万输出token 2.50美元。
该模型大幅超越了之前的3.1 Flash-Lite。在Terminal-Bench 2.1上,得分为54%对31%。在GDM-MRCR v2(长上下文基准)上,达到72.2%对60.1%。在GDPval-AA v2上,得分为1140对642。值得注意的是,Flash-Lite在某些评估中甚至超越了旧的3 Flash。在SWE-Bench Pro上以54.2%对49.6%领先,在OSWorld-Verified上以74.0%对65.1%领先。
Flash-Lite提供可配置的思考级别:最小、低和高。开发者可以优先考虑低成本、低延迟的高容量任务执行。他们也可以针对多步骤子代理工作负载使用更高的思考级别。计算机使用同样是内置工具。
Gemini 3.5 Flash Cyber in CodeMender:廉价代理找出并修补漏洞
Gemini 3.5 Flash Cyber是最专门的版本。它基于3.5 Flash构建,经过微调以发现、验证和修补软件漏洞。其设计前提是搜索空间问题。找到深层漏洞意味着探索巨大的执行搜索空间。单次调用单个大规模模型成为瓶颈。
解决方案是多次调用廉价模型。在谷歌的代码安全代理CodeMender内部,多个3.5 Flash Cyber代理并行运行。CodeMender最多调用模型五次,然后将子代理的结果合并成一份报告。在CyberGym基准测试中,这种设置达到了与更大模型相竞争的性能。
内部评估结果引人注目。在谷歌的Big Sleep评估中,Flash Cyber显著超越了主线3.5 Flash和3.6 Flash。在V8 JavaScript引擎上,它在固定调用次数下发现了55个独特确认问题,而主线3.5 Flash为47个,Claude Opus 4.6为36个。它发现了另外两个模型遗漏的10个问题。在一次实际测试中,谷歌的云漏洞研究团队利用它在两小时内发现了公共API中的远程代码执行漏洞。
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
社区反应
反应可预测地分裂。开发者欢迎价格和效率的提升。推迟发布的旗舰模型引发了最强烈的批评。在Hacker News上,一些人认为谷歌过度宣传其无法可靠提供的容量,并引用了令人沮丧的实际编码会话。受限制的Flash Cyber发布引发了关于谁应该拥有自动漏洞发现工具的双重用途辩论。
以下仪表板按平台汇总了讨论内容。这是定性的编辑综合,并非抓取的数据集,并附有方法说明。
可用性
Gemini 3.6 Flash和3.5 Flash-Lite即日起可用。开发者可以通过Google AI Studio和Android Studio中的Gemini API访问。Gemini 3.6 Flash也在Google Antigravity中,并正在GitHub Copilot中推出。企业用户在Gemini Enterprise Agent平台中获得这两款模型,3.6 Flash在Gemini Enterprise应用中。所有用户都可以通过Gemini应用使用它们,3.5 Flash-Lite正在Google搜索中推出。从开发者指南开始。
要点总结
Gemini 3.6 Flash输出token减少17%(DeepSWE上最高65%),输出价格从9.00美元降至7.50美元每百万token。
Gemini 3.5 Flash-Lite以每秒350 token运行,价格为输入0.30美元/输出2.50美元每百万token,在SWE-Bench Pro和OSWorld-Verified上击败了旧版3 Flash。
Gemini 3.5 Flash Cyber通过廉价多代理扫描驱动CodeMender;在V8引擎中发现55个独特问题,而3.5 Flash和Opus 4.6分别为47和36个。
由于双重用途风险,Flash Cyber仅限政府及可信合作伙伴的有限访问试点。
这篇文章首次出现在MarkTechPost上。