AI News HubLIVE
站内改写2 分钟阅读

Google Gemini 3.6 Flash 旨在降低企业代理的Token成本

Google发布了Gemini 3.6 Flash和3.5 Flash-Lite,旨在降低企业AI代理的延迟和Token成本。3.6 Flash在多项基准测试中性能提升显著,而3.5 Flash-Lite则专注于高吞吐量、低延迟的场景。此外,Google还推出了针对网络安全的3.5 Flash Cyber模型,并集成了客户端计算机使用工具。

来源Artificial Intelligence News作者: Ryan Daws

Google发布了Gemini 3.6 Flash和3.5 Flash-Lite,作为其最新的企业级AI模型,旨在显著降低延迟和Token成本,从而优化自主软件代理在生產環境中的运行效率。

企业运行自主代理的经济性取决于一个简单的公式:模型需要高效地完成多步骤任务,但每生成一个额外Token都会增加成本和延迟,尤其是在工作流每小时执行数千次的情况下。Google的新模型系列正是为了解决这一问题而设计。

Gemini 3.6 Flash专注于编码和多模态推理,在多个基准测试中表现优异。根据Google的开发文档,该模型在Artificial Analysis Index中的输出Token比前代3.5 Flash减少了17%。在Datacurve DeepSWE等特定合成测试中,Token使用量甚至下降了65%。定价方面,输入Token为每百万个1.50美元,输出Token为每百万个7.50美元,适合持续运行的推理循环。

在性能上,3.6 Flash在DeepSWE基准测试中成功率达到49%,高于前代的37%;在MLE Bench上从49.7%提升至63.9%;在衡量实际知识工作的GDPval-AA v2测试中,得分从1349升至1421。

企业用户已开始受益。Figma将3.6 Flash集成到其原型设计基础设施中,据产品工程总监Matt Colyer称,该模型加快了设计迭代速度且不影响质量。法律科技平台Harvey和研究工具Hebbia则利用该模型处理多模态文档,包括解析金融文件、图表和生成报告草稿。

Google还在Gemini API和企业平台中集成了客户端计算机使用工具,无需中间软件即可让模型直接操作系统。该工具在OSWorld-Verified测试中得分83.0%(前代78.4%),并增强了防滥用能力。

对于高吞吐量的后台代理,3.5 Flash-Lite提供了一种更经济的选择。它在Artificial Analysis Index中达到每秒350个输出Token,是3.5系列中最快的。定价为输入每百万个0.30美元,输出每百万个2.50美元,适合简单、高频的子代理任务。在GDM-MRCR v2长上下文测试中,其成功率为72.2%(前代60.1%),GDPval-AA v2得分近乎翻倍至1140。

此外,Google推出了3.5 Flash Cyber模型,专门用于验证和修复代码漏洞。该模型在CyberGym基准测试中达到与前沿模型竞争的水平,但具体数据未公开。它通过试点项目仅限于政府和认证合作伙伴,以防止被用于生成攻击代码。在Google的CodeMender安全代理中,多个3.5 Flash Cyber实例并行运行,相互验证后生成报告供人工审核。

这些新模型可通过Gemini API、Google AI Studio、Android Studio或Gemini Enterprise Agent Platform访问。消费者也可在Gemini应用中体验,而3.5 Flash-Lite正在Google搜索中逐步推出。Google还透露,3.5 Pro仍在合作伙伴测试中,下一代Gemini 4架构的预训练已经开始。