AI News HubLIVE
站内改写3 分钟阅读

谷歌发布三款新Gemini模型,但众人期待的旗舰仍未现身

谷歌发布了 Gemini 3.6 Flash、更便宜更快的 3.5 Flash-Lite 以及针对网络安全的 3.5 Flash Cyber 模型,但备受期待的 3.5 Pro 旗舰模型仍未发布。3.6 Flash 在多数基准测试中超越前代,且成本更低。3.5 Flash-Lite 面向高吞吐量任务,性价比突出。3.5 Flash Cyber 目前仅限政府及合作伙伴试用。

来源The New Stack AI作者: Frederic Lardinois

谷歌于周二发布了三款新的 Gemini 模型:Gemini 3.6 Flash、一款更便宜更快的 3.5 Flash-Lite,以及针对网络安全用例优化的 3.5 Flash Cyber,后者在整体性能上超越了 Anthropic 的 4.6 Opus 模型。

然而,这一阵容中明显缺失了谷歌最新的旗舰模型 3.5 Pro,该模型已推迟发布数周。谷歌在五月的 I/O 大会上首次宣布 3.5 Pro,并承诺在六月推出。谷歌表示,Pro 模型“目前正在与合作伙伴进行测试”,并计划“一旦准备就绪”就广泛提供。谷歌还透露,已经开始对 Gemini 4 进行预训练。

3.6 Flash

大多数人没想到会在 Gemini 3.5 Pro 之前看到 Flash 模型的更新,但事实如此。好消息是,3.6 Flash 相比前代有显著提升,而且成本更低。输入价格保持每百万 token 1.50 美元,但输出价格从每百万 token 9 美元降至 7.50 美元。谷歌特别指出,3.6 Flash 在代理工作流中需要更少的推理步骤和工具调用来实现目标,从而更具成本效益。据 Artificial Analysis 称,它使用的 token 减少了 17%。

在大多数基准测试中,3.6 Flash 轻松超越前代,尤其是在编码方面。在全新的 DeepSWE 软件工程基准测试中,3.6 Flash 得分为 49%,而 3.5 Flash 为 37%。然而,这并非最佳成绩:Anthropic 的 Claude Sonnet 5 达到 54%,顶级前沿模型则超过 70%。团队还在 MLE Bench 机器学习研究基准测试(63.9% 对 49.7%)和 OSWorld-Verified 计算机使用测试(83% 对 78.4%)中看到了大幅提升。大多数现代模型在此范围内得分相近,这对于像 3.6 Flash 这样的中档模型来说相当令人印象深刻。相比之下,Claude Fable 仅略高,为 85%。

在知识工作方面,3.6 Flash 在 GDPval-AA v2 上达到 1421,远高于 3.5 Flash 的 1349,但远低于其他前沿实验室的中档模型,如 Anthropic 的 Claude Sonnet 5(1600)和 OpenAI 的 GPT-5.6 Terra(1581)。需要注意的是,谷歌也在价格上竞争,但情况复杂。例如,3.6 Flash 并不总是优于 GPT 5.6 Luna,后者输入/输出价格为每百万 token 1/6 美元(但仅在上下文窗口低于 272,000 个 token 时)。Anthropic 的 Sonnet 5 在八月底前以介绍性价格每百万 token 2/10 美元提供。

可用性

3.6 Flash 和 3.5 Flash Lite 现已在 Gemini API 中通过 Google AI Studio 和 Android Studio 提供,而 3.6 Flash 也可在谷歌的 Antigravity 代理编码工具以及面向企业用户的 Gemini Enterprise Agent Platform(原 Vertex AI)中使用。对于消费者,3.5 Flash-Lite 将进入 Google 搜索。

3.5 Flash-Lite

3.5 Flash-Lite 是谷歌最新的低端模型。鉴于最旧的‘Lite’版本 3.1 Flash Lite 已发布近半年,3.5 Flash 全线提升并不意外。但它也稍贵:输入/输出价格为每百万 token 0.3/2.5 美元(原为 0.25/1.5 美元)。在基准测试方面,它不会打破任何记录,但也不是此模型的目的。它适用于高吞吐量任务,如代理搜索和文档处理,而非推理和规划代理工作负载。尽管如此,它比 3.1 Flash Lite 显著更好:GDPval-AA v2 得分从 642 升至 1140,SWE-Bench Pro 从 49.6% 升至 54.2%,OSWorld-Verified 达到 74%。对于许多公司来说,它将在延迟敏感的工作负载中找到甜蜜点,正如 Ramp 的应用 AI 主管 Veeral Patel 所指出的:“Gemini 3.5 Flash-Lite 在我们的收据提取基准测试中达到了帕累托前沿,在准确性、延迟和成本之间提供了我们测试过的最佳权衡之一。”

3.5 Flash Cyber

通过 Gemini 3.5 Flash Cyber,谷歌更深入地利用 AI 进行网络安全用例——且避免了类似 Fable 5 的风险。谷歌指出,如今“AI 模型发现安全漏洞的速度已快于当前系统修复它们的能力”。该公司基于常规 3.5 Flash 模型构建了 3.5 Flash Cyber,并收取相同费用,从而有理由声称它“提供了一种经济高效且功能强大的替代方案,替代大型昂贵的网络安全模型”。但你现在还无法获得 Cyber 模型:它仅以有限访问试点形式向政府和受信任合作伙伴提供,且仅在谷歌自己的 CodeMender 工具中。谷歌计划随着时间的推移扩大访问。3.5 Flash Cyber 在发现和利用软件漏洞方面可能还达不到 Anthropic Mythos 的水平,但这表明前沿实验室对推出这些模型有多谨慎。谷歌表示:“这将给前线防御者一个先发优势,在漏洞被利用之前发现并修复关键漏洞,同时减轻更广泛的滥用。”与此同时,许多中文开源模型如 Kimi K3 可能已达到与 3.5 Flash Cyber 相同的水平。谷歌称其性能达到 Opus 4.6 的水平,并指出“由于护栏,较新的竞争对手模型表现不如 Claude Opus 4.6”。