AI News HubLIVE
站内改写4 分钟阅读

Cerebras上的Gemma 4:快速多模态AI

本文介绍了在Cerebras上使用Gemma 4构建的三个多模态应用,包括文档处理、图像理解和视频分析。Gemma 4 31B模型在Cerebras上达到约2,300 tok/s的速度,实现了实时多模态交互。

2026年7月8日

首次体验Cerebras上的Gemma 4:我们构建的3个快速多模态应用

本指南介绍了使用Gemma 4构建的三个多模态应用,涵盖文档处理、图像理解和视频分析。

作者:Zhenwei Gao、William Ryan、Sherif Cherfa、Sarah Chieng

我们花了一周时间,在Cerebras上以约2,300 tok/s的速度运行Gemma 4,构建多模态用例。以下是我们构建的内容及经验总结。

这是开放权重多模态模型首次突破2,000 tok/s的壁垒。Cerebras上的Gemma 4 31B实现了这一壮举。

作为谷歌最新的开放权重多模态模型,Gemma 4将视觉、推理、长上下文、思维链、函数调用和强大的智能体能力整合到这个31B密集模型中。

在Cerebras上以约2,300 tok/s运行,使得实时多模态智能体、迭代推理和交互式工作流变得切实可行。

Cerebras上的规格:

  • 31B密集模型:307亿参数的密集模型,每次推理所有参数都参与。
  • 视觉能力:支持文本+图像输入,用于OCR、文档理解、图像搜索、目标检测、UI理解和视频帧分析。
  • 131K上下文窗口:处理长文档、大批量数据、智能体轨迹和多步骤工作流。
  • 140+语言:支持全球企业和消费者应用中的多语言用例。
  • 指令调优:优化了提示遵循、对话、结构化JSON输出、系统指令、函数调用和智能体工作流。

更大的问题是这些能力如何转化为实际性能。根据Artificial Analysis,Gemma 4相比Gemma 3 26B有重大飞跃,并在其智能指数中排名最强开放权重模型之一,该指数是模型性能的领先独立基准。

作为Cerebras上首个也是最快的多模态模型,我们迫不及待地首先测试了Gemma 4的图像输入。

我们构建和测试的多模态用例:

文档分析

首先,我们测试了一个经典的多模态工作流:并排文档分析。我们上传了60页的DeepSeek-V4技术报告,要求Gemma 4解释前三个技术图表,包括图形、图表和关键要点。

从上传到输出,完整响应在Cerebras上仅需1.79秒,而GPU提供商需要近25秒,速度提升了17倍。

对于研究人员而言,这种速度改变了文献综述的方式。他们不再需要等待模型逐一解析密集的论文,而是可以快速查询长技术文档、检查图表,并在上下文仍然新鲜时从问题转向答案。

图像分析

接下来,我们测试了图像搜索,并与流行的GPU推理提供商进行了对比。在这个演示中,我们指向一个图像文件夹,用自然语言输入搜索内容,如“食物”或“红色汽车”,Gemma 4同时启动两个智能体。左侧是Cerebras上的Gemma 4,右侧是GPU上的相同模型。

两个推理提供商循环处理完全相同的80张图像,以相同方式批处理,使用相同提示,因此唯一的变量是速度。差异并不微妙。阅读模型速度快很多倍是抽象的,但亲眼看到则不然。让视频来说明。

到目前为止,我们测试了Gemma 4在静态多模态输入上的表现:文档、图表和图像。但许多现实世界的视觉任务并非单次提示。它们跨越帧、重复调用、结构化输出和下游操作,快速推理在整个流程中累积。

租车损坏侦探

受团队成员最近欧洲夏季旅行和沿途租车的启发,我们构建了“损坏侦探”,一个租车绕车检查工具。

工作流从一段短车辆绕车视频开始,类似于租车取还车时可能录制的视频。应用程序从视频中采样帧,发送给Cerebras上的Gemma 4,并要求输出结构化JSON,描述任何可见损坏、位置以及模型的置信度评估。

然后,它去重跨帧重复出现的相同划痕,在最清晰的证据帧上绘制边界框,并组装一份损坏报告,可在眨眼间完成审查或传递到下一步。

由于原始视频以60fps录制,我们每两秒采样一帧,相机围绕SUV移动。34秒的录制产生了17帧。

以下是最近在Cerebras WSE-3晶圆上运行的结果示例。注释帧几乎立即开始返回,随着流水线的进行,可见损坏被标记和框出。

为了在图像上绘制轮廓,我们使用Gemma 4的结构化输出通过JavaScript生成图像上的边界框。每批三张图像平均处理时间为300毫秒。全部17帧从开始到结束仅需5秒即可处理和注释。

完整的并排演示使延迟差异显而易见。观看下面的并排演示,我们将Cerebras与提供相同Gemma 4 31B模型的流行GPU提供商进行对比。结果不言自明。相同请求、相同录制,速度提升约17倍。

在这些演示中,我们学到的教训很明确:Cerebras上的Gemma 4足够快,使多模态工作流感觉交互式,但原始推理速度只是结果的一部分。体验之所以成功,是因为整个系统也针对速度进行了设计:提示格式、图像处理、批处理、结构化输出和工具编排都很重要。

这些教训成为部署Cerebras上Gemma 4的开发人员在实际多模态应用中的实用起点。

我们的经验:快速多模态应用的7个技巧

要充分利用Gemma 4,速度必须设计到整个应用程序中,而不仅仅是模型端点。

  1. 使用官方聊天模板。Gemma 4期望标准的系统、用户和助手/模型轮次,以及图像、音频、思考、工具、tool_calls和tool_responses的正确格式。当结构正确处理时,模型变得更加可靠。当手工错误处理时,尤其是在智能体工作流中,推理质量可能下降,看起来像模型失败,但实际上是工具问题。
  1. 从谷歌推荐的生成默认值开始。对于生成,我们使用了温度1.0和top_p 0.95。这为后续针对特定工作流(如文档分析、图像搜索和视频帧分析)进行调优提供了良好基线。
  1. 有意图地启用思考模式。思考模式有助于推理密集型工作流,但不应默认添加在所有地方。官方文档通过在系统指令中激活它,并且最好将它与系统指令和工具定义合并到单个系统轮次中。
  1. 保持多轮历史记录清洁。对于多轮智能体,原始想法应从普通对话历史中剥离,但在需要时保留在tool_call序列中。对于长期运行的智能体,最好总结之前的推理并将该摘要作为普通文本反馈,而不是重复注入链式思考并创建循环。
  1. 在多模态提示中将图像放在文本之前。提示结构很重要。我们发现图像输入应放在文本指令之前,并且视觉token预算应与任务匹配。图像搜索和分类通常可以使用较低的视觉细节,而文档解析、图表理解和帧级检查受益于更高分辨率和更多视觉token。
  1. 长上下文在输入结构化时效果最佳。大上下文窗口很强大,但并非魔法。即使有131K上下文窗口,我们了解到不应假设完美检索。对于文档分析和企业工作流,最好结构化任务、要求引用或提取证据、必要时分块并验证输出。
  1. 使工具循环简单明确。当工作流使用工具时,循环应保持干净:模型推理、发出tool_call、应用程序执行它,然后返回tool_response供模型继续。这种结构有助于在整个应用程序中保持速度,而不是在编排开销中丢失。

结论很简单:Gemma 4很快,但最佳结果来自于整个应用程序保持这种速度。干净的模板、清晰的提示、有意图的推理、结构化的tool_call和正确的多模态设置是将原始推理速度转化为真正交互式工作流的关键。

开始构建

更大的意义不仅在于可以更快地打印token。更在于低延迟的多模态推理改变了开发人员可以合理设计的内容。不再围绕长时间等待、进度条和批处理作业构建,而是可以围绕实时反馈、快速迭代和持续交互进行构建。

这种转变开启了不同类型的产品体验。它改变了你可以构建什么以及如何构建。

对于开发人员而言,这开启了更雄心勃勃的产品模式:更丰富的交互、更频繁的模型调用、更紧密的反馈循环以及默认感觉交互式的工作流。速度成为体验的基础,而不仅仅是性能声明。

Gemma 4现已在Cerebras上可用,访问cloud.cerebras.ai。使用它构建,分享你的成果,并在X上标记@cerebras。

—————————————-

特别感谢Halley Chang、Tin Hoang、Manny Monge和Sneha Khanvilkar的设计支持、文案编辑和审阅反馈。