AI News HubLIVE
站內改寫4 分鐘閱讀

Cerebras上的Gemma 4:快速多模態AI

本文介紹了在Cerebras上使用Gemma 4構建的三個多模態應用,包括文檔處理、圖像理解和視頻分析。Gemma 4 31B模型在Cerebras上達到約2,300 tok/s的速度,實現了實時多模態交互。

2026年7月8日

首次體驗Cerebras上的Gemma 4:我們構建的3個快速多模態應用

本指南介紹了使用Gemma 4構建的三個多模態應用,涵蓋文檔處理、圖像理解和視頻分析。

作者:Zhenwei Gao、William Ryan、Sherif Cherfa、Sarah Chieng

我們花了一週時間,在Cerebras上以約2,300 tok/s的速度運行Gemma 4,構建多模態用例。以下是我們構建的內容及經驗總結。

這是開放權重多模態模型首次突破2,000 tok/s的壁壘。Cerebras上的Gemma 4 31B實現了這一壯舉。

作為谷歌最新的開放權重多模態模型,Gemma 4將視覺、推理、長上下文、思維鏈、函數調用和強大的智能體能力整合到這個31B密集模型中。

在Cerebras上以約2,300 tok/s運行,使得實時多模態智能體、迭代推理和交互式工作流變得切實可行。

Cerebras上的規格:

  • 31B密集模型:307億參數的密集模型,每次推理所有參數都參與。
  • 視覺能力:支持文本+圖像輸入,用於OCR、文檔理解、圖像搜索、目標檢測、UI理解和視頻幀分析。
  • 131K上下文窗口:處理長文檔、大批量數據、智能體軌跡和多步驟工作流。
  • 140+語言:支持全球企業和消費者應用中的多語言用例。
  • 指令調優:優化了提示遵循、對話、結構化JSON輸出、系統指令、函數調用和智能體工作流。

更大的問題是這些能力如何轉化為實際性能。根據Artificial Analysis,Gemma 4相比Gemma 3 26B有重大飛躍,並在其智能指數中排名最強開放權重模型之一,該指數是模型性能的領先獨立基準。

作為Cerebras上首個也是最快的多模態模型,我們迫不及待地首先測試了Gemma 4的圖像輸入。

我們構建和測試的多模態用例:

文檔分析

首先,我們測試了一個經典的多模態工作流:並排文檔分析。我們上傳了60頁的DeepSeek-V4技術報告,要求Gemma 4解釋前三個技術圖表,包括圖形、圖表和關鍵要點。

從上傳到輸出,完整響應在Cerebras上僅需1.79秒,而GPU提供商需要近25秒,速度提升了17倍。

對於研究人員而言,這種速度改變了文獻綜述的方式。他們不再需要等待模型逐一解析密集的論文,而是可以快速查詢長技術文檔、檢查圖表,並在上下文仍然新鮮時從問題轉向答案。

圖像分析

接下來,我們測試了圖像搜索,並與流行的GPU推理提供商進行了對比。在這個演示中,我們指向一個圖像文件夾,用自然語言輸入搜索內容,如“食物”或“紅色汽車”,Gemma 4同時啓動兩個智能體。左側是Cerebras上的Gemma 4,右側是GPU上的相同模型。

兩個推理提供商循環處理完全相同的80張圖像,以相同方式批處理,使用相同提示,因此唯一的變量是速度。差異並不微妙。閲讀模型速度快很多倍是抽象的,但親眼看到則不然。讓視頻來説明。

到目前為止,我們測試了Gemma 4在靜態多模態輸入上的表現:文檔、圖表和圖像。但許多現實世界的視覺任務並非單次提示。它們跨越幀、重複調用、結構化輸出和下游操作,快速推理在整個流程中累積。

租車損壞偵探

受團隊成員最近歐洲夏季旅行和沿途租車的啓發,我們構建了“損壞偵探”,一個租車繞車檢查工具。

工作流從一段短車輛繞車視頻開始,類似於租車取還車時可能錄製的視頻。應用程序從視頻中採樣幀,發送給Cerebras上的Gemma 4,並要求輸出結構化JSON,描述任何可見損壞、位置以及模型的置信度評估。

然後,它去重跨幀重複出現的相同劃痕,在最清晰的證據幀上繪製邊界框,並組裝一份損壞報告,可在眨眼間完成審查或傳遞到下一步。

由於原始視頻以60fps錄製,我們每兩秒採樣一幀,相機圍繞SUV移動。34秒的錄製產生了17幀。

以下是最近在Cerebras WSE-3晶圓上運行的結果示例。註釋幀幾乎立即開始返回,隨着流水線的進行,可見損壞被標記和框出。

為了在圖像上繪製輪廓,我們使用Gemma 4的結構化輸出通過JavaScript生成圖像上的邊界框。每批三張圖像平均處理時間為300毫秒。全部17幀從開始到結束僅需5秒即可處理和註釋。

完整的並排演示使延遲差異顯而易見。觀看下面的並排演示,我們將Cerebras與提供相同Gemma 4 31B模型的流行GPU提供商進行對比。結果不言自明。相同請求、相同錄製,速度提升約17倍。

在這些演示中,我們學到的教訓很明確:Cerebras上的Gemma 4足夠快,使多模態工作流感覺交互式,但原始推理速度只是結果的一部分。體驗之所以成功,是因為整個系統也針對速度進行了設計:提示格式、圖像處理、批處理、結構化輸出和工具編排都很重要。

這些教訓成為部署Cerebras上Gemma 4的開發人員在實際多模態應用中的實用起點。

我們的經驗:快速多模態應用的7個技巧

要充分利用Gemma 4,速度必須設計到整個應用程序中,而不僅僅是模型端點。

  1. 使用官方聊天模板。Gemma 4期望標準的系統、用户和助手/模型輪次,以及圖像、音頻、思考、工具、tool_calls和tool_responses的正確格式。當結構正確處理時,模型變得更加可靠。當手工錯誤處理時,尤其是在智能體工作流中,推理質量可能下降,看起來像模型失敗,但實際上是工具問題。
  1. 從谷歌推薦的生成默認值開始。對於生成,我們使用了温度1.0和top_p 0.95。這為後續針對特定工作流(如文檔分析、圖像搜索和視頻幀分析)進行調優提供了良好基線。
  1. 有意圖地啓用思考模式。思考模式有助於推理密集型工作流,但不應默認添加在所有地方。官方文檔通過在系統指令中激活它,並且最好將它與系統指令和工具定義合併到單個系統輪次中。
  1. 保持多輪歷史記錄清潔。對於多輪智能體,原始想法應從普通對話歷史中剝離,但在需要時保留在tool_call序列中。對於長期運行的智能體,最好總結之前的推理並將該摘要作為普通文本反饋,而不是重複注入鏈式思考並創建循環。
  1. 在多模態提示中將圖像放在文本之前。提示結構很重要。我們發現圖像輸入應放在文本指令之前,並且視覺token預算應與任務匹配。圖像搜索和分類通常可以使用較低的視覺細節,而文檔解析、圖表理解和幀級檢查受益於更高分辨率和更多視覺token。
  1. 長上下文在輸入結構化時效果最佳。大上下文窗口很強大,但並非魔法。即使有131K上下文窗口,我們瞭解到不應假設完美檢索。對於文檔分析和企業工作流,最好結構化任務、要求引用或提取證據、必要時分塊並驗證輸出。
  1. 使工具循環簡單明確。當工作流使用工具時,循環應保持乾淨:模型推理、發出tool_call、應用程序執行它,然後返回tool_response供模型繼續。這種結構有助於在整個應用程序中保持速度,而不是在編排開銷中丟失。

結論很簡單:Gemma 4很快,但最佳結果來自於整個應用程序保持這種速度。乾淨的模板、清晰的提示、有意圖的推理、結構化的tool_call和正確的多模態設置是將原始推理速度轉化為真正交互式工作流的關鍵。

開始構建

更大的意義不僅在於可以更快地打印token。更在於低延遲的多模態推理改變了開發人員可以合理設計的內容。不再圍繞長時間等待、進度條和批處理作業構建,而是可以圍繞實時反饋、快速迭代和持續交互進行構建。

這種轉變開啓了不同類型的產品體驗。它改變了你可以構建什麼以及如何構建。

對於開發人員而言,這開啓了更雄心勃勃的產品模式:更豐富的交互、更頻繁的模型調用、更緊密的反饋循環以及默認感覺交互式的工作流。速度成為體驗的基礎,而不僅僅是性能聲明。

Gemma 4現已在Cerebras上可用,訪問cloud.cerebras.ai。使用它構建,分享你的成果,並在X上標記@cerebras。

—————————————-

特別感謝Halley Chang、Tin Hoang、Manny Monge和Sneha Khanvilkar的設計支持、文案編輯和審閲反饋。