AI News HubLIVE
站內改寫4 分鐘閱讀

Cerebras上的Gemma 4:快速多模態AI

本文介紹了在Cerebras上使用Gemma 4構建的三個多模態應用,包括文件處理、影像理解和影片分析。Gemma 4 31B模型在Cerebras上達到約2,300 tok/s的速度,實現了即時多模態互動。

2026年7月8日

首次體驗Cerebras上的Gemma 4:我們構建的3個快速多模態應用

本指南介紹了使用Gemma 4構建的三個多模態應用,涵蓋文件處理、影像理解和影片分析。

作者:Zhenwei Gao、William Ryan、Sherif Cherfa、Sarah Chieng

我們花了一週時間,在Cerebras上以約2,300 tok/s的速度執行Gemma 4,構建多模態用例。以下是我們構建的內容及經驗總結。

這是開放權重多模態模型首次突破2,000 tok/s的壁壘。Cerebras上的Gemma 4 31B實現了這一壯舉。

作為谷歌最新的開放權重多模態模型,Gemma 4將視覺、推理、長上下文、思維鏈、函式呼叫和強大的智慧體能力整合到這個31B密集模型中。

在Cerebras上以約2,300 tok/s執行,使得即時多模態智慧體、迭代推理和互動式工作流變得切實可行。

Cerebras上的規格:

  • 31B密集模型:307億引數的密集模型,每次推理所有引數都參與。
  • 視覺能力:支援文本+影像輸入,用於OCR、文件理解、影像搜尋、目標檢測、UI理解和影片幀分析。
  • 131K上下文視窗:處理長文件、大批次資料、智慧體軌跡和多步驟工作流。
  • 140+語言:支援全球企業和消費者應用中的多語言用例。
  • 指令調優:最佳化了提示遵循、對話、結構化JSON輸出、系統指令、函式呼叫和智慧體工作流。

更大的問題是這些能力如何轉化為實際效能。根據Artificial Analysis,Gemma 4相比Gemma 3 26B有重大飛躍,並在其智慧指數中排名最強開放權重模型之一,該指數是模型效能的領先獨立基準。

作為Cerebras上首個也是最快的多模態模型,我們迫不及待地首先測試了Gemma 4的影像輸入。

我們構建和測試的多模態用例:

文件分析

首先,我們測試了一個經典的多模態工作流:並排文件分析。我們上傳了60頁的DeepSeek-V4技術報告,要求Gemma 4解釋前三個技術圖表,包括圖形、圖表和關鍵要點。

從上傳到輸出,完整響應在Cerebras上僅需1.79秒,而GPU提供商需要近25秒,速度提升了17倍。

對於研究人員而言,這種速度改變了文獻綜述的方式。他們不再需要等待模型逐一解析密集的論文,而是可以快速查詢長技術文件、檢查圖表,並在上下文仍然新鮮時從問題轉向答案。

影像分析

接下來,我們測試了影像搜尋,並與流行的GPU推理提供商進行了對比。在這個演示中,我們指向一個影像資料夾,用自然語言輸入搜尋內容,如“食物”或“紅色汽車”,Gemma 4同時啟動兩個智慧體。左側是Cerebras上的Gemma 4,右側是GPU上的相同模型。

兩個推理提供商迴圈處理完全相同的80張影像,以相同方式批處理,使用相同提示,因此唯一的變數是速度。差異並不微妙。閱讀模型速度快很多倍是抽象的,但親眼看到則不然。讓影片來說明。

到目前為止,我們測試了Gemma 4在靜態多模態輸入上的表現:文件、圖表和影像。但許多現實世界的視覺任務並非單次提示。它們跨越幀、重複呼叫、結構化輸出和下游操作,快速推理在整個流程中累積。

租車損壞偵探

受團隊成員最近歐洲夏季旅行和沿途租車的啟發,我們構建了“損壞偵探”,一個租車繞車檢查工具。

工作流從一段短車輛繞車影片開始,類似於租車取還車時可能錄製的影片。應用程式從影片中取樣幀,傳送給Cerebras上的Gemma 4,並要求輸出結構化JSON,描述任何可見損壞、位置以及模型的置信度評估。

然後,它去重跨幀重複出現的相同劃痕,在最清晰的證據幀上繪製邊界框,並組裝一份損壞報告,可在眨眼間完成審查或傳遞到下一步。

由於原始影片以60fps錄製,我們每兩秒取樣一幀,相機圍繞SUV移動。34秒的錄製產生了17幀。

以下是最近在Cerebras WSE-3晶圓上執行的結果示例。註釋幀幾乎立即開始返回,隨著流水線的進行,可見損壞被標記和框出。

為了在影像上繪製輪廓,我們使用Gemma 4的結構化輸出透過JavaScript生成影像上的邊界框。每批三張影像平均處理時間為300毫秒。全部17幀從開始到結束僅需5秒即可處理和註釋。

完整的並排演示使延遲差異顯而易見。觀看下面的並排演示,我們將Cerebras與提供相同Gemma 4 31B模型的流行GPU提供商進行對比。結果不言自明。相同請求、相同錄製,速度提升約17倍。

在這些演示中,我們學到的教訓很明確:Cerebras上的Gemma 4足夠快,使多模態工作流感覺互動式,但原始推理速度只是結果的一部分。體驗之所以成功,是因為整個系統也針對速度進行了設計:提示格式、影像處理、批處理、結構化輸出和工具編排都很重要。

這些教訓成為部署Cerebras上Gemma 4的開發人員在實際多模態應用中的實用起點。

我們的經驗:快速多模態應用的7個技巧

要充分利用Gemma 4,速度必須設計到整個應用程式中,而不僅僅是模型端點。

  1. 使用官方聊天模板。Gemma 4期望標準的系統、使用者和助手/模型輪次,以及影像、音訊、思考、工具、tool_calls和tool_responses的正確格式。當結構正確處理時,模型變得更加可靠。當手工錯誤處理時,尤其是在智慧體工作流中,推理質量可能下降,看起來像模型失敗,但實際上是工具問題。
  1. 從谷歌推薦的生成預設值開始。對於生成,我們使用了溫度1.0和top_p 0.95。這為後續針對特定工作流(如文件分析、影像搜尋和影片幀分析)進行調優提供了良好基線。
  1. 有意圖地啟用思考模式。思考模式有助於推理密集型工作流,但不應預設新增在所有地方。官方文件透過在系統指令中啟用它,並且最好將它與系統指令和工具定義合併到單個系統輪次中。
  1. 保持多輪歷史記錄清潔。對於多輪智慧體,原始想法應從普通對話歷史中剝離,但在需要時保留在tool_call序列中。對於長期執行的智慧體,最好總結之前的推理並將該摘要作為普通文本反饋,而不是重複注入鏈式思考並建立迴圈。
  1. 在多模態提示中將影像放在文本之前。提示結構很重要。我們發現影像輸入應放在文本指令之前,並且視覺token預算應與任務匹配。影像搜尋和分類通常可以使用較低的視覺細節,而文件解析、圖表理解和幀級檢查受益於更高解析度和更多視覺token。
  1. 長上下文在輸入結構化時效果最佳。大上下文視窗很強大,但並非魔法。即使有131K上下文視窗,我們瞭解到不應假設完美檢索。對於文件分析和企業工作流,最好結構化任務、要求引用或提取證據、必要時分塊並驗證輸出。
  1. 使工具迴圈簡單明確。當工作流使用工具時,迴圈應保持乾淨:模型推理、發出tool_call、應用程式執行它,然後返回tool_response供模型繼續。這種結構有助於在整個應用程式中保持速度,而不是在編排開銷中丟失。

結論很簡單:Gemma 4很快,但最佳結果來自於整個應用程式保持這種速度。乾淨的模板、清晰的提示、有意圖的推理、結構化的tool_call和正確的多模態設定是將原始推理速度轉化為真正互動式工作流的關鍵。

開始構建

更大的意義不僅在於可以更快地列印token。更在於低延遲的多模態推理改變了開發人員可以合理設計的內容。不再圍繞長時間等待、進度條和批處理作業構建,而是可以圍繞即時反饋、快速迭代和持續互動進行構建。

這種轉變開啟了不同型別的產品體驗。它改變了你可以構建什麼以及如何構建。

對於開發人員而言,這開啟了更雄心勃勃的產品模式:更豐富的互動、更頻繁的模型呼叫、更緊密的反饋迴圈以及預設感覺互動式的工作流。速度成為體驗的基礎,而不僅僅是效能宣告。

Gemma 4現已在Cerebras上可用,訪問cloud.cerebras.ai。使用它構建,分享你的成果,並在X上標記@cerebras。

—————————————-

特別感謝Halley Chang、Tin Hoang、Manny Monge和Sneha Khanvilkar的設計支援、文案編輯和審閱反饋。