介紹 Step 3.7 Flash:大規模多模態推理
StepFun 的 Step 3.7 Flash 是一款 1980 億引數的稀疏 MoE 視覺語言模型,現已在 Baseten 模型庫中以硬體高效配置提供。該模型支援多模態輸入、256k 上下文視窗和靈活推理,專為代理工作流設計。透過 FP8 量化,可在 4 塊 H100 GPU 上部署,大幅降低成本。
StepFun 近日在 Baseten 模型庫中推出了其旗艦多模態推理模型——Step 3.7 Flash。該模型採用高效的稀疏 MoE 架構,總引數量達 1980 億,但每次推理僅啟用其中 110 億引數,兼顧效能與效率。這種設計類似於一個龐大的團隊,但每個請求只由一小部分專家處理,大部分“腦力”處於待命狀態,從而實現了極致的計算效率。
Step 3.7 Flash 原生支援影像和影片輸入,這意味著使用者無需為視覺任務切換不同的模型。它擁有 256k 令牌的上下文視窗,足以處理大型程式碼庫等大規模輸入。此外,該模型具備低、中、高三個等級的靈活推理能力,特別適合代理工作流,如編碼和工具呼叫。這些特性解鎖了豐富的應用場景:將白板照片轉化為可執行計劃、將資料視覺化圖表轉化為結構化表格、將收據處理為電子表格、從截圖直接生成程式碼,以及分析螢幕錄製以診斷問題。這些功能顯著縮短了從創意到執行的週期。
為了降低部署成本,Baseten 對模型進行了 FP8 量化,將每個權重的位寬從 16 位降至 8 位,使模型權重僅需 198 GB 記憶體。相比之下,官方 vLLM 方案要求 8 塊 H200 或 B200 GPU(分別提供 1,128 GB 和 1,536 GB 視訊記憶體),而 Baseten 僅用 4 塊 H100 GPU 即可提供服務,大幅減少了每 token 的成本,同時為生產流量保留了充足餘量。這得益於 MoE 架構的稀疏啟用(僅 11B 引數活躍)、混合注意力機制(有效控制長對話的記憶體消耗)以及投機解碼技術(並行預測多個 token,提升吞吐量而不損失質量)。三者共同確保了 4×H100 不僅能夠容納模型,還能輕鬆應對生產負載。
目前,Step 3.7 Flash 已可透過 Baseten 模型庫的專用推理部署直接使用。使用者只需一鍵部署,生成 API 金鑰,即可按照 StepFun 的快速入門指南處理影像、影片和文本輸入。StepFun 的加入豐富了 Baseten 模型庫的生態系統,團隊期待看到更多使用者利用這一模型實現創新。