AI News HubLIVE
站內改寫1 分鐘閱讀

介紹 Step 3.7 Flash:大規模多模態推理

StepFun 的 Step 3.7 Flash 是一款 1980 億參數的稀疏 MoE 視覺語言模型,現已在 Baseten 模型庫中以硬件高效配置提供。該模型支持多模態輸入、256k 上下文窗口和靈活推理,專為代理工作流設計。通過 FP8 量化,可在 4 塊 H100 GPU 上部署,大幅降低成本。

StepFun 近日在 Baseten 模型庫中推出了其旗艦多模態推理模型——Step 3.7 Flash。該模型採用高效的稀疏 MoE 架構,總參數量達 1980 億,但每次推理僅激活其中 110 億參數,兼顧性能與效率。這種設計類似於一個龐大的團隊,但每個請求只由一小部分專家處理,大部分“腦力”處於待命狀態,從而實現了極致的計算效率。

Step 3.7 Flash 原生支持圖像和視頻輸入,這意味着用户無需為視覺任務切換不同的模型。它擁有 256k 令牌的上下文窗口,足以處理大型代碼庫等大規模輸入。此外,該模型具備低、中、高三個等級的靈活推理能力,特別適合代理工作流,如編碼和工具調用。這些特性解鎖了豐富的應用場景:將白板照片轉化為可執行計劃、將數據可視化圖表轉化為結構化表格、將收據處理為電子表格、從截圖直接生成代碼,以及分析屏幕錄製以診斷問題。這些功能顯著縮短了從創意到執行的週期。

為了降低部署成本,Baseten 對模型進行了 FP8 量化,將每個權重的位寬從 16 位降至 8 位,使模型權重僅需 198 GB 內存。相比之下,官方 vLLM 方案要求 8 塊 H200 或 B200 GPU(分別提供 1,128 GB 和 1,536 GB 顯存),而 Baseten 僅用 4 塊 H100 GPU 即可提供服務,大幅減少了每 token 的成本,同時為生產流量保留了充足餘量。這得益於 MoE 架構的稀疏激活(僅 11B 參數活躍)、混合注意力機制(有效控制長對話的內存消耗)以及投機解碼技術(並行預測多個 token,提升吞吐量而不損失質量)。三者共同確保了 4×H100 不僅能夠容納模型,還能輕鬆應對生產負載。

目前,Step 3.7 Flash 已可通過 Baseten 模型庫的專用推理部署直接使用。用户只需一鍵部署,生成 API 密鑰,即可按照 StepFun 的快速入門指南處理圖像、視頻和文本輸入。StepFun 的加入豐富了 Baseten 模型庫的生態系統,團隊期待看到更多用户利用這一模型實現創新。