介绍 Step 3.7 Flash:大规模多模态推理
StepFun 的 Step 3.7 Flash 是一款 1980 亿参数的稀疏 MoE 视觉语言模型,现已在 Baseten 模型库中以硬件高效配置提供。该模型支持多模态输入、256k 上下文窗口和灵活推理,专为代理工作流设计。通过 FP8 量化,可在 4 块 H100 GPU 上部署,大幅降低成本。
StepFun 近日在 Baseten 模型库中推出了其旗舰多模态推理模型——Step 3.7 Flash。该模型采用高效的稀疏 MoE 架构,总参数量达 1980 亿,但每次推理仅激活其中 110 亿参数,兼顾性能与效率。这种设计类似于一个庞大的团队,但每个请求只由一小部分专家处理,大部分“脑力”处于待命状态,从而实现了极致的计算效率。
Step 3.7 Flash 原生支持图像和视频输入,这意味着用户无需为视觉任务切换不同的模型。它拥有 256k 令牌的上下文窗口,足以处理大型代码库等大规模输入。此外,该模型具备低、中、高三个等级的灵活推理能力,特别适合代理工作流,如编码和工具调用。这些特性解锁了丰富的应用场景:将白板照片转化为可执行计划、将数据可视化图表转化为结构化表格、将收据处理为电子表格、从截图直接生成代码,以及分析屏幕录制以诊断问题。这些功能显著缩短了从创意到执行的周期。
为了降低部署成本,Baseten 对模型进行了 FP8 量化,将每个权重的位宽从 16 位降至 8 位,使模型权重仅需 198 GB 内存。相比之下,官方 vLLM 方案要求 8 块 H200 或 B200 GPU(分别提供 1,128 GB 和 1,536 GB 显存),而 Baseten 仅用 4 块 H100 GPU 即可提供服务,大幅减少了每 token 的成本,同时为生产流量保留了充足余量。这得益于 MoE 架构的稀疏激活(仅 11B 参数活跃)、混合注意力机制(有效控制长对话的内存消耗)以及投机解码技术(并行预测多个 token,提升吞吐量而不损失质量)。三者共同确保了 4×H100 不仅能够容纳模型,还能轻松应对生产负载。
目前,Step 3.7 Flash 已可通过 Baseten 模型库的专用推理部署直接使用。用户只需一键部署,生成 API 密钥,即可按照 StepFun 的快速入门指南处理图像、视频和文本输入。StepFun 的加入丰富了 Baseten 模型库的生态系统,团队期待看到更多用户利用这一模型实现创新。