Mellum2 开源:适用于 AI 工作流的快速模型
JetBrains 开源了 Mellum2,一个 12B 参数的 MoE 模型,专为快速、高效的 AI 工作流设计,用于路由、问答、子代理等。由于采用 MoE 架构,每 token 仅激活 2.5B 参数,降低了推理成本和延迟。
JetBrains 今日宣布开源 Mellum2,一个 12B 参数的混合专家(MoE)模型,旨在解决生产级 AI 中延迟、吞吐量和成本的核心挑战。该模型从零开始训练,采用 Apache 2.0 许可证发布,为基础设施提供了高性能、高性价比的替代方案。
Mellum 最初专注于代码补全,如今已进化为同时处理自然语言和代码的通用工具。Mellum2 适用于路由、总结和中间推理步骤,可灵活集成到现代 AI 工作流中。无论是实验、微调还是大规模部署,用户都可以在自己的系统中运行 Mellum2。
在架构上,Mellum2 采用 MoE 设计,总参数 12B,但每 token 仅激活 2.5B 参数,从而降低计算成本并实现高吞吐量、低延迟的推理。该模型并非多模态,而是专门针对自然语言和代码数据训练,确保在软件工程环境中表现出色且保持轻量。技术报告显示,Mellum2 在代码生成、科学、数学和推理基准测试中与同类模型竞争,同时推理时间缩短一半以上,这使其在生产部署中具有明显优势。
关键用例包括:路由和编排 AI 工作负载,分析传入提示并选择合适模型;构建低延迟 RAG 流水线,检索上下文并即时生成响应;在复杂工作流中驱动快速子代理,将代理流程拆分为上下文收集、规划和验证等步骤;以及启用私有本地 AI 部署,完全控制代码和数据。
JetBrains 强调“焦点模型”理念:随着 AI 系统日益复杂,性能瓶颈从原始能力转向延迟、吞吐量和成本。并非所有任务都需要最大模型,许多步骤重复、对延迟敏感且频繁。焦点模型作为快速、可靠的专门组件,能够高效处理高频任务。JetBrains 认为未来属于协调的系统,而 Mellum2 正是下一代 AI 软件工具中的焦点模型。
用户可立即开始使用 Mellum2,将其集成到 IDE、RAG 流水线、代理工作流或自有基础设施中。JetBrains 表示,开源是打造更好工具的方式。