AI News HubLIVE
站内改写1 分钟阅读

Mellum2 开源:适用于 AI 工作流的快速模型

JetBrains 开源了 Mellum2,一个 12B 参数的 MoE 模型,专为快速、高效的 AI 工作流设计,用于路由、问答、子代理等。由于采用 MoE 架构,每 token 仅激活 2.5B 参数,降低了推理成本和延迟。

来源Hacker News AI作者: microflash

JetBrains 今日宣布开源 Mellum2,一个 12B 参数的混合专家(MoE)模型,旨在解决生产级 AI 中延迟、吞吐量和成本的核心挑战。该模型从零开始训练,采用 Apache 2.0 许可证发布,为基础设施提供了高性能、高性价比的替代方案。

Mellum 最初专注于代码补全,如今已进化为同时处理自然语言和代码的通用工具。Mellum2 适用于路由、总结和中间推理步骤,可灵活集成到现代 AI 工作流中。无论是实验、微调还是大规模部署,用户都可以在自己的系统中运行 Mellum2。

在架构上,Mellum2 采用 MoE 设计,总参数 12B,但每 token 仅激活 2.5B 参数,从而降低计算成本并实现高吞吐量、低延迟的推理。该模型并非多模态,而是专门针对自然语言和代码数据训练,确保在软件工程环境中表现出色且保持轻量。技术报告显示,Mellum2 在代码生成、科学、数学和推理基准测试中与同类模型竞争,同时推理时间缩短一半以上,这使其在生产部署中具有明显优势。

关键用例包括:路由和编排 AI 工作负载,分析传入提示并选择合适模型;构建低延迟 RAG 流水线,检索上下文并即时生成响应;在复杂工作流中驱动快速子代理,将代理流程拆分为上下文收集、规划和验证等步骤;以及启用私有本地 AI 部署,完全控制代码和数据。

JetBrains 强调“焦点模型”理念:随着 AI 系统日益复杂,性能瓶颈从原始能力转向延迟、吞吐量和成本。并非所有任务都需要最大模型,许多步骤重复、对延迟敏感且频繁。焦点模型作为快速、可靠的专门组件,能够高效处理高频任务。JetBrains 认为未来属于协调的系统,而 Mellum2 正是下一代 AI 软件工具中的焦点模型。

用户可立即开始使用 Mellum2,将其集成到 IDE、RAG 流水线、代理工作流或自有基础设施中。JetBrains 表示,开源是打造更好工具的方式。