Cohere发布Command A+:218B稀疏MoE模型,专为智能体工作流设计,仅需两块H100 GPU即可运行
Cohere发布开源模型Command A+,这是一款218B参数的稀疏混合专家(MoE)模型,专注于企业智能体工作流。该模型在W4A4量化下仅需两块H100 GPU即可运行,支持48种语言,是Cohere首个多模态推理模型。性能显著提升,在多项基准测试中超越前代。
Cohere近日发布了其最新的开源模型Command A+,这是一款专为企业智能体工作流设计的稀疏混合专家(MoE)模型。该模型采用Apache 2.0许可,旨在以最小的计算开销实现高性能的智能体任务。Command A+集成了此前四款Command A模型(Command A、Command A Reasoning、Command A Vision和Command A Translate)的能力,形成一个统一的可扩展模型。
在架构方面,Command A+是一个仅有解码器的稀疏MoE Transformer,总参数量为218B,但每次推理仅激活25B参数。它包含128个专家,每个token激活其中8个,并且所有token共享一个共享专家。这种设计使得模型在保持大规模参数的同时,推理计算量维持在25B参数级别。注意力层采用滑动窗口注意力与全局注意力交错设计,比例为3:1,并使用了旋转位置嵌入。稀疏MoE层采用无丢弃训练,并使用token选择路由器,每个token通过归一化sigmoid选择top-k专家。
Command A+支持文本、图像和工具使用作为输入,输出则包括文本、推理和工具使用。模型拥有128K的输入上下文长度和64K的最大生成长度。在硬件需求方面,Cohere提供了三种量化变体:BF16需要4×B200或8×H100 GPU;FP8需要2×B200或4×H100 GPU;而W4A4(4位量化)仅需单块B200或2块H100 GPU。三种量化在基准质量上差异极小,Cohere建议大多数部署使用W4A4。W4A4量化采用NVFP4方案,仅对MoE专家进行4位权重和激活量化,并使用两级缩放,而注意力路径保持全精度。为了弥补量化带来的质量差距,Cohere在后训练阶段使用了量化感知蒸馏(QAD),让量化学生模型模仿全精度教师的输出分布。
在性能方面,Command A+相比前代模型有显著提升。在τ²-Bench Telecom上,得分从37%提升至85%;在Terminal-Bench Hard智能体编码任务上,从3%提升至25%。在Cohere内部North平台评估中,使用LLM作为评判员,智能体问答准确率比Command A Reasoning提升20%;电子表格分析质量提升32%;内存使用质量(衡量智能体利用之前会话信息回答后续问题的能力)从39%提升至54%。作为Cohere首个多模态推理模型,Command A+在MMMU Pro上达到63%,在MMMU上达到75.1%(对比Command A Vision的65.3%)。MathVista从73.5%提升至80.6%,CharXiv推理从46.9%提升至52.7%。多语言支持从23种扩展至48种,机器翻译和多语言推理能力均有提升。该模型在Artificial Analysis Intelligence Index上获得37分,领先其他领先开源模型。
在速度和延迟方面,在相同量化和并发级别下,Command A+的每秒输出令牌数(TOPS)比Command A Reasoning提升高达63%,首令牌时间(TTFT)降低高达17%。W4A4量化额外带来47%的速度提升和13%的延迟降低。针对MoE架构优化的推测解码进一步为文本和多模态输入带来1.5-1.6倍的推理加速。
Command A+是Cohere首个使用最新分词器的模型,分词效率显著提升:阿拉伯语提升20%,韩语提升16%,日语提升18%。模型支持通过vLLM和Transformers使用,工具使用通过Transformers中的聊天模板处理,使用JSON模式描述工具。启用推理后,模型会在生成最终答案前产生思考痕迹。W4A4变体需要vLLM ≥0.21.0和cohere_melody>=0.9.0。Cohere建议的采样参数为temperature=0.9, top_p=0.95, repetition_penalty=1.04。
总而言之,Command A+以其高效的稀疏MoE架构、低硬件需求、显著性能提升和广泛的多语言与多模态支持,为企业智能体工作流提供了一个强大的开源解决方案。Cohere表示,该模型权重和技术细节均已公布,欢迎社区使用。