Cohere釋出Command A+:218B稀疏MoE模型,專為智慧體工作流設計,僅需兩塊H100 GPU即可執行
Cohere釋出開源模型Command A+,這是一款218B引數的稀疏混合專家(MoE)模型,專注於企業智慧體工作流。該模型在W4A4量化下僅需兩塊H100 GPU即可執行,支援48種語言,是Cohere首個多模態推理模型。效能顯著提升,在多項基準測試中超越前代。
Cohere近日釋出了其最新的開源模型Command A+,這是一款專為企業智慧體工作流設計的稀疏混合專家(MoE)模型。該模型採用Apache 2.0許可,旨在以最小的計算開銷實現高效能的智慧體任務。Command A+整合了此前四款Command A模型(Command A、Command A Reasoning、Command A Vision和Command A Translate)的能力,形成一個統一的可擴充套件模型。
在架構方面,Command A+是一個僅有解碼器的稀疏MoE Transformer,總引數量為218B,但每次推理僅啟用25B引數。它包含128個專家,每個token啟用其中8個,並且所有token共享一個共享專家。這種設計使得模型在保持大規模引數的同時,推理計算量維持在25B引數級別。注意力層採用滑動視窗注意力與全域性注意力交錯設計,比例為3:1,並使用了旋轉位置嵌入。稀疏MoE層採用無丟棄訓練,並使用token選擇路由器,每個token透過歸一化sigmoid選擇top-k專家。
Command A+支援文本、影像和工具使用作為輸入,輸出則包括文本、推理和工具使用。模型擁有128K的輸入上下文長度和64K的最大生成長度。在硬體需求方面,Cohere提供了三種量化變體:BF16需要4×B200或8×H100 GPU;FP8需要2×B200或4×H100 GPU;而W4A4(4位量化)僅需單塊B200或2塊H100 GPU。三種量化在基準質量上差異極小,Cohere建議大多數部署使用W4A4。W4A4量化採用NVFP4方案,僅對MoE專家進行4位權重和啟用量化,並使用兩級縮放,而注意力路徑保持全精度。為了彌補量化帶來的質量差距,Cohere在後訓練階段使用了量化感知蒸餾(QAD),讓量化學生模型模仿全精度教師的輸出分佈。
在效能方面,Command A+相比前代模型有顯著提升。在τ²-Bench Telecom上,得分從37%提升至85%;在Terminal-Bench Hard智慧體編碼任務上,從3%提升至25%。在Cohere內部North平臺評估中,使用LLM作為評判員,智慧體問答準確率比Command A Reasoning提升20%;電子表格分析質量提升32%;記憶體使用質量(衡量智慧體利用之前會話資訊回答後續問題的能力)從39%提升至54%。作為Cohere首個多模態推理模型,Command A+在MMMU Pro上達到63%,在MMMU上達到75.1%(對比Command A Vision的65.3%)。MathVista從73.5%提升至80.6%,CharXiv推理從46.9%提升至52.7%。多語言支援從23種擴充套件至48種,機器翻譯和多語言推理能力均有提升。該模型在Artificial Analysis Intelligence Index上獲得37分,領先其他領先開源模型。
在速度和延遲方面,在相同量化和併發級別下,Command A+的每秒輸出令牌數(TOPS)比Command A Reasoning提升高達63%,首令牌時間(TTFT)降低高達17%。W4A4量化額外帶來47%的速度提升和13%的延遲降低。針對MoE架構最佳化的推測解碼進一步為文本和多模態輸入帶來1.5-1.6倍的推理加速。
Command A+是Cohere首個使用最新分詞器的模型,分詞效率顯著提升:阿拉伯語提升20%,韓語提升16%,日語提升18%。模型支援透過vLLM和Transformers使用,工具使用透過Transformers中的聊天模板處理,使用JSON模式描述工具。啟用推理後,模型會在生成最終答案前產生思考痕跡。W4A4變體需要vLLM ≥0.21.0和cohere_melody>=0.9.0。Cohere建議的取樣引數為temperature=0.9, top_p=0.95, repetition_penalty=1.04。
總而言之,Command A+以其高效的稀疏MoE架構、低硬體需求、顯著效能提升和廣泛的多語言與多模態支援,為企業智慧體工作流提供了一個強大的開源解決方案。Cohere表示,該模型權重和技術細節均已公佈,歡迎社群使用。