本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

Cohere、Command A+ を発表:オープンソースの混合専門家モデル、エージェントタスク向けに最適化

記事の要約

Cohere は、Apache 2.0 ライセンスのもと、218B パラメータ(アクティブは 25B)の混合専門家(MoE)モデル Command A+ をオープンソース化しました。エンタープライズ向けエージェントワークフローに最適化されており、128K の入力コンテキスト、64K の生成、テキスト・画像・ツール利用をサポート。推論、マルチモーダル理解、多言語タスクで従来の Command A シリーズを大幅に上回り、低ビット量子化と投機的復号により効率的なデプロイが可能です。Hugging Face および Model Vault で入手できます。

ソースCohere Blog
Cohere、Command A+ を発表:オープンソースの混合専門家モデル、エージェントタスク向けに最適化
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Cohere は本日、Command A+ をオープンソースとしてリリースしました。これは、同社の Command シリーズの最新モデルで、混合専門家(MoE)アーキテクチャを採用しています。Command A+ は総パラメータ 218B、アクティブパラメータ 25B で、Apache 2.0 ライセンスのもとで公開され、開発者が高性能でプライベートデプロイ可能なエージェント機能を利用できるようにすることを目的としています。

Command A+ は、Cohere がエンタープライズプラットフォーム North で 1 年以上にわたって培った知見を基に開発され、以前の Command シリーズ(Command A、Command A Reasoning、Command A Vision、Command A Translate)の機能を統合しています。このモデルは、推論、マルチモーダル理解、ツール使用、多言語サポートを単一のモデルで実現します。

パフォーマンス面では、Command A+ は Command A Reasoning と比較して大幅な向上を示しています。通信分野の 𝜏²-Bench ベンチマークでは 37% から 85% に、Terminal-Bench Hard のエージェントコーディングでは 3% から 25% に改善しました。マルチモーダル理解では、MMMU で 75.1%、MathVista で 80.6%(前モデルは 73.5%)、CharXiv 推論で 52.7%(同 46.9%)を達成。多言語サポートは 23 言語から 48 言語に拡大され、機械翻訳と多言語推論のスコアも向上しています。Artificial Analysis Intelligence Index では 37 点を獲得し、他の主要なオープンモデルを上回りました。

効率面では、Command A+ は BF16、FP8、W4A4 量子化をサポートし、わずか 2 台の H100 または 1 台の B200 GPU で動作可能で、品質劣化はほとんどありません。Command A Reasoning と比較して、出力トークン速度(TOPS)が最大 63% 向上し、初回トークン時間(TTFT)が 17% 短縮されました。投機的復号により、テキストとマルチモーダル入力の両方で推論速度が 1.5~1.6 倍向上しています。新しいトークナイザーは、非ヨーロッパ言語の圧縮効率を大幅に改善し、アラビア語で 20%、韓国語で 16%、日本語で 18% の向上を実現しました。

Command A+ は、Hugging Face および Model Vault ですぐに利用可能です。Cohere は、このオープンソースリリースにより、開発者がモデルを自由に実行、制御、適応できる主権 AI の実現を目指しています。Fujitsu などのパートナー企業も、このモデルへの支持を表明しています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Command A+ は Cohere の最新オープンソース MoE モデルで、総パラメータ 218B、アクティブパラメータ 25B、Apache 2.0 ライセンス。
  • エージェントタスク向けに設計され、128K 入力コンテキスト、64K 生成をサポート。テキスト、画像、ツール利用に対応。
  • Command A Reasoning と比較して、Telecom ベンチマークで 37% から 85% に向上、エージェントコーディングで 3% から 25% に向上。
  • 48 言語対応、W4A4 量子化により 2 台の H100 または 1 台の B200 で動作可能。トークン速度が最大 63% 向上、レイテンシが 17% 削減。
  • Hugging Face および Model Vault で入手可能。低ビット量子化と投機的復号による効率的なデプロイをサポート。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。