AI News HubLIVE
サイト内リライト3 分で読了

Alibabaの新モデル、ノートPCでOpus 4.6レベルの性能を実現か

Alibabaは2.4兆パラメータのQwen3.8に加え、Apache 2.0ライセンスで270億パラメータの高密度モデルQwen3.8-27Bを公開。ローカルで実行でき、ベンチマークではAnthropicのOpus 4.6 Maxと同等以上の性能を示す。ビジョン機能も備え、注目に値する。

ソースThe New Stack AI著者: Frederic Lardinois

Alibabaは最近、2.4兆パラメータのQwen3.8モデルのオープンウェイトを公開しました。これは巨大なモデルであり、そのベンチマークは米国の実験室によるクローズドなフロンティアモデルと直接競合するものです。しかし、さらに興味深いのは、金曜日にAlibabaがApache 2.0ライセンスでQwen 3.8の高密度270億パラメータ版も公開したことです。

つまり、このモデルはスペックの高いMacBook ProやMac Studioでローカルに実行できます。しかも、それには価値があるかもしれません。Alibabaのベンチマークによれば、このモデルの性能はAnthropicのOpus 4.6をMax設定で実行した場合と同水準だからです。多くのベンチマークでは、Anthropicの以前のフラッグシップモデルをも上回っており、特にコンピュータ使用、コーディング、ナレッジワークのテストで顕著です。そのモデルは2月にリリースされた当時、最先端でした。

さらに、このモデルはビデオを含むビジョン機能も備えているため、ローカル利用にとって魅力的な選択肢となります(ハードウェアが対応している場合)。

ただし、いつものように、ベンチマークは実際の性能を測るものではない可能性があります。エージェント的なユースケースでは、実行環境がモデル自体と同じくらい重要です。初期の報告によれば、このモデルは考えすぎる傾向があるとのことです。また、Alibabaのベンチマークは、ローカルユーザーが通常使う量子化バージョンではなく、元のチェックポイントに基づいている可能性があります。量子化によりコンシューマーハードウェアでの実行が可能になりますが、品質とのトレードオフは常に存在します。

それでも、ローカルで実行できるモデルとしては、印象的な結果です。

Alibabaは、このモデルが前世代のQwen 3.7-Plusを特にコーディングとナレッジワークで大幅に上回っていると述べています。いくつかの性能向上は驚くべきもので、DeepSWEエージェントコーディングベンチマークでは14.2ポイントから42.2ポイントに跳ね上がりました。これはまだ現在のフロンティア(新しくリリースされたGLM-5.3などの他のオープンモデル)には及びませんが、Googleの中級モデルGemini 3.6 Flashでもこのテストで49%にしか達しておらず、そのモデルをノートPCで実行することは当面不可能です。

Alibabaはまた、最近リリースされた同規模のローカルモデルであるMetaのMuse Glimmer-30Bとも比較しています。Qwen3.8-27Bは、Alibabaが両モデルのスコアを報告しているすべてのテストでリードしています。どうやら「Glimmer」という名前は正しかったようです。

Qwen 3.8 27Bをローカルで実行するために必要なハードウェアについて、速度も当然問題になります。現時点では、Alibabaはより小型のQwen3.8 27B混合専門家モデルをリリースしていません。そのようなモデルはトークンごとにパラメータを少なく活性化でき、高密度の27Bリリースよりも高速に動作します。たとえば、Qwen 3.6-35Bではそのような構成を取っていました。量子化されていないQwen3.8-27Bリポジトリは55.6GBで、推論ランタイムとコンテキストキャッシュを考慮していません。これはほとんどの人が実行する形態ではありません。

Macユーザーにとっての良いニュースは、Apple Silicon向けのコミュニティ作成のMLX変換が既に利用可能であることです。4ビット版は約16.1GB、8ビット版は29.5GBです。つまり、32GBユニファイドメモリのMacで、中程度のコンテキスト長なら4ビット版を実行するのに適しています。48GBや64GBがあれば、より高精度またはより長いプロンプト用にかなり余裕が生まれます。

デフォルトでは、このモデルは262,000トークンのコンテキストをサポートし、YaRNメソッドを使用して100万トークンに拡張できます(Alibabaはホスト型本番バージョンで拡張する予定です)。しかし、デスクトップでその全コンテキストウィンドウを利用できるわけではありません。プロンプトが大きくなるとキーバリューキャッシュがより多くのメモリを消費するためです。