本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

GLM 5.2 Fast が Fireworks で利用可能に

記事の要約

GLM 5.2 Fast が Fireworks でリリースされ、Opus レベルの知能をオープンソース価格で提供します。契約不要でトークン単位の課金です。1M トークンのコンテキストウィンドウ、積極的なプロンプトキャッシュ、構造化出力をサポートし、共有サーバーレスで標準パスの2〜3倍の速度を実現します。Fireworks は 446 tok/sec を達成し、MoE とスパースアテンションのアーキテクチャを最適化しました。

GLM 5.2 Fast が Fireworks で利用可能に
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

GLM 5.2 Fast が Fireworks で正式に利用可能になりました。Opus レベルの知能をオープンソース価格で提供し、契約は不要でトークン単位の課金です。このモデルはエージェントループ向けに最適化されており、共有サーバーレスインフラ上で動作し、GPU の予約は不要で、標準パスよりも2〜3倍高速です。

Fireworks では、GLM 5.2 は完全な 1M トークンコンテキストウィンドウ、高い適応型レート制限(事前コミットメントなし)、および積極的なプロンプトキャッシュ価格設定(100万キャッシュ入力トークンあたり$0.14)をサポートしています。また、OpenAI および Anthropic 互換の API を備え、輻輳時に信頼性を高めるサーバーレス優先モードも選択可能です。プロンプトキャッシュは単なる割引ではなく、長いコンテキストのエージェントを実用的にするための鍵です。エージェントは多数のターンにわたって同じ大きなプレフィックスを再利用し、Fireworks はマルチティアキャッシュを通じてそのプレフィックスを再利用可能に保ち、繰り返しコンテキストのコストを低減します。

Fireworks は GLM 5.2 のアーキテクチャを深く最適化し、Mixture-of-Experts(MoE)とスパースアテンション(MLA)の2つのサブ問題に分割して扱っています。MoE 側では、ワークロードに応じてシャーディング戦略をバランスさせ、通信オーバーヘッドと負荷の不均衡を最小化しました。アテンション側では、GLM 5.2 は DeepSeek のスパースアテンションを採用し、IndexShare メカニズムを追加することで、インデクサーがレイヤーのグループにサービスを提供し、主要なアテンションの計算を固定数の先行トークンに制限し、長いシーケンスの計算複雑性を低減しています。

速度と品質の両立を確実にするため、Fireworks は GLM 5.2 に調整された投機的デコード、低精度推論(品質評価が合格した場合のみ使用)、およびプリフィルとデコードの分離を採用しています。構造化出力に関しては、Fast パスは JSON スキーマモード、完全な BNF 文法モード、およびツール呼び出しをサポートし、標準パスと同じ品質評価基準を維持しています。

GLM 5.2 Fast は SWE-bench Verified で77.8%の精度を達成し、トークンコストはクローズドモデルの数分の一です。ユーザーはモデル ID を変更するだけで標準パスから Fast パスに切り替えることができ、GPU の予約や専用デプロイメントの管理は不要です。Fireworks は開発者が GLM 5.2 Fast を使ってすぐに構築を始めることを推奨しています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • GLM 5.2 Fast は標準より2〜3倍高速で、1M トークンコンテキストとプロンプトキャッシュ(100万キャッシュ入力トークンあたり$0.14)を提供。
  • Fireworks は MoE とスパースアテンションを別々に最適化し、並列性とメモリ効率を向上。
  • 構造化出力、ツール呼び出しをサポートし、SWE-bench Verified で77.8%を達成。
  • GPU の予約は不要で、モデル ID を変更するだけで切り替え可能。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。