GLM 5.2 Fast が Fireworks で正式に利用可能になりました。Opus レベルの知能をオープンソース価格で提供し、契約は不要でトークン単位の課金です。このモデルはエージェントループ向けに最適化されており、共有サーバーレスインフラ上で動作し、GPU の予約は不要で、標準パスよりも2〜3倍高速です。
Fireworks では、GLM 5.2 は完全な 1M トークンコンテキストウィンドウ、高い適応型レート制限(事前コミットメントなし)、および積極的なプロンプトキャッシュ価格設定(100万キャッシュ入力トークンあたり$0.14)をサポートしています。また、OpenAI および Anthropic 互換の API を備え、輻輳時に信頼性を高めるサーバーレス優先モードも選択可能です。プロンプトキャッシュは単なる割引ではなく、長いコンテキストのエージェントを実用的にするための鍵です。エージェントは多数のターンにわたって同じ大きなプレフィックスを再利用し、Fireworks はマルチティアキャッシュを通じてそのプレフィックスを再利用可能に保ち、繰り返しコンテキストのコストを低減します。
Fireworks は GLM 5.2 のアーキテクチャを深く最適化し、Mixture-of-Experts(MoE)とスパースアテンション(MLA)の2つのサブ問題に分割して扱っています。MoE 側では、ワークロードに応じてシャーディング戦略をバランスさせ、通信オーバーヘッドと負荷の不均衡を最小化しました。アテンション側では、GLM 5.2 は DeepSeek のスパースアテンションを採用し、IndexShare メカニズムを追加することで、インデクサーがレイヤーのグループにサービスを提供し、主要なアテンションの計算を固定数の先行トークンに制限し、長いシーケンスの計算複雑性を低減しています。
速度と品質の両立を確実にするため、Fireworks は GLM 5.2 に調整された投機的デコード、低精度推論(品質評価が合格した場合のみ使用)、およびプリフィルとデコードの分離を採用しています。構造化出力に関しては、Fast パスは JSON スキーマモード、完全な BNF 文法モード、およびツール呼び出しをサポートし、標準パスと同じ品質評価基準を維持しています。
GLM 5.2 Fast は SWE-bench Verified で77.8%の精度を達成し、トークンコストはクローズドモデルの数分の一です。ユーザーはモデル ID を変更するだけで標準パスから Fast パスに切り替えることができ、GPU の予約や専用デプロイメントの管理は不要です。Fireworks は開発者が GLM 5.2 Fast を使ってすぐに構築を始めることを推奨しています。