ニュース
GLM 5.2 Fastのご紹介
新しいFastモデルAPI階層のご紹介です。
著者
Abu Qader
Philip Kiely
Alina Weinstein
最終更新日
2026年7月23日
共有
本日、GLM-5.2 Fastを発表します。これは、標準のGLM-5.2と同じ重みを提供しながら、リアルタイムアプリケーション向けにユーザーあたりのスループットを最適化したインフラ上で動作する独立したモデルAPI階層です。エンドポイントはzai-org/GLM-5.2-Fastです。
エージェントワークロードに異なる階層が必要な理由
GLM-5.2がリリースされたとき、コーディングやツール使用において十分な性能を持っていたため、チームはリアルタイムのエージェントワークロードを同モデルに移行し始めました。
エージェントワークフローはシステム的です。メインエージェントが作業を計画し、小さなタスクに分割し、それらのタスクを専門のサブエージェントに委任し、その出力をレビューし、ツールやコードを実行し、結果を最終的な回答や成果物に統合します。各ハンドオフは新たな推論ループ、新たな推論呼び出し、そしてレイテンシが累積する別のポイントを生み出します。これらのシステムがより重要な作業を担うにつれて、速度はますます重要になります。なぜなら、ワークフロー全体の勢いを維持できるかどうかを左右するからです。
GLM-5.2 Fastはこのワークフローを変革します。なぜなら、それはサブエージェントのためだけでなく、メインエージェントとして信頼できるオープンモデルだからです。ワークフローを調整するのに十分な知能、サブエージェント間でスケールするのに十分なコスト効率、そしてシステム全体を競争力のある状態に保つのに十分な速度を備えています。
GLM-5.2 Fastは、より厳格なパフォーマンスガードレールにより使いやすさを維持
GLM 5.2 Fastは、標準のGLM-5.2と同じ重みを提供し、インフラがリアルタイムエージェントユースケース向けに異なる構成でプロビジョニングされています。以下を提供します:
使いやすさ:モデルAPIは、コードが指すOpenAI互換のAPIエンドポイントにすぎません。管理すべきインフラはなく、使用した分だけ支払います(100万トークンあたり)。
より厳格なパフォーマンスSLA:Fast階層は、最も変動が大きくバースト的なワークロードでも、スループットとレイテンシの指標のばらつきを小さく保つように設計されています。
標準のGLM-5.2からの切り替え
Fastは単なるモデルスラッグであるため、切り替えは1行の変更で済みます:
import os from openai import OpenAI
client = OpenAI( api_key=os.environ["BASETEN_API_KEY"], base_url="", )
response = client.chat.completions.create( model="zai-org/GLM-5.2-Fast", messages=[{"role": "user", "content": "この関数を非同期にリファクタリングしてください。"}], stream=True, )
Fastを標準のGLM-5.2と並行して実行し、ワークロードに応じてルーティング(エージェントループはFastに、バッチ要約は標準に)でき、各階層の使用量をダッシュボードで個別に確認できます。ほとんどの実際のデプロイメントでは、レイテンシに敏感なトラフィックと許容度の高いトラフィックが混在しています。それぞれを必要な階層にルーティングすることで、コスト効率よく運用できます。
はじめに
ローンチ時点で完全にオープンアクセスです。お客様はUIまたはアカウントチームを通じて直接アクセスできます。切り替えはモデルスラッグの1行変更です。こちらから使い始められます。
ニュースレターを購読
モデルのパフォーマンス、推論インフラなどの最新情報をお届けします。