本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

GLM 5.2 Fastのご紹介

記事の要約

リアルタイムのエージェントワークロード向けに最適化された新しいモデルAPI階層、GLM-5.2 Fastを発表します。標準のGLM-5.2と同じ重みを持ちながら、ユーザーあたりのスループットに調整されたインフラ上で動作し、低レイテンシと安定したパフォーマンスを提供します。

ソースBaseten Blog
GLM 5.2 Fastのご紹介
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

ニュース

GLM 5.2 Fastのご紹介

新しいFastモデルAPI階層のご紹介です。

著者

Abu Qader

Philip Kiely

Alina Weinstein

最終更新日

2026年7月23日

共有

本日、GLM-5.2 Fastを発表します。これは、標準のGLM-5.2と同じ重みを提供しながら、リアルタイムアプリケーション向けにユーザーあたりのスループットを最適化したインフラ上で動作する独立したモデルAPI階層です。エンドポイントはzai-org/GLM-5.2-Fastです。

エージェントワークロードに異なる階層が必要な理由

GLM-5.2がリリースされたとき、コーディングやツール使用において十分な性能を持っていたため、チームはリアルタイムのエージェントワークロードを同モデルに移行し始めました。

エージェントワークフローはシステム的です。メインエージェントが作業を計画し、小さなタスクに分割し、それらのタスクを専門のサブエージェントに委任し、その出力をレビューし、ツールやコードを実行し、結果を最終的な回答や成果物に統合します。各ハンドオフは新たな推論ループ、新たな推論呼び出し、そしてレイテンシが累積する別のポイントを生み出します。これらのシステムがより重要な作業を担うにつれて、速度はますます重要になります。なぜなら、ワークフロー全体の勢いを維持できるかどうかを左右するからです。

GLM-5.2 Fastはこのワークフローを変革します。なぜなら、それはサブエージェントのためだけでなく、メインエージェントとして信頼できるオープンモデルだからです。ワークフローを調整するのに十分な知能、サブエージェント間でスケールするのに十分なコスト効率、そしてシステム全体を競争力のある状態に保つのに十分な速度を備えています。

GLM-5.2 Fastは、より厳格なパフォーマンスガードレールにより使いやすさを維持

GLM 5.2 Fastは、標準のGLM-5.2と同じ重みを提供し、インフラがリアルタイムエージェントユースケース向けに異なる構成でプロビジョニングされています。以下を提供します:

使いやすさ:モデルAPIは、コードが指すOpenAI互換のAPIエンドポイントにすぎません。管理すべきインフラはなく、使用した分だけ支払います(100万トークンあたり)。

より厳格なパフォーマンスSLA:Fast階層は、最も変動が大きくバースト的なワークロードでも、スループットとレイテンシの指標のばらつきを小さく保つように設計されています。

標準のGLM-5.2からの切り替え

Fastは単なるモデルスラッグであるため、切り替えは1行の変更で済みます:

import os from openai import OpenAI

client = OpenAI( api_key=os.environ["BASETEN_API_KEY"], base_url="", )

response = client.chat.completions.create( model="zai-org/GLM-5.2-Fast", messages=[{"role": "user", "content": "この関数を非同期にリファクタリングしてください。"}], stream=True, )

Fastを標準のGLM-5.2と並行して実行し、ワークロードに応じてルーティング(エージェントループはFastに、バッチ要約は標準に)でき、各階層の使用量をダッシュボードで個別に確認できます。ほとんどの実際のデプロイメントでは、レイテンシに敏感なトラフィックと許容度の高いトラフィックが混在しています。それぞれを必要な階層にルーティングすることで、コスト効率よく運用できます。

はじめに

ローンチ時点で完全にオープンアクセスです。お客様はUIまたはアカウントチームを通じて直接アクセスできます。切り替えはモデルスラッグの1行変更です。こちらから使い始められます。

ニュースレターを購読

モデルのパフォーマンス、推論インフラなどの最新情報をお届けします。

要点と分析を開く

記事インテリジェンス

エンジニア中級

要点

  • GLM-5.2 Fastは、標準のGLM-5.2と同じ重みを持つ独立したモデルAPI階層であり、インフラがリアルタイムアプリケーション向けに最適化されています。
  • エージェントワークフローでメインエージェントとしてサブタスクを調整し、レイテンシの累積を低減します。
  • より厳格なパフォーマンスSLAを提供し、バースト的なワークロードもサポート。切り替えはモデルスラッグの1行変更のみです。
  • 完全オープンアクセスで、標準のGLM-5.2と併用でき、ワークロードに応じてルーティング可能です。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。