推出GLM 5.2 Fast
我們推出了一個新的模型API服務層級——GLM-5.2 Fast,專為實時代理工作負載優化,提供與標準GLM-5.2相同的權重,但基礎設施針對每用户吞吐量進行了調整,以實現低延遲和穩定的性能。
新聞
推出GLM 5.2 Fast
我們推出全新Fast模型API層級。
作者
Abu Qader
Philip Kiely
Alina Weinstein
最後更新
2026年7月23日
分享
今天,我們推出GLM-5.2 Fast:一個獨立的模型API層級,提供與標準GLM-5.2相同的權重,但基礎設施針對實時應用的每用户吞吐量進行了調優。端點地址為zai-org/GLM-5.2-Fast。
為什麼代理工作負載需要不同的層級
當GLM-5.2發佈時,它在編碼和工具使用方面的能力已足夠強大,以至於團隊開始將實時代理工作負載遷移到該模型上。
代理工作流是系統化的:主代理規劃工作,將其分解為較小的任務,將這些任務委派給專門的子代理,審查它們的輸出,運行工具或代碼,然後將結果合併到最終答案或工件中。每一次交接都會產生另一個推理循環、另一次推理調用,以及另一個可能累積延遲的地方。隨着這些系統承擔越來越重要的工作,速度變得更為關鍵,因為它決定了整個工作流能否保持動力。
GLM-5.2 Fast改變了這一工作流,因為它是一個開放模型,我們信任它作為主代理,而不僅僅是用於其周圍的子代理。它足夠智能以協調工作流,足夠經濟以擴展到多個子代理,並且足夠快速以保持整個系統的競爭力。
GLM-5.2 Fast通過更嚴格的性能保障保留易用性
GLM 5.2 Fast提供與標準GLM-5.2相同的權重,但基礎設施針對實時代理使用場景進行了不同配置。它提供:
易用性:模型API就是您代碼所指向的OpenAI兼容API端點。無需管理基礎設施,只需按使用付費(每100萬tokens)。
更嚴格的性能SLA:我們的Fast層級旨在處理最多變、最突發的工作負載,同時保持吞吐量和延遲指標的低方差。
從標準GLM-5.2切換
因為Fast只是一個模型名稱,切換隻需一行更改:
導入操作系統模塊 從openai導入OpenAI
客户端 = OpenAI( api_key=os.environ["BASETEN_API_KEY"], base_url="", )
響應 = 客户端.chat.completions.create( model="zai-org/GLM-5.2-Fast", messages=[{"role": "user", "content": "將此函數重構為異步。"}], stream=True, )
您可以將Fast與標準GLM-5.2並行運行,根據工作負載路由——代理循環到Fast,批量摘要到標準——並在控制面板中分別查看每個層級的使用情況。大多數實際部署混合了延遲敏感和延遲容忍的流量;將每種流量路由到其所需的層級可以經濟高效地運行。
開始使用
啓動時完全開放訪問。客户可直接通過UI或客户團隊訪問。切換隻需更改一行模型名稱。您可以從此處開始使用。
訂閲我們的新聞通訊
實時瞭解模型性能、推理基礎設施等最新信息。