推出GLM 5.2 Fast
我们推出了一个新的模型API服务层级——GLM-5.2 Fast,专为实时代理工作负载优化,提供与标准GLM-5.2相同的权重,但基础设施针对每用户吞吐量进行了调整,以实现低延迟和稳定的性能。
新闻
推出GLM 5.2 Fast
我们推出全新Fast模型API层级。
作者
Abu Qader
Philip Kiely
Alina Weinstein
最后更新
2026年7月23日
分享
今天,我们推出GLM-5.2 Fast:一个独立的模型API层级,提供与标准GLM-5.2相同的权重,但基础设施针对实时应用的每用户吞吐量进行了调优。端点地址为zai-org/GLM-5.2-Fast。
为什么代理工作负载需要不同的层级
当GLM-5.2发布时,它在编码和工具使用方面的能力已足够强大,以至于团队开始将实时代理工作负载迁移到该模型上。
代理工作流是系统化的:主代理规划工作,将其分解为较小的任务,将这些任务委派给专门的子代理,审查它们的输出,运行工具或代码,然后将结果合并到最终答案或工件中。每一次交接都会产生另一个推理循环、另一次推理调用,以及另一个可能累积延迟的地方。随着这些系统承担越来越重要的工作,速度变得更为关键,因为它决定了整个工作流能否保持动力。
GLM-5.2 Fast改变了这一工作流,因为它是一个开放模型,我们信任它作为主代理,而不仅仅是用于其周围的子代理。它足够智能以协调工作流,足够经济以扩展到多个子代理,并且足够快速以保持整个系统的竞争力。
GLM-5.2 Fast通过更严格的性能保障保留易用性
GLM 5.2 Fast提供与标准GLM-5.2相同的权重,但基础设施针对实时代理使用场景进行了不同配置。它提供:
易用性:模型API就是您代码所指向的OpenAI兼容API端点。无需管理基础设施,只需按使用付费(每100万tokens)。
更严格的性能SLA:我们的Fast层级旨在处理最多变、最突发的工作负载,同时保持吞吐量和延迟指标的低方差。
从标准GLM-5.2切换
因为Fast只是一个模型名称,切换只需一行更改:
导入操作系统模块 从openai导入OpenAI
客户端 = OpenAI( api_key=os.environ["BASETEN_API_KEY"], base_url="", )
响应 = 客户端.chat.completions.create( model="zai-org/GLM-5.2-Fast", messages=[{"role": "user", "content": "将此函数重构为异步。"}], stream=True, )
您可以将Fast与标准GLM-5.2并行运行,根据工作负载路由——代理循环到Fast,批量摘要到标准——并在控制面板中分别查看每个层级的使用情况。大多数实际部署混合了延迟敏感和延迟容忍的流量;将每种流量路由到其所需的层级可以经济高效地运行。
开始使用
启动时完全开放访问。客户可直接通过UI或客户团队访问。切换只需更改一行模型名称。您可以从此处开始使用。
订阅我们的新闻通讯
实时了解模型性能、推理基础设施等最新信息。