AI News HubLIVE
站内改写1 分钟阅读

GLM 5.2 Fast 现已在 Fireworks 上线

GLM 5.2 Fast 在 Fireworks 平台上线,提供 Opus 级别的智能和开源价格,无需合同,按 token 付费。该模型专为智能体循环优化,支持 1M token 上下文窗口,快速推理速度达 446 tok/sec,并具有主动提示缓存和结构化输出支持。Fireworks 通过优化 MoE 和稀疏注意力架构实现了高性能,同时保持质量不变。

GLM 5.2 Fast 现已在 Fireworks 平台正式上线,提供 Opus 级别的智能和开源价格,无需合同,按 token 付费。该模型专为智能体循环优化,在共享无服务器基础设施上运行,无需预留 GPU,速度比标准路径快 2-3 倍。

在 Fireworks 上,GLM 5.2 支持完整的 1M token 上下文窗口,具有高自适应速率限制且无需预先承诺,并提供积极的提示缓存定价——每 1M 缓存输入 token 仅需 $0.14。它还兼容 OpenAI 和 Anthropic 的 API,并可选择无服务器优先模式以增强拥塞时的可靠性。提示缓存不仅是一种折扣,更是使长上下文智能体变得实用的关键。智能体在多次交互中重复使用相同的大型前缀,而 Fireworks 通过多层缓存保持该前缀可重用,从而降低重复上下文的成本。

Fireworks 对 GLM 5.2 的架构进行了深度优化,将其视为混合了专家混合(MoE)和稀疏注意力(MLA)两个子问题的模型。对于 MoE 侧,Fireworks 针对不同工作负载平衡了分片策略,以最小化通信开销和负载不均。对于注意力侧,GLM 5.2 使用了 DeepSeek 的稀疏注意力,并增加了 IndexShare 机制,使索引器可以为一组层服务,将主要注意力的计算限制在固定数量的先前 token 上,从而降低长序列的计算复杂度。

为了确保速度与质量并存,Fireworks 使用了针对 GLM 5.2 调整的推测解码、低精度推理(仅在质量评估通过时),并分离了预填充和解码阶段。在结构化输出方面,Fast 路径支持 JSON 模式、完整 BNF 语法模式和工具调用,且与标准路径保持相同的质量评估标准。

GLM 5.2 Fast 在 SWE-bench Verified 上达到了 77.8% 的准确率,而 token 成本仅为闭源模型的一小部分。用户只需更改模型 ID 即可从标准路径切换到 Fast 路径,无需预留 GPU 或管理专用部署。Fireworks 鼓励开发者立即开始使用 GLM 5.2 Fast 构建应用。