GLM 5.2 Fast 現已在 Fireworks 上線
GLM 5.2 Fast 在 Fireworks 平臺上線,提供 Opus 級別的智慧和開源價格,無需合同,按 token 付費。該模型專為智慧體迴圈最佳化,支援 1M token 上下文視窗,快速推理速度達 446 tok/sec,並具有主動提示快取和結構化輸出支援。Fireworks 透過最佳化 MoE 和稀疏注意力架構實現了高效能,同時保持質量不變。
GLM 5.2 Fast 現已在 Fireworks 平臺正式上線,提供 Opus 級別的智慧和開源價格,無需合同,按 token 付費。該模型專為智慧體迴圈最佳化,在共享無伺服器基礎設施上執行,無需預留 GPU,速度比標準路徑快 2-3 倍。
在 Fireworks 上,GLM 5.2 支援完整的 1M token 上下文視窗,具有高自適應速率限制且無需預先承諾,並提供積極的提示快取定價——每 1M 快取輸入 token 僅需 $0.14。它還相容 OpenAI 和 Anthropic 的 API,並可選擇無伺服器優先模式以增強擁塞時的可靠性。提示快取不僅是一種折扣,更是使長上下文智慧體變得實用的關鍵。智慧體在多次互動中重複使用相同的大型字首,而 Fireworks 透過多層快取保持該字首可重用,從而降低重複上下文的成本。
Fireworks 對 GLM 5.2 的架構進行了深度最佳化,將其視為混合了專家混合(MoE)和稀疏注意力(MLA)兩個子問題的模型。對於 MoE 側,Fireworks 針對不同工作負載平衡了分片策略,以最小化通訊開銷和負載不均。對於注意力側,GLM 5.2 使用了 DeepSeek 的稀疏注意力,並增加了 IndexShare 機制,使索引器可以為一組層服務,將主要注意力的計算限制在固定數量的先前 token 上,從而降低長序列的計算複雜度。
為了確保速度與質量並存,Fireworks 使用了針對 GLM 5.2 調整的推測解碼、低精度推理(僅在質量評估透過時),並分離了預填充和解碼階段。在結構化輸出方面,Fast 路徑支援 JSON 模式、完整 BNF 語法模式和工具呼叫,且與標準路徑保持相同的質量評估標準。
GLM 5.2 Fast 在 SWE-bench Verified 上達到了 77.8% 的準確率,而 token 成本僅為閉源模型的一小部分。使用者只需更改模型 ID 即可從標準路徑切換到 Fast 路徑,無需預留 GPU 或管理專用部署。Fireworks 鼓勵開發者立即開始使用 GLM 5.2 Fast 構建應用。