AI News HubLIVE
站內改寫1 分鐘閱讀

GLM 5.2 Fast 現已在 Fireworks 上線

GLM 5.2 Fast 在 Fireworks 平台上線,提供 Opus 級別的智能和開源價格,無需合同,按 token 付費。該模型專為智能體循環優化,支持 1M token 上下文窗口,快速推理速度達 446 tok/sec,並具有主動提示緩存和結構化輸出支持。Fireworks 通過優化 MoE 和稀疏注意力架構實現了高性能,同時保持質量不變。

GLM 5.2 Fast 現已在 Fireworks 平台正式上線,提供 Opus 級別的智能和開源價格,無需合同,按 token 付費。該模型專為智能體循環優化,在共享無服務器基礎設施上運行,無需預留 GPU,速度比標準路徑快 2-3 倍。

在 Fireworks 上,GLM 5.2 支持完整的 1M token 上下文窗口,具有高自適應速率限制且無需預先承諾,並提供積極的提示緩存定價——每 1M 緩存輸入 token 僅需 $0.14。它還兼容 OpenAI 和 Anthropic 的 API,並可選擇無服務器優先模式以增強擁塞時的可靠性。提示緩存不僅是一種折扣,更是使長上下文智能體變得實用的關鍵。智能體在多次交互中重複使用相同的大型前綴,而 Fireworks 通過多層緩存保持該前綴可重用,從而降低重複上下文的成本。

Fireworks 對 GLM 5.2 的架構進行了深度優化,將其視為混合了專家混合(MoE)和稀疏注意力(MLA)兩個子問題的模型。對於 MoE 側,Fireworks 針對不同工作負載平衡了分片策略,以最小化通信開銷和負載不均。對於注意力側,GLM 5.2 使用了 DeepSeek 的稀疏注意力,並增加了 IndexShare 機制,使索引器可以為一組層服務,將主要注意力的計算限制在固定數量的先前 token 上,從而降低長序列的計算複雜度。

為了確保速度與質量並存,Fireworks 使用了針對 GLM 5.2 調整的推測解碼、低精度推理(僅在質量評估通過時),並分離了預填充和解碼階段。在結構化輸出方面,Fast 路徑支持 JSON 模式、完整 BNF 語法模式和工具調用,且與標準路徑保持相同的質量評估標準。

GLM 5.2 Fast 在 SWE-bench Verified 上達到了 77.8% 的準確率,而 token 成本僅為閉源模型的一小部分。用户只需更改模型 ID 即可從標準路徑切換到 Fast 路徑,無需預留 GPU 或管理專用部署。Fireworks 鼓勵開發者立即開始使用 GLM 5.2 Fast 構建應用。