2026年7月15日,Thinking Machines 正式釋出了其通用多模態模型 Inkling。該模型接受文本、影像和音訊輸入,並生成文本輸出,總引數量達 9750 億,其中活躍引數為 410 億。Inkling 採用了混合專家(Mixture-of-Experts)架構和 100 萬個令牌的上下文視窗,從設計之初就注重廣度而非深度,使其成為進一步微調的優秀基座模型。
Inkling 的獨特之處在於其區域性注意力佈局。在每六個注意力層中,有五層使用滑動視窗注意力,僅關注最近的令牌,而一層使用全域性注意力關注整個序列。這種設計將計算資源集中在最近的令牌上,顯著提升了效率。Modal 在第一天就提供了對 Inkling 的託管端點支援,並整合了針對該模型定製的 DFlash 推測器。在 8 塊 B200 GPU 上執行代理工作負載時,每個使用者每秒可生成 250 個令牌,每 GPU 吞吐量達到 250 萬令牌/分鐘,互動速度比模型內建的推測路徑快 67%。
DFlash 是由 Z Lab 開發的推測解碼技術,其核心是塊擴散起草器(block diffusion drafter),能夠在一次並行前向傳遞中生成整個令牌塊,條件依賴於目標模型的特徵。相比之下,大多數開源模型使用的多令牌預測(MTP)頭一次只能起草一個令牌,隨著步驟增加效能會觸及瓶頸。Modal 團隊進一步最佳化了 DFlash:所有起草器層均使用滑動視窗注意力,無需全域性注意力,因為起草過程主要依賴最近令牌;同時將層從非因果改為因果,以便在推理時利用高度最佳化的注意力核心(如 trtllm)。
Modal 認為,塊擴散起草是一種面向未來的推測架構,其成本隨塊大小增長保持平穩,且架構能夠像目標模型一樣快速削減計算開銷。Inkling 現已透過 Modal Auto Endpoints 以相容 OpenAI 的共享端點形式提供,採用基於令牌的定價。使用者可以立即嘗試,並提供反饋。