跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

Thinking Machines 的 Inkling 現已在 Modal 上可用

文章摘要

Thinking Machines 發佈了通用多模態模型 Inkling,支持文本、圖像和音頻輸入並生成文本輸出,現可通過 Modal 託管端點使用,採用基於令牌的定價。文章還討論了其獨特的局部注意力架構和 DFlash 推測解碼技術的優勢。

Thinking Machines 的 Inkling 現已在 Modal 上可用
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

2026年7月15日,Thinking Machines 正式發佈了其通用多模態模型 Inkling。該模型接受文本、圖像和音頻輸入,並生成文本輸出,總參數量達 9750 億,其中活躍參數為 410 億。Inkling 採用了混合專家(Mixture-of-Experts)架構和 100 萬個令牌的上下文窗口,從設計之初就注重廣度而非深度,使其成為進一步微調的優秀基座模型。

Inkling 的獨特之處在於其局部注意力佈局。在每六個注意力層中,有五層使用滑動窗口注意力,僅關注最近的令牌,而一層使用全局注意力關注整個序列。這種設計將計算資源集中在最近的令牌上,顯著提升了效率。Modal 在第一天就提供了對 Inkling 的託管端點支持,並集成了針對該模型定製的 DFlash 推測器。在 8 塊 B200 GPU 上運行代理工作負載時,每個用户每秒可生成 250 個令牌,每 GPU 吞吐量達到 250 萬令牌/分鐘,交互速度比模型內置的推測路徑快 67%。

DFlash 是由 Z Lab 開發的推測解碼技術,其核心是塊擴散起草器(block diffusion drafter),能夠在一次並行前向傳遞中生成整個令牌塊,條件依賴於目標模型的特徵。相比之下,大多數開源模型使用的多令牌預測(MTP)頭一次只能起草一個令牌,隨着步驟增加性能會觸及瓶頸。Modal 團隊進一步優化了 DFlash:所有起草器層均使用滑動窗口注意力,無需全局注意力,因為起草過程主要依賴最近令牌;同時將層從非因果改為因果,以便在推理時利用高度優化的注意力內核(如 trtllm)。

Modal 認為,塊擴散起草是一種面向未來的推測架構,其成本隨塊大小增長保持平穩,且架構能夠像目標模型一樣快速削減計算開銷。Inkling 現已通過 Modal Auto Endpoints 以兼容 OpenAI 的共享端點形式提供,採用基於令牌的定價。用户可以立即嘗試,並提供反饋。

展開要點與分析

文章情報

工程師進階

要點

  • Thinking Machines 發佈 Inkling,一個 975B 總參數(41B 活躍)的多模態專家混合模型,支持 1M 令牌上下文窗口。
  • Inkling 採用局部注意力佈局,每六層中有五層使用滑動窗口注意力,提高計算效率。
  • Modal 提供對 Inkling 的託管端點支持,並集成了自定義 DFlash 推測器,實現了每用户每秒 250 令牌的吞吐量。
  • DFlash 推測技術使用塊擴散生成器並行生成整個令牌塊,比傳統的多令牌預測頭更快。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。