跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

歡迎Inkling:Thinking Machines的多模態大模型

文章摘要

Thinking Machines發佈了Inkling,一個擁有約1萬億參數的開源多模態模型,支持圖像、文本和音頻輸入,可處理高達100萬token的上下文。該模型採用混合專家架構,僅激活410億參數,並配有相對注意力和短卷積等創新設計。Inkling已在Hugging Face上發佈,並得到transformers、SGLang和llama.cpp的即日支持。

歡迎Inkling:Thinking Machines的多模態大模型
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Thinking Machines於2026年7月15日正式發佈了Inkling,這是一個具有里程碑意義的開源多模態大模型。Inkling擁有約1萬億參數,是首批能夠原生處理圖像、文本和音頻輸入的大型開放模型之一,其上下文窗口高達100萬token,能夠處理極長序列。該模型在包含文本、圖像、音頻和視頻在內的45萬億token數據上進行了訓練,專注於跨模態推理,並旨在通過微調實現領域適應。

Inkling的架構基於解碼器-only的混合專家(MoE)模型,總參數為9750億,但每次推理僅激活410億參數。這種稀疏門控機制包含256個專家,每次選擇6個路由專家加上2個共享專家,從而實現高效的推理。在注意力機制方面,Inkling採用了相對注意力,直接學習位置信息,而非使用傳統的旋轉位置編碼(RoPE)。此外,模型採用了混合注意力模式,將全局注意力和滑動窗口注意力按1:5的比例交替排列,結合了全局上下文和局部效率的優勢。短1D卷積(SConv)的引入進一步增強了局部表示能力,使注意力模塊能夠專注於全局關係。

對於多模態輸入,Inkling使用簡潔的層次化MLP補丁器處理圖像,通過逐步合併像素生成每個補丁的嵌入。音頻處理則採用離散化梅爾頻譜圖,將100毫秒的音頻塊轉換為梅爾刻度並分類到精確的梅爾頻段中。這些多模態塔設計簡單,無需獨立的編碼器,與許多采用分離編碼器的模型形成對比。

在推理支持方面,Inkling在Hugging Face上以BF16和NVFP4兩種精度發佈。BF16檢查點需要2TB顯存,而NVFP4版本僅需600GB,後者在Blackwell GPU上運行。用户可以通過transformers的any-to-any pipeline、SGLang和vLLM等工具進行推理。transformers 5.14.0版本提供了即日支持,並支持多種推理努力級別(從“none”到“max”)。對於本地部署,llama.cpp和Unsloth提供了量化版本,其中Unsloth將模型量化至1位精度,相比原始模型減少了95%的顯存消耗。此外,通過Hugging Face的推理提供商,用户可以使用OpenAI兼容的API遠程訪問模型,但音頻支持仍在開發中。

Inkling的發佈標誌着開放多模態模型領域的一個重要進展。其龐大的參數規模和創新的架構設計,為開發新一代多模態推理應用提供了強大的基礎。無論是研究人員還是開發者,都可以通過微調該模型來適應特定領域任務。Thinking Machines團隊已利用該模型構建了多個演示,對其潛力充滿信心。

展開要點與分析

文章情報

工程師進階

要點

  • Inkling是首個約1萬億參數的開源模型,原生支持圖像、文本和音頻輸入,上下文窗口達100萬token。
  • 採用混合專家架構,總參數9750億,但僅激活410億,實現高效推理。
  • 創新設計包括相對注意力、混合注意力和短1D卷積。
  • 在Hugging Face上提供BF16和NVFP4量化版本,並支持多種推理引擎。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。