AI News HubLIVE
站內改寫2 分鐘閱讀

Thinking Machines Lab 釋出 Inkling-Small:276B 總引數、12B 啟用的開源多模態 MoE 模型

Thinking Machines Lab 釋出開源權重 MoE 模型 Inkling-Small,總引數 276B、啟用引數僅 12B,約為旗艦模型 Inkling 的四分之一。原生支援文本、影像和音訊輸入,上下文視窗達 100 萬 token。NVFP4 量化檢查點只需 180GB 視訊記憶體,可在單塊 NVIDIA B300 上執行。該模型在多項推理與編碼基準上超越更大的 Inkling,但事實效能力有所回退。

來源MarkTechPost作者: Asif Razzaq

Thinking Machines Lab 正式釋出 Inkling-Small,這是其開放權重混合專家(MoE)模型。模型總引數量 276B,每次推理只啟用 12B 引數,體量約為旗艦模型 Inkling(975B 總引數、41B 啟用引數)的四分之一。Inkling-Small 在 NVIDIA GB300 NVL72 系統上完成訓練,原生支援文本、影像和音訊輸入,上下文視窗高達 100 萬 token,並允許使用者調整思考深度。模型權重以 Apache 2.0 許可證在 Hugging Face 上開放下載。

部署方面,量化版本顯著降低硬體門檻。根據模型卡,BF16 檢查點至少需要 600GB 聚合視訊記憶體,相當於 4 塊 NVIDIA B300 或 8 塊 H200;而 NVFP4 檢查點只需 180GB,可在單塊 B300(SM100+)上以 W4A4 執行,或在兩塊 H200 上以 W4A16 執行。支援的推理引擎包括 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face。這意味著一家初創公司租用單塊 B300 即可自託管,中型企業也可複用現有 H200 容量,金融、醫療、保險、電信和公共部門等受監管行業則可獲得私有權重方案。典型場景包括編碼智慧體、終端自動化、文件與圖表理解;音訊能力還延伸至呼叫中心分析、語音介面與會議紀要。

架構上,Inkling-Small 是一個 42 層 decoder-only Transformer,採用稀疏 MoE 前饋網路;每個 token 從 256 個專家中路由到 6 個,並始終啟用 2 個共享專家。注意力層混合區域性與全域性模式,整體無編碼器。影像被分割為 40×40 畫素的 patch,經過四層 hMLP 變換;音訊以 dMel 聲譜圖表示;二者透過輕量嵌入層與文本 token 聯合處理。數值精度支援 BF16、MXFP8 和 NVFP4,音訊輸入為 16kHz WAV,建議不超過兩分鐘,輸出僅限文本。

訓練過程上,Inkling-Small 在更大的 Inkling 之後啟動,使團隊可以修訂預訓練資料混合和機器學習方案。研究者先以 Inkling 為教師,透過線上策略蒸餾對早期檢查點 Inkling-Small (preview) 進行後訓練,再在此基礎上繼續擴充套件智慧體編碼的強化學習,持續兩週。

基準測試顯示,較小的模型在推理和智慧體編碼上超過了教師模型:HLE(純文本)31.6% vs 29.7%,SWE-bench Verified 80.2% vs 77.6%(bash-only harness),Terminal-Bench 2.1 最好成績 64.7%,Toolathlon Verified 54.4% vs 45.5%,GPQA Diamond 89.5%,AIME 2026 95.5%,IFBench 82.2%,ARC-AGI-2 從 36.5% 升至 40.1%。然而事實性記憶明顯回退:SimpleQA Verified 從 Inkling 的 43.9% 降至 20.6%,AA Omniscience 指數從 2.1 降至 -9.0,Tau 3 Banking 從 23.7% 降至 15.5%。所有評估在 effort 0.99、溫度 1.0 下進行,編碼評估使用 256K max-token 軌跡限制;外部分數來自 Artificial Analysis、Scale AI 和 ARC Prize。

多模態方面,Inkling-Small 以更低成本接近 Inkling:MMMU Pro 74.0%,CharXiv RQ 77.4%(用 Python 程式設計裁剪、縮放和檢查圖表時升至 81.3%),Audio MC 54.9%,MMAU 77.0%,VoiceBench 90.1%。認識論方面,團隊使用真實世界預測問題的大規模語料,透過針對適當評分規則的強化學習訓練校準;無搜尋 ForecastBench 的 Brier Index 為 61.3±0.46,優於 Inkling 的 60.1±0.54。安全評測上,StrongREJECT 為 98.4%,FORTRESS 對抗性 71.6%,FORTRESS 良性 96.9%。Thinking Machines Lab 認為該模型相對現有開放權重生態沒有顯著風險提升,但建議在面向消費者的部署中疊加 Llama Guard 等下游稽核。目前兩個模型都在 Tinker 上提供限時折扣,Tinker Playground 支援文本、影像和音訊對話;官方還發布了互動式直譯器,從稀疏路由、基準排名、多模態融合和硬體需求四個維度展示模型特性。