Thinking Machines Lab 發佈 Inkling-Small:276B 總參數、12B 激活的開源多模態 MoE 模型
Thinking Machines Lab 發佈開源權重 MoE 模型 Inkling-Small,總參數 276B、激活參數僅 12B,約為旗艦模型 Inkling 的四分之一。原生支持文本、圖像和音頻輸入,上下文窗口達 100 萬 token。NVFP4 量化檢查點只需 180GB 顯存,可在單塊 NVIDIA B300 上運行。該模型在多項推理與編碼基準上超越更大的 Inkling,但事實性能力有所回退。
Thinking Machines Lab 正式發佈 Inkling-Small,這是其開放權重混合專家(MoE)模型。模型總參數量 276B,每次推理只激活 12B 參數,體量約為旗艦模型 Inkling(975B 總參數、41B 激活參數)的四分之一。Inkling-Small 在 NVIDIA GB300 NVL72 系統上完成訓練,原生支持文本、圖像和音頻輸入,上下文窗口高達 100 萬 token,並允許用户調整思考深度。模型權重以 Apache 2.0 許可證在 Hugging Face 上開放下載。
部署方面,量化版本顯著降低硬件門檻。根據模型卡,BF16 檢查點至少需要 600GB 聚合顯存,相當於 4 塊 NVIDIA B300 或 8 塊 H200;而 NVFP4 檢查點只需 180GB,可在單塊 B300(SM100+)上以 W4A4 運行,或在兩塊 H200 上以 W4A16 運行。支持的推理引擎包括 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face。這意味着一家初創公司租用單塊 B300 即可自託管,中型企業也可複用現有 H200 容量,金融、醫療、保險、電信和公共部門等受監管行業則可獲得私有權重方案。典型場景包括編碼智能體、終端自動化、文檔與圖表理解;音頻能力還延伸至呼叫中心分析、語音界面與會議紀要。
架構上,Inkling-Small 是一個 42 層 decoder-only Transformer,採用稀疏 MoE 前饋網絡;每個 token 從 256 個專家中路由到 6 個,並始終激活 2 個共享專家。注意力層混合局部與全局模式,整體無編碼器。圖像被分割為 40×40 像素的 patch,經過四層 hMLP 變換;音頻以 dMel 聲譜圖表示;二者通過輕量嵌入層與文本 token 聯合處理。數值精度支持 BF16、MXFP8 和 NVFP4,音頻輸入為 16kHz WAV,建議不超過兩分鐘,輸出僅限文本。
訓練過程上,Inkling-Small 在更大的 Inkling 之後啓動,使團隊可以修訂預訓練數據混合和機器學習方案。研究者先以 Inkling 為教師,通過在線策略蒸餾對早期檢查點 Inkling-Small (preview) 進行後訓練,再在此基礎上繼續擴展智能體編碼的強化學習,持續兩週。
基準測試顯示,較小的模型在推理和智能體編碼上超過了教師模型:HLE(純文本)31.6% vs 29.7%,SWE-bench Verified 80.2% vs 77.6%(bash-only harness),Terminal-Bench 2.1 最好成績 64.7%,Toolathlon Verified 54.4% vs 45.5%,GPQA Diamond 89.5%,AIME 2026 95.5%,IFBench 82.2%,ARC-AGI-2 從 36.5% 升至 40.1%。然而事實性記憶明顯回退:SimpleQA Verified 從 Inkling 的 43.9% 降至 20.6%,AA Omniscience 指數從 2.1 降至 -9.0,Tau 3 Banking 從 23.7% 降至 15.5%。所有評估在 effort 0.99、温度 1.0 下進行,編碼評估使用 256K max-token 軌跡限制;外部分數來自 Artificial Analysis、Scale AI 和 ARC Prize。
多模態方面,Inkling-Small 以更低成本接近 Inkling:MMMU Pro 74.0%,CharXiv RQ 77.4%(用 Python 編程裁剪、縮放和檢查圖表時升至 81.3%),Audio MC 54.9%,MMAU 77.0%,VoiceBench 90.1%。認識論方面,團隊使用真實世界預測問題的大規模語料,通過針對適當評分規則的強化學習訓練校準;無搜索 ForecastBench 的 Brier Index 為 61.3±0.46,優於 Inkling 的 60.1±0.54。安全評測上,StrongREJECT 為 98.4%,FORTRESS 對抗性 71.6%,FORTRESS 良性 96.9%。Thinking Machines Lab 認為該模型相對現有開放權重生態沒有顯著風險提升,但建議在面向消費者的部署中疊加 Llama Guard 等下游審核。目前兩個模型都在 Tinker 上提供限時折扣,Tinker Playground 支持文本、圖像和音頻對話;官方還發布了交互式解釋器,從稀疏路由、基準排名、多模態融合和硬件需求四個維度展示模型特性。