AI News HubLIVE
站内改写2 分钟阅读

Thinking Machines Lab 发布 Inkling-Small:276B 总参数、12B 激活的开源多模态 MoE 模型

Thinking Machines Lab 发布开源权重 MoE 模型 Inkling-Small,总参数 276B、激活参数仅 12B,约为旗舰模型 Inkling 的四分之一。原生支持文本、图像和音频输入,上下文窗口达 100 万 token。NVFP4 量化检查点只需 180GB 显存,可在单块 NVIDIA B300 上运行。该模型在多项推理与编码基准上超越更大的 Inkling,但事实性能力有所回退。

来源MarkTechPost作者: Asif Razzaq

Thinking Machines Lab 正式发布 Inkling-Small,这是其开放权重混合专家(MoE)模型。模型总参数量 276B,每次推理只激活 12B 参数,体量约为旗舰模型 Inkling(975B 总参数、41B 激活参数)的四分之一。Inkling-Small 在 NVIDIA GB300 NVL72 系统上完成训练,原生支持文本、图像和音频输入,上下文窗口高达 100 万 token,并允许用户调整思考深度。模型权重以 Apache 2.0 许可证在 Hugging Face 上开放下载。

部署方面,量化版本显著降低硬件门槛。根据模型卡,BF16 检查点至少需要 600GB 聚合显存,相当于 4 块 NVIDIA B300 或 8 块 H200;而 NVFP4 检查点只需 180GB,可在单块 B300(SM100+)上以 W4A4 运行,或在两块 H200 上以 W4A16 运行。支持的推理引擎包括 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face。这意味着一家初创公司租用单块 B300 即可自托管,中型企业也可复用现有 H200 容量,金融、医疗、保险、电信和公共部门等受监管行业则可获得私有权重方案。典型场景包括编码智能体、终端自动化、文档与图表理解;音频能力还延伸至呼叫中心分析、语音界面与会议纪要。

架构上,Inkling-Small 是一个 42 层 decoder-only Transformer,采用稀疏 MoE 前馈网络;每个 token 从 256 个专家中路由到 6 个,并始终激活 2 个共享专家。注意力层混合局部与全局模式,整体无编码器。图像被分割为 40×40 像素的 patch,经过四层 hMLP 变换;音频以 dMel 声谱图表示;二者通过轻量嵌入层与文本 token 联合处理。数值精度支持 BF16、MXFP8 和 NVFP4,音频输入为 16kHz WAV,建议不超过两分钟,输出仅限文本。

训练过程上,Inkling-Small 在更大的 Inkling 之后启动,使团队可以修订预训练数据混合和机器学习方案。研究者先以 Inkling 为教师,通过在线策略蒸馏对早期检查点 Inkling-Small (preview) 进行后训练,再在此基础上继续扩展智能体编码的强化学习,持续两周。

基准测试显示,较小的模型在推理和智能体编码上超过了教师模型:HLE(纯文本)31.6% vs 29.7%,SWE-bench Verified 80.2% vs 77.6%(bash-only harness),Terminal-Bench 2.1 最好成绩 64.7%,Toolathlon Verified 54.4% vs 45.5%,GPQA Diamond 89.5%,AIME 2026 95.5%,IFBench 82.2%,ARC-AGI-2 从 36.5% 升至 40.1%。然而事实性记忆明显回退:SimpleQA Verified 从 Inkling 的 43.9% 降至 20.6%,AA Omniscience 指数从 2.1 降至 -9.0,Tau 3 Banking 从 23.7% 降至 15.5%。所有评估在 effort 0.99、温度 1.0 下进行,编码评估使用 256K max-token 轨迹限制;外部分数来自 Artificial Analysis、Scale AI 和 ARC Prize。

多模态方面,Inkling-Small 以更低成本接近 Inkling:MMMU Pro 74.0%,CharXiv RQ 77.4%(用 Python 编程裁剪、缩放和检查图表时升至 81.3%),Audio MC 54.9%,MMAU 77.0%,VoiceBench 90.1%。认识论方面,团队使用真实世界预测问题的大规模语料,通过针对适当评分规则的强化学习训练校准;无搜索 ForecastBench 的 Brier Index 为 61.3±0.46,优于 Inkling 的 60.1±0.54。安全评测上,StrongREJECT 为 98.4%,FORTRESS 对抗性 71.6%,FORTRESS 良性 96.9%。Thinking Machines Lab 认为该模型相对现有开放权重生态没有显著风险提升,但建议在面向消费者的部署中叠加 Llama Guard 等下游审核。目前两个模型都在 Tinker 上提供限时折扣,Tinker Playground 支持文本、图像和音频对话;官方还发布了交互式解释器,从稀疏路由、基准排名、多模态融合和硬件需求四个维度展示模型特性。