AI News HubLIVE
站内改写2 分钟阅读

Thinking Machines Inkling 完全指南

Thinking Machines Lab 发布了其首个通用开放权重基础模型 Inkling。该模型拥有 9750 亿参数(其中 410 亿激活)、100 万 token 上下文窗口,采用多模态稀疏 MoE 架构,支持文本、图像和音频处理。Inkling 以可定制的开源模型形态,面向多模态推理、智能体、编程、工具使用及企业微调场景。本文详解其架构、训练、基准测试、部署及微调工作流。

来源Analytics Vidhya作者: Harsh Mishra

Thinking Machines Lab 于 2026 年 7 月 15 日发布了其首个通用开放权重基础模型 Inkling。作为一个多模态模型,Inkling 能够处理文本、图像和音频,并生成文本输出。模型采用稀疏 Mixture-of-Experts(MoE)架构,总参数量 9750 亿,但每次推理仅激活约 410 亿参数,显著降低了计算成本。其上下文窗口高达 100 万 token,可选 6.4 万或 25.6 万 token 的上下文配置。Inkling 以 Apache 2.0 许可发布,允许商业使用、修改和再分发,旨在成为可定制、可微调的基础模型,适用于多模态推理、智能体 AI、编程、工具使用、视觉和音频任务以及特定领域微调。

架构细节 Inkling 是一个 66 层、仅解码器的多模态 MoE Transformer。每个 MoE 层包含 256 个路由专家和 2 个共享专家,每个 token 激活 6 个路由专家和 2 个共享专家。路由基于 sigmoid 分数,采用无辅助损失的负载均衡。模型还整合了混合注意力机制:每 5 个滑动窗口注意力层后接一个全局注意力层,以高效处理长序列。相对位置嵌入替换了常见的 RoPE,以改善长上下文外推。短卷积应用于键/值投影后及注意力/MLP 输出加入残差流前,以捕获局部模式。此外,多 token 预测层通过投机解码加速推理。

多模态处理 对于文本,Inkling 采用标准的自回归 token 化;图像被分割为 40×40 像素的块,通过四层分层 MLP 编码;音频转换为离散化梅尔频谱图(dMel)嵌入。推荐图像尺寸 40-4096 像素,音频则建议使用 16 kHz WAV 格式、时长不超过 20 分钟。视频虽在预训练中涉及,但官方未针对直接使用做正式评估,推荐微调后再投入生产。

训练与后训练 Inkling 在 45 万亿 token 上完成预训练,数据涵盖文本、图像、音频和视频,并经过严格清洗、去重和质量过滤。优化器方面,大矩阵权重使用 Muon,其他参数使用 Adam,并采用与学习率平方相关的权重衰减调度。后训练包括监督微调和强化学习。监督微调阶段利用多个开源模型(如 Kimi K2.5)生成合成数据;大部分后训练算力投入于大规模强化学习,覆盖数学、推理、智能体编程、工具使用、视觉、音频、对话、指令遵循等方面。强化学习 rollout 超过 3000 万次,聚合推理奖励从 SFT 初始化后的 0.264 提升至发布检查点的 0.356。训练基于 NVIDIA GB300 NVL72 系统。

自我微调能力 Inkling 的另一亮点是其自我微调能力。通过 Tinker 平台与编码助手,模型能够帮助用户定义目标行为、生成合成训练样本、编写评估逻辑、启动微调任务并评估结果。这并非模型自主修改权重,而是利用工具链自动化微调流程,降低人工工程投入。

基准测试表现 Inkling 在数学推理(AIME 2026)、科学推理(GPQA Diamond)、指令遵循(IFBench)、语音理解(VoiceBench)和视觉推理方面表现强劲。它擅长结合工具使用、检索和外部计算来解决复杂问题。在编程方面,Inkling 处理仓库级任务、工具调用和终端交互的能力在开放权重模型中处于前列,但顶尖闭源模型在 SWE-bench Pro 和 Terminal Bench 上仍领先。事实性知识方面是弱点,因此在医疗、法律、金融等高风险场景需搭配检索系统、来源引用和人工审核。视觉和音频支持是其优势,无需额外模型即可理解图表、文档和语音指令。

访问与部署 用户可通过多种方式使用 Inkling:Tinker Playground(支持 100 万 token 上下文)、Hugging Face(权重下载)、Together AI 等托管推理提供商,以及自托管(支持 Transformers、vLLM、llama.cpp 等)。本地推理推荐使用 NVFP4 量化格式以降低显存需求。此外,Thinking Machines 还提供了更小版本的 Inkling-Small 供开发者尝试。

结论 Inkling 并非追求单一基准的冠军模型,而是强调平衡、可定制和开源。它适合需要灵活控制、多模态能力和微调功能的研究团队和企业。其开放权重许可和广泛的部署选项有望推动 AI 民主化,但事实性短板仍需通过增强的检索和验证机制来弥补。