AI News HubLIVE
站内改写1 分钟阅读

认识 Inkling:Thinking Machines Lab 的新型可定制模型

Thinking Machines Lab 发布了 Inkling,一个拥有 9750 亿参数的开源权重多模态模型,支持文本、图像和音频输入,采用混合专家架构,活跃参数为 410 亿。Baseten 提供首发支持。

今天我们自豪地宣布,Baseten 平台从第一天起就支持 Thinking Machines Lab 的最新开源权重模型 Inkling。

Inkling 是一个通用、多模态的自回归 Transformer 模型,能够处理文本、图像和音频输入,并生成文本输出。它预训练于 45 万亿 token 的文本、图像、音频和视频数据。Inkling 采用混合专家(MoE)架构,总参数 9750 亿,活跃参数 410 亿,上下文窗口高达 100 万 token。

Thinking Machines Lab 选择“Inkling”这个名字,寓意一个最初的想法,有潜力成长为更伟大的事物。Inkling 构建为一个极其博学、通用的基础模型,可通过微调进行扩展。它专为开发 AI 应用程序的开发者设计,包括代理和工具使用系统、编码助手、聊天机器人和检索增强生成系统。

在技术架构上,Inkling 是一个 66 层的稀疏 MoE Transformer,总参数 9750 亿,活跃参数 410 亿。每个 token 通过 256 个专家中的 6 个以及 2 个共享专家进行路由,从而在不激活全部参数的情况下利用广泛的能力。评估显示,它在推理、编码、视觉、音频和安全性方面表现出色。

开源权重为用户提供了更多的定制和部署控制权,但也带来了巨大的基础设施需求:BF16 检查点至少需要 2 TB 的 GPU 总内存,而 NVFP4 检查点则需要至少 600 GB。将 9750 亿参数的模型投入生产并非易事。

Baseten 负责部署 Inkling 所需的基础设施,包括自动扩展、权重分发和跨云容量管理。Baseten 推理堆栈提供自动扩展器,可根据需求变化添加或删除模型副本;Baseten 分发网络将模型权重靠近可用计算资源,并在多个副本同时启动时协调下载,实现 2-3 倍的冷启动加速。多云容量管理将来自 20 多个云的 GPU 整合到一个全球池中,确保即使某个云容量不足,工作负载也能在其他云中运行。

您今天即可通过 Baseten Model APIs 和 Dedicated Inference 开始使用 Inkling。我们期待看到您用它构建的精彩应用。