AI News HubLIVE
站内改写2 分钟阅读

最新开放工件(#23):Laguna S2.1、Inkling 和 Kimi K3 展示开放模型在帕累托前沿的实用性

尽管许多人预测模型实验室将走向整合,但开放模型领域仍在持续繁荣。本期《开放工件》盘点了 Thinking Machines 的 Inkling、腾讯 Hy3、Poolside Laguna S2.1、DeepSeek-V4-Flash 以及 Moonshot AI 的 Kimi K3 等重要发布,并探讨了开放模型许可与商业模式的新动向。

来源Interconnects (Nathan Lambert)作者: Florian Brand

尽管不少人预测模型实验室会走向整合,但现实是,越来越多公司正在投入巨资训练强大模型,并选择公开发布。训练成本每年成数量级增长,然而 token 需求依然旺盛,效率提升与用例扩展将进一步推动需求。那些被认为需要整合的实验室发现,构建 token 机器是通向价值的可行路径,未来会有更多公司加入。

Thinking Machines 是这一趋势的典型代表。这家公司 2025 年 2 月成立时很少有人将其视为开放模型公司,如今其开放模型微调服务年收入数亿美元,并发布了美国最强的开放权重模型 Inkling,超越 NVIDIA 的 Nemotron 和 Arcee 的 Trilogy。与此同时,中国实验室保持稳定发布节奏,小米等新玩家也在扩大影响力。

本期开放模型盘点内容非常丰富。Inkling 是 Thinking Machines 的首个模型,规模为 975B-A41B,是多模态 MoE,支持文本、图像和音频输入,生成文本输出。虽然不是同类尺寸中最强,但非常适合作为微调基础,可用其商业产品 Tinker 定制,同时发布较小版本 276B-A12B。腾讯的 Hy3 是 295B-A21B MoE,全面超越前代,许可从自定义限制性许可改为 Apache 2.0。该模型还借助专用 harness 和 Sol 评判证明了一个 50 年历史的数学问题。

Poolside 的 Laguna-S-2.1 是 118B-A8B MoE,经过新一轮预训练和后训练,可在 DGX Spark 上运行,因此备受关注。采用 OpenMDW 许可证,类似 Apache 2.0 但对 AI 模型有更好的法律支持,并在博客中公开完整评估轨迹。DeepSeek-V4-Flash-0731 在 OpenAI 将最小模型价格下调 80% 后一天发布,在帕累托前沿击败 Luna。更大模型尚未更新,表现待观察。Moonshot AI 的 Kimi K3 是近期最大的开放模型发布,采用非商业许可,推理和微调提供商需签订商业协议。Kevin Xu 和 Graham Webster 指出,这种许可可能让美国官员此前讨论的针对中国开放模型的政策工具更明确适用。

其他通用模型方面,美团发布 LongCat-2.0,1.6T 参数的 MoE,完全在昇腾 910 上训练,是首个非华为、非玩具级别、完全使用中国加速器训练的模型。Poolside 更新了 Laguna-XS-2.1(33B-A3B)。韩国 Motif 发布 314B-A13B 的 Motif-3-Beta 预览,引入 GDLA 和 mHC 架构创新。瑞士 swiss-ai 基于全开源 Apertus 1.0 继续预训练 Apertus-v1.5-70B,额外使用 2T token。AMD 的 Instella-MoE-16B-A3B-Think 在 Instinct 显卡上训练,并提供从基础到 SFT、MidTrain 和 DPO 等多阶段权重。开放模型浪潮不仅没有消退,反而在加速。