AI News HubLIVE
站內改寫2 分鐘閱讀

最新開放工件(#23):Laguna S2.1、Inkling 和 Kimi K3 展示開放模型在帕累託前沿的實用性

儘管許多人預測模型實驗室將走向整合,但開放模型領域仍在持續繁榮。本期《開放工件》盤點了 Thinking Machines 的 Inkling、騰訊 Hy3、Poolside Laguna S2.1、DeepSeek-V4-Flash 以及 Moonshot AI 的 Kimi K3 等重要發佈,並探討了開放模型許可與商業模式的新動向。

來源Interconnects (Nathan Lambert)作者: Florian Brand

儘管不少人預測模型實驗室會走向整合,但現實是,越來越多公司正在投入巨資訓練強大模型,並選擇公開發布。訓練成本每年成數量級增長,然而 token 需求依然旺盛,效率提升與用例擴展將進一步推動需求。那些被認為需要整合的實驗室發現,構建 token 機器是通向價值的可行路徑,未來會有更多公司加入。

Thinking Machines 是這一趨勢的典型代表。這家公司 2025 年 2 月成立時很少有人將其視為開放模型公司,如今其開放模型微調服務年收入數億美元,併發布了美國最強的開放權重模型 Inkling,超越 NVIDIA 的 Nemotron 和 Arcee 的 Trilogy。與此同時,中國實驗室保持穩定發佈節奏,小米等新玩家也在擴大影響力。

本期開放模型盤點內容非常豐富。Inkling 是 Thinking Machines 的首個模型,規模為 975B-A41B,是多模態 MoE,支持文本、圖像和音頻輸入,生成文本輸出。雖然不是同類尺寸中最強,但非常適合作為微調基礎,可用其商業產品 Tinker 定製,同時發佈較小版本 276B-A12B。騰訊的 Hy3 是 295B-A21B MoE,全面超越前代,許可從自定義限制性許可改為 Apache 2.0。該模型還藉助專用 harness 和 Sol 評判證明了一個 50 年曆史的數學問題。

Poolside 的 Laguna-S-2.1 是 118B-A8B MoE,經過新一輪預訓練和後訓練,可在 DGX Spark 上運行,因此備受關注。採用 OpenMDW 許可證,類似 Apache 2.0 但對 AI 模型有更好的法律支持,並在博客中公開完整評估軌跡。DeepSeek-V4-Flash-0731 在 OpenAI 將最小模型價格下調 80% 後一天發佈,在帕累託前沿擊敗 Luna。更大模型尚未更新,表現待觀察。Moonshot AI 的 Kimi K3 是近期最大的開放模型發佈,採用非商業許可,推理和微調提供商需簽訂商業協議。Kevin Xu 和 Graham Webster 指出,這種許可可能讓美國官員此前討論的針對中國開放模型的政策工具更明確適用。

其他通用模型方面,美團發佈 LongCat-2.0,1.6T 參數的 MoE,完全在昇騰 910 上訓練,是首個非華為、非玩具級別、完全使用中國加速器訓練的模型。Poolside 更新了 Laguna-XS-2.1(33B-A3B)。韓國 Motif 發佈 314B-A13B 的 Motif-3-Beta 預覽,引入 GDLA 和 mHC 架構創新。瑞士 swiss-ai 基於全開源 Apertus 1.0 繼續預訓練 Apertus-v1.5-70B,額外使用 2T token。AMD 的 Instella-MoE-16B-A3B-Think 在 Instinct 顯卡上訓練,並提供從基礎到 SFT、MidTrain 和 DPO 等多階段權重。開放模型浪潮不僅沒有消退,反而在加速。