跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Mistral Large 4 釋出:代號「Le chonk」

文章摘要

Mistral 放出 Mistral Large 4 預覽版:總引數 1 萬億、啟用引數 490 億,在自建的 3,800 塊 NVIDIA Grace Blackwell GPU 叢集上訓練。API 預覽版已上線,開放權重承諾本月底釋出;Artificial Analysis 得分 38,較上一代 Large 3 的 9 分大幅躍升,但整體仍落後前沿約 6 個月。

Mistral Large 4 釋出:代號「Le chonk」
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Mistral 重回賽場:Mistral Large 4 預覽版釋出,代號“Le chonk”

2026 年 10 月 6 日,Simon Willison 在其連結部落格中介紹,Mistral 釋出了 Mistral Large 4 的預覽版。這是 Mistral 在經歷了一段時間的低迷後重新回到大模型競賽中的重要動作。該模型是一個擁有 1 萬億引數的模型,其中 490 億為啟用引數,訓練於 Mistral 自有的 3,800 塊 NVIDIA Grace Blackwell GPU 叢集之上。1 萬億總引數與 490 億啟用引數的組合通常意味著採用了專家混合(MoE)架構,但原文並未明確說明這一點。

目前該預覽版僅透過 Mistral 的 API 提供。Mistral 承諾將在“本月底”釋出該模型的開放權重版本。這意味著開發者屆時可能可以下載權重並在本地或自有基礎設施上執行,不過開放權重發布的具體許可證和可用性細節尚未公佈,仍存在變數。

在推理能力方面,該模型透過 Mistral API 只支援兩種推理級別:“none”和“high”。Simon Willison 展示了兩種設定下生成的“鵜鶘騎腳踏車”測試影像。他表示,“high”設定下的影像看起來更好,但令人意外的是,它只使用了 2,717 個輸出 token,而“none”設定反而用了 3,275 個輸出 token。這一細節表明,更高的推理級別並不一定意味著更長的輸出,至少在 token 數量上如此。

在 Artificial Analysis 的評測中,Mistral Large 4 得分為 38,僅落後於 DeepSeek 4.1 Flash,後者是一個 552B(5,520 億)引數的模型。相比去年 12 月釋出的 Mistral Large 3,這是一個巨大的進步。Mistral Large 3 當時畫出了“糟糕的鵜鶘”,在 Artificial Analysis 上僅得 9 分。從 9 分到 38 分的躍升,說明 Mistral 在模型能力上取得了顯著改進。

Simon Willison 評價說,這當然不是一個 Fable 級別的模型,但很高興看到 Mistral 推出一個重新回到大約落後前沿 6 個月水平的模型。換句話說,Mistral 雖然還沒有追上最頂尖的模型,但已經縮小了差距,回到了一個相對有競爭力的位置。對於一家曾經引領開放模型潮流的公司來說,這無疑是一個積極的訊號。

該訊息經由 Hacker News 傳播,原文標題為“Introducing Mistral Large 4: Le chonk”,釋出在 Simon Willison 的部落格上。文章標籤包括:ai、generative-ai、llms、mistral、pelican-riding-a-bicycle、llm-release。需要留意的是,目前釋出的是預覽版,模型能力、API 行為以及最終開放權重版本都可能發生變化。Artificial Analysis 的分數也會隨著評測更新而變動。因此,以上資訊反映的是 2026 年 10 月 6 日時點的狀態。

展開要點與分析

文章情報

工程師進階

要點

  • 總引數 1 萬億、啟用引數 490 億,訓練依託 Mistral 自有的 3,800 塊 NVIDIA Grace Blackwell GPU 叢集
  • 預覽版已透過 Mistral API 開放,開放權重版本承諾於本月底釋出
  • 推理僅提供「none」與「high」兩檔;「high」畫出的鵜鶘更好,卻只用了 2,717 個輸出 token,少於「none」的 3,275 個
  • Artificial Analysis 得分 38,略遜於 552B 的 DeepSeek 4.1 Flash,但遠高於 2025 年 12 月 Mistral Large 3 的 9 分

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。