Poolside 釋出 Laguna S 2.1:開源權重代理編碼模型,在 SWE-Bench Multilingual 上表現超越同類
Poolside 釋出了 Laguna S 2.1,一款 118B 引數的開源權重混合專家(MoE)編碼模型,每 token 僅啟用 8B 引數,支援 1M token 上下文視窗。該模型在代理編碼基準測試中擊敗了多個體積數倍於它的模型,並以 4-bit 量化可在單個 NVIDIA DGX Spark 上執行。訓練耗時不到九周,使用 4096 塊 H200 GPU。模型提供兩種思考模式,預設“最大思考”模式帶來顯著效能提升,但 token 消耗也更高。
Poolside 宣佈推出 Laguna S 2.1,這是一款面向代理編碼的 1180 億引數開源權重模型。它採用混合專家(MoE)架構,每個 token 僅啟用約 80 億引數(啟用率約 6.8%),並支援高達 100 萬 token 的上下文視窗,可在思考與非思考模式下使用。模型權重以 OpenMDW-1.1 許可證釋出在 Hugging Face 上,尺寸緊湊到足以在單個 NVIDIA DGX Spark 上執行。
在長週期編碼基準測試中,Laguna S 2.1 與數倍於其規模的模型(包括 DeepSeek-V4-Pro-Max、NVIDIA 的 Nemotron 3 Ultra 和 Thinking Machines 的 Inkling)不相上下。它是 Laguna XS 系列的放大版本,使用與 XS 2.1 相同的預訓練資料。
模型規格
模型每 token 僅啟用約 6.8% 的引數。全部 1180 億引數駐留在記憶體中,但每步只有約 80 億透過網路路由。這種稀疏性使得中等規模的模型能夠表現得像大型模型,同時保持較低的推理成本。Poolside 團隊提供了 BF16、FP8、INT4 和 NVFP4 格式的權重,以及官方的 GGUF 和 MLX 轉換版本和 DFlash 草稿模型。從訓練開始到釋出僅用了不到九周時間。預訓練於 2026 年 5 月 22 日在 4096 塊 NVIDIA H200 GPU 上啟動。這是 Poolside 首個以 FP8 精度執行強化學習的模型。
效能表現
啟用思考模式後,Laguna S 2.1 在 Terminal-Bench 2.1 上取得 70.2% 的分數,在 Poolside 編制的公開模型中位列第一,僅次於更大或閉源系統。在 SWE-Bench Multilingual 上,它以 78.5% 的分數直接登頂公開排行榜。完整對比資料如下:
| 基準測試 | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | Inkling (975B-A41B) | Nemotron 3 Ultra (550B-A55B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Qwen 3.7 Max | Muse Spark 1.1 | Claude Fable 5 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Terminal-Bench 2.1 | 70.2 | 71.7 | 63.8 | 56.4 | 64.0 | 88.3 | 74.5 | 80.0 | 88.0 | | SWE-Bench Multilingual | 78.5 | 75.8 | – | 67.7 | 76.2 | – | 78.3 | – | – | | SWE-Bench Pro (Public) | 59.4 | 57.9 | 54.3 | – | 55.4 | – | 60.6 | 61.5 | 80.3 | | DeepSWE v1.1 | 40.4 | – | – | – | 9.0 | 69.0 | – | 53.3 | 70.0 | | SWE Atlas (Codebase QnA) | 46.2 | – | – | – | 27.2 | – | – | 42.2 | – | | Toolathlon Verified | 49.7 | – | 45.5 | 34.3 | 55.9 | – | – | 75.6 | – |
最顯著的訊號來自 DeepSWE v1.1,該基準仍有提升空間。Laguna S 2.1 取得 40.4%,而 DeepSeek-V4-Pro-Max 僅為 9.0%,且前者活躍引數僅為後者的約六分之一。閉源前沿模型(如 Claude Fable 5 和 Kimi K3)在若干基準上仍保持領先。Poolside 的宣告聚焦於其“重量級”表現,而非絕對領先。最終評估軌跡已釋出在 trajectories.poolside.ai。
兩種思考模式與效能來源
Laguna S 2.1 提供兩種模式:關閉和最大(預設啟用最大模式)。在最大模式下,模型自行設定測試時計算預算。目前 Poolside 未提供使用者可配置的低/中/高努力控制。最大思考將 Terminal-Bench 2.1 從 60.4% 提升至 70.2%,將 DeepSWE 從 16.5% 提升至 40.4%。這些提升需要付出 token 代價:DeepSWE 軌跡在思考模式下約消耗 24.9 萬 completion token,而非思考模式下僅 9.9 萬。Poolside 團隊報告,模型能夠進行連貫且富有成效的推理,持續數小時並生成數十萬 token。
三條公開軌跡
Poolside 團隊分享了三條未經編輯的軌跡以展示行為而非分數。第一個案例中,模型從空資料夾構建了一個可用的 HTML/CSS 瀏覽器引擎,耗時 50 分鐘,共 181 步,無需人工干預,並自行透過無頭 Chromium 驗證輸出。第二個案例中,模型最佳化了 Poolside 自己的代理框架,使框架速度提升 5.2%,記憶體分配降低約 71%,將 O(n²) 字串拼接替換為緩衝區。第三個案例中,模型在 68 分鐘內用 Perl 離線重新推導了 Erdős Problem #397(因沙箱無 Python),這是一項獨立的重新發現;GPT-5.2 Pro 曾於 2026 年 1 月解決同一問題,而 Laguna 的知識截止日期為 2025 年 11 月。
實際部署可行性
模型尺寸基於全部 1180 億引數,而非 80 億活躍引數,因為每個專家都駐留在記憶體中。4-bit (NVFP4 或 INT4) 量化下權重約需 59 GB,可輕鬆裝入單塊 DGX Spark 的 128 GB 統一記憶體。FP8 下約需 118 GB,仍可裝入單塊 Spark 或單塊 H200。BF16 下約需 236 GB,需要兩塊 Spark 或一個多 GPU 資料中心節點。
Poolside 與 NVIDIA 合作最佳化推理,從 TRT-LLM 服務到 Blackwell 上的 NVFP4,直至單塊 DGX Spark。模型在釋出首日即支援 vLLM、SGLang 和 Ollama。託管訪問透過 OpenRouter 提供,256K 上下文免費,完整 1M 上下文收費為每百萬輸入/輸出/快取讀取 token 分別 $0.10 / $0.20 / $0.01。模型還可在 Baseten、Kilo、Prime Intellect Prime Lab 和 ZML 上使用。
關鍵要點
- Laguna S 2.1 是一款 118B 總引數/8B 活躍引數的 MoE 編碼模型,支援 1M token 上下文,以 OpenMDW-1.1 許可證開源。
- 在 Terminal-Bench 2.1 和 SWE-Bench Multilingual 上分別取得 70.2% 和 78.5% 的分數,在公開模型中領先。
- 4-bit 量化後可在單塊 NVIDIA DGX Spark 上執行;FP8 適合單塊 Spark 或 H200,BF16 需要兩塊。
- 預設“最大思考”模式驅動了大部分效能提升,但 token 消耗顯著(DeepSWE: 16.5% → 40.4%)。
- 在不到九周內於 4096 塊 H200 GPU 上完成訓練,是 Poolside 在三個月內釋出的第三個模型。
來源:Poolside Technical — Introducing Laguna S 2.1,Robert McHardy 在 X 上的發言,Poolside 在 X 及 Hugging Face 模型卡。