AI News HubLIVE
站內改寫3 分鐘閱讀

Poolside 發佈 Laguna S 2.1:開源權重代理編碼模型,在 SWE-Bench Multilingual 上表現超越同類

Poolside 發佈了 Laguna S 2.1,一款 118B 參數的開源權重混合專家(MoE)編碼模型,每 token 僅激活 8B 參數,支持 1M token 上下文窗口。該模型在代理編碼基準測試中擊敗了多個體積數倍於它的模型,並以 4-bit 量化可在單個 NVIDIA DGX Spark 上運行。訓練耗時不到九周,使用 4096 塊 H200 GPU。模型提供兩種思考模式,默認“最大思考”模式帶來顯著性能提升,但 token 消耗也更高。

來源MarkTechPost作者: Asif Razzaq

Poolside 宣佈推出 Laguna S 2.1,這是一款面向代理編碼的 1180 億參數開源權重模型。它採用混合專家(MoE)架構,每個 token 僅激活約 80 億參數(激活率約 6.8%),並支持高達 100 萬 token 的上下文窗口,可在思考與非思考模式下使用。模型權重以 OpenMDW-1.1 許可證發佈在 Hugging Face 上,尺寸緊湊到足以在單個 NVIDIA DGX Spark 上運行。

在長週期編碼基準測試中,Laguna S 2.1 與數倍於其規模的模型(包括 DeepSeek-V4-Pro-Max、NVIDIA 的 Nemotron 3 Ultra 和 Thinking Machines 的 Inkling)不相上下。它是 Laguna XS 系列的放大版本,使用與 XS 2.1 相同的預訓練數據。

模型規格

模型每 token 僅激活約 6.8% 的參數。全部 1180 億參數駐留在內存中,但每步只有約 80 億通過網絡路由。這種稀疏性使得中等規模的模型能夠表現得像大型模型,同時保持較低的推理成本。Poolside 團隊提供了 BF16、FP8、INT4 和 NVFP4 格式的權重,以及官方的 GGUF 和 MLX 轉換版本和 DFlash 草稿模型。從訓練開始到發佈僅用了不到九周時間。預訓練於 2026 年 5 月 22 日在 4096 塊 NVIDIA H200 GPU 上啓動。這是 Poolside 首個以 FP8 精度運行強化學習的模型。

性能表現

啓用思考模式後,Laguna S 2.1 在 Terminal-Bench 2.1 上取得 70.2% 的分數,在 Poolside 編制的公開模型中位列第一,僅次於更大或閉源系統。在 SWE-Bench Multilingual 上,它以 78.5% 的分數直接登頂公開排行榜。完整對比數據如下:

| 基準測試 | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | Inkling (975B-A41B) | Nemotron 3 Ultra (550B-A55B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Qwen 3.7 Max | Muse Spark 1.1 | Claude Fable 5 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Terminal-Bench 2.1 | 70.2 | 71.7 | 63.8 | 56.4 | 64.0 | 88.3 | 74.5 | 80.0 | 88.0 | | SWE-Bench Multilingual | 78.5 | 75.8 | – | 67.7 | 76.2 | – | 78.3 | – | – | | SWE-Bench Pro (Public) | 59.4 | 57.9 | 54.3 | – | 55.4 | – | 60.6 | 61.5 | 80.3 | | DeepSWE v1.1 | 40.4 | – | – | – | 9.0 | 69.0 | – | 53.3 | 70.0 | | SWE Atlas (Codebase QnA) | 46.2 | – | – | – | 27.2 | – | – | 42.2 | – | | Toolathlon Verified | 49.7 | – | 45.5 | 34.3 | 55.9 | – | – | 75.6 | – |

最顯著的信號來自 DeepSWE v1.1,該基準仍有提升空間。Laguna S 2.1 取得 40.4%,而 DeepSeek-V4-Pro-Max 僅為 9.0%,且前者活躍參數僅為後者的約六分之一。閉源前沿模型(如 Claude Fable 5 和 Kimi K3)在若干基準上仍保持領先。Poolside 的聲明聚焦於其“重量級”表現,而非絕對領先。最終評估軌跡已發佈在 trajectories.poolside.ai。

兩種思考模式與性能來源

Laguna S 2.1 提供兩種模式:關閉和最大(默認啓用最大模式)。在最大模式下,模型自行設定測試時計算預算。目前 Poolside 未提供用户可配置的低/中/高努力控制。最大思考將 Terminal-Bench 2.1 從 60.4% 提升至 70.2%,將 DeepSWE 從 16.5% 提升至 40.4%。這些提升需要付出 token 代價:DeepSWE 軌跡在思考模式下約消耗 24.9 萬 completion token,而非思考模式下僅 9.9 萬。Poolside 團隊報告,模型能夠進行連貫且富有成效的推理,持續數小時並生成數十萬 token。

三條公開軌跡

Poolside 團隊分享了三條未經編輯的軌跡以展示行為而非分數。第一個案例中,模型從空文件夾構建了一個可用的 HTML/CSS 瀏覽器引擎,耗時 50 分鐘,共 181 步,無需人工干預,並自行通過無頭 Chromium 驗證輸出。第二個案例中,模型優化了 Poolside 自己的代理框架,使框架速度提升 5.2%,內存分配降低約 71%,將 O(n²) 字符串拼接替換為緩衝區。第三個案例中,模型在 68 分鐘內用 Perl 離線重新推導了 Erdős Problem #397(因沙箱無 Python),這是一項獨立的重新發現;GPT-5.2 Pro 曾於 2026 年 1 月解決同一問題,而 Laguna 的知識截止日期為 2025 年 11 月。

實際部署可行性

模型尺寸基於全部 1180 億參數,而非 80 億活躍參數,因為每個專家都駐留在內存中。4-bit (NVFP4 或 INT4) 量化下權重約需 59 GB,可輕鬆裝入單塊 DGX Spark 的 128 GB 統一內存。FP8 下約需 118 GB,仍可裝入單塊 Spark 或單塊 H200。BF16 下約需 236 GB,需要兩塊 Spark 或一個多 GPU 數據中心節點。

Poolside 與 NVIDIA 合作優化推理,從 TRT-LLM 服務到 Blackwell 上的 NVFP4,直至單塊 DGX Spark。模型在發佈首日即支持 vLLM、SGLang 和 Ollama。託管訪問通過 OpenRouter 提供,256K 上下文免費,完整 1M 上下文收費為每百萬輸入/輸出/緩存讀取 token 分別 $0.10 / $0.20 / $0.01。模型還可在 Baseten、Kilo、Prime Intellect Prime Lab 和 ZML 上使用。

關鍵要點

  • Laguna S 2.1 是一款 118B 總參數/8B 活躍參數的 MoE 編碼模型,支持 1M token 上下文,以 OpenMDW-1.1 許可證開源。
  • 在 Terminal-Bench 2.1 和 SWE-Bench Multilingual 上分別取得 70.2% 和 78.5% 的分數,在公開模型中領先。
  • 4-bit 量化後可在單塊 NVIDIA DGX Spark 上運行;FP8 適合單塊 Spark 或 H200,BF16 需要兩塊。
  • 默認“最大思考”模式驅動了大部分性能提升,但 token 消耗顯著(DeepSWE: 16.5% → 40.4%)。
  • 在不到九周內於 4096 塊 H200 GPU 上完成訓練,是 Poolside 在三個月內發佈的第三個模型。

來源:Poolside Technical — Introducing Laguna S 2.1,Robert McHardy 在 X 上的發言,Poolside 在 X 及 Hugging Face 模型卡。