Poolside 发布 Laguna S 2.1:开源权重代理编码模型,在 SWE-Bench Multilingual 上表现超越同类
Poolside 发布了 Laguna S 2.1,一款 118B 参数的开源权重混合专家(MoE)编码模型,每 token 仅激活 8B 参数,支持 1M token 上下文窗口。该模型在代理编码基准测试中击败了多个体积数倍于它的模型,并以 4-bit 量化可在单个 NVIDIA DGX Spark 上运行。训练耗时不到九周,使用 4096 块 H200 GPU。模型提供两种思考模式,默认“最大思考”模式带来显著性能提升,但 token 消耗也更高。
Poolside 宣布推出 Laguna S 2.1,这是一款面向代理编码的 1180 亿参数开源权重模型。它采用混合专家(MoE)架构,每个 token 仅激活约 80 亿参数(激活率约 6.8%),并支持高达 100 万 token 的上下文窗口,可在思考与非思考模式下使用。模型权重以 OpenMDW-1.1 许可证发布在 Hugging Face 上,尺寸紧凑到足以在单个 NVIDIA DGX Spark 上运行。
在长周期编码基准测试中,Laguna S 2.1 与数倍于其规模的模型(包括 DeepSeek-V4-Pro-Max、NVIDIA 的 Nemotron 3 Ultra 和 Thinking Machines 的 Inkling)不相上下。它是 Laguna XS 系列的放大版本,使用与 XS 2.1 相同的预训练数据。
模型规格
模型每 token 仅激活约 6.8% 的参数。全部 1180 亿参数驻留在内存中,但每步只有约 80 亿通过网络路由。这种稀疏性使得中等规模的模型能够表现得像大型模型,同时保持较低的推理成本。Poolside 团队提供了 BF16、FP8、INT4 和 NVFP4 格式的权重,以及官方的 GGUF 和 MLX 转换版本和 DFlash 草稿模型。从训练开始到发布仅用了不到九周时间。预训练于 2026 年 5 月 22 日在 4096 块 NVIDIA H200 GPU 上启动。这是 Poolside 首个以 FP8 精度运行强化学习的模型。
性能表现
启用思考模式后,Laguna S 2.1 在 Terminal-Bench 2.1 上取得 70.2% 的分数,在 Poolside 编制的公开模型中位列第一,仅次于更大或闭源系统。在 SWE-Bench Multilingual 上,它以 78.5% 的分数直接登顶公开排行榜。完整对比数据如下:
| 基准测试 | Laguna S 2.1 (118B-A8B) | Tencent Hy3 (295B-A21B) | Inkling (975B-A41B) | Nemotron 3 Ultra (550B-A55B) | DeepSeek-V4-Pro-Max (1.6T-A49B) | Kimi K3 (2.8T-A50B) | Qwen 3.7 Max | Muse Spark 1.1 | Claude Fable 5 | | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Terminal-Bench 2.1 | 70.2 | 71.7 | 63.8 | 56.4 | 64.0 | 88.3 | 74.5 | 80.0 | 88.0 | | SWE-Bench Multilingual | 78.5 | 75.8 | – | 67.7 | 76.2 | – | 78.3 | – | – | | SWE-Bench Pro (Public) | 59.4 | 57.9 | 54.3 | – | 55.4 | – | 60.6 | 61.5 | 80.3 | | DeepSWE v1.1 | 40.4 | – | – | – | 9.0 | 69.0 | – | 53.3 | 70.0 | | SWE Atlas (Codebase QnA) | 46.2 | – | – | – | 27.2 | – | – | 42.2 | – | | Toolathlon Verified | 49.7 | – | 45.5 | 34.3 | 55.9 | – | – | 75.6 | – |
最显著的信号来自 DeepSWE v1.1,该基准仍有提升空间。Laguna S 2.1 取得 40.4%,而 DeepSeek-V4-Pro-Max 仅为 9.0%,且前者活跃参数仅为后者的约六分之一。闭源前沿模型(如 Claude Fable 5 和 Kimi K3)在若干基准上仍保持领先。Poolside 的声明聚焦于其“重量级”表现,而非绝对领先。最终评估轨迹已发布在 trajectories.poolside.ai。
两种思考模式与性能来源
Laguna S 2.1 提供两种模式:关闭和最大(默认启用最大模式)。在最大模式下,模型自行设定测试时计算预算。目前 Poolside 未提供用户可配置的低/中/高努力控制。最大思考将 Terminal-Bench 2.1 从 60.4% 提升至 70.2%,将 DeepSWE 从 16.5% 提升至 40.4%。这些提升需要付出 token 代价:DeepSWE 轨迹在思考模式下约消耗 24.9 万 completion token,而非思考模式下仅 9.9 万。Poolside 团队报告,模型能够进行连贯且富有成效的推理,持续数小时并生成数十万 token。
三条公开轨迹
Poolside 团队分享了三条未经编辑的轨迹以展示行为而非分数。第一个案例中,模型从空文件夹构建了一个可用的 HTML/CSS 浏览器引擎,耗时 50 分钟,共 181 步,无需人工干预,并自行通过无头 Chromium 验证输出。第二个案例中,模型优化了 Poolside 自己的代理框架,使框架速度提升 5.2%,内存分配降低约 71%,将 O(n²) 字符串拼接替换为缓冲区。第三个案例中,模型在 68 分钟内用 Perl 离线重新推导了 Erdős Problem #397(因沙箱无 Python),这是一项独立的重新发现;GPT-5.2 Pro 曾于 2026 年 1 月解决同一问题,而 Laguna 的知识截止日期为 2025 年 11 月。
实际部署可行性
模型尺寸基于全部 1180 亿参数,而非 80 亿活跃参数,因为每个专家都驻留在内存中。4-bit (NVFP4 或 INT4) 量化下权重约需 59 GB,可轻松装入单块 DGX Spark 的 128 GB 统一内存。FP8 下约需 118 GB,仍可装入单块 Spark 或单块 H200。BF16 下约需 236 GB,需要两块 Spark 或一个多 GPU 数据中心节点。
Poolside 与 NVIDIA 合作优化推理,从 TRT-LLM 服务到 Blackwell 上的 NVFP4,直至单块 DGX Spark。模型在发布首日即支持 vLLM、SGLang 和 Ollama。托管访问通过 OpenRouter 提供,256K 上下文免费,完整 1M 上下文收费为每百万输入/输出/缓存读取 token 分别 $0.10 / $0.20 / $0.01。模型还可在 Baseten、Kilo、Prime Intellect Prime Lab 和 ZML 上使用。
关键要点
- Laguna S 2.1 是一款 118B 总参数/8B 活跃参数的 MoE 编码模型,支持 1M token 上下文,以 OpenMDW-1.1 许可证开源。
- 在 Terminal-Bench 2.1 和 SWE-Bench Multilingual 上分别取得 70.2% 和 78.5% 的分数,在公开模型中领先。
- 4-bit 量化后可在单块 NVIDIA DGX Spark 上运行;FP8 适合单块 Spark 或 H200,BF16 需要两块。
- 默认“最大思考”模式驱动了大部分性能提升,但 token 消耗显著(DeepSWE: 16.5% → 40.4%)。
- 在不到九周内于 4096 块 H200 GPU 上完成训练,是 Poolside 在三个月内发布的第三个模型。
来源:Poolside Technical — Introducing Laguna S 2.1,Robert McHardy 在 X 上的发言,Poolside 在 X 及 Hugging Face 模型卡。