Poolside 发布 Laguna S 2.1:118B 参数开源编程模型,SWE-Bench 多语言测试登顶
Poolside 推出开源编程模型 Laguna S 2.1,118B 总参数仅 8B 激活,1M token 上下文,在 SWE-Bench Multilingual 上以 78.5% 成绩领先所有公开模型。支持单张 DGX Spark 运行,提供多种量化版本。本文详解性能、部署方式及对中文开发者的意义。
一句话看懂
Poolside 发布开源编程模型 Laguna S 2.1,118B 参数仅 8B 激活,1M 上下文,SWE-Bench 多语言测试 78.5% 登顶,可单卡运行。
详细发生了什么
Poolside 于 2026 年 7 月 21 日发布 Laguna S 2.1。这是一款 118B 总参数的 Mixture-of-Experts(MoE)开源编程模型,每 token 只激活 8B 参数(约 6.8%)。它支持 1M token 上下文窗口,提供 thinking 和 no-thinking 两种模式。权重以 OpenMDW-1.1 许可证发布在 Hugging Face 上。
性能方面,Laguna S 2.1 在 Terminal-Bench 2.1 上达到 70.2%(thinking 模式),在 SWE-Bench Multilingual 上以 78.5% 的成绩超越所有公开披露参数的模型,包括 Tencent Hy3(75.8%)、DeepSeek-V4-Pro-Max(76.2%)等。在 DeepSWE v1.1 上,它以 40.4% 大幅领先 DeepSeek-V4-Pro-Max 的 9.0%,而激活参数仅为后者的约六分之一。
模型从训练到发布只用了 9 周(2026 年 5 月 22 日开始,4096 张 H200 GPU),是 Poolside 三个月内的第三个模型。团队提供了 BF16、FP8、INT4、NVFP4 等多种量化版本,以及 GGUF、MLX 转换和 DFlash draft 模型。
中文圈视角
对中文开发者来说,Laguna S 2.1 的吸引力在于:
-
开源可部署:模型权重完全公开,许可证 OpenMDW-1.1 允许商用(需确认具体条款)。4-bit 量化只需 59 GB 显存,单张 DGX Spark(128 GB 统一内存)就能运行。国内开发者可通过 Hugging Face 或 ModelScope 镜像下载。
-
编程场景实用:SWE-Bench Multilingual 测试涵盖多语言编程任务,中文代码场景(如 Python、JavaScript)同样受益。模型在长任务(如构建浏览器引擎)中表现出自主推理能力,适合自动化代码审查、bug 修复等场景。
-
国产平替对比:相比 DeepSeek-V4-Pro-Max(1.6T 参数,49B 激活)或 Kimi K3(2.8T 参数),Laguna S 2.1 参数规模小得多,但特定任务(如 DeepSWE)表现更强。国内类似模型如 Qwen 3.7 Max(未公开参数)在部分基准上领先,但 Laguna 的开源特性使其更易定制。
-
部署门槛:国内用户若无法获取 DGX Spark,可使用 H200 或 A100 等 GPU。FP8 版本需 118 GB 显存(单张 H200 可容纳),BF16 需 236 GB(需多卡)。API 服务通过 OpenRouter 提供,但国内访问可能受限,建议自行部署。
几条值得记住的细节
- 参数效率:118B 总参数,仅 8B 激活,稀疏度约 93.2%,推理成本远低于同规模密集模型。
- Thinking 模式:默认开启 max thinking,Terminal-Bench 从 60.4% 提升至 70.2%,DeepSWE 从 16.5% 提升至 40.4%,但 token 消耗翻倍(DeepSWE 从 99k 增至 249k)。
- 部署配置:4-bit 量化(NVFP4/INT4)需 59 GB,单张 DGX Spark 可运行;FP8 需 118 GB(单张 H200);BF16 需 236 GB(双 Spark 或多卡)。
- 开源生态:支持 vLLM、SGLang、Ollama 等推理框架,发布即兼容。
- 定价:OpenRouter 上 256K 上下文免费,1M 上下文输入 $0.10/1M tokens,输出 $0.20/1M tokens,缓存读取 $0.01/1M tokens。
一句话总结
Laguna S 2.1 以极小激活参数实现顶级编程性能,开源可部署,是中文开发者低成本接入前沿 Agentic Coding 的优质选择。