Laguna S 2.1
摘要
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
暂无内容
查看缓存全文
缓存时间:
2026/07/21 21:40
# 介绍 Laguna S 2.1 来源:https://poolside.ai/blog/introducing-laguna-s-2-1 今天我们发布了 Laguna S 2.1,这是我们在开发追求更长周期工作并有效利用推理能力的模型过程中的重要一步。Laguna S 2.1 是一个总参数为 118B 的混合专家(MoE)模型,每个 token 激活 8B 参数,在思考和无需思考模式下支持高达 100 万 token 的上下文窗口。从训练开始到发布仅用了不到九周时间,在长周期编码基准测试中,其表现可媲美数倍于其规模的模型。对于今天发布的每个基准分数,我们将在 trajectories.poolside.ai (http://trajectories.poolside.ai/) 上发布最终评估集中每次试验的完整轨迹。
- Laguna S 2.1 - 118B-A8B
- Tencent Hy3 - 295B-A21B
- Inkling - 975B-A41B
- Nemotron 3 Ultra - 550B-A55B
- DeepSeek-V4-Pro-Max - 1.6T-A49B
- Kimi K3 - 2.8T-A50B
- Qwen 3.7 Max —
- Muse Spark 1.1 —
- Claude Fable 5 —
**Terminal-Bench 2.1** - 在 Terminal-Bench 2.1 上解决的任务
**SWE-Bench Multilingual** - 在 SWE-Bench Multilingual 上解决的任务
**SWE-Bench Pro(公共数据集)** - 在 SWE-Bench Pro(公共数据集)上解决的任务
**DeepSWE** - 在 DeepSWE 上解决的任务
**SWE Atlas(代码库问答)** - 在 SWE Atlas(代码库问答)上解决的任务
**Toolathlon Verified** - 在 Toolathlon Verified 上解决的任务。截至 2026 年 7 月 21 日的基准测试。pass@1 平均每任务 4 次尝试,但 DeepSWE、SWE Atlas(代码库问答)和 Toolathlon Verified 每任务 3 次尝试。对于所有基准测试,我们取供应商自我报告分数、基准作者排行榜或第三方排行榜(Artificial Analysis)中的最大值,但对于 SWE Atlas(代码库问答),我们不使用第三方排行榜数据。
## 超越同侪
Laguna S 2.1,据我们所知,**是其同重量级别中最强大的智能编码模型,大幅领先**。在启用思考功能的情况下,S 2.1 在我们代理框架中的 Terminal-Bench 2.1 上获得了 70.2% 的分数。其紧凑的尺寸使其特别适合在本地机器上进行复杂工作。
基准测试 - 开放权重 - 封闭/规模未公开
1. GPT-5.6 Sol - 88.8
2. Kimi K3 - 2.8T-A50B - 88.3
3. Claude Fable 5 - 88.0
4. GPT-5.6 Terra - 87.4
5. GPT-5.6 Luna - 84.7
6. Claude Opus 4.8 - 84.6
7. Claude Sonnet 5 - 80.4
8. Muse Spark 1.1 - 80.0
9. Qwen-3.7 Max - 74.5
10. Hy3 - 295B-A21B - 71.7
11. **Laguna S 2.1 - 118B-A8B - 70.2**
12. MiniMax M3 - 428B-A23B - 66.0
13. DeepSeek-V4-Pro-Max - 1600B-A49B - 64.0
14. Inkling - 975B-A41B - 63.8
15. DeepSeek-V4-Flash-Max - 284B-A13B - 61.8
16. Nemotron 3 Ultra - 550B-A55B - 56.4
17. Inkling-Small - 276B-A12B - 52.7
18. Qwen3.6-27B - 27B - 51.3
19. Qwen3.6-35B-A3B - 35B-A3B - 44.9
20. Nemotron 3 Super - 120B-A12B - 38.6
21. Laguna XS 2.1 - 33B-A3B - 33.4
22. Mistral Small 41 - 19B - 21.4
截至 2026 年 7 月 21 日的基准测试。pass@1 平均每任务 4 次尝试,但 DeepSWE、SWE Atlas(代码库问答)和 Toolathlon Verified 每任务 3 次尝试。对于所有基准测试,我们取供应商自我报告分数、基准作者排行榜或第三方排行榜(Artificial Analysis)中的最大值,但对于 SWE Atlas(代码库问答),我们不使用第三方排行榜数据。
Terminal-Bench 2.1 评估了一组广泛、高质量的长周期任务,其中代理模型通过终端连接到其环境。Laguna S 2.1 在该基准测试中是其尺寸类别中的佼佼者。
总参数,对数尺度。未公开总参数数量的模型被省略。
## 深入剖析 DeepSWE
上述基准测试都有其意义,我们很高兴能在这些测试中接近前沿。但部分接近是基准测试日趋成熟的结果:随着前沿推进,最高分数集中在 70-90% 范围内,表现差异很大的模型最终得分差距不过几个百分点。
Datacurve 的 DeepSWE 仍有很大的提升空间。其任务周期更长且难以部分解决,分数分布更分散:在 v1.1 变体中,前沿模型得分范围从 54% 到 73%,一些超过 1T 参数的开放模型得分低于 10%。在 DeepSWE v1.1 上,Laguna S 2.1 在池框架中使用思考模式时得分为 **40.4**。
- 开放权重 - 封闭/规模未公开
1. GPT-5.6 Sol - 73.0
2. Claude Fable 5 - 70.0
3. GPT-5.6 Terra - 70.0
4. Kimi K3 - 2.8T-A50B - 69.0
5. GPT-5.6 Luna - 67.2
6. GPT-5.5 - 67.0
7. Claude Opus 4.8 - 59.0
8. Claude Sonnet 5 - 54.0
9. Grok 4.5 - 54.0
10. Muse Spark 1.1 - 53.3
11. GPT-5.4 - 52.0
12. GLM 5.2 - 753B-A40B - 44.0
13. **Laguna S 2.1 - 118B-A8B - 40.4**
14. Gemini 3.5 Flash - 37.0
15. Kimi K2.7 Code - 31.0
16. Claude Sonnet 4.6 - 30.0
17. Gemini 3.1 Pro - 12.0
18. DeepSeek-V4-Pro-Max - 1600B-A49B - 9.0
19. Laguna XS 2.1 - 33B-A3B - 0.3
pass@1 平均每任务 3 次尝试,框架各异(DeepSWE 的排行榜使用 mini-swe-agent,模型提供商可能会在其自己的框架中报告,而我们报告的是在 pool 中的结果,即我们的代理框架)。对于所有基准测试,我们取供应商自我报告分数、基准作者排行榜或第三方排行榜(Artificial Analysis)中的最大值。
值得注意的是,Laguna S 2.1 在我们的代理框架 pool(而非 DeepSWE 排行榜使用的 mini-swe-agent)中得分 40.4%。对于其他模型,我们报告报告分数中的最大值,对大多数模型而言,那是 Datacurve 报告的官方排行榜结果。虽然这降低了分数的可比性,但我们不认为这使我们处于特别有利的位置,因为有报道称,许多模型在使用 mini-swe-agent 时的得分与其原生框架相同或更好。
最终评估运行中的每条轨迹均可在此处 (https://trajectories.poolside.ai/?benchmark=deep-swe&sort=result&dir=desc&variant=thinking) 查看。
## 评估方法
代理模型的评估因奖励黑客现象的普遍存在而出了名的困难。我们之前曾撰文介绍领先基准测试中的奖励黑客现象 (https://poolside.ai/blog/through-the-looking-glass) 以及我们的评估系统和方法(作为 Laguna M.1 和 XS.2 模型技术报告的一部分)。近期的研究集中在对抗性评判上,以增强奖励黑客的检测能力。
在此版本中,我们将在 trajectories.poolside.ai (http://trajectories.poolside.ai/) 上提供并允许下载已发布的 Laguna S 2.1 检查点最终评估中的所有轨迹。
## 观察模型工作
基准测试分数提供了模型行为的量化视角,但为了更直观地理解模型的工作原理,观察其在真实世界任务上的运行非常有帮助。我们分享三个此类任务,附有未编辑的轨迹和评论。
### 案例研究 1 - 从空白文件夹开始构建浏览器引擎
关于 Laguna S 2.1,我们最喜欢的一点是其 **"资源丰富性"**:即使直接路径不可用,它也能找到巧妙的方法达成目标。当我们要求它从零开始构建一个浏览器引擎时,我们看到了一个很好的证明;考虑到模型缺乏视觉能力,这对 Laguna 验证其工作来说是一个挑战。在一次 50 分钟、181 步的会话中,没有任何人为干预,Laguna S 2.1 从一个空文件夹构建了一个可工作的 HTML/CSS 渲染引擎,然后通过对比真实浏览器来证明其渲染效果。在整个工作过程中,尽管存在局限性,模型仍不断找到越来越复杂的验证方法,最终运行无头 Chromium 读取画布,并以数值方式比较截图。
查看完整轨迹 (https://trajectories.poolside.ai/trials/019f6c37-7621-7ec1-96b5-f041f83c1540)
阅读完整案例研究
```
// 原文提示词 · 可自行重现
你的任务是构建一个简单的浏览器引擎(仅 HTML/CSS),使用 JavaScript,以展示 poolside 新型"Laguna S"模型的能力。目标是像真实浏览器一样在画布上渲染 HTML 片段。为展示引擎,构建一个自包含的单页应用,并排展示多个 HTML 片段(使用我们的渲染引擎绘制在画布上 + 使用 iframe 让宿主浏览器真实渲染以作对比)。支持大多数常见的布局和样式元素。
```
在整个会话中,模型使用纯 JavaScript 构建了完整的管线:解析器 → 级联 → 布局 → 渲染器,包括 HTML 分词器和 DOM 树、支持选择器特异性的 CSS 解析器、支持继承的级联引擎、盒子模型布局以及 Canvas 2D 渲染器,最终封装在一个应用中,该应用在画布上显示九段代码片段,同时在同一标记的 iframe 旁边显示,使得宿主浏览器作为参考。
Laguna S 浏览器引擎界面,将其画布渲染与宿主浏览器的 iframe 渲染进行对比。
*屏幕截图:模型的引擎在画布上的渲染(左侧)与宿主浏览器对相同标记的渲染(右侧)并列。标题栏显示像素尺寸以及两者之间的测量差异。*
### 案例研究 2 - 优化我们自己的框架
Laguna S 2.1 能够承担有意义的工程和研究工作。在一个例子中,我们的一名研究人员将其指向我们的代理框架(用于训练/评估和与模型的用户交互)。在自动化循环中,Laguna S 2.1 使我们的框架速度提升了 5.2%,内存分配减少了约 70%。
查看完整轨迹 (https://trajectories.poolside.ai/trials/019f7297-e7f9-7756-9644-6aadb6e2b668)
阅读完整案例研究
对于此项任务,我们为框架添加了基准测试工具,以便模型能精确看到时间和内存的去向。我们设定了严格的规则:一次只做一个方法,每次更改后运行基准测试,只保留那些可衡量地获胜的更改。然后,我们让 Laguna S 2.1 在一个自动化研究循环中运行,该循环将每个结果反馈给它,并推动它持续改进。
**结果**:经过数小时的工作,Laguna S 2.1 在我们的代理框架中发现并实现了多种不同的优化,总体速度提升 5.2%,内存分配减少约 70%。下图显示了优化的进展,以及模型在此过程中的洞察和发现。
Laguna S 2.1 发现流式令牌累加使用了 O(n²) 字符串拼接,并将其替换为缓冲区。它还发现了轨迹物化过程中的几处冗余复制和过度分配问题,通过记忆化物化以及按精确大小预分配切片来解决。值得注意的是,当速度提升变得微不足道且难以在我们的设置中测量时,Laguna S 2.1 仍然继续前进,持续优化。它发现内存分配可以更准确地测量,于是将工作重点转向此处。这进一步证明了 Laguna S 2.1 确实是一个不轻易放弃、理解环境限制并能在限制下持续进步的模型。
- 挂钟时间最佳成绩(排名目标)
- 分配最佳成绩(代理指标)
- 尝试(未改进最佳)
最佳方案(尝试 9):框架时间减少 5.19%,分配减少 71.1%
挂钟记录:-0.368 于 1 (strings.Builder 在流处理中)
挂钟记录:-1.199 于 2 (ActiveSegments 子切片)
挂钟记录:-1.385 于 3 (两遍预分配用于步骤组)
挂钟记录:-1.599 于 4 (连续子切片分组)
挂钟记录:-2.429 于 5 (容量预分配)
挂钟记录:-5.106 于 6 (记忆化 Entries() 每个步骤)
挂钟记录:-5.19 于 9
挂钟非记录尝试:-2.289 于 7
挂钟非记录尝试:-4.231 于 8
挂钟非记录尝试:-3.107 于 10
挂钟非记录尝试:-2.467 于 11
挂钟非记录尝试:-2.366 于 12
挂钟非记录尝试:-4.458 于 13
挂钟非记录尝试:-4.41 于 14
挂钟非记录尝试:-4.749 于 15
挂钟非记录尝试:-2.105 于 16
挂钟非记录尝试:-4.478 于 17
挂钟非记录尝试:-3.445 于 18
挂钟非记录尝试:-2.277 于 19
挂钟非记录尝试:-4.123 于 20
分配记录:1.213 于 1
分配记录:-47.299 于 2
分配记录:-57.291 于 3
分配记录:-62.577 于 4
分配记录:-68.976 于 5
分配记录:-69.455 于 6
分配记录:-70.026 于 7
分配记录:-70.953 于 8
分配记录:-71.147 于 9
分配记录:-72.147 于 11
分配记录:-72.836 于 12
分配非记录尝试:-70.615 于 10
分配非记录尝试:-72.282 于 13
分配非记录尝试:-71.68 于 14
分配非记录尝试:-72.162 于 15
分配非记录尝试:-71.811 于 16
分配非记录尝试:-71.813 于 17
分配非记录尝试:-71.703 于 18
分配非记录尝试:-71.696 于 19
分配非记录尝试:-71.806 于 20
−5.19% −71.1%
尝试 挂钟时间 Δ% vs 基准 分配变更 Δ% vs 基准
优化循环中的尝试 1-20。实线和虚线步骤显示了各自的最佳成绩;空心点是未能改进该最佳成绩的有效尝试。越低越好。
虽然此处使用的基准测试并非完整的生产测试,但我们使用 Go 的竞态检测器和启用 go vet 栅栏对最终运行进行了验证,并测试了最终产物以确认其工作正常。这让我们相信,模型的中间解决方案是有效、稳定的软件,而非通过隐藏竞态条件换取性能提升。
### 案例研究 3 - 离线使用 Perl 重新推导 Erdős 问题 #397
我们发现 Laguna S 2.1 在数学方面的能力超越了以往开发的任何模型。它独立发现了 Erdős 问题 #397(Erdős, Graham, Ruzsa, Straus, 1975)的一个证明,构建了一个能产生无穷多解族的构造。这是一个独立的重新发现,因为该猜想的证明已于 2026 年 1 月由 GPT-5.2 Pro 提前给出 (https://www.erdosproblems.com/397)。我们确信此结果未受先前结果影响,因为模型的知识截止日期为 2025 年 11 月。在 GPT 5.2 Pro 的解决方案之前,这个问题悬而未决超过 50 年。
查看完整轨迹 (https://trajectories.poolside.ai/trials/019f2a95-b4b3-77b8-ad7c-dbdf59c0d9ca)
阅读完整案例研究
```
// 原文提示词
这是一个未解决问题,请解决。设 B_k = C(2k, k) 为第 k 个中心二项式系数。Erdős、Graham、Ruzsa 和 Straus 提问:是否存在有限多个解满足 B_m1 · B_m2 · ... · B_mr = B_n1 · B_n2 · ... · B_ns,其中所有指标都是不同的 ≥ 2 的整数?请解决此问题,并提供完整证明。
```
S 2.1 花了 68 分钟找到了一个确定的解决方案。沙箱中没有 Python;模型找到了 Perl 并在其中进行数论运算:暴力精确质因数分解、模式分析、推测一个族,然后给出证明:一个封闭形式的无穷八指标解族。
B_{11+10n} · B_{14+12n} · B_{18+15n} · B_{22+20n} = B_{12+10n} · B_{13+12n} · B_{17+15n} · B_{23+20n} 对所有 n ≥ 0 成立
尽管结果是 **重新发现,而非首次发现**,但 Laguna S 2.1 推导出的族在结构上与先前发表的构造不同(八个线性增长的指标对比已知的六指标族),显示了全新的推导过程,而非记忆后复述。
我们发现 Laguna S 2.1 是一个在多个领域都异常坚韧的问题解决者,能够找到利用其环境提供所有工具的方法,并坚持工作直至完成。正是这种特性,使其即使与数倍于自身规模的模型相比也极具竞争力。
## 思考努力
Laguna S 2.1 具有两种思考模式:关闭和最大(默认启用),其中模式决定适当的思考/测试时计算预算
相似文章
Hugging Face Models Trending
Poolside发布了Laguna S 2.1,这是一个1176亿参数的混合专家(MoE)模型,其中85亿参数被激活,专为智能体编程设计,具备滑动窗口注意力、原生推理支持和本地部署能力。
Reddit r/LocalLLaMA
Poolside 发布了 Laguna M.1,这是一个 225B 参数的混合专家模型,每个 token 激活 23B 参数,专为代理编程和长周期任务设计。它在 SWE-bench 基准测试上取得了有竞争力的结果,并采用 Apache 2.0 许可证发布。
TLDR AI
Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。
X AI KOLs Following
Poolside 发布了 Laguna S 2.1,这是一个 118B 参数的混合专家模型,每个 token 激活 8B 参数,拥有 1M 上下文窗口,声称可以击败体积是其三倍的模型,例如 DeepSeek v4 Pro、Gemini 3.6 Flash 和 Thinking Machines Inkling。
Hugging Face Models Trending
Poolside 发布 Laguna XS.2,这是一个拥有 33B 总参数、3B 激活参数的 MoE 模型,专为智能体编码设计,可在配备 36GB RAM 的 Mac 上本地部署。