@runsonai: https://x.com/runsonai/status/2079919970209681734

X AI KOLs Timeline 模型

摘要

详细对比了新开源权重混合专家模型 Laguna-S-2.1 与 Qwen 3.6-35B-A3B,突出了Laguna更大的活跃参数数量和长期关注焦点使其在扩展任务中表现更优,尽管速度较慢。

https://t.co/qHRJ1I2Myu
查看原文
查看缓存全文

缓存时间: 2026/07/24 17:18

Laguna-S-2.1 对比 Qwen 3.6 35BA3B

我差点就把这个模型放弃了。然后我让它跑了一整夜。

快到午夜了,我正准备合上笔记本电脑。那天 poolside 团队发布了一个新的开放权重模型 Laguna-S-2.1,我花了晚上的部分时间用我惯常的测试集跑了一遍。结果还行。算不上惊艳。在我测试的一些短编码任务上,它没能打败我办公室 GX10 机器上已经在生产环境运行的 Qwen3.6-35B-A3B。我当时的真实反应是“好吧,挺酷的,下一个。”

然后睡前我又刷了一遍 X。poolside 的人一直在反复强调他们模型的同一件事:它是为长周期工作打造的。那些需要运行数小时的任务。不是巧妙的单次回答。

这话让我停了下来。因为长周期恰恰是我过去几个月一直在挣扎的事情。

如果那些名字看起来像车牌号

这里有个值得理解的部分,因为它解释了整个取舍。

Qwen3.6-35B-A3B 中的 A3B 代表 30 亿活跃参数。该模型总共有 350 亿参数,但生成每个词时只激活其中大约 30 亿。这种设计叫做混合专家模型。想象一家有 200 人的咨询公司,每个问题只会被分派给 2 或 3 个真正懂行的专家,而不是每次把 200 个人都拉进会议室。

这样做的回报是速度。你得到接近大模型的知识,但运行成本却像小模型。而较旧的方法,称为密集模型,每个词都会激活所有参数。纸面上同样大小,运行起来却慢得多。

这里有个值得精确说明的部分,因为我一开始理解错了。Laguna 也是一个混合专家模型。它采用相同的架构,但拨到了一个非常不同的刻度:总参数 1180 亿,每个 token 激活约 80 亿,而 Qwen 是 350 亿总参数和 30 亿激活。Laguna 保留了 256 位专家,每次会议拉进 10 位,大约 7% 的模型在任意时刻被激活。

所以 Laguna 不是因为架构不同而更慢。它更慢是因为它是一个大得多的建筑,每个房间里的人更多。每个 token 的活跃参数几乎是 Qwen 的 3 倍,要存放的总权重也是 3 倍以上。在我的硬件上,这导致 Qwen 每秒约 120 个 token,而 Laguna 是 39 个 token。两者都经过量化以适应机器。两者都使用一种称为推测解码的技巧来挽回一些速度。

所以这从来就不是一个快与慢的故事,也不是小与大的故事。两个以相同方式构建的模型,在同一个刻度盘上调到了不同位置。快不等于聪明。输掉长任务的那个是快的。

我已经花了几个小时的问题

我在办公室的机器上运行本地模型,因为它们几乎免费。你只需要付电费。就是这样。没有 token 账单,没有月度上限,没有计量表在凌晨 3 点运行一个代理做无聊事情时跑着。

问题是,你桌面上的模型只是系统的一半。另一半是工具链,也就是把任务交给模型并保持它诚实的软件。我选择的工具链是 pi。为了让 pi 能与 Qwen 一起处理任何长运行任务,我不得不构建了一个完整的扩展:循环断路器、大小守卫、分类账、以及在模型开始空转时推动它前进的提示。我花了无数个小时在那东西上。精细调整它,使 /goal 和 /loop 能够承受数小时的任务。

为什么那个扩展需要存在?因为 Qwen 在短时间内表现出色,但在长时间跨度中就会崩溃。我知道这一点。我一直在为一个已知的弱点搭建脚手架,并称之为解决。

所以,当一个模型声称它特别擅长我一直在补偿的那个确切领域时,这值得我机器 6 个小时的时间。反正我也要睡觉了。

我为什么要费心做基准测试

我测试新模型不是为了好玩。现在有客户要求使用本地模型,这意味着在把某个模型放入他们的业务之前,我需要真正了解这些东西能做什么、不能做什么。

所以我测试一系列工作,而不是单一分数。代理工作流,模型必须规划和执行多个步骤,不需要人类推动。工具调用,听起来很无聊,但在我的清单上可能是最重要的技能。如果你想运行像 Hermes 或 OpenClaw 这样的东西,一个搞砸工具调用的模型,无论它写得多好,都是无用的。然后是编码,这是大多数需求的来源。

以下是在长测试前一天晚上,这个测试集所说的话。每个单元格是 5 次全新运行的平均值,两个模型都处于最佳配置,对两者来说这意味着关闭思考模式。越高越好,1.0 是完美的。

看看这个,你就能理解为什么我当时只是耸耸肩。Laguna 赢得了大多数单元格,但优势小到足以被视为噪音,除了测试套件编写这一项,它在那里是 Qwen 的两倍多。它在代理调查上输了,而这正是我对 Hermes 和 OpenClaw 最关心的方面。这里没有任何东西说“围绕我重建你的堆栈”。

跑足够多的这种测试,就会显现出一个模式。模型并不是在一个从愚蠢到聪明的梯子上排名。它们有形状。一个快速而广泛。另一个耐心而狭窄。错误在于问哪个更好,而不是问你要把哪个工作交给它。

我睡觉前设置的实验

在家拥有机器的好处之一是,当你合上笔记本电脑时,工作不必停止。

我给我的 Claude 会话分配了一个晚上的任务:构建一个真正长的测试,然后让两个模型都跑一遍,早上告诉我结果。

它构建的任务很刁钻,以一种好的方式。一个包含 10 个模块的 Python 库,259 个测试,其中故意植入了 32 个 bug。然后它完全删除了一个模块,只留下了书面规范,所以模型必须从头编写一个解析器才能使这些测试通过。起始分数:259 个中通过 169 个。两个模型得到了相同的工作、相同的起点、400 轮可用次数,以及最多 5 小时的墙上时钟时间。

这就是真实工作的样子。不是“给我写个函数”。更像是“这里有一个代码库,它以一种没人告诉你的方式坏了,去修复它,在测试变绿之前不要停下来。”

我醒来时看到的

Qwen 从未编写过一个文件。

它探索了大约 20 轮,看起来还挺健康。然后它陷入了一个循环,一遍又一遍地运行测试套件。211 次相同的测试运行。250 轮。零次编辑。分数始终冻结在 169,我最终让人把它杀掉了。它并非不理解问题。它只是无法将理解转化为持续的行动。

刺痛人心的细节:在相同测试的较小版本上,Qwen 在 31 轮内解决了问题。规模是触发因素。把工作做得足够大,轮子就掉下来了。

Laguna 从 169 上升到了 259 中通过 257 个。它用了 61 轮和大约 55 分钟。零回归,意味着它从未破坏一个已经通过的测试,这是我在某物无监督地编辑我的代码时最关心的失败模式。分数一路上升:169,然后是 234,然后是 243、249、255、257。这是一个真正在工作的模型,而不是在瞎折腾。

相同的硬件。相同的任务。同一个夜晚。

下面是带有数字的相同比较:

我反复回看的两行是测试套件运行次数和 token 数量。Qwen 运行了 211 次测试,生成了 8,300 个 token,这是一个模型反复阅读相同的失败信息却从未决定改变任何东西的标志。Laguna 运行了 8 次测试套件,写了 74,000 个 token,在每次检查之间批量处理一堆修复。这才是人会做的方式。

如果我不提这部分,那就是在说谎

Laguna 在第 61 轮时退出了,还有 2 个测试未通过。它在预算中还有 339 轮可用。

它没有崩溃或打转。它决定自己完成了,但实际上并没有。这是一个真正的弱点。对于我想用它做的事情(一个在我睡觉时无人看管运行的代理),一个在完成 99% 时提前停止的东西仍然是我必须解决的问题。

好消息是,这是一个工具链问题。我知道如何解决这类问题。当我通过 pi 再次运行整个任务,并在它前面加了一个完成门控时,门控拒绝了模型第一次声称的“完成”。模型回去纠正了自己,而不是退出。这是实时生效的修复,而不是纸面上的。

同样需要直说的是:这只是那个规模下的一次运行。不是 5 次。我通常坚持每个测试至少跑 3 次,因为我见过相同的设置在相同条件下得出截然不同的分数。当每次运行需要数小时时,你就要做出取舍,我是在知情的情况下做出的。从“零编辑崩溃”到“修复 88 个测试”之间的差距足够大,让我感到放心,但我不会假装这在统计上是无懈可击的。

通用模型与专用模型

我从中学到的更大教训是关于我如何评估本地模型。

Qwen 是一个通才。它能处理视觉,这对我的许多涉及截图和文档的工作流很重要。在我的硬件上,它速度大约是 Laguna 的 3 倍。对于快速交互式工作,它仍然是不二之选。它仍然在我的生产端口上服务。

Laguna 没有视觉能力。它是为代码构建的。从纸面上看,这是一个更窄的模型。我的第一个基准测试把这种窄当作缺点,因为我衡量错了东西。我在测试短任务上的峰值性能。对于我使用这些东西的方式,真正重要的是模型能否在没有人类在场的情况下保持 4 小时的一致性。

这些是不同的问题。一个模型可以在一个问题上获胜,而在另一个问题上惨败。我现在认为本地模型世界正在分裂为通才和专才。挑选一个“最佳本地模型”的做法,其过时速度大概会和挑选一把最佳厨房刀一样快。

经过所有这些测试,我终于可以说出 Laguna 到底是干什么用的了,这比知道它在排行榜上的位置对我更有用。它的用途是长时间运行的编码工作。不是研究,不是视觉,不是快速回答。给它一个庞大混乱的代码库加上几小时的时间。它能做到我从未能让 Qwen 做到的事情。

你一直在根据实际交给模型的工作形状来评估模型吗?我以前没有。我的测试集里充满了短任务,因为短任务容易评分。

技术细节,给需要的人

两个模型都在 GX10 上一次运行一个,因为 121GB 内存不足以同时容纳两者。两者都量化到 NVFP4 以适应。两者都使用推测解码,即一个较小的辅助模型猜测接下来的几个 token,以便大模型可以批量验证,而不是逐个生成。接受长度是这些猜测平均幸存的数量,所以越高意味着这个技巧对你越有用。

那个首次 token 生成时间是人们低估的数字。99 毫秒对 293 毫秒在纸面上感觉没什么。但坐在两个模型前面一个下午来回工作,Qwen 感觉生动,而 Laguna 感觉像是在思考是否要回答你。对于交互式使用,这个差距决定了你实际上会伸手去拿哪一个。

现在反过来。在一个无人观看、运行一小时的作业上,首次 token 生成时间毫无意义,每秒 token 数只决定了墙上时钟时间。Laguna 以 39 tok/s 的速度在 55 分钟内完成了长任务。而 Qwen 以 3 倍的速度,在尝试了 26 分钟后什么也没完成。速度只有在模型朝着某个方向前进时才重要。

如果你自己运行这些模型,有一个配置说明:对两者都保持思考模式关闭。对 Laguna 而言,它在质量上毫无好处,损害代理工作,并使 token 数量增加三倍。对 Qwen 而言,它确实有帮助,特别是在测试编写上,但代价是大约 10 倍的 token 和每次运行 16 分钟。我在本页的所有数字中都将其关闭了。

我现在用它做什么

我正在重建我的 pi 扩展,使其能运行两个模型,根据工作路由。Qwen 用于快速交互内容以及任何涉及图像的东西。Laguna 作为编码执行器:错误分类、根本原因分析、建议修复,以及更大项目上的漫长艰辛会话。

那个扩展最初是专门为 Qwen 构建的,这对其实际用途来说一直有点自欺欺人。实际上,底层的循环断路器、守卫和分类账从来就不是 Qwen 特有的。所以我正在将其拆分为一个中性核心,加上每个模型系列的薄适配器,并且我计划开源它。如果你有一台机器和一个本地模型,你应该能够将其指向你自己的硬件,并获得一个能够完成长作业的编码代理。

我从几乎删除这个模型,转变为计划围绕它构建下个季度的工作。全因为我在一个空闲的夜晚燃烧了一下机器,相信了一个不是在看真实问题的测试。

选出你最希望 AI 在你睡觉时做的那一件工作。构建一个与该工作实际耗时一样长的测试,然后让你的模型在上面跑一夜。从那一个晚上你学到的,会比阅读一个月基准图表学到的更多。

相似文章

介绍 Laguna XS 2.1(5分钟阅读)

TLDR AI

Poolside 发布 Laguna XS 2.1,这是一个 33B 参数的混合专家模型,每个 token 激活 3B 参数,专为智能编码设计,在 SWE-bench Multilingual 及其他基准测试上有所改进,现已在宽松的 OpenMDW-1.1 许可证下提供。

Unsloth 推出的 Laguna S 2.1 量化版本已发布

Reddit r/LocalLLaMA

Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。