2026年中本地模型
摘要
2026年中本地AI模型的技术概览,重点介绍开放权重模型如何通过混合专家模型和稀疏注意力机制的进步缩小了与前沿模型的差距,从而实现高效的本地推理。
开放权重今年已经足够接近可以在本地运行,不是通过需要更多RAM,而是相反:稀疏注意力、MoE、潜在KV压缩、多token预测和四比特量化。
查看缓存全文
缓存时间: 2026/06/15 00:53
# 2026年中本地模型:缩小差距的工程学突破 · coles.codes
来源:https://coles.codes/posts/local-models-mid-2026
2026年本地模型的故事比表面上的头条要安静得多。开放权重的模型并没有追上前沿水平,但在我们大多数人日常所做的工作上已经足够接近。自己本地运行LLM不再只是一个业余爱好项目,而已经成为一个合理的选择——无论你是需要一个用于写作和研究的基础模型,还是将其作为专门的智能体来运行。
我觉得有趣的是让我们走到这一步的工程学突破,而且进展并不仅仅意味着我们需要更多内存来运行更大的模型。恰恰相反:人们找到了在不损失质量的情况下,减少每个token的计算量和内存消耗的方法。
## 我当前最喜欢的模型
(https://coles.codes/posts/local-models-mid-2026#my-current-favourite-models)
Qwen 3.6 发布了一个开源的密集 27B 模型,以及一个 35B 的混合专家模型(MoE),后者每个token仅激活约 3B 参数。Google 的 Gemma 4 覆盖了多种尺寸,其中较大的模型远超其参数规模的表现。GLM-5 是一个 744B 的混合专家模型(MoE),而 Kimi K2.6 则是一个万亿参数模型,激活参数为 32B(不过 GLM-5 和 Kimi K2 都需要相当大的内存才能在我的本地设备上运行😅!)。DeepSeek 在四月预览了 V4 的两个版本:Flash 和 Pro,两者都是 MoE 架构,支持百万 token 的上下文。
有趣的是,以上列表中的模型几乎没有一个是需要完整加载的密集模型。总参数量很大,但激活参数量很小,而这正是本文接下来要讨论的核心。
## 稀疏注意力
(https://coles.codes/posts/local-models-mid-2026#sparse-attention)
标准注意力是二次方复杂度的:计算量随着上下文长度的平方增长。每个新 token 都必须回头看所有之前的 token,因此上下文长度翻倍意味着两倍的 token 数,每个 token 需要做两倍的回顾工作,总共是四倍的计算量。上下文长度变为十倍,计算量就是一百倍。当上下文达到百万 token 时,这个开销确实会累积起来——这很可能就是上下文窗口长期保持较小的原因(另一个原因是,一旦上下文变长,模型会忘记你最初提出的问题)。
```
关注方向 ->
t1 t2 t3 t4 t5 t6 t7 t8
完整 t4 ■ ■ ■ ■ 每个 token 读取其之前的所有
t8 ■ ■ ■ ■ ■ ■ ■ ■ token:n 个 token 执行
n 次回溯 = n²
稀疏 t8 ■ · · ■ · · ■ ■ 一个较小的近端窗口加上
索引器选取的 top-k
```
DeepSeek 的工作是稀疏注意力的绝佳例子。DeepSeek V3.2 引入了他们称之为 DeepSeek Sparse Attention 的机制,而 V4 在此基础上做了改进。该机制是一个“闪电索引器”(lightning indexer),一个以 FP8 运行的低成本评分函数,用于决定每个查询 token 应该关注哪些更早的 token。你保留一个较小的近期 token 滑动窗口,以全精度保持局部连贯性;而对于更早的内容,你只关注索引器标记的 top-k 个 token。复杂度从二次方降到了所选集合上的近似线性。索引器运行在独立的 CUDA 流上,因此其延迟隐藏在其他工作背后,不会成为关键路径。
DeepSeek 报告称,V4-Pro 在百万 token 上下文下,每个 token 的推理 FLOPs 大约是 V3.2 的四分之一,KV 缓存仅为 V3.2 的十分之一——这正是长上下文从“演示可用”到“真正可构建”之间的差距。
## 混合专家模型
(https://coles.codes/posts/local-models-mid-2026#mixture-of-experts)
MoE 是一个万亿参数模型能够运行的原因。它不是使用一个大型的前馈网络(dense feed-forward network),而是拥有多个较小的“专家”网络,以及一个路由器,将每个 token 发送给其中少数几位专家。Kimi K2.6 有 384 个专家,每个 token 激活其中八个专家加上一个共享专家。GLM-5 激活其 744B 总参数中的大约 40B 参数。模型拥有其全部参数的知识容量,但每个 token 的开销却小得多。
值得注意的是,即使每个 token 只触及少数专家,你仍然需要将所有专家都保存在内存中。因此,MoE 在计算和带宽方面是便宜的,但在容量方面非常重。这种紧张关系正是下面硬件部分重要的原因,也是统一内存系统几乎偶然地适合这类模型的原因。
## KV 缓存问题
(https://coles.codes/posts/local-models-mid-2026#the-kv-cache-problem)
人们低估了这个问题。对于长上下文,以及那些会生成两万个工作过程 token 的推理模型,推理时占主导地位的内存成本并非权重,而是 KV 缓存——即迄今为止每个 token 所存储的键和值。它随着上下文长度线性增长,并且必须留在快速内存中。
今年有两类应对方法随处可见。第一种是多头潜在注意力(Multi-head Latent Attention),DeepSeek 的技巧是将 KV 缓存压缩为低秩潜在表示,而不是完整存储,这可将占用空间减少约 90%。Kimi 和其他模型采用了变体。第二种更简单:以较低精度存储缓存,FP8 以及越来越多的 FP4,这可将内存需求减半或减四分之一,而精度损失很小,并且通常可以通过训练恢复。将压缩注意力与压缩、量化后的缓存结合,长上下文的内存墙就被大大推远了。
## 多 token 预测
(https://coles.codes/posts/local-models-mid-2026#multi-token-prediction)
这个很简单,也是为什么今年本地生成感觉更快的原因。通常,模型生成一个 token,将其反馈,再生成下一个,逐一进行。每一步都受限于内存带宽而非数学计算,因此硬件大多处于闲置状态,等待权重到来。
多 token 预测——由 DeepSeek-V3 在大规模上验证,并且现在 Gemma 4、Qwen 等模型均已采用——则将空闲的算力利用起来。它使用一个小型廉价的草稿模型(drafter)提前猜测多个 token,然后让完整模型在单次并行传递中验证所有这些 token。它接受匹配的序列,抛弃其余部分。DeepSeek 报告称,第二个预测的 token 被接受的概率为 85% 到 90%,从而获得大约 1.8 倍的吞吐量提升。Gemma 4 为此专门配备了小型草稿模型,它们共享主模型的嵌入和 KV 缓存,因此运行成本几乎为零。
使这成为可能(且并非质量折衷)的特性在于它是无损失的:大模型仍然检查每个 token,因此输出完全相同,只是速度更快。缺点是收益取决于工作负载。可预测的文本草稿效果好,运行快;而真正新颖或高熵的输出会导致更多草稿被拒绝,每次拒绝都是浪费的计算。在已经很快的小模型上,记账开销有时会使事情变慢,因此收益是真实的,但多大程度上取决于你生成的内容。
## 四比特量化
(https://coles.codes/posts/local-models-mid-2026#four-bit-quantisation)
另一个悄然发生的转变是精度。FP4,即 NVFP4 和 MXFP4 格式,已从研究走向产品发布。OpenAI 以原生 MXFP4 格式发布了 gpt-oss。Nvidia 的 Blackwell 在硬件上支持 FP4。Qwen 3.6 27B 模型在四比特量化下从约 17GB 降至 NVFP4 下的约 14GB,而量化感知训练(quantisation-aware training)恢复了大半因简单舍入而丢失的质量。在小型或敏感模型上,FP4 确实会带来精度损失,因为微小的块大小与异常值处理交互不佳;但对于较大的模型,它已从折衷方案变成了合理的默认选择。
## 内存供应紧张
(https://coles.codes/posts/local-models-mid-2026#the-memory-supply-crunch)
所有这些工程进步使模型运行成本降低,但今年我们在运行本地模型时遇到了其他问题:由于 AI 竞赛中人人都在购买硬件,硬件变得极其昂贵。
内存制造商将产能转向数据中心 HBM,因为每片晶圆的 HBM 收入是普通 DRAM 的数倍,而且一片 HBM 晶圆大约会挤占三片普通 DRAM 晶圆的产能。传统 DRAM 合约价格在 2026 年初逐季上涨约 90% 到 98%,PC DRAM 涨幅甚至超过 100%;NAND 紧随其后,1TB SSD 价格大约翻了一倍。SK Hynix 在财报电话会议上表示,明年的产能已经售罄,任何真正缓解——让想购买 GPU、内存和硬盘的人看到希望——预计要到 2027 年底。
时机有点讽刺:模型终于好到可以在家运行了,而用来运行它们的设备却变得昂贵。一个好处是,本地推理机不必由一堆 GPU 构成;你可以使用统一内存系统——比如 Apple Silicon Mac Studio 或 AMD Strix Halo 迷你 PC,它们拥有 CPU 和 GPU 共享的 128GB 内存。这非常适合 MoE,因为这类模型需要大量容量来存放所有专家,但只需要适度的带宽来运行回答查询所需的少数专家。二手 3090 仍然是预算之选,而 5090 是快速之选(如果你有钱的话)。中间地带且有趣的硬件现在是统一内存系统,尽管它们也变得越来越贵。
今年晚些时候,我们将看到一些其他硬件,例如 Nvidia 的 RTX Spark——于五月底与微软共同发布(https://nvidianews.nvidia.com/news/nvidia-microsoft-windows-pcs-agents-rtx-spark),预计今年秋季发货。它是一个 Grace CPU 和 Blackwell GPU 组合成的超级芯片(superchip),拥有高达 128GB 的统一内存,其卖点是可以在轻薄笔记本电脑上本地运行 120B 参数的模型,支持百万 token 上下文,这些笔记本来自戴尔、联想、惠普和 Surface 等品牌。
我已经有一台较旧的 DGX Spark 放在桌上,因此我对 RTX Spark 上的体验有相当可靠的预判;我怀疑内存带宽以及散热仍会是推理时的瓶颈。我会关注评测,希望这些问题有所改进;如果能够在一台拥有如此多统一内存的便携设备上拥有完整的 CUDA 栈,那将让 2026 年末的本地推理在硬件选择上更加有趣。在我购买之前,我想看到带宽数据以及真实的 tokens-per-second 数字,但这仍然是我目前最关注的硬件。
## 与闭源模型的差距所在
(https://coles.codes/posts/local-models-mid-2026#where-the-gap-to-closed-models-sits)
Epoch 的测量(https://epoch.ai/data-insights/open-closed-eci-gap)是一个很好的基准,它显示最佳开源模型大约落后闭源前沿四个月。这比他们在过去几年中测量的三个月平均值(https://epoch.ai/data-insights/open-weights-vs-closed-weights-models)稍宽。在编程和智能体任务上,开源模型与闭源模型相差只有几个百分点,你很可能察觉不到差异。在困难推理和新颖数学这类真正有难度的任务上,闭源前沿仍然领先,而且你能感受到这种差距。
至于具体的基准分数,Artificial Analysis 的六月指数(https://artificialanalysis.ai/articles/recent-open-weights-model-launches)显示:Kimi K2.6 为 54 分,而 GPT-5.5 为 60 分,Claude Opus 4.7 为 57 分;DeepSeek V4 Pro 与 Sonnet 4.6 水平相当;而真正能装在单张 GPU 上的小型密集模型——Qwen 27B 和 Gemma 31B 级别——则低一个档次。他们的指数主要基于编程、工具使用和智能体评估构建,因此衡量的是我刚刚谈到的日常工作。他们没有任何一张图表同时包含本文中提到的所有模型,因此我尝试将自己的图表整理如下:
需要注意的是,基准测试存在两个问题。如今每个模型都在基准测试上刷分,因此公开分数对所有人都有些虚高。还有一个模型尚未体现:Claude Fable 5(https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5),就在我写这篇文章时它发布了;如果早期数据成立,那么“四个月差距”这个数字在乐观方面已经过时了。另一方面,对很多人来说,这些分数超过某个点后就无关紧要了:一个足够好的模型装在一个合适的框架里,已经能满足他们的日常需求;对他们所做的大部分事情来说,这是一个非常令人满意的状态。
## 为什么我自己运行模型
(https://coles.codes/posts/local-models-mid-2026#why-i-run-my-own)
我在家运行模型,因为这是学习发生的地方。花一个下午的时间搞清楚为什么同一个模型在一台机器上每秒生成 14 个 token,而在另一台机器上是 40 个;观察 KV 缓存在你推高上下文时吃掉你的显存——这比花一个月阅读相关文章学到的东西更多。
另一半原因是灵活性。开源栈让我可以在模型发布当天拉取它,量化它以适应任何空闲的盒子,在我自己的数据上微调它,并将敏感内容保存在我控制的硬件上。
这一切之所以可能,全凭上述工程大多是开放的:稀疏注意力、MoE 路由、潜在 KV 压缩、多 token 预测以及四比特量化,都是发表的论文和合并的代码,而非商业机密——而这正是该领域值得保护的部分。模型好用固然不错,但方法保持开放才给了我们其余人选择的权利。
相似文章
本地模型是否比预期更快变得“足够好”?
这篇文章讨论了本地AI模型在日常任务中日益增长的可行性,暗示了向混合架构的转变,这种架构优化成本和延迟,而不是仅仅依赖前沿的云模型。
本地模型从几乎无用迅速变得真正有用。是什么发生了变化?
文章指出,过去一年中,本地AI模型变得显著更有用,从玩具变成了编程和工作流程的实用工具,尽管在复杂任务上仍落后于闭源模型。
专注打磨,推动本地模型
本文批评了当前用于编程助手的本地AI模型现状,认为虽然可运行性有所改善,但由于缺少工具参数流式传输等功能以及推理引擎间的过度碎片化,用户体验大打折扣,远不如使用托管API那般精致。
@ClementDelangue: 叙事矛盾:根据@Stanford的研究,本地模型能够准确回答71.3%的真实世界聊天和推理问题…
斯坦福大学研究表明,本地模型现在能准确回答71.3%的真实世界查询,而2023年仅为23.2%,这表明大多数任务不需要前沿模型,未来将是多模型模式,多数工作负载由本地、开源模型承担。
现在运行本地模型已经很不错了
作者报告说,运行本地AI模型如今已经表现出色,最近发布的GPT-OSS和Gemma 4等模型使得在本地进行自主编码的准确率达到了前沿模型的大约75%,与几个月前相比有了显著提升。