@FinanceYF5: 阅读文章:https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/…

X AI KOLs Following 新闻

摘要

这篇文章强调了截至2026年6月开放权重AI模型日益增长的重要性,DeepSeek V4 Flash作为一种高性价比、高性能模型出现,在代理任务上与GPT-5.5等前沿模型相媲美。

阅读文章:https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/…
查看原文
查看缓存全文

缓存时间: 2026/06/29 12:38


值得关注的开放权重模型:2026年6月

来源:https://openrouter.ai/blog/insights/the-open-weight-models-that-matter-june-2026/ 过去几个月,一系列引人注目的开放权重模型相继发布,其中包括来自中国和美国的新玩家。此外,随着成本成为大规模AI应用组织的核心关注点,开放权重模型迎来了高光时刻。与许多人的预期相反,开放权重模型的智能和能力正与美国前沿实验室保持同步,并且已经持续超过18个月保持3-6个月的差距。前沿实验室(至少在目前)似乎并未加速拉开与开放权重实验室的距离。

将工作负载从前沿模型转移到开放权重模型,可以带来巨大的成本节约机会。前沿模型必然会继续演进,但对于任何固定的智能水平,成本将持续下降。

考虑到发布的节奏、能力的参差不齐以及新的进入者,很难弄清楚哪些模型值得关注以及为什么。截至2026年6月,我们认为以下四个开放权重模型最为重要。

1. DeepSeek V4 Flash (https://openrouter.ai/deepseek/deepseek-v4-flash) —— 首个跨越智能体门槛的模型

DeepSeek V4 Flash 是首个团队立即将其投入实际智能体流水线、作为Anthropic或OpenAI类前沿模型可行替代品的开放权重模型。更大的V4 Pro变体以SWE-bench Verified 80.6%的分数设定了天花板,这是开放权重中的最高分,与GPT-5.5级别的智能体性能相当。但真正取得突破的是Flash,因为它以处于性能与成本帕累托前沿的价格捕获了其中大部分能力。

数据印证了这种行为。Flash采用MIT许可,约284B参数/约13B活跃的MoE架构,支持1M token上下文,在SWE-bench Verified上获得79.0%的分数——仅比Pro的80.6%低约1.6个百分点,也低于其自身的约1.6T/49B兄弟模型。该模型于2026年4月发布。

采用率也很大程度上由价格驱动;DeepSeek的第一方API将Flash的定价列为每百万token $0.14 / $0.28(输入/输出),但保留数据进行训练。使用缓存后,实际价格甚至更低(每百万输入token $0.029)。DeepSeek以该定价推出模型,并宣称是75%的“折扣”,并于5月将该定价永久化。这约为GPT-5.5输出成本的150分之一。然而,DeepSeek会保留并使用你的数据进行训练。

不进行数据训练的西方托管服务商(例如Fireworks、Together、DeepInfra)收费大约是第一方价格的两倍。对于这种智能水平来说,仍然是极佳的价值。我们不知道训练数据的价值在多大程度上使得DeepSeek能够实现低价,还是由于计算补贴等原因——但可以肯定的是,这种低第一方价格已经为所有提供商创造了竞争动态,从而为这种智能水平带来了极低的价格。

OpenRouter在模型页面的供应商标签页 (https://openrouter.ai/deepseek/deepseek-v4-flash#providers) 的详细信息窗格中公开了每个供应商的所属国家,并允许对您和您的组织可以接受的数据政策进行精细控制。

注意事项: 仅支持文本;不支持图像或视频输入。第一方API通过中国路由数据,其服务条款允许基于你的数据进行训练——不过如前所述,在不进行训练的西方托管服务商处可以以可比价格获得。据传闻,该模型更擅长技术工作,在写作和语调方面满意度较低。我们还看到报告称,与Anthropic模型相比,提示需要优化——Flash在给出非常具体的指令时表现更好,而不是依赖其自身的判断。

何时选用: 当您想要一个前沿级别的智能体/编码模型,但成本仅为一小部分时。从Flash开始;仅在边际质量值得溢价时才升级到Pro。

2. GLM 5.2 (https://openrouter.ai/z-ai/glm-5.2) —— 让Opus式智能体编码变得可移植的开放模型

GLM 5.2于6月中旬发布,但早期评价非常积极。如果说DeepSeek在价格上取得突破,那么GLM 5.2似乎在规划质量和长周期编码上取得了突破。

Artificial Analysis (https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index) 将GLM 5.2评为开放权重模型在智能指数(v4.1)上的第一名,得分51,领先于Nemotron 3 Ultra(48)、MiniMax M3(44)、DeepSeek V4 Pro(44)和Kimi K2.6(43),仅落后Claude Fable 5约5分。它在Artificial Analysis的实际智能体基准测试(GDPval-AA v2)中领先于所有开放权重模型,与GPT-5.5 xhigh基本持平。

采用率尚处早期,但该模型已经可以通过一系列有意义的第三方托管服务商获得。定价不像DeepSeek那么便宜,但仍显著低于封闭的前沿编码模型。实际定价为OpenRouter加权平均每百万token $0.447 / $3.31(输入/输出)。虽然按token计价比GPT-5.5 / Opus类模型便宜,但该模型倾向于进行大量思考,可能在输出token上快速消耗美元。

还存在地缘政治方面的推动因素。GLM 5.2在美国出口管制指令发布几天后推出,该指令迫使Anthropic广泛禁用Fable 5和Mythos 5以防止外国公民访问。一个具有接近前沿编码性能的MIT权重模型,对于需要连续性的组织来说,变得更具吸引力。

注意事项: 仅支持文本;不支持图像或视频输入。它消耗token较多,在高思维模型上可能烧钱。它仍然非常新,供应商质量会有所不同。各供应商的吞吐量峰值约为~78 tok/s(而DeepSeek V4-Flash约为~84 tok/s)。

何时选用: 最适合作为智能体规划和编码的直接替代品。在架构规划、仓库级重构或长时间运行的智能体任务中表现出色。当质量和规划比最低价格更重要时,选择它而非DeepSeek。

3. MiniMax M3 (https://openrouter.ai/minimax/minimax-m3) —— 多模态长上下文模型

MiniMax M3 是本组中唯一不仅理解文本,还能原生理解图像和视频的模型。如果你的智能体需要读取截图、检查UI状态、解析图表或对视频进行推理,M3是首先要测试的开放权重方向。

Artificial Analysis将M3在其智能指数(v4.1)上评为44分——与DeepSeek V4 Pro持平,落后于GLM 5.2和Nemotron 3 Ultra,但其差异在于模态,而非原始指数排名。更具说服力的是,它在Artificial Analysis的实际智能体基准测试GDPval-AA上与Claude Sonnet 4.6大致持平。它也是一个真正的长上下文模型:约428B参数/约23B活跃MoE,支持1M token上下文,以及MiniMax稀疏注意力(Sparse Attention)使百万token推理不那么荒谬。

实际定价具有吸引力,OpenRouter加权平均为每百万token $0.098 / $1.21(输入/输出)(但在上下文长度超过512k token时价格会上涨)。但与GLM一样,便宜的token并不意味着便宜的整体运行成本。M3可能比较冗长且推理密集。

架构也具有创新性;MSA使用基于真实K/V块的块状稀疏注意力,而不是单独的检索或压缩系统。论文报告称,可以在没有重大质量损失的情况下大幅减少注意力计算。在实践中,这就是M3能够以合理成本支持整个仓库、长文档、截图密集或基于视频的智能体的原因。

注意事项: 非MIT许可。权重已发布,但受MiniMax社区许可约束:商业用途需要注明出处/通知,较大的商业产品需要事先书面授权。供应商质量和完整上下文支持会有所不同。它也不是本组中最佳的纯编码模型;对于纯文本智能体编码,GLM 5.2可能是更好的默认选择。

何时选用: 当您需要具有原生图像或视频输入的长上下文智能体时。最适合UI自动化、截图转代码、图表/文档理解、基于视频的工作流程,或混合模态的仓库/文档智能体。很可能成为同样在多模态理解方面表现出色的Gemini Flash模型的强劲竞争对手。

4. NVIDIA Nemotron 3 Ultra (https://openrouter.ai/nvidia/nemotron-3-ultra-550b-a55b) —— 美国开放权重加速器

NVIDIA的Nemotron 3 Ultra是最明显的信号,表明强大的开放权重模型并非仅来自中国实验室。它总体上不是最好的开放模型,但它是美国最强的开放权重参赛者:一个严肃的推理模型,专为企业部署构建,背后有NVIDIA的硬件和软件栈支持。

基准测试结果扎实。Artificial Analysis将Nemotron 3 Ultra在其智能指数(v4.1)上评为48分——在开放权重模型中排名第二,仅次于GLM 5.2(51分),领先于MiniMax M3、DeepSeek V4 Pro和Kimi K2.6,并且稳居美国开放权重参赛者之首。其差异化之处在于部署效率。OpenRouter的加权平均价格为每百万token $0.423 / $2.61(输入/输出),另有一个独立的**:free** 路由,它非常受欢迎并推动着采用。

该模型是一个550B/55B活跃的混合Mamba-2 + Transformer MoE,采用NVFP4训练,支持1M上下文、多token预测,并采用OpenMDW许可。NVIDIA还发布了比权重更多的内容:数据、配方、评估工具和RL基础设施。NVIDIA的动机很明确:更广泛的开放模型使用(以及更多有意义模型)意味着对Blackwell/Hopper推理、NIM微服务、CUDA、AI Enterprise和主权AI部署的更大需求。Nemotron是一个模型,但它也旨在促进整个开放生态系统,进而促进NVIDIA AI栈。

请关注NVIDIA在此方面的努力,因为他们有动力继续在全球生态系统中推广模型,并且拥有雄厚的资金来资助研究和训练,以跟上世界上任何一个实验室的步伐。

注意事项: 仅支持文本;不支持图像或视频输入。在原始智能上落后于GLM 5.2,而更广泛的中国开放前沿在峰值编码得分上领先。免费路由对测试和采用有用,但不足以围绕它构建一个严肃的生产SLA。此外,虽然许可相对宽松,但它是OpenMDW,而非MIT。

何时选用: 当您想要一个美国构建的开放权重模型用于长时间运行的智能体、RAG、编排、编码支持或企业工作流,并且速度、可部署性、数据控制和供应商舒适度比绝对基准排名更重要时。对于顶级的开放编码质量,选择GLM或DeepSeek;当栈很重要时,选择Nemotron。

概览

模型AA指数 (v4.1)价格(每百万token 输入/输出)吞吐量何时选用
DeepSeek V4 Flash40$0.054 / $0.242~84 tok/s以最低成本寻求前沿级智能体编码——成本/性能帕累托前沿。
GLM 5.251(开放权重最高)$0.447 / $3.31~78 tok/s规划质量和长周期编码比最低价格更重要;Opus风格工作的最佳开放替代品。
MiniMax M344$0.098 / $1.21~59 tok/s智能体需要长上下文下的原生图像或视频输入——截图、UI状态、图表、文档。
Nemotron 3 Ultra48$0.423 / $2.61 (+ :free)~75 tok/s想要一个美国构建、完全开放的模型,基于NVIDIA栈,且供应商/部署故事与排名同等重要。
主线:DeepSeek证明了开放模型可以就是你的前沿智能体——而且只需几分钱。GLM是新的质量领导者。MiniMax拥有预算内的多模态。NVIDIA带来了一个完全开放、美国构建的选项,背后有最雄厚的资金。与封闭前沿的差距是真实存在但狭窄的,并且没有在扩大。选择与您的工作负载相匹配的成本/质量/模态/供应商角落——而且,一如既往,唯一的地面真相是在您自己的任务上进行测试。

所有定价和吞吐量数据均来自OpenRouter.ai (https://openrouter.ai/),时间为2026年6月(跨供应商加权平均);智能评分来自Artificial Analysis Intelligence Index v4.1,索引日期为2026年6月25日。模型页面:DeepSeek V4 Flash (https://openrouter.ai/deepseek/deepseek-v4-flash) · GLM 5.2 (https://openrouter.ai/z-ai/glm-5.2) · MiniMax M3 (https://openrouter.ai/minimax/minimax-m3) · Nemotron 3 Ultra (https://openrouter.ai/nvidia/nemotron-3-ultra-550b-a55b)。

相似文章

开放模型未来走向之我见

Reddit r/LocalLLaMA

作者分析中国AI实验室分阶段发布开放权重模型以从前沿模型吸引用户的策略,并预测随着它们瞄准大型组织,中端模型将暂停发布。

开放与封闭AI模型:2025-2026年差距如何缩小及未来走向

Reddit r/artificial

本文探讨了从2025年初到2026年中,开放与封闭AI模型之间的性能差距如何急剧缩小,以DeepSeek开放模型的发布及其后续市场影响为例。文章还讨论了中国实验室在推动开放前沿方面的作用及其对行业的影响。