@ropaulhan_ai: 开源模型刚刚在实际支出份额的两项新任务排行榜上夺得榜首:DeepSeek V4 Pro 在 shell 执行方面领先…
摘要
开源模型在实际支出份额的两项新任务排行榜上名列前茅,其中 DeepSeek V4 Pro 在 shell 执行方面领先,Kimi K3 在工具调度方面领先,这表明模型路由正转向按任务特定化。
查看缓存全文
缓存时间: 2026/08/08 05:05
开源模型刚刚在2个新任务排行榜上按实际支出份额夺得了第一名:DeepSeek V4 Pro 在 shell 执行方面领先,Kimi K3 在工具调度方面按实际支出领先。
这种按任务路由模型的转变正在快速发生。企业越来越不倾向于为所有任务只选择一个模型。
OpenRouter (@OpenRouter): 开源模型按实际支出份额登顶了2个新任务排行榜:
• Shell 执行:DeepSeek V4 Pro • 工具调度:Kimi K3
相似文章
@zhengyaojiang: 我们对7个前沿模型在三个类别的自动研究任务上进行了基准测试:ML工程、框架/提示工程以及……
研究人员对7个前沿模型在自动研究任务上进行了基准测试。Fable-5总体获胜,但开源模型Kimi-K2.7-Code在ML工程任务上超越了其他模型。
@rohanpaul_ai: 一篇关于开放模型采用情况的论文发现,以Qwen为首的中国模型现在占据主导地位。中国在开放模型…
本文分析了开放语言模型的采用情况,发现以Qwen为首的中国模型目前在下载量上占据主导地位,到2026年3月已超越美国模型。Qwen的领先优势来自其多样化的模型尺寸,而DeepSeek在超大型模型领域领先,一些美国模型仍显示出强劲的增长势头。
@karminski3: 接招: 卷我们最擅长了 国模这波直接霸榜了 OpenRouter 上周和本周的 Top6 用量模型. 与去年7月份可以说是两极反转了, 那个时候破圈的只有DeepSeek和Qwen. 现在用量第一的是腾讯混元3的免费版 (可以配置到龙虾里…
中国AI模型在OpenRouter上周和本周用量Top6中霸榜,其中腾讯混元3免费版排名第一,小米MiMo-V2.5和DeepSeek-V4-Flash分别位居前列,反映出国产模型在开源社区的影响力显著提升。
@rohanpaul_ai: 令人惊讶的好消息,开源编码模型,而且还有很多隐藏的机会可以降低成本……
Databricks 测试了开源编码模型 GLM-5.2,发现它在真实企业代码任务中可与 Claude Opus 4.8 等顶级闭源模型竞争,同时成本更低(每任务 1.28 美元对 1.94 美元)。评估还强调了 Pi 这个框架,它通过减少每轮发送的上下文来降低成本。
@TeksEdge:哇!全新开源计算机使用模型在单个 DGX Spark 上于 LLM 排行榜展现强劲本地性能!这…
H 公司发布了 Holo-3.1-35B-A3B-NVFP4,一款开源计算机使用模型,在单个 DGX Spark 节点上可实现每秒高达 195 个 token 的推理速度,性能超越 Qwen3.5-397B 和 Kimi-K2.5 等更大模型。