万亿参数困境:MiMo-V2.5-Pro 开源(1.02T 参数)。当 API 处理 3.87 亿 Token 仅需 70 美元时,自托管还划算吗?

Reddit r/LocalLLaMA 模型

摘要

Xiaomi open-sourced MiMo-V2.5-Pro, a 1.02 trillion parameter MoE model, prompting a cost-benefit analysis of using its API versus self-hosting for autonomous coding tasks.

小米开源了 MiMo-V2.5-Pro。1.02 万亿参数,420 亿活跃参数(MoE 架构),1M 上下文窗口,采用 MIT 许可证。纸面上这令人兴奋。但在实践中,我被其中的经济账困住了。**我在使用它做什么** 我一直在通过 Claude Code 使用 API 运行 V2.5-Pro,进行自主编码会话。这并非一次性提示,而是持续数小时的扩展运行,模型自主选择任务、调试自己的代码,并利用基于文件的记忆跨会话保持连续性。在约 125 次会话中,它从一个空仓库构建了一个完整的 SaaS 产品:一个交互式 API 成本计算器,实时显示 33 个模型和 10 家提供商的价格,无服务器 API 端点,Stripe 结账集成,可嵌入的小部件系统,RSS 源,新闻通讯基础设施,带有结构化数据的 SEO,以及 60 多个页面的内容。301 次提交,全部自主完成。它还对自身的输出进行了质量审计:在多个文件中发现问题并在未被要求的情况下进行了修复。https://preview.redd.it/yuxs21bl7v0h1.jpg?width=384&format=pjpg&auto=webp&s=30ee7e8294f303d382e8312beb6d1bedbc9ef3de 这不仅仅是“给我生成一个着陆页”。这是持续的自主开发,模型跨会话保持上下文,管理自己的待办事项,并做出架构决策。在这种类型的工作中,如果模型在遵循指令或长上下文推理方面较弱,你会立即察觉。**缓存让它变得极其便宜** 以下是我的账单明细: | 指标 | 数值 | |:-|:-| | 总 Token 数 | 387,380,436 | | 缓存命中 Token | 373,124,480 (96.3%) | | 缓存未命中 Token | 11,600,665 (3.0%) | | 输出 Token | 2,655,291 (0.7%) | | 总成本 | $70.12 | https://preview.redd.it/675sbyal7v0h1.jpg?width=415&format=pjpg&auto=webp&s=4c418f8433035f0b8bdaff63a4d35c2c32a463fe 96% 的缓存命中率。Claude Code 在会话内的工具调用之间大量重用上下文,而 V2.5-Pro 的缓存意味着在最初几次调用后,你几乎不需要为输入支付任何费用。在 125 次会话中,3.87 亿 Token 的成本仅为 70.12 美元。**与其他模型的对比** | | MiMo-V2.5-Pro | Claude Opus 4.6 | GPT-5.4 | |:-|:-|:-|:-| | 输入 | $1.00/M | $15.00/M | $2.50/M | | 缓存输入 | $0.14/M (86%) | $1.50/M (90%) | $0.25/M (90%) | | 输出 | $3.00/M | $75.00/M | $15.00/M | | 3.87 亿 Token 工作负载 | $70 (实际) | ~$350-450 (估算) | ~$180-240 (估算) | MiMo 的成本是我们测试中实际测量的数据。Claude 和 GPT 的估算是基于已发布的 API 定价和保守的缓存命中假设(90% 对比 MiMo 的 96%),尽管并非针对完全相同的工作负载。**然后我对开源感到兴奋** MIT 许可证。开放权重。我可以自己运行它。没有速率限制,不依赖 API,完全的数据隐私。然后我查看了规格。1.02T 总参数。即使采用 MoE(42B 活跃),完整的模型权重也非常庞大。使用 FP8 量化,你需要大约 1TB 的空间。我的硬件:一台配备 48GB 统一内存的 MacBook Pro M4 和一台配备 RTX 4090(24GB 显存)的台式机。4090 处理 70B 模型没问题,我经常在上面运行量化版的 Qwen 和 DeepSeek。但是 1.02T 参数?完全不够。 realistically,在本地运行此模型非常困难。你需要严肃的多 GPU 基础设施,至少需要 4 张 A100 80GB,可能更多。这意味着 15,000-20,000 美元的硬件投入,或者每小时 6 美元的云 GPU 租赁费用。对于每天进行几小时编码会话的开发者来说,经济上并不划算。**API 的优势(及劣势)** 对于像我这样的间歇性使用,每天几小时的编码会话,具有 96% 缓存命中率的 API 确实很难被超越。我平均每次会话花费约 0.56 美元。等效的云 GPU 时间仅硬件成本就达每小时 6 美元,这还不包括设置和维护费用。https://preview.redd.it/s1q9yyal7v0h1.jpg?width=265&format=pjpg&auto=webp&s=105d57d247dcd8162fbd6cbc59afb528da6ea64a 自托管的优势在于:• 数据隐私(企业真正的杀手锏功能)• 在专有代码库上进行微调• 在规模上 24/7 运行,此时每小时成本被摊薄• 没有速率限制(我在重度测试期间几次触碰到 API 限制)但对于大多数开发者来说?API 端的缓存做了太多繁重的工作。小米还提供带有折扣信用倍数和峰谷定价的 Token 计划,这可能会根据工作负载模式和使用强度进一步降低成本。**问题** 有人实际尝试过开源的 V2.5-Pro 吗?你们在考虑什么样的硬件?我很好奇是否有人在致力于量化版本或 GGUF 转换,尽管在 1.02T 参数下,即使是 Q4 量化也会非常巨大。该模型在持续的自主编码方面确实非常出色。我只是想不出,对于不全天候运行的人来说,在什么情况下自托管它在财务上是合理的。
查看原文

相似文章

XiaomiMiMo/MiMo-V2.5-Pro

Hugging Face Models Trending

小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。