测量从GPT-5.3-codex到Minimax M3的生产工作流切换
摘要
一个生产团队将其QA智能体从GPT-5.3-codex迁移到MiniMax M3,发现虽然新模型每个任务使用更多token,但由于其更低的每token价格,中位成本降低了55%。文章还强调了推理提供商选择以及隐藏推理token对有效定价的影响。
我们在生产中运行浏览器驱动的QA智能体:它们在开发容器中针对真实应用执行测试计划。6月下旬,我们将最高流量的智能体从GPT-5.3-codex迁移到MiniMax M3。由于我们对每个智能体步骤进行计量,这次迁移让我们在同一工作负载上对两个模型进行了一次干净的自然实验:总计超过半个万亿token。长话短说:每个流水线运行的中位LLM成本下降了55%。MiniMax需要2.5倍的token来完成相同工作,而推理提供商的选择几乎与模型选择同等重要。
每运行成本下降超过一半
每个测试运行器步骤的成本,以codex中位数为基准(= 1.00):
百分位 GPT-5.3-codex MiniMax M3 变化
p50 1.00 0.40 −60%
p90 2.16 1.39 −36%
p99 3.66 3.05 −17%
效果在整个分布中成立,而不仅限于中位数。每个流水线运行(一次运行包含多个步骤),中位数下降了55%。
我们采用的模型是效率较低的
我们没有预料到的结果:从所有物理指标来看,GPT-5.3-codex用更少的工作完成相同任务。在匹配样本上(每个模型156个成功步骤,相同仓库,相同类型的测试批次,从会话记录重建):
每次测试批次中位数 GPT-5.3-codex MiniMax M3 比率
智能体轮次 94 116 1.23倍
工具调用 118 134 1.14倍
输出+推理token 21.5k 46.8k 2.18倍
输入token(含缓存读取) 5.4M 13.5M 2.51倍
成本(指数化) 1.00 0.46 0.46倍
如果按轮次或完成token数进行评估,我们会选择codex。但我们的账单选择了MiniMax:在每token价格低3-12倍的情况下,效率低下被吸收且有余。
Token效率和成本效率是不同维度,它们可能指向相反方向。
推理token使codex实际价格比标价高58%
我们将每一步的账单与记录的token数量(残差低于2%)进行拟合,得出有效的每百万token费率:
费率($/Mtok) 标价 实测有效
GPT-5.3-codex 输入 $1.75 $1.72
GPT-5.3-codex 缓存输入 $0.175 $0.19
GPT-5.3-codex 输出 $14.00 $22.12
MiniMax M3 输入 $0.30 $0.33
MiniMax M3 缓存输入 $0.06 $0.06
MiniMax M3 输出 $1.20 $1.05
差异在于推理token:它们作为输出计费,但被排除在可见token计数之外。MiniMax在带内进行推理,其有效费率几乎与公布价格完全一致。
从账单中推导有效的每token费率,而不是从定价页面。
节省的代价
指标 GPT-5.3-codex MiniMax M3
中位步骤持续时间(挂钟时间) 23分钟 29分钟
步骤失败率(终端状态占比) 2.4% 4.5%
每个仓库的节省相对codex时代基线 −81%至−13%
持续时间包括非LLM工作(浏览器自动化、测试执行),这些在两个时代没有变化。重试吸收了大部分额外失败,使其在用户可见前被解决,但重试并非免费。它们是实际节省(55%)小于原始3-12倍价格差距的部分原因。每个仓库的差异是真实的:上下文密集、智能体会话长的仓库节省最多,因为缓存读取占其账单大头;输出密集型仓库节省少得多。
同一模型在不同提供商上并非同一模型
“开放权重”暗示了一种商品:无论你在哪里购买,模型都一样。实际上,采样设置、量化、上下文处理,尤其是提示缓存行为因提供商而异,而且这些参数大多对你不可见。我们在Vercel AI Gateway、OpenRouter和Together AI上测试了GLM-5.2和MiniMax M3:Vercel AI Gateway对两个模型的缓存命中率都远低于其他,在我们的内部评估中得分也最低,而通过OpenRouter可到达的相同底层提供商。通过OpenRouter路由到Together AI,在缓存率和可靠性上都远差于直接调用Together AI。同样的权重,同样的命名提供商,中间层不同会导致行为不同。我们的工作假设是,服务设置无法完好无损地通过聚合层传输。我们最终选择了直接接入。
对于智能体工作负载,缓存行为并非锦上添花:我们约97%的输入token是缓存读取。一个悄悄降低缓存的提供商(或中间层)会使你的账单倍增,超过模型选择本身的影响。
相似文章
Kimi K2.6 vs Minimax M3:成本高出5倍,结果反而更差?我做了测试。
对Kimi K2.6和Minimax M3在实际工作流中的亲测比较表明,M3成本约低5倍,而质量几乎相同,使其在生成式系统中更具成本效益。
众所周知,Minimax M3 几天后就要开源了,因此我在网上搜索其评分,发现了一些相当有趣的结果。Minimax M3 在智能体任务和编程方面真的那么出色吗?它比旧的 GPT 模型更好吗?
用户询问即将开源的 Minimax M3 模型在智能体任务和编程方面的表现,并想知道它与 GPT 5.2 等旧版 GPT 模型相比如何。
产品经理实测 M3 的百万级别上下文在真实 Q3 简报中的表现:哪里稳定,哪里失效
一位产品经理分享了在真实 Q3 战略简报上对 Minimax M3 的 1M 上下文窗口的实操测试,指出在约 20 万 token 以内来源归因很准确,但超过后综合能力下降。
MiniMax-M2系列:迷你激活释放最大现实智能
MiniMax-M2系列引入了混合专家语言模型,在极少的激活参数下(总参数量2299亿,每token仅激活98亿)在代理任务上实现了高性能。该系列利用代理驱动的数据管道、名为Forge的可扩展强化学习系统,以及一个向自我进化迈出初步步骤的检查点。
通过API在三个真实的机器学习和编程工作流中测试MiniMax M2.7
一位开发者通过API在三个实际的机器学习和编程工作流中测试了MiniMax M2.7模型,并评估了其性能。