@akshay_pachaar: 只需改动一行代码,即可将Claude推理成本降低50%! - 删除 → model="claude-opus-4-8" - 添加 → model="ship-…"

X AI KOLs Timeline 产品

摘要

Ship 宣布推出一款端点,通过动态选择最便宜的执行路径,同时保持参考模型的质量,从而确保 Claude 推理成本降低 50%,并将成本波动从应用中消除。

只需改动一行代码,即可将Claude推理成本降低50%! - 删除 → model="claude-opus-4-8" - 添加 → model="ship-like/claude-opus-4-8" 我在自己的终端中,通过以相同的提示词调用相同的Anthropic模型,验证了成本的降低。 Ship的底层工程技术实际上很有趣,这些模式可以应用于任何生产级别的LLM栈。 本质上,训练好的模型是一个冻结的产物。 每个请求都执行相同的前向传播,无论是提取日期还是重构模块,因为计算决策在训练时就已确定,远在请求出现之前。 而Ship则在推理时做出这个决策。 在收到请求后,它会搜索各种执行方案,包括单一模型、级联、集成或带工具的封装,并选择最便宜且能与参考模型质量匹配的方案。 这不是一个简单的路由器,因为为每次查询选择更便宜的模型并不能保证该模型能保留原始模型的行为,例如输出格式、工具调用模式和拒绝响应等。 Ship直接衡量这种等价性。 输出在分布上与参考模型无法区分,而不是令牌完全相同——因为即使调用同一个模型两次,结果也会有所不同——但在能力和行为上它们是无法区分的。 当然,有些请求执行成本很低,有些则让Ship承担的费用高于客户支付的费用,但无论哪种情况,每次请求的价格都统一打五折,因此执行成本的波动完全从应用的账单中消失了。 下方视频展示了我实际调用中的成本节省和输出结果,我与团队合作制作了这段内容。
查看原文
查看缓存全文

缓存时间: 2026/07/22 04:22

成本降低50%的Claude推理,只需改动一行代码!

  • 移除 → model="claude-opus-4-8"
  • 添加 → model="ship-like/claude-opus-4-8"

我在自己的终端中通过同一个提示词调用同一个Anthropic模型,验证了成本节省的效果。

Ship背后的工程技术其实很有意思,这些模式可以应用在任何生产环境的大语言模型技术栈中。

本质上,训练好的模型是一个冻结的产物。

每次请求执行的都是相同的前向传播,无论是提取日期还是重构模块,因为计算决策早在训练时就已确定,比请求产生的时间还早。

而Ship将决策推迟到推理时进行。

在收到请求后,它会搜索多种执行方案,包括单一模型、级联模型、集成模型或带有工具的工具链,然后提供最便宜且能匹配参考模型质量的方案。

这不是简单的路由器,因为按查询选择更便宜的模型并不能保证便宜的模型能保留原始模型的行为,比如输出格式、工具调用模式和拒绝回答的模式。

Ship直接衡量这种等价性。

输出在分布上与参考模型无法区分,但不是令牌级别完全一致——因为即使是两次调用同一个模型,输出也会不同——但在能力和行为上它们是不可区分的。

当然,有些请求执行起来很便宜,有些则让Ship花费的成本比客户支付的更多,但每个请求的价格仍然是固定的50%折扣,所以执行成本的波动完全从应用程序的账单上消失了。

下面的视频展示了我在实际调用中的成本节省和输出情况,我是与团队合作制作了这个视频。

Martian (@withmartian): 发布Ship:一个每美元智能度最高的前沿模型端点。

现在,Ship通过质量SLA保证,使用Opus和GPT 5.6 Sol的成本降低50%。

相似文章