@addyosmani: 很高兴Claude的限制感觉不同了!Opus 5.5 更低的价格直接反映在你的限制上。它们比 Opus 5 多出约25%的容量…

X AI KOLs Following 模型

摘要

文章详细介绍了Claude的Opus 5.5模型的成本改进和性能提升,包括限制延长25%、缓存读取成本降低60%以及输出生成速度提升30%。

很高兴Claude的限制感觉不同了!Opus 5.5 更低的价格直接反映在你的限制上。它们比 Opus 5 多出约25%的容量。缓存读取成本降低60%,输出生成速度提升30%:https://claude.dev/blog/what-a-task-costs-on-opus-5-5/…
查看原文
查看缓存全文

缓存时间: 2026/09/28 03:26

很高兴看到 Claude 的额度感觉有所不同!Opus 5.5 更低的价格直接计入您的额度中。相比 Opus 5,其额度使用效率提升了约25%。缓存读取成本降低了60%,输出生成速度提升了30%:https://claude.dev/blog/what-a-task-costs-on-opus-5.5/…


Opus 5.5 上一项任务的成本

来源:https://claude.dev/blog/what-a-task-costs-on-opus-5.5/

一项任务的成本,以及一次重试的成本

您并非一开始就打算购买数百万个令牌。您的目标是构建一个功能、完成一次迁移,或执行一项任务。令牌数量取决于模型完成任务所需的一切。

两个每令牌成本相同的模型,在执行同一任务时可能产生截然不同的费用。一个模型读取一次代码。另一个则读取代码、尝试修复、然后再次读取。其中每一步都是一个轮次,每个轮次都会重新发送迄今为止的对话历史。因此,需要更多轮次的模型会花费更多,即使价格相同。

在本篇文章的最后,您应该能够回答关于您自身工作的三个问题:

  • 我的典型任务在 Opus 5.5 上花费多少?
  • 哪些设置会改变这一点,改变多少?
  • 我如何查看自己的会话用量?

我想提前分享一个权衡:每种减少令牌消耗的方式,也都可能让您付出完成任务的代价。更低的思考强度、更小的模型,或更少的上下文,当然都能节省令牌。但一次重试所花费的,远超过这些节省。本文试图为每一种权衡标价。

这里的一些数字是标准价格,另一些是基于标准价格构建的示例。这些图表是交互式的,因此您可以在阅读时更改输入。这些是尽力而为的示例,因此请务必查阅我们的文档并进行自己的计算。

一项任务的成本是多少?

Claude Code 中的一项任务是一个循环。模型读取对话,调用工具,读取结果,然后再次循环,直到完成。每次循环都是一次请求。循环的成本由四件事决定。

**轮次。**每个轮次都会重新发送迄今为止的对话历史。更少的轮次意味着处理的输入更少。

**缓存读取。**一个轮次重新发送的大部分内容,是模型在上一轮次已经看到的文本。它按缓存读取计费,价格只是输入价格的一小部分。

**输出令牌类型。**最昂贵的令牌,价格是输入价格的五倍。思考(Thinking)按输出计费,因此一个在得出答案过程中推理较少的模型花费更少。

**模型。**每个模型都有自己的价格,列在定价页面上,因此您选择的模型决定了每个令牌的价格。

我们的示例使用 Opus 5.5 的 API 标准价格:每百万输入令牌 4 美元,每百万输出令牌 20 美元,每百万缓存读取 0.20 美元。像下面的计算器一样,示例将缓存输入按读取价格计费,其他所有内容按输入价格计费,并且不包括缓存写入。令牌数量为示例数据。

轮次

假设一个任务开始时有 20K 令牌的上下文,随着模型读取文件和工具结果,增长到 120K。在 40 个轮次的情况下,平均每个轮次发送约 70K 令牌。该任务大约需要 2.8M 输入令牌,尽管对话历史从未超过 120K。在 90% 来自缓存的情况下,输入成本约为 1.62 美元。同样的任务在 25 个轮次下处理约 1.75M 令牌,输入成本约为 1.02 美元。

一个轮次的成本高于它所添加的令牌,因为它重新发送了之前的所有内容。因此,最便宜的轮次是您不需要的那个。

一种可以减少轮次的习惯是给模型提供一种检查自己工作的方式。例如,运行一个测试、构建一个项目,或执行一个调用端点的脚本。一个能够检查自己工作的模型能更早发现错误。

一个模型如果能在一次遍历中收集所需信息,并批量处理其工具调用,也能减少重新发送的次数。

缓存读取

相同的 2.8M 输入令牌,如果没有来自缓存,成本将是 11.20 美元。在 90% 的命中率下,成本为 1.62 美元,在 96% 的命中率下,约为 0.99 美元。没有其他设置能如此大幅地影响输入成本。一个持续的会话自然能保持高命中率。我将在后文介绍一些避免破坏缓存的操作。

输出令牌

在 Opus 5.5 上,一个输出令牌的成本是一个缓存读取令牌的 100 倍。一个典型任务的 60K 输出令牌成本为 1.20 美元,这相当于从缓存读取 6M 令牌。输出包括思考。您需要为所有输出付费,即使 Claude Code 只向您显示摘要。这就是为什么思考强度(主要改变模型思考多少)会如此显著地影响账单的原因。

模型

一个具有更便宜缓存读取的模型主要帮助长会话。一个具有更便宜输出的模型主要帮助需要大量推理的任务。

OPUS 5.5 发生了哪些变化

有两件事发生了变化:价格,以及模型完成的工作量。

**每项价格都降低了。**输入和输出令牌比 Opus 5 便宜 20%。缓存读取便宜了 60%。输入价格下降了,读取价格也随之下降,从输入价格的十分之一降至二十分之一。图 A 比较了两个模型每百万令牌的价格。这些是 API 标准价格。在 Pro、Max 或 Team 计划上,较低的 Opus 5.5 价格会传递给您的额度,包括缓存上下文,因此其额度使用效率比 Opus 5 高约 25%。缓存读取的额外折扣是 API 价格的变化。

此外,Pro、Max、Team 和基于席位的企业计划的五小时额度上限提高了,符合条件的订阅者会获得一个可在任意时间使用的额度重置。您可以在网页版或 Claude Desktop 的“设置 > 用量”下找到它,而不是在您终端中的 Claude Code 里。重置适用于您的整个账户,包括 Claude Code。

每百万令牌的 API 标准价格柱状图,Opus 5 与 Opus 5.5 对比:输入 $5.00 和 $4.00,输出 $25.00 和 $20.00,缓存读取 $0.50 和 $0.20,分别降低了 20%、20% 和 60%。图 A 每百万令牌的 API 标准价格。在 API 密钥上,缓存读取价格的下调对 Claude Code 最为重要。一个长的智能体会话会将大部分输入开销用于缓存读取。在下面图 B 所示的定价会话中,缓存读取项目从 1.00 美元降至 0.40 美元,是账单上降幅最大的一项。

您节省多少取决于您的工作模式。一个主要是缓存读取的会话在输入上最多可节省 60%。一个没有缓存且答案较长的简短问题最多可节省 20%,因为输出占主导。大多数 Claude Code 任务介于两者之间。下面的计算器显示了您的任务处于哪个位置。

您可能已经听说 Opus 5.5 的运行成本比 Opus 5 低 40%。这是我们基于按令牌计费的标准设置,对典型工作负载的估算。它假设 Opus 5.5 在其默认的中等思考强度下,每任务使用更少的令牌,加上更低的价格,所以这不是令牌价格的直接 40% 削减。令牌价格是图 A 中的价格,图 B 显示了仅价格变化带来的影响。

Opus 5.5 可以在一个答案上使用更多令牌,因为它总是在回复前进行思考。我们预计人们在 Opus 5.5 上能完成更多工作,但这因任务而异,请在您的实际工作中测量。图 C 比较了两个模型每任务的成本。这部分更多地取决于您的工作,而不仅仅是价格。

在一个范围明确的任务中,两个模型完成所需的轮次大致相同,您得到的就是价格削减。差距应该在开放式任务上最大,在这种任务中,模型可能会在错误的思路上花费很多轮次。没有一个单一的数字适用于所有代码库,因此请自行测量(见最后一节)。

**长运行任务会附带一份报告。**Opus 5.5 会在长运行结束时总结其更改的内容、发现的内容以及需要您提供的信息。这也可以节省金钱,因为当您能看到发生了什么时,重新运行会话的次数就会减少。

同一任务的并排对比

图 B 使用相同的令牌数量在两个模型上为同一个会话定价。因此,差异仅仅是价格变化。切换模型进行比较。令牌数量为示例数据。

$3.50 按 Opus 5 API 标准价格

  • 缓存读取 2.0M $1.00
  • 全新输入 200K $1.00
  • 输出 60K $1.50
  • 总计, Opus 5 $3.50

图 B 使用相同令牌数量在两个模型上的示例会话,因此这仅是价格变化的影响。账单包含 /usage 显示的三项内容。按令牌计,缓存读取是最大的项目,为 2M。输出是最小的令牌项目,也是成本最高的项目。全新输入介于两者之间。它涵盖了每个文件和每个新工具结果的首次读取。

图 B 给两个模型相同的令牌数量,因此它仅显示价格变化。您自己的会话在 Opus 5.5 上可能使用更多或更少的令牌。按此定价,该会话成本降低了约 31%。

记录的运行增加了第二个影响,即模型完成工作量的变化。在一个有错误启动的任务上,差距应该会扩大。

尝试您自己的数据

设置您的一个任务所使用的数量,或从预设开始。预设相当有说明性,但我仍然建议进行自己的计算。缓存输入按缓存读取价格计费,全新输入按输入价格计费,因此缓存滑块显示差距中有多少来自缓存读取。

要从真实会话中填充滑块,请在任务结束时运行 /usage。会话块会给出输入、输出和缓存数据。最后一个滑块是您对 Opus 5.5 在您的任务上减少多少工作量的假设。仅价格变化时请将其保持在 0%。要根据您自己的工作进行设置,方法如下:在 Opus 5 和 Opus 5.5 上运行相同的任务,然后比较轮次和输出令牌。“自行测量”部分将详细介绍,“查看会话”部分会显示在 /usage 中检查什么。

输入令牌 2.2M 在所有轮次中发送给模型的所有内容,无论是否缓存。 缓存读取 91% 输出令牌 60K 包括思考内容,按输出计费。 每日任务数 10 在 Opus 5.5 上的令牌变化(您的假设) 0% 仅价格变化时保持在 0%。Opus 5.5 可能使用比 Opus 5 更多或更少的令牌,因此请在您自己的任务上测量。

Opus 5,这些令牌 $3.50 每月 770 Opus 5.5,这些令牌 **2.40** 每月 $528 按 API 标准价格变化 −31% 仅价格变化,每月减少 $242

Opus 5,这些令牌:3.50。Opus 5.5,这些令牌:2.40。按 API 标准价格变化:−31%,仅价格变化每月减少 $242。

图 C 一个月按 22 个工作日计算。API 标准价格。在 Pro、Max 或 Team 计划上,这不是账单。无批量或大额折扣,且缓存写入未计算在内(参见 缓存与压缩 (https://claude.dev/blog/what-a-task-costs-on-opus-5.5/#caching-and-compaction))。

最大化会话价值的技巧

Opus 5.5 更低的价格使每个令牌成本更低。您运行会话的方式决定了使用令牌的数量,以下步骤可提供帮助。

在更换模型前先提高思考强度

思考强度设定了模型在每个轮次花费多少令牌的一般倾向:其思考过程、撰写的文本及其工具调用。在较低的思考强度下,它会减少工具调用次数并保持简短。Opus 5.5 有四个级别(低、中、高和极高),加上用于单次会话的最大值。选择下面的级别以查看何时使用它以及设置它的命令。

中等:用于范围明确的日常工作 具有明确范围的日常工作。它比高思考强度在每轮次思考更少,因此每轮次成本更低。 当任务范围明确时,从这里开始。

  • /effort medium
  • /effort status
  • /model
  • /usage

级别从最少思考到最多思考。Claude Code 为每个模型设置默认级别,/effort status 会显示您的当前级别。对于范围明确的日常工作,尝试中等。当中等思考强度导致停滞时,尝试高。它每轮次的花费比中等多,但少于换用更大的模型。对于机械性工作,如重命名或在文件间应用已知模式,使用低。

在 Opus 5.5 上,默认是中等,比 Opus 5 的默认“高”低一个级别。不同模型上,相同级别不代表相同的思考量。在给定级别上,Opus 5.5 比 Opus 5 每轮次思考更多,在极高和最大值时尤其如此。因此,不要照搬您为 Opus 5 选择的级别。从中等开始,并将极高和最大值保留用于您已测量出收益的工作。

一个粗略的思考强度定价思路:假设高思考强度在一个任务中增加 20K 思考令牌。在 Opus 5.5 上这是 0.40 美元。一个十轮次、100K 缓存上下文、总共 10K 输出令牌的重试循环,花费也差不多。因此,高思考强度在一个通过节省一次重试即可回本的任务上是值得的。在一个中等思考强度本可以一次完成的任务上,它就是浪费。

当中等思考强度仅修复了一层时

您需要更多思考强度的最明显迹象是修复停留在一层。

假设 API 处理器中的一个字段被重命名。在中等思考强度下,模型更新了处理器,处理器的测试通过了,但客户端仍在发送旧字段。它完成了被要求的工作。它只是没有深入查找以找到第二个调用者。在高思考强度下,它会在编写代码前花费更多轮次读取调用点,并在一次遍历中更改两层。

一个检查也可以捕获同样的错误。如果模型可以运行一个经过客户端的测试,那么在编写代码的轮次,旧字段会在中等思考强度下失败该测试。因此,在提高思考强度之前,请检查模型是否有办法检查自己的工作。运行一个测试消耗一个轮次及其输出。而提高思考强度会增加每个轮次的思考。

如果升级思考强度级别和添加检查都不起作用,那么就换用更大的模型。

在会话中途更改思考强度

在 Claude Code 中,运行 /effort 加级别,例如 /effort high。/effort status 会打印当前级别。您可以在任务中途更改,新级别将应用于下一个请求。

在使用 API 密钥或 Claude 订阅的 Opus 5.5 上,更改思考强度会保留缓存。您可以为某一个困难步骤提高它,然后再次降低,而无需重写对话历史。在 Amazon Bedrock、Google Cloud 的 Agent Platform 或 Claude 应用网关上,更改思考强度仍会清除缓存的对话历史,下一个请求将对所有内容支付缓存写入价格。Opus 5.5 的思考功能始终开启,因此没有思考设置需要更改。

为您的工作选择合适的模型

模型选择决定了会话中每个令牌的价格,因此它比思考强度更能影响账单。它影响的范围也更广。每个继承主模型的子智能体也继承其价格。大多数日子需要三种模型:一个用于查询的小模型,一个用于您紧密监督工作的 Opus 5.5,以及一个用于最困难任务的大模型。

按成本顺序排列的三种模型,柱状条仅显示成本顺序:Haiku 或 Sonnet 用于查询和子智能体,Opus 5.5 作为日常主力,以及 Fable 5.1 用于最困难的工作,每种模型都标注了其适用的工作类型。#### Opus 5.5 作为日常主力

将 Opus 5.5 用于您监督的工作:涉及多个文件的功能开发、调试以及带有后续编辑的代码审查。您阅读它的输出,并在它偏离时介入,因此循环保持短暂。

升级到 Fable 5.1

**当结果比令牌价格更重要时,升级到 Fable 5.1。**例如,您无法监督的长运行任务、代码库中没有现成模式的问题,以及协调多个子智能体的大型更改。不要等到第三次失败。如果 Opus 5.5 在极高思考强度下遇到两次同样的问题,就切换,并在问题解决后切换回来。对于交互性工作,Opus 5.5 更合适,因为它延迟更低且成本更低。

Fable 5.1 的标准价格为每百万输入令牌 10 美元,每百万输出令牌 50 美元,是 Opus 5.5 价格的 2.5 倍。其缓存读取成本为每百万 0.25 美元,仅为 Opus 5.5 费率的 1.25 倍,因为它们按输入价格的 0.025 倍计费。因此,在长而缓存密集型的运行中差距最小,在输出量大的任务中差距最大。

在自然的中断点进行切换。缓存属于先前的模型,因此请预计新模型的第一个轮次将为整个对话历史支付缓存写入价格。首先运行 /compact,或使用一个简短的书面计划开始新会话,以使该轮次更小。运行 /model (https://code.claude.com/docs/en/model-config) 并附带别名或模型名称进行切换。/model 还会将您的选择保存为新会话的默认值,因此在困难部分完成后请切换回来。

降级用于查询

降级到 Sonnet 或 Haiku 用于查询,不要

相似文章