Fable 5 使得代理构建者必须采用成本感知模型路由

Reddit r/AI_Agents 模型

摘要

Anthropic 发布了 Fable 5,这是一款价格高昂的强大新模型,由于令牌扇出和高输出成本,使得成本感知路由对代理构建者来说至关重要。

Anthropic 今天发布了 Fable 5,这是他们新的 Mythos 级别模型,高于 Opus。定价为输入每百万令牌 10 美元,输出每百万令牌 50 美元,正好是 Opus 4.8 的两倍。如果你构建代理,价格表并不是让你担忧的部分。让你担忧的部分是扇出。用户对一个代理系统提出的一个“问题”从来不是一次完成。它包括一个规划过程、若干子代理生成、工具调用循环、重试和自我验证过程。Anthropic 明确将 Fable 5 营销为用于多天自主会话,涉及子代理委派。一个复杂的请求可以扇出到数千万个令牌,按输出每百万令牌 50 美元计算,对于最终用户来说,这相当于提出了一个问题,却要付出四位数的账单。我亲身在消费者端测试了这一点。在 Max 20x 计划下,在一次高强度会话中,我每分钟大约消耗我使用窗口的 2%。同样的工作负载在 Opus 4.8 上从未接近限制。该模型每轮思考更长,写更多,因此每个任务的实际成本远高于价格表所示的 2 倍。这对代理架构的改变是:在这种层级下,那种默认用最好模型的扁平化方法已经行不通了。你需要一个前置路由器:便宜的模型(Haiku/Sonnet 级别)用于分类、提取和胶水工作,中端模型用于标准推理,只有那些真正需要前沿能力的步骤才使用 Fable。提示缓存比以往任何时候都重要(输入折扣 90%)。令牌预算和每任务成本上限需要在你的编排层中成为一等公民,而不是事后考虑。而且你需要对每任务成本的观测能力,而不仅仅是每次调用的成本,因为预算就是在扇出中耗尽的。据报道,Uber 在四个月内就用完了他们年度 AI 预算,而在这个定价层级出现之前。需要明确的是,这个模型确实是一个进步,对于困难的长周期问题,它很可能能收回成本。但是“用哪个模型”现在是一个经济决策,由你的编排器每一步做出,而不是你一次设置好的配置值。大家现在是如何处理路由的?根据任务类型设置静态规则,让 LLM 判断选择模型,还是直接承担成本?
查看原文

相似文章

Fable 5 Is Dead. And Honestly? We Might Be Better Off

Reddit r/openclaw

美国政府迫使Anthropic在发布仅数天后撤下了其最强大的模型Fable 5。OpenRouter的新基准测试显示,融合的预算模型面板能以一半的成本达到或超过Fable 5的性能,引发了对前沿模型价值的质疑。

让 Fable 比 Opus 更便宜(12 分钟阅读)

TLDR AI

Cognition 在 Devin 的 Fusion 架构中将 Opus 模型替换为 Fable,尽管 Fable 的每 token 价格更高,但通过更好的委托和减少主导模型回合,实现了更高的性能和更低的成本。