Sakana Fugu在Claude被封禁后推出,LiveCodeBench得分93.2(3分钟阅读)
摘要
Sakana AI推出多模型编排API Fugu,此前Anthropic暂停了对Claude Fable 5和Mythos 5的访问。Fugu Ultra在LiveCodeBench上获得93.2分,表现优于Fable 5,起价为每百万输入代币5美元。
Fugu Ultra在LiveCodeBench上击败了Fable,起价为每百万输入代币5美元。
查看缓存全文
缓存时间: 2026/06/30 17:17
# Sakana Fugu 发布,LiveCodeBench 得分 93.2
来源:https://www.implicator.ai/sakana-fugu-launches-with-93-2-livecodebench-score-after-claude-ban/
AI 新闻 (https://www.implicator.ai/tag/ai-news/)
Sakana AI 在 Anthropic 暂停 Fable 5 和 Mythos 5 访问权限后发布了 Fugu。Fugu Ultra 在 LiveCodeBench 上击败了 Fable,起价为每百万输入 token 5 美元,但该服务要求买家信任其 AI 堆栈核心的一个黑盒路由器。
Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/)
Sakana AI 本周发布了 Fugu 和 Fugu Ultra (https://sakana.ai/fugu-release/?ref=implicator.ai),将其多智能体编排研究转化为商业 API。此前 Anthropic 表示,美国政府指令迫使其暂停 Claude Fable 5 和 Claude Mythos 5 的访问权限。Sakana 称 Fugu Ultra 在 LiveCodeBench 上得分为 93.2,领先于 Fable 5 的 89.8,并在科学和软件基准测试中与多个顶级模型持平或超越。这家东京公司将服务作为单一端点销售,可以在模型池中路由工作,而不是将客户绑定到单一提供商。
Anthropic 于 6 月 12 日宣布 (https://www.anthropic.com/news/fable-mythos-access?ref=implicator.ai),美国政府援引国家安全权力,指示其暂停 Fable 5 和 Mythos 5 对外国国民(包括 Anthropic 员工)的访问权限。该公司表示,为了合规,必须为客户禁用这些模型,而其他 Anthropic 模型的访问权限不受影响。Sakana 联合创始人兼首席执行官 David Ha 将这一中断视为 Fugu 的商业机会。
据 VentureBeat 报道,Ha 在 X 上写道:“依赖单一公司的模型来支撑国家基础设施是巨大的风险。Fugu 只是通过完全可替换的代理池来绕过供应商限制。”
关键要点
- Sakana AI 发布 Fugu 和 Fugu Ultra,作为一个多模型编排的统一 API。
- Fugu Ultra 在 LiveCodeBench 上得分 93.2,领先于 Claude Fable 5 的 89.8。
- 该服务起价为每百万输入 token 5 美元,每百万输出 token 30 美元。
- 批评者指出 Fugu 增加了另一个黑盒,因为用户无法看到每个任务由哪些模型处理。
AI 生成摘要,经编辑审阅。更多关于我们的 AI 指南 (https://www.implicator.ai/about/)。
## Sakana 在 LiveCodeBench 上取得 93.2 分
Sakana 将 Fugu 描述为一个语言模型,它被训练用来调用其他语言模型(包括自身的实例),并决定何时委派、验证和合并工作。该公司表示,该系统建立在两篇 ICLR 2026 论文 TRINITY 和 Conductor 的基础上,这些论文训练协调模型将任务分配给专业智能体,而不是使用固定工作流。
基准测试成绩是此次发布的重点。Sakana 称 Fugu Ultra 在 SWE-Bench Pro 上得分 73.7,领先于 Anthropic 的 Claude Opus 4.8(69.2)和 OpenAI 的 GPT-5.5(58.6),但落后于受限制的 Fable 5 得分 80.0。在 GPQA-Diamond 上,Fugu 和 Fugu Ultra 均得分 95.5,高于 Sakana 归因于 Mythos Preview 的 94.6。
这些成绩有一个 Sakana 自己也指出的注意事项。Fable 5 和 Mythos Preview 不在 Fugu 的智能体池中,因为它们无法公开访问,而且 Sakana 尚未披露 Fugu 在给定请求中使用了哪些模型。The Verge 的 Richard Lawler 指出,这相当于更谨慎地使用其他前沿模型,同时让客户无法了解哪个模型完成了哪部分工作。
## Fugu Ultra 起价为每百万输入 token 5 美元
Sakana 提供两个版本。Fugu 面向编码、聊天和低延迟工作;Fugu Ultra 面向更困难的任务,如 AI 研究、论文复现、网络安全评估和专利搜索。两者都通过兼容 OpenAI 的 API 提供。
根据 VentureBeat 引用的 Sakana 文档,Fugu Ultra 起价为每百万输入 token 5 美元,每百万输出 token 30 美元,缓存输入价格为每百万 token 50 美分。对于超过 272,000 token 的上下文,Ultra 费率上升至每百万输入 token 10 美元,每百万输出 token 45 美元,每百万缓存输入 token 1 美元。
标准 Fugu 服务根据请求激活的最高层基础模型进行可变定价,而不是为工作流中的每个智能体叠加收费。Sakana 还表示,企业用户可以从路由池中排除特定提供商或模型,并可以选择退出将提示用于未来训练。由于公司正在处理数据合规问题,该服务在欧盟或欧洲经济区不可用。
在您的收件箱中获取 Implicator.ai
来自旧金山的战略 AI 新闻。没有炒作,没有“AI 将改变一切”的空话。只看什么发生了变动,谁赢了,以及为什么重要。每日太平洋时间早上 6 点发送。
邮箱地址检查您的收件箱。点击链接确认。
没有垃圾邮件。随时取消订阅。
## 批评者指出黑盒问题
Sakana 表示,在发布前有近 500 名 Beta 用户测试了 Fugu,用途包括代码审查、安全评估、专利搜索和自动化研究。OfficeChai 引用了一个 AutoResearch 运行,其中 Fugu Ultra 在一张 H100 GPU 上 14 小时内运行了 123 个训练实验。
外部测试者报告了喜忧参半的结果。VentureBeat 引用了 Mark Studios 的 Mark Santos,他在 Three.js 游戏构建中比较了 Fugu Ultra 和 Claude Opus 4.8。Santos 表示,Fugu Ultra 在 22 分钟内完成,使用了约 89,000 个 token,花费约 7.32 美元,而 Opus 花费了 79 分钟,使用了约 940,000 个 token,花费近 37.85 美元。但他仍认为 Opus 在最终应用程序设计和功能上更胜一筹。
Prime Intellect 的研究工程师 Elie Bakouch 反对 Sakana 的主权叙事。据 VentureBeat 报道,他在 X 上写道:“这是一个封闭源代码的编排器,运行在封闭源代码的模型之上。如果以前你无法控制模型,那么现在你甚至无法控制使用了哪些模型以及用了多少。”
Sakana 的下一个考验是采用率,而不是另一个基准测试。该公司表示,将逐步将开放模型和自有模型添加到池中,商业版现已普遍可用,但受限的欧洲地区除外。考虑 Fugu 的客户必须决定,为了减少对单一模型提供商的依赖,再增加一个黑盒是否是可以接受的成本。
常见问题
什么是 Sakana Fugu?Sakana Fugu 是 Sakana AI 的一个商业 API,在单个兼容 OpenAI 的端点后协调多个语言模型。系统决定何时委派、验证和合并其模型池中的工作。
Fugu Ultra 在 LiveCodeBench 上表现如何?Sakana 称 Fugu Ultra 在 LiveCodeBench 上得分 93.2,而标准 Fugu 得分 92.9,Anthropic 的 Claude Fable 5 在同一编码基准测试中得分 89.8。
为什么 Anthropic 的指令很重要?Anthropic 于 6 月 12 日表示,美国政府指令要求其暂停 Fable 5 和 Mythos 5 对外国国民的访问权限,并为客户禁用这些模型以合规。
Fugu Ultra 的费用是多少?Fugu Ultra 起价为每百万输入 token 5 美元,每百万输出 token 30 美元。对于超过 272,000 token 的上下文,费率上升至每百万输入 token 10 美元,每百万输出 token 45 美元。
对 Fugu 的主要批评是什么?批评者指出,Fugu 是专有的,并且不披露哪个底层模型处理请求。这可以在减少对单一供应商依赖的同时,增加一个新的黑盒层。
AI 生成摘要,经编辑审阅。更多关于我们的 AI 指南 (https://www.implicator.ai/about/)。
协同工作的 AI 模型比单一系统性能提升 30%,Sakana 研究发现 日本研究人员证明 AI 模型作为团队工作比单独工作效果更好,性能提升 30%。TreeQuest 让公司可以混合使用不同的 AI 提供商,而不是依赖单一一家。The Implicator (https://www.implicator.ai/ai-models-working-in-concert-outperform-solo-systems-by-30-percent-sakana-study-finds/)
OpenClaw 创建者表示 Anthropic 正在将开发者推离 Claude 订阅 OpenClaw 创建者 Peter Steinberger 表示 Anthropic 正在将开发者推离 Claude 消费者订阅,转向 API 密钥。The Implicator (https://www.implicator.ai/openclaw-creator-says-anthropic-is-pushing-developers-off-claude-subscriptions/)
你在管理五个昂贵的 AI 实习生 Anthropic 的多智能体 Claude Code 让开发者可以同时运行多个助手。token 账单说明了谁才是真正的受益者。The Implicator (https://www.implicator.ai/youre-not-a-10x-developer-youre-managing-five-expensive-ai-interns/)
Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/)
旧金山
Implicator.ai 主编兼创始人。前 ARD 记者和资深广播记者,拥有超过 10 年科技报道经验。撰写关于政策和市场动态的每日简报。常驻旧金山。邮箱:[email protected]
早间简报
### 在您的收件箱中获取早间简报。
注册我们的免费每日早间通讯和免费会员文章。仅我们的特别每周专业简报(Pro Briefing)需要每月 8 美元。
相似文章
Fable 5不再是第一了!?根据公司公告,Sakana的Fugu在某些情况下击败了它
根据Sakana AI的公司博客,其新模型Fugu在LiveCodeBench和Terminal Bench 2.1上以微小的优势超越了Fable 5,尽管结果尚未得到独立确认。
@rohanpaul_ai: Sakana Fugu Ultra 在实时交易终端编码测试中凭借视觉精美度击败其他模型,接近 GLM 5.2,…
Sakana 的 Fugu Ultra 模型编排系统在交易终端 UI 的实时编码测试中表现优于其他模型,尽管成本高出 17 倍,但展示了其在视觉精美度和多智能体协调方面的优势。
@sashimikun_void: @serenaa_ge 请提供 Deepswe 基准测试
Sakana AI 发布了 Sakana Fugu,这是一个多智能体编排系统,可通过单一模型 API 访问,其中 Fugu Ultra 模型在无出口管制风险的情况下达到了前沿性能。
@DeRonin_: 我靠,日本公开发布了Fable级别模型,通过编程和研究基准测试,它几乎等同于……
Sakana AI 发布了 Fugu Ultra,这是一个多智能体编排系统,可通过单一模型 API 访问,其性能与 Fable 和 Mythos 模型相当。
@omarsar0: 天哪!Fugu Ultra 在这些3D渲染中表现得极其出色。
Sakana AI 发布了 Fugu Ultra,这是一种多智能体编排模型,在避免出口管制的同时,其性能媲美 Fable 和 Mythos 的前沿水平。