Sakana Fugu在Claude被封禁后推出,LiveCodeBench得分93.2(3分钟阅读)

TLDR AI 产品

摘要

Sakana AI推出多模型编排API Fugu,此前Anthropic暂停了对Claude Fable 5和Mythos 5的访问。Fugu Ultra在LiveCodeBench上获得93.2分,表现优于Fable 5,起价为每百万输入代币5美元。

Fugu Ultra在LiveCodeBench上击败了Fable,起价为每百万输入代币5美元。
查看原文
查看缓存全文

缓存时间: 2026/06/30 17:17

# Sakana Fugu 发布,LiveCodeBench 得分 93.2 来源:https://www.implicator.ai/sakana-fugu-launches-with-93-2-livecodebench-score-after-claude-ban/ AI 新闻 (https://www.implicator.ai/tag/ai-news/) Sakana AI 在 Anthropic 暂停 Fable 5 和 Mythos 5 访问权限后发布了 Fugu。Fugu Ultra 在 LiveCodeBench 上击败了 Fable,起价为每百万输入 token 5 美元,但该服务要求买家信任其 AI 堆栈核心的一个黑盒路由器。 Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/) Sakana AI 本周发布了 Fugu 和 Fugu Ultra (https://sakana.ai/fugu-release/?ref=implicator.ai),将其多智能体编排研究转化为商业 API。此前 Anthropic 表示,美国政府指令迫使其暂停 Claude Fable 5 和 Claude Mythos 5 的访问权限。Sakana 称 Fugu Ultra 在 LiveCodeBench 上得分为 93.2,领先于 Fable 5 的 89.8,并在科学和软件基准测试中与多个顶级模型持平或超越。这家东京公司将服务作为单一端点销售,可以在模型池中路由工作,而不是将客户绑定到单一提供商。 Anthropic 于 6 月 12 日宣布 (https://www.anthropic.com/news/fable-mythos-access?ref=implicator.ai),美国政府援引国家安全权力,指示其暂停 Fable 5 和 Mythos 5 对外国国民(包括 Anthropic 员工)的访问权限。该公司表示,为了合规,必须为客户禁用这些模型,而其他 Anthropic 模型的访问权限不受影响。Sakana 联合创始人兼首席执行官 David Ha 将这一中断视为 Fugu 的商业机会。 据 VentureBeat 报道,Ha 在 X 上写道:“依赖单一公司的模型来支撑国家基础设施是巨大的风险。Fugu 只是通过完全可替换的代理池来绕过供应商限制。” 关键要点 - Sakana AI 发布 Fugu 和 Fugu Ultra,作为一个多模型编排的统一 API。 - Fugu Ultra 在 LiveCodeBench 上得分 93.2,领先于 Claude Fable 5 的 89.8。 - 该服务起价为每百万输入 token 5 美元,每百万输出 token 30 美元。 - 批评者指出 Fugu 增加了另一个黑盒,因为用户无法看到每个任务由哪些模型处理。 AI 生成摘要,经编辑审阅。更多关于我们的 AI 指南 (https://www.implicator.ai/about/)。 ## Sakana 在 LiveCodeBench 上取得 93.2 分 Sakana 将 Fugu 描述为一个语言模型,它被训练用来调用其他语言模型(包括自身的实例),并决定何时委派、验证和合并工作。该公司表示,该系统建立在两篇 ICLR 2026 论文 TRINITY 和 Conductor 的基础上,这些论文训练协调模型将任务分配给专业智能体,而不是使用固定工作流。 基准测试成绩是此次发布的重点。Sakana 称 Fugu Ultra 在 SWE-Bench Pro 上得分 73.7,领先于 Anthropic 的 Claude Opus 4.8(69.2)和 OpenAI 的 GPT-5.5(58.6),但落后于受限制的 Fable 5 得分 80.0。在 GPQA-Diamond 上,Fugu 和 Fugu Ultra 均得分 95.5,高于 Sakana 归因于 Mythos Preview 的 94.6。 这些成绩有一个 Sakana 自己也指出的注意事项。Fable 5 和 Mythos Preview 不在 Fugu 的智能体池中,因为它们无法公开访问,而且 Sakana 尚未披露 Fugu 在给定请求中使用了哪些模型。The Verge 的 Richard Lawler 指出,这相当于更谨慎地使用其他前沿模型,同时让客户无法了解哪个模型完成了哪部分工作。 ## Fugu Ultra 起价为每百万输入 token 5 美元 Sakana 提供两个版本。Fugu 面向编码、聊天和低延迟工作;Fugu Ultra 面向更困难的任务,如 AI 研究、论文复现、网络安全评估和专利搜索。两者都通过兼容 OpenAI 的 API 提供。 根据 VentureBeat 引用的 Sakana 文档,Fugu Ultra 起价为每百万输入 token 5 美元,每百万输出 token 30 美元,缓存输入价格为每百万 token 50 美分。对于超过 272,000 token 的上下文,Ultra 费率上升至每百万输入 token 10 美元,每百万输出 token 45 美元,每百万缓存输入 token 1 美元。 标准 Fugu 服务根据请求激活的最高层基础模型进行可变定价,而不是为工作流中的每个智能体叠加收费。Sakana 还表示,企业用户可以从路由池中排除特定提供商或模型,并可以选择退出将提示用于未来训练。由于公司正在处理数据合规问题,该服务在欧盟或欧洲经济区不可用。 在您的收件箱中获取 Implicator.ai 来自旧金山的战略 AI 新闻。没有炒作,没有“AI 将改变一切”的空话。只看什么发生了变动,谁赢了,以及为什么重要。每日太平洋时间早上 6 点发送。 邮箱地址检查您的收件箱。点击链接确认。 没有垃圾邮件。随时取消订阅。 ## 批评者指出黑盒问题 Sakana 表示,在发布前有近 500 名 Beta 用户测试了 Fugu,用途包括代码审查、安全评估、专利搜索和自动化研究。OfficeChai 引用了一个 AutoResearch 运行,其中 Fugu Ultra 在一张 H100 GPU 上 14 小时内运行了 123 个训练实验。 外部测试者报告了喜忧参半的结果。VentureBeat 引用了 Mark Studios 的 Mark Santos,他在 Three.js 游戏构建中比较了 Fugu Ultra 和 Claude Opus 4.8。Santos 表示,Fugu Ultra 在 22 分钟内完成,使用了约 89,000 个 token,花费约 7.32 美元,而 Opus 花费了 79 分钟,使用了约 940,000 个 token,花费近 37.85 美元。但他仍认为 Opus 在最终应用程序设计和功能上更胜一筹。 Prime Intellect 的研究工程师 Elie Bakouch 反对 Sakana 的主权叙事。据 VentureBeat 报道,他在 X 上写道:“这是一个封闭源代码的编排器,运行在封闭源代码的模型之上。如果以前你无法控制模型,那么现在你甚至无法控制使用了哪些模型以及用了多少。” Sakana 的下一个考验是采用率,而不是另一个基准测试。该公司表示,将逐步将开放模型和自有模型添加到池中,商业版现已普遍可用,但受限的欧洲地区除外。考虑 Fugu 的客户必须决定,为了减少对单一模型提供商的依赖,再增加一个黑盒是否是可以接受的成本。 常见问题 什么是 Sakana Fugu?Sakana Fugu 是 Sakana AI 的一个商业 API,在单个兼容 OpenAI 的端点后协调多个语言模型。系统决定何时委派、验证和合并其模型池中的工作。 Fugu Ultra 在 LiveCodeBench 上表现如何?Sakana 称 Fugu Ultra 在 LiveCodeBench 上得分 93.2,而标准 Fugu 得分 92.9,Anthropic 的 Claude Fable 5 在同一编码基准测试中得分 89.8。 为什么 Anthropic 的指令很重要?Anthropic 于 6 月 12 日表示,美国政府指令要求其暂停 Fable 5 和 Mythos 5 对外国国民的访问权限,并为客户禁用这些模型以合规。 Fugu Ultra 的费用是多少?Fugu Ultra 起价为每百万输入 token 5 美元,每百万输出 token 30 美元。对于超过 272,000 token 的上下文,费率上升至每百万输入 token 10 美元,每百万输出 token 45 美元。 对 Fugu 的主要批评是什么?批评者指出,Fugu 是专有的,并且不披露哪个底层模型处理请求。这可以在减少对单一供应商依赖的同时,增加一个新的黑盒层。 AI 生成摘要,经编辑审阅。更多关于我们的 AI 指南 (https://www.implicator.ai/about/)。 协同工作的 AI 模型比单一系统性能提升 30%,Sakana 研究发现 日本研究人员证明 AI 模型作为团队工作比单独工作效果更好,性能提升 30%。TreeQuest 让公司可以混合使用不同的 AI 提供商,而不是依赖单一一家。The Implicator (https://www.implicator.ai/ai-models-working-in-concert-outperform-solo-systems-by-30-percent-sakana-study-finds/) OpenClaw 创建者表示 Anthropic 正在将开发者推离 Claude 订阅 OpenClaw 创建者 Peter Steinberger 表示 Anthropic 正在将开发者推离 Claude 消费者订阅,转向 API 密钥。The Implicator (https://www.implicator.ai/openclaw-creator-says-anthropic-is-pushing-developers-off-claude-subscriptions/) 你在管理五个昂贵的 AI 实习生 Anthropic 的多智能体 Claude Code 让开发者可以同时运行多个助手。token 账单说明了谁才是真正的受益者。The Implicator (https://www.implicator.ai/youre-not-a-10x-developer-youre-managing-five-expensive-ai-interns/) Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/) 旧金山 Implicator.ai 主编兼创始人。前 ARD 记者和资深广播记者,拥有超过 10 年科技报道经验。撰写关于政策和市场动态的每日简报。常驻旧金山。邮箱:[email protected] 早间简报 ### 在您的收件箱中获取早间简报。 注册我们的免费每日早间通讯和免费会员文章。仅我们的特别每周专业简报(Pro Briefing)需要每月 8 美元。

相似文章