介绍Ember-1 (约9分钟阅读)

TLDR AI 模型

摘要

Ember-1 是一个来自Fireworks Research的专用AI模型,通过优化推理效率,以减少40%的tokens来实现Kimi K3的质量,旨在降低编码和智能体工作负载的成本。

Ember-1 是一个基于Kimi K3构建的新专用模型,以减少40%的tokens实现Kimi K3的质量。它现在作为服务选项与基础Kimi K3模型一起,在Serverless上作为研究预览版推出。Fireworks Research 正在推出研究版本,为开发者提供为期两周的无服务器访问新研究模型。需求最高的模型将被永久保留。
查看原文
查看缓存全文

缓存时间: 2026/09/24 14:41

# Ember-1 发布 来源:https://fireworks.ai/blog/ember-1 ## Ember-1:减半Token消耗,保持同等回答质量 Ember-1 (https://fireworks.ai/models/fireworks/ember-1) 是 Fireworks Research 推出的全新专用模型,在保持 Kimi K3 同等质量的同时,减少 40% 的 Token 消耗。基于 Kimi K3 构建,它学会了削减不必要的推理过程,同时保留关键的思维环节。我们在外部基准测试、实时客户 A/B 测试以及自身的编程与智能体工作负载中进行了验证,其质量在各种场景下均保持稳定。Ember-1 现已推出,它开启了 Fireworks 一系列专用模型的序幕,旨在满足开发者未来的需求。Ember 仅仅是 Fireworks 训练平台能力的一个开端。 ## Fireworks Research 如何构建 Ember-1 我们从用户处获悉,他们需要以更低成本使用 K3 的编程能力,因为其冗长的推理链在规模化自动编程场景中成本高昂。单纯降低 K3 的推理力度(reasoning effort)无法解决此问题。较低的力度设置会导致质量严重下降。为了在保持质量的同时削减 Token 消耗,模型必须学会更高效地进行推理,而这需要通过训练来实现。 达到这一目标需要深入的研究。我们的团队进行了超过 50 次训练实验和 200 多次评估,并在此过程中开发了新的训练算法,以在不损失准确性的前提下缩短推理链。这一切都是在 Fireworks Serverless Training (https://fireworks.ai/training#training-api:~:text=RUN%20THE%20LOOP-,Training%20API,-For%20ML%20researchers) 上完成的。因为我们无需配置或管理 GPU,所以一旦有想法就能立即启动实验,仅为实际运行付费,并将从研究到上线的时间与成本缩减到通常的一小部分。 我们在广泛的任务上进行了训练,以确保 Token 节省效果能转移到多种工作负载中。随后,我们在 Specialized Intelligence Index (https://fireworks.ai/specialized-intelligence-index/)、公开基准测试和实际生产流量上评估了 Ember-1,确认其使用了更少的 Token,且质量未受损失。Ember-1 是 Fireworks 自研的模型,也是 Fireworks Research 推出的一系列模型中的首个。 ## 问题所在:推理模型“想得太多” 像 Kimi K3 这样的推理模型,其生成的大部分 Token(有时超过 90%)用于内部推理,而非最终答案本身。这种思考结构在单个请求上成本已很高,但在多轮智能体工作负载中情况会变得更糟。每一轮都会将之前所有的推理过程重新发送给模型,因此上下文长度随轮次数大致呈二次增长。早期轮次的长推理链在每次后续调用中都会被重复读取(并重复计费)。 所有这些推理都真正必要吗?我们的实验表明并非如此。Kimi K3 产生的推理过程远超任务所需,超出的部分可以在不影响答案的情况下被移除。这正是我们创建 Ember-1 的方式——一个基于专用智能构建的、经济高效的 Kimi K3 版本。 ## 从观察到高级模型 并非 K3 的所有推理都是浪费。其中一部分是自我反思:重新审视一个假设、响应反馈或追溯结果至早期决策,有助于模型从错误中恢复。机遇在于保留这种能力的同时,减少不必要的推理并跳出低效循环。我们相信,通过任务和环境反馈进行学习,可以教会模型更高效地推理,同时保持其能力。 对于智能体任务,这种学习贯穿整个交互过程。模型探索可能的操作,整合新观察,并在推进过程中精炼其推理。反馈将决策与其后果联系起来,鼓励在整个任务过程中进行有价值的反思。 我们将这些洞见融入了一个涵盖数学、编程、指令遵循、对话、搜索、工具使用和软件工程的训练集合中,覆盖了独立问题和扩展交互,以强制模型适应观察和结果。任务反馈指导在策略(on-policy)的规划和学习,重点是在各种场景下保持能力。 公开基准测试和实时 A/B 测试的结果支持了这一方向:在七个基准测试和两个客户的生产流量中,Kimi K3 的推理链可以在不牺牲准确性的情况下缩短 35–50%。内化的行为在失败尝试上也表现出受约束的 Token 使用,减少了冗长、低效的推理。 ## Specialized Intelligence Index:Ember-1 为 Bedside Bench 设定帕累托前沿 本周早些时候,我们推出了 Specialized Intelligence Index (SII) (https://fireworks.ai/specialized-intelligence-index/),用于根据行业专家创建的真实任务对开放、封闭和专用模型进行基准测试。 我们在 Doximity 的 Bedside Bench 上评估了 Ember-1,这是一个由医生验证的基准,涵盖 500 个临床案例,分布在 10 个专业类别中。 **结果如何?** Ember-1 在 Bedside Bench 上,无论是在开放模型还是封闭模型中(包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5),都为成本/任务设立了新的帕累托前沿。 Figure of Cost/Task SII 图 1:来自 SII 的 Bedside Bench 帕累托前沿 图 2:Bedside Bench SII 的得分与时长关系图 图 2:Bedside Bench SII 的得分与时长关系图 ## 在更多行业基准测试中评估帕累托曲线 我们还在其他一些行业基准测试上评估了 Ember-1 的质量-成本前沿。我们使用公开的 Kimi K3 API 定价(未缓存输入 $3/百万 Token,缓存输入 $0.30/百万,输出 $15/百万)计算每个基准测试的成本,并将其与三个分支的通过率绘制成图:**K3 推理力度低**、**K3 推理力度高**、**K3 推理力度最大(默认)**以及 **Ember-1**。在所有测试样本超过 50 个的基准测试中,Ember-1 均位于或接近帕累托前沿,以极低成本匹配 K3-max 的质量,并严格优于 K3-low。我们还分析了 GPT-6 Astra、Claude Opus-5 和 GLM 5.3,发现 Ember-1 在帕累托前沿处于领先地位。 图 3:开放与封闭模型成本/任务的 5 个行业基准测试平均值 图 3:开放与封闭模型成本/任务的 5 个行业基准测试平均值 我们深入对比了 Ember-1 与原始 K3 的结果,发现如下: | 行业基准测试 | N | K3 Low | K3 High | K3 max | Ember-1 | Ember-1 vs. K3 Max | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | **82.0%** | -51.9% / -23.1 USD | | SWE-bench Verified | 500 | 80.4% | 86.0% | **93.2%** | 92.2% | -15.5% / -68.1 USD | | SWE-Interact | 75 | 6.7% | 13.3% | **21.3%** | 20.0% | -32.5% / -60.8 USD | | DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | **75.2%** | -23.7% / -126.9 USD | | τ-2 Bench Airline | 50 | 64% | 64% | 64% | **66%** | -5.9% / -0.3 USD | 运行 K3 最节省成本的方式,不再是让它少思考,而是运行 Ember-1——这个学会了高效思考的模型。 ## 客户验证:实时 A/B 测试 基准测试只能告诉你这么多。正如我们在 Specialized Intelligence Index 结果中发现的,我们希望在更多实际工作负载上测试该模型,并使用生产流量进行测试。真正的考验通常是模型在用户依赖的产品中的生产流量上是否表现稳定。 我们与两个客户在其生产编程工作负载上进行了实时 A/B 测试。在这两种情况下,Ember-1 都实现了**惊人的 Token 节省,在可比质量下,每个任务的 Token 消耗减少了约 35%**。大多数下游产品指标保持不变或有所改善,包括任务完成率、成功评分和失败率,在显著降低 Token 成本的同时都向好的方向发展。A/B 测试之后,其中一位客户现在正将 Ember-1 用于实时生产,并计划将其扩展以完全替代基础模型。 | | 分数 | 步骤数 | 输出 Token | 推理 Token 减少量 | 总 Token 减少量 | | :--- | :--- | :--- | :--- | :--- | :--- | | Kimi K3* | 0.751* | *23.8* | *49.3K* | *-* | - | | Ember-1 | 0.753 | *21.4* | *29.9K* | *71.3%* | 39% | ## 内部验证:我们的开发者毫无察觉 Fireworks 大量的内部编程/协作流量由我们自己的推理服务提供支持。在任何客户看到该模型之前,我们就将 Ember-1 投入内部使用,让我们的开发者将其用于日常编程工作,包括在实际任务上进行大规模的 Vibe 测试。 我们最引以为豪的结果是:**毫无动静**。没有动静就是好消息。开发者继续他们的编程工作负载,没有注意到模型的切换,同时消耗了显著减少的 Token。对于一个其全部价值主张是“同等回答,更少 Token”的模型来说,在内部流量上的无感部署是最有力的信号。 ## 下一步计划 **Ember-1** 将作为服务选项,与基础 Kimi K3 模型一同在 Serverless 上作为研究预览版(Research Preview)推出。为了支持快速发展的开源生态系统,我们将推出研究版本,为开发者提供为期两周的 Serverless 访问新研究模型的机会,并根据社区需求使其成为永久模型。对于推理 Token 占成本大部分的智能体编程和其他工作负载,它能以大约一半的 Token 成本提供同等质量。 Fireworks Research 将继续通过将专用智能引入更多 Ember 模型来推动模型效率的前沿,使您能够部署最经济的模型,降低您的 Token 支出。Token 效率正在成为 Fireworks 的一个主题。 希望更进一步,针对您的用例优化 Ember-1?我们还将为 Ember-1 推出训练支持,使企业能够使用自己的数据,构建符合需求的、定制化的、高 Token 效率的模型。开放模型的未来,就是在您特定工作负载上训练的专用模型。 在您的工作负载上尝试 Ember-1 (https://fireworks.ai/models/fireworks/ember-1) 吗?我们很想听听您的体验,请在 X 上标记我们(@FireworksAI_HQ (https://x.com/FireworksAI_HQ))并告诉我们您正在构建什么!

相似文章

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

reteetzad/Kimi-K3

Hugging Face Models Trending

Kimi K3 是 Moonshot AI 即将推出的开放前沿模型,采用混合专家架构,具备原生智能体能力及增强型代码理解上下文,计划于 2026 年 7 月 27 日发布。

Kimi K2.7 Code 务实胜过炫技

Reddit r/AI_Agents

Kimi 发布了 K2.7 Code,这是一款专注于编程的 AI 模型,其基准测试成绩提升,且思考令牌使用量降低 30%。它更强调在长代码循环和智能体工具集成中的实际性能,而非炫目的分数。