Kimi K3 与 Fable 相当;Kimi K3 和 Fable 达到最先进水平
摘要
Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。
暂无内容
查看缓存全文
缓存时间: 2026/07/22 02:17
# Kimi K3 与 Fable 实力相当;Kimi K3 + Fable 达到 SoTA。
来源:https://fireworks.ai/blog/kimik3-fable
K3 是一个成本极低的前沿级开放模型。更关键的是,它能以可预测的方式补充 Fable,从而通过任务路由获得最高质量的智能。
🧭**快速总结:**我们在约 1,000 个智能体任务上对 Kimi K3(开放模型)和 Fable 5(闭源模型)进行了测试,发现:
1. **通过 K3 与 Fable 之间的路由,我们实现了 93% 的准确率。**
2. **在长智能体循环中,成本效益比单独使用 Fable 高出约 50 倍**,并且在所有使用场景中成本持续更低。
## 我们的评测方法
我们平均了**多个基准测试,每个测试针对不同类型的工作**,并在同一框架下运行了 K3 和 Fable 5。总共约 1,030 个任务,均在真实智能体循环中完成。
| 任务族 | 测试内容 | 任务数 |
|--------|----------|--------|
| SWE | 真实代码仓库缺陷修复(SWE-bench 风格) | 460 |
| Terminal | 长链智能体操作:安全、加密、逆向工程、系统管理 | 89 |
| Algorithmic | LeetCode / AtCoder 风格问题 | 100 |
| Multi-Language | 六种语言的实现 | 225 |
| Legal | 法律智能体基准测试(由律师评分的任务) | 120 |
在进入结果之前,先快速定义一个概念。**神谕路由**是一种测量理论最佳性能的方法:通过让每个模型执行任务,然后选取最便宜的正确答案(成本/性能上限)。在实际路由器中,你无法让一个任务同时跑多个模型。路由器会预测哪个模型在成本和质量之间取得最佳平衡,但最终这是一个猜测。
在本研究中,神谕路由显示 K3 被选中处理 72–96% 的任务。这表明通过学习日常任务与真正长尾前沿工作之间的区别,或许可以接近完美的路由器。但需要多一个数量级的路由数据和实际性能才能有定论。
## K3 是一款好模型。
从宏观角度看,很容易将两者的直接对比视为平局。例如,看头条基准 SWE:K3 达到 **92.4%**,Fable 达到 **92.6%**。在我们评测的五类任务中,两者往往相差不超过几个百分点,Fable 在编程语言广度(多语言)上略微领先。
基准测试图表
图 1 · 按类别划分的任务解决率。整体平均值近乎相同;但在不同任务类型上各有擅长。
很容易就此止步并说“它们大致相当”。但关键在于,它们在不同任务类型上具有离散的更好性能。
## 两个模型胜过一个模型
如果深入单个基准测试内部,你会发现比表面准确率数字更多的信息。以 SWE 为例,两者总体完全持平。但如果按问题领域划分 SWE,可以看到每个模型的闪光点。K3 在符号数学和开发工具方面最为出色;Fable 在网络和数据可视化工作中取胜。同样的模式贯穿于多语言集合中,Fable 的广度覆盖了 Java、Python 和 C++,而 K3 在 JavaScript 和 Rust 上追平。
显示平局也是参差不齐的 Fable 与 K3 基准测试
图 2 · 按 SWE 领域的点差(K3 减去 Fable)。整体基准持平,但两者在领域上各有专长。
在终端的长时域工作中——驱动 shell、数十轮调试系统——K3 展现了真正实力。它完成了一批 Fable 从未攻克的任务:7z 哈希、FEAL 密码分析、泄露的秘密、实时漏洞、失控的异步作业。
K3 主导智能体终端
图 3 · 在 89 个终端任务中,K3 有 11 次独赢,Fable 有 7 次,K3 完全拿下了安全和加密类任务。
## 在 Fireworks 上,K3 成本可低至 50 倍。🫳🎤
虽然质量在高层面上近乎平手,但价格差距悬殊。
模型真正分化的地方在于成本差异图
图 4 · 每个任务的成本优势。背后有两个因素:令牌定价和模型运行时间因任务而异。
那么,这个巨大的价格差距从何而来?令牌定价、提示缓存以及每个任务的投入程度。例如在 SWE 上,K3 比 Fable 努力得多:每个任务约 55 轮、130 万令牌,而 Fable 是 21 轮、13 万令牌。在长终端任务上则相反:Fable 会陷入循环,运行 64 轮、150 万令牌(有时直接超时)。
投入也是参差不齐的,它驱动成本图表
图 5 · 每任务的轮数(线性)和令牌数(对数)。两个模型并非全线经济;额外工作落在 K3 的 SWE 和 Fable 的终端任务上。注意令牌图的 y 轴是任务解决率。
提示缓存将这种投入转化为 K3 的价格优势:即使 K3 读取的令牌数多十倍,由于缓存命中,SWE 运行成本仍低于 Fable。但有一个权衡:额外轮数的任务通常意味着更多实际时间,即更慢的运行。如果你需要在两秒内得到答案,这很重要;如果你在大规模后台运行智能体,大幅缩小的账单则重要得多。
## 不要选择模型。要路由。
如果你将每个任务发送给最适合处理它的模型,你不会落在两个模型之间,而是会高于两者。
每任务路由总是优于任何单一模型运行:
路由最佳模型,你就能超越两者图表
图 6 · 每任务神谕路由 vs 各模型单独运行。绿色标签 = 在该类别中优于最佳单一模型获得的点数。
神谕路由器选择 K3 处理 72–96% 的任务流量。通过这样设计路由器,你最终获得高于任一模型单独使用的整体质量,而成本接近仅使用成本优化模型。
成本优化模型完成了大部分工作
图 7 · 神谕路由器将每个任务发送到何处。像 K3 这样强大且成本优化的模型成为默认选择;优质模型是例外,而非规则。
## K3 在所有工作类型上都是成本优化的
将质量和成本放在同一张图上。K3(蓝色)在所有五个任务族中都落在 Fable(红色)的左侧(更具成本效益的一侧)。准确率互有胜负:Fable 在多语言上领先,K3 在终端和法律上领先,其余大致持平。
每种工作的成本都更低图表
图 8 · 各族的成本(对数刻度)vs 准确率。K3 在 Fable 左侧,所有五个族成本均更低。垂直间隙显示哪个模型在何处更强。
## 单一模型是浪费的,且不再是 SoTA
Kimi K3 + Fable 通过路由结合,以最佳价格释放了它们的最佳品质。
单一模型供应商、令牌最大化的时代即将结束。任务级数据显示这些模型是不同价格的专业化模型。最好的 AI 不再来自单一实验室,而是模型的混合。
这在实践中意味着什么:
1. **开放模型作为默认。**像 K3 这样成本低 50 倍的开放模型应作为你的基础选择,因为神谕路由已经将大部分流量发送给它。
2. **路由器是你的护城河。**路由器必须根据你的工作负载定制,持续学习任务/模型分割是你保持领先的最佳机会。
相似文章
Kimi K3 泄露:与 Fable 相当
关于 Kimi K3 的泄露细节表明其性能与 Fable 相当,标志着 AI 模型领域的一个竞争性发展。
根据这些基准测试,Kimi K3 属于 Fable 级别。
基准测试显示,Kimi K3 达到了 Fable 级别的性能,标志着该模型的一个重要里程碑。
Kimi-K3 还未完全超越 Fable,但确实越来越接近了。
Kimi-K3 尚未超越 Fable,但已显示出明显进展,差距正在缩小。
ArenaAI Kimi K3 与 Fable 和 Sol 的对比
关于 ArenaAI 上 AI 模型 Kimi K3、Fable 和 Sol 的对比视频
@eliebakouch: Kimi K3(总参数2.8万亿)是一个开源权重模型,与fable和gpt 5.6 sol竞争,同时价格便宜得多,……
Kimi K3 是一个开源权重的2.8万亿参数大语言模型,采用了线性注意力、潜在MoE和新激活函数等创新,以更低成本提供有竞争力的性能。