Kimi K3 与 Fable 相当;Kimi K3 和 Fable 达到最先进水平

Hacker News Top 新闻

摘要

Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:17

# Kimi K3 与 Fable 实力相当;Kimi K3 + Fable 达到 SoTA。 来源:https://fireworks.ai/blog/kimik3-fable K3 是一个成本极低的前沿级开放模型。更关键的是,它能以可预测的方式补充 Fable,从而通过任务路由获得最高质量的智能。 🧭**快速总结:**我们在约 1,000 个智能体任务上对 Kimi K3(开放模型)和 Fable 5(闭源模型)进行了测试,发现: 1. **通过 K3 与 Fable 之间的路由,我们实现了 93% 的准确率。** 2. **在长智能体循环中,成本效益比单独使用 Fable 高出约 50 倍**,并且在所有使用场景中成本持续更低。 ## 我们的评测方法 我们平均了**多个基准测试,每个测试针对不同类型的工作**,并在同一框架下运行了 K3 和 Fable 5。总共约 1,030 个任务,均在真实智能体循环中完成。 | 任务族 | 测试内容 | 任务数 | |--------|----------|--------| | SWE | 真实代码仓库缺陷修复(SWE-bench 风格) | 460 | | Terminal | 长链智能体操作:安全、加密、逆向工程、系统管理 | 89 | | Algorithmic | LeetCode / AtCoder 风格问题 | 100 | | Multi-Language | 六种语言的实现 | 225 | | Legal | 法律智能体基准测试(由律师评分的任务) | 120 | 在进入结果之前,先快速定义一个概念。**神谕路由**是一种测量理论最佳性能的方法:通过让每个模型执行任务,然后选取最便宜的正确答案(成本/性能上限)。在实际路由器中,你无法让一个任务同时跑多个模型。路由器会预测哪个模型在成本和质量之间取得最佳平衡,但最终这是一个猜测。 在本研究中,神谕路由显示 K3 被选中处理 72–96% 的任务。这表明通过学习日常任务与真正长尾前沿工作之间的区别,或许可以接近完美的路由器。但需要多一个数量级的路由数据和实际性能才能有定论。 ## K3 是一款好模型。 从宏观角度看,很容易将两者的直接对比视为平局。例如,看头条基准 SWE:K3 达到 **92.4%**,Fable 达到 **92.6%**。在我们评测的五类任务中,两者往往相差不超过几个百分点,Fable 在编程语言广度(多语言)上略微领先。 基准测试图表 图 1 · 按类别划分的任务解决率。整体平均值近乎相同;但在不同任务类型上各有擅长。 很容易就此止步并说“它们大致相当”。但关键在于,它们在不同任务类型上具有离散的更好性能。 ## 两个模型胜过一个模型 如果深入单个基准测试内部,你会发现比表面准确率数字更多的信息。以 SWE 为例,两者总体完全持平。但如果按问题领域划分 SWE,可以看到每个模型的闪光点。K3 在符号数学和开发工具方面最为出色;Fable 在网络和数据可视化工作中取胜。同样的模式贯穿于多语言集合中,Fable 的广度覆盖了 Java、Python 和 C++,而 K3 在 JavaScript 和 Rust 上追平。 显示平局也是参差不齐的 Fable 与 K3 基准测试 图 2 · 按 SWE 领域的点差(K3 减去 Fable)。整体基准持平,但两者在领域上各有专长。 在终端的长时域工作中——驱动 shell、数十轮调试系统——K3 展现了真正实力。它完成了一批 Fable 从未攻克的任务:7z 哈希、FEAL 密码分析、泄露的秘密、实时漏洞、失控的异步作业。 K3 主导智能体终端 图 3 · 在 89 个终端任务中,K3 有 11 次独赢,Fable 有 7 次,K3 完全拿下了安全和加密类任务。 ## 在 Fireworks 上,K3 成本可低至 50 倍。🫳🎤 虽然质量在高层面上近乎平手,但价格差距悬殊。 模型真正分化的地方在于成本差异图 图 4 · 每个任务的成本优势。背后有两个因素:令牌定价和模型运行时间因任务而异。 那么,这个巨大的价格差距从何而来?令牌定价、提示缓存以及每个任务的投入程度。例如在 SWE 上,K3 比 Fable 努力得多:每个任务约 55 轮、130 万令牌,而 Fable 是 21 轮、13 万令牌。在长终端任务上则相反:Fable 会陷入循环,运行 64 轮、150 万令牌(有时直接超时)。 投入也是参差不齐的,它驱动成本图表 图 5 · 每任务的轮数(线性)和令牌数(对数)。两个模型并非全线经济;额外工作落在 K3 的 SWE 和 Fable 的终端任务上。注意令牌图的 y 轴是任务解决率。 提示缓存将这种投入转化为 K3 的价格优势:即使 K3 读取的令牌数多十倍,由于缓存命中,SWE 运行成本仍低于 Fable。但有一个权衡:额外轮数的任务通常意味着更多实际时间,即更慢的运行。如果你需要在两秒内得到答案,这很重要;如果你在大规模后台运行智能体,大幅缩小的账单则重要得多。 ## 不要选择模型。要路由。 如果你将每个任务发送给最适合处理它的模型,你不会落在两个模型之间,而是会高于两者。 每任务路由总是优于任何单一模型运行: 路由最佳模型,你就能超越两者图表 图 6 · 每任务神谕路由 vs 各模型单独运行。绿色标签 = 在该类别中优于最佳单一模型获得的点数。 神谕路由器选择 K3 处理 72–96% 的任务流量。通过这样设计路由器,你最终获得高于任一模型单独使用的整体质量,而成本接近仅使用成本优化模型。 成本优化模型完成了大部分工作 图 7 · 神谕路由器将每个任务发送到何处。像 K3 这样强大且成本优化的模型成为默认选择;优质模型是例外,而非规则。 ## K3 在所有工作类型上都是成本优化的 将质量和成本放在同一张图上。K3(蓝色)在所有五个任务族中都落在 Fable(红色)的左侧(更具成本效益的一侧)。准确率互有胜负:Fable 在多语言上领先,K3 在终端和法律上领先,其余大致持平。 每种工作的成本都更低图表 图 8 · 各族的成本(对数刻度)vs 准确率。K3 在 Fable 左侧,所有五个族成本均更低。垂直间隙显示哪个模型在何处更强。 ## 单一模型是浪费的,且不再是 SoTA Kimi K3 + Fable 通过路由结合,以最佳价格释放了它们的最佳品质。 单一模型供应商、令牌最大化的时代即将结束。任务级数据显示这些模型是不同价格的专业化模型。最好的 AI 不再来自单一实验室,而是模型的混合。 这在实践中意味着什么: 1. **开放模型作为默认。**像 K3 这样成本低 50 倍的开放模型应作为你的基础选择,因为神谕路由已经将大部分流量发送给它。 2. **路由器是你的护城河。**路由器必须根据你的工作负载定制,持续学习任务/模型分割是你保持领先的最佳机会。

相似文章

Kimi K3 泄露:与 Fable 相当

Reddit r/LocalLLaMA

关于 Kimi K3 的泄露细节表明其性能与 Fable 相当,标志着 AI 模型领域的一个竞争性发展。