在Fable 5、Kimi K3和GPT-5.6 Sol上运行了12个真实的多应用代理任务。最便宜的模型与最贵的模型打平。

Reddit r/AI_Agents 新闻

摘要

对三个AI代理在12个多应用任务上的基准测试显示,Kimi K3以极低的成本与最贵的模型GPT-5.6 Sol打平,尽管三者都未能通过跨应用协调任务,这突显了在生产环境中进行验证的必要性。

过去几周,我在Fable 5、Kimi K3和GPT-5.6 Sol上运行了12个多步代理任务。使用真实账户,而非沙箱环境。涉及Gmail、Slack、Sheets、Salesforce、HubSpot、GitHub、Linear。没有主观评分。每次运行后,验证器都会调用API,检查账户中实际到达的内容与预期是否一致。设置是Claude Code驱动Fable和Kimi,Codex CLI驱动GPT-5.6。相同的12个模板,相同的MCP工具路由器。每次写入都做了标记,以便后续清理。 得分:Fable 5 - 7/12,Kimi K3 - 7/12,GPT-5.6 Sol - 6/12。按标价计算的每次案例成本,无缓存折扣,因此这些视为上限:Fable 5 - 约776k tokens,约$7.76;GPT-5.6 - 约538k,约$2.69;Kimi K3 - 约463k,约$1.39。整套测试下来分别约为$93、$32和$17。因此Kimi以六分之一的成本与最贵的模型打平。而价格处于中间的模型反而垫底。这出乎我的意料。 让我困扰的部分。12个任务中有5个是跨应用协调任务,旨在压力测试模型。在Gmail/Slack/Sheets之间同步工单状态。从分布在多个应用中的记录构建退款分类账。花名册同步,供应商目录。三者全部失败,全部五个任务。没有一次通过。一个任务只有在每个评分检查都通过时才计数,工单任务有24个检查点。一次糟糕的合并就导致整个运行失败。不过,部分分数讲述了不同的故事。GPT-5.6通常在它失败的任务上最接近。工单任务中20/24,而Kimi是17/24。供应商任务12/13,退款任务10/13。它的失败看起来像是接近命中,而不是模型彻底失控。这对于生产环境来说更糟糕,而不是更好。接近命中的错误在生产环境中很容易被忽略。 有一个任务将它们清楚地区分开。CRM身份去重,即在Salesforce和HubSpot之间匹配联系人,追踪埋藏在Gmail线程中的规范来源注释,然后返回一个审查结果而不修改任何记录。Fable通过了,Kimi通过了。GPT通过了5/7检查,但失败了。这就是7/12和6/12之间的全部差距。一个任务。 那么这给我带来了什么?对于普通的SaaS工具调用,差异很小,价格起决定作用,而Kimi看起来更具性价比。对于任何需要在应用之间精确保持状态的任务,我不会让这三个模型中的任何一个在无监督下运行。需要验证器加上重试循环,并假设它会自信地返回但略有错误。 免责声明,以免有人在评论区大喊大叫。GPT在不同的框架上运行(Codex vs Claude Code),因此运行之间的账户状态不完全相同。它是在相同模板上逐个任务进行的,而不是一个干净的对照实验。Fable和Kimi的token计数是按案例标准化的运行时token,而GPT的是直接测量的。比率比具体的美元数字更可靠。图表和每个任务的详细分析在评论中,如果你需要的话。有人有能够经受多步协调的框架吗?想知道先计划后验证是否能缩小差距,或者只是浪费token得到相同的结果。
查看原文

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。

@_alejandroao: https://x.com/_alejandroao/status/2066548511106076932

X AI KOLs Timeline

一项研究引入了DuoBench,这是一个用于评估编码智能体中规划者-实现者配对的基准测试。它在CPython问题上测试了Kimi K2.7、K2.6、GPT-5.5和Claude Opus 4.8的组合,发现作为实现者的Kimi K2.7以低成本提供高质量,性能优于更昂贵的配对。