@patpcj: Fable-5/Mythos 今早发布了,我们在智能体搜索上测试了一下——结果它成了新的 SOTA。性能差距确实存在……
摘要
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。
查看缓存全文
缓存时间: 2026/06/10 07:47
Fable-5/Mythos 今早发布了,我们在智能搜索上做了测试——它成为了新的 SOTA。
性能差距确实存在。
那么,为什么我们仍然对我们开源的 20B 参数 Harness-1 感到兴奋?
• 自部署成本更低:预估每百万输出 token 约 $0.2,对比 25–50
• 在我们的设置中没有过滤查询:Harness-1 执行了所有评估查询,而 Fable-5 过滤掉了约 7%
• 开源权重且模型足够小,可以实际运行、检查和构建
你真正能负担得起大规模运行的开源搜索代理,仍然值得打造。
继续努力吧。
相似文章
@cline: Claude Opus 5 在 SWE-Bench 上以 97% 的成绩排名第一,并声称以半价提供 Fable 5 级别的智能。令人难以置信的是,在……
Anthropic 发布了 Claude Opus 5,该模型在 SWE-Bench 上取得了 97% 的成绩,并声称以一半的价格提供 Fable 5 级别的智能,展示了 SOTA 的快速提升。
新 SOTA:Poetiq 使用自优化框架以 Gemini 3 Flash 超越 Opus 4.7 等模型
Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。
当前 10B 以下 SOTA 模型(如 MiniCPM5-2B)搭配现代工具,能否超越 2025 年 3 月前的前沿模型(如 Grok 3、GPT-4o)?
本文探讨当前如 MiniCPM5-2B 这样的 10B 以下 AI 模型,通过现代工具增强,能否在日常使用中达到 2025 年 3 月前前沿模型(如 Grok 3 和 GPT-4o)的实际能力。
@gregpr07: Browser Use Beta 刚刚在我们最难的内部网络代理基准测试中实现了 SOTA。Fable 在优化方面确实令人惊叹…
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
Anthropic 推出 Claude Fable 5.1,并表示其用于智能体任务的成本降低高达45%
Anthropic 推出 Claude Fable 5.1 和 Mythos 5.1,声称用于智能体任务的成本降低高达45%,性能提升,并提供新的数据隐私选项。