@patpcj: Fable-5/Mythos 今早发布了,我们在智能体搜索上测试了一下——结果它成了新的 SOTA。性能差距确实存在……
摘要
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。
查看缓存全文
缓存时间: 2026/06/10 07:47
Fable-5/Mythos 今早发布了,我们在智能搜索上做了测试——它成为了新的 SOTA。
性能差距确实存在。
那么,为什么我们仍然对我们开源的 20B 参数 Harness-1 感到兴奋?
• 自部署成本更低:预估每百万输出 token 约 $0.2,对比 25–50
• 在我们的设置中没有过滤查询:Harness-1 执行了所有评估查询,而 Fable-5 过滤掉了约 7%
• 开源权重且模型足够小,可以实际运行、检查和构建
你真正能负担得起大规模运行的开源搜索代理,仍然值得打造。
继续努力吧。
相似文章
@cline: Claude Opus 5 在 SWE-Bench 上以 97% 的成绩排名第一,并声称以半价提供 Fable 5 级别的智能。令人难以置信的是,在……
Anthropic 发布了 Claude Opus 5,该模型在 SWE-Bench 上取得了 97% 的成绩,并声称以一半的价格提供 Fable 5 级别的智能,展示了 SOTA 的快速提升。
新 SOTA:Poetiq 使用自优化框架以 Gemini 3 Flash 超越 Opus 4.7 等模型
Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。
@gregpr07: Browser Use Beta 刚刚在我们最难的内部网络代理基准测试中实现了 SOTA。Fable 在优化方面确实令人惊叹…
Browser Use Beta 在困难的内部网络代理基准测试中取得了先进的结果,使用了 Fable 进行优化和分析。
@adamdotnew:我们非常激动地宣布,Anthropic 的 Fable 5 在机械工程任务中达到了 SOTA 水平!它可以生成……
Anthropic 宣布推出 Fable 5,这是一款在机械工程任务中达到最先进水平的模型,能够通过单个提示生成复杂的装配体与机构。
@patpcj:再次感谢您对我们工作的兴趣!链接在此,以免被“显示更多”埋没:论文:https://arxi…
Harness-1 是一个 20B 参数规模的搜索代理,通过使用有状态搜索线索的强化学习进行训练,在检索基准测试中取得了强劲结果,并优于其他开源搜索子代理。