介绍 Toast 1

Hacker News Top 模型

摘要

Mixedbread 推出 Toast 1,这是一款专用搜索代理,其质量可与前沿模型媲美,同时成本最高降低 10 倍,速度最高提升 12 倍。它自动化了代理式搜索循环,并在 OfficeQA Pro V2 和法律知识任务等基准测试中取得了最先进的结果。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/14 15:28

# 介绍 Toast 1 来源:https://www.mixedbread.com/blog/toast-1 **Toast 1**,我们的首个专业搜索智能体,现已正式上线。它提供前沿搜索质量,匹配或超越 Claude Opus 5 和 GPT-5.6 Sol,同时成本最高可降低 10 倍,速度最高可提升 12 倍。它与 Mixedbread Search 配合效果最佳,但也可与任何搜索后端协同工作。 如今,前沿模型已经能够执行真正的知识工作。它们可以推理、分析,并在复杂文档集合中查找信息。但它们也是整个技术栈中最昂贵的模型。随着智能服务越来越多地按用量计费,以极低成本匹敌其能力的专业智能体的需求比以往任何时候都更加迫切。 Toast 1 既可以作为独立的专业检索智能体运行,也可以作为你的前沿模型已经知道如何依赖的众多子智能体之一。它完全接管搜索循环:给定初始查询,它会将其分解为子查询,收集证据,检查来源,并在返回前整理相关上下文。这使你的智能体能够将上下文和计算资源花费在需要通才型前沿模型的任务上:推理、行动并生成最终答案。 Toast 1 智能体搜索的水瀑布追踪:3 轮中 16 次工具调用,在刚超过 5 秒内回答一个就业率比较查询。展开追踪,然后选择一个步骤以查看该步骤生成的子查询、grep 模式或计划。 这种智能体劳动力的专业化不仅使搜索成本大幅降低,还在许多实际任务中带来了更好的端到端结果。我们发现,Toast 1 在每任务成本和每任务速度方面,为智能体工作负载树立了新的帕累托前沿。 ### 财务分析:OfficeQA Pro V2 [章节链接](https://www.mixedbread.com/blog/toast-1#financial-analysis-officeqa-pro-v2) OfficeQA Pro V2 由 Databricks 发布,旨在评估在现实复杂企业财务情境下 90 个问题的答案正确性。 GPT-5.6 Sol 在 Codex 中将 Toast 1 作为子智能体使用,答案正确率达到 70%,每任务成本约 1.15 美元:这是 Databricks 在 OfficeQA v2 版本评估的所有系统中得分最高的,同时在质量和效率方面树立了新的最先进性能。 OfficeQA Pro V2 上答案正确率与每次运行成本(对数刻度)的散点图。GPT-5.6 Sol 在 Codex 中以 Toast 1 作为子智能体运行,每任务约 1.20 美元时达到 70% 正确率,高于 Databricks 评估中的先前帕累托前沿,而 Databricks Genie 上的 Claude Fable 5 在约 4 美元时达到 60%。 OfficeQA Pro V2 上答案正确率与每次运行成本的对比。Genie 和 harness 数据由 Databricks 报告;Codex + Toast 1 运行为我们所做。阴影区域位于先前帕累托前沿之下。 相比之下,之前表现最好的 Databricks Genie 上的 Claude Fable 5 在每任务约 4 美元时达到 60% 正确率,而 Codex 中未使用 Toast 1 的 GPT-5.6 Sol 仅达到 33% 正确率。 这一改进源于重构了证据收集的经济性。Toast 1 的专业化使其能够生成高质量、token 高效的证据包,为推理过程留出充足资源以得出最终答案。 ### 法律智能体基准 - 律所知识 [章节链接](https://www.mixedbread.com/blog/toast-1#legal-agentic-benchmark---firm-knowledge) Harvey LAB 的律所知识基准旨在评估智能体在大规模、现实场景中搜索和运用机构法律知识的能力。 法律工作本质上依赖大量上下文。如果对方掌握了更优质、更相关的先例和细节,你很难在辩论中胜过他们。但法律工作也充满噪音:许多情况相似却因简单细节而异,这使得在不产生大量误报的情况下收集高质量证据包变得棘手。 在随机选择的 33 个任务子集中[¹](https://www.mixedbread.com/blog/toast-1#user-content-fn-1),我们发现 GPT-5.6 Sol 的答案质量在不同搜索方法下保持不变。 Harvey LAB 律所知识基准所使用的总 token 数柱状图。普通智能体在每任务 21.7 轮次中使用 8060 万 token。添加 Mixedbread Search 后,token 使用量减少 42%,降至 4700 万,每任务 14.6 轮次。再添加 Toast 1 作为子智能体,token 使用量进一步减少 51%,降至 2300 万,每任务 11.2 轮次。三种配置均达到完全相同的任务得分 55,因此最终结果是在 token 使用量减少 3.5 倍的情况下实现相同性能。 Token 为 33 个任务基准的总量;轮次为每个任务的智能体循环迭代次数。三种配置均达到完全相同的任务得分 55。 然而,提高搜索质量大幅提升了 token 效率:以 Mixedbread Search 取代普通智能体的文件系统搜索,在相同任务得分下将 token 用量从 8060 万降至 4700 万。随后添加 Toast 1 作为专用搜索子智能体,进一步将用量降至 2300 万,并使其在普通智能体所需轮次的一半内完成。 引入由 Mixedbread Search 驱动的 Toast 1 保持了答案质量,同时 token 用量减少 3.5 倍,成本降低超过 60%。Toast 1 释放了前沿模型的上下文窗口,让它们将 token 用于得出正确答案。 基准测试和数字只能讲述故事的一部分。要真正理解 Toast 1 的工作方式,最好的办法就是观看它实际搜索的过程。在 Mixedbread,我们非常喜欢 Dwarkesh 的播客,并认为能够深入搜索其文字记录会很有趣。 你可以[在这里](https://dwarkesh-search-demo.vercel.app/)亲自试用。 尽管 Toast 1 是处理复杂任务的得力子智能体,它也是一个经过专门深度搜索训练的出色独立模型。它代表了我们在嵌入模型和 Silo 背后的共同设计方法的下一步:模型、智能体框架和检索原语被设计为协同工作。[²](https://www.mixedbread.com/blog/toast-

相似文章

一个相当智能的语音代理

arXiv cs.AI

本文介绍了JarvisBench,一个用于评估长周期AI代理工作流中连续、实时语音中介层的基准,并展示了一个模块化的Jarvis原型,该原型在WildClaw任务上使用多种基于LLM的工作代理进行了测试。