@samsja19: 很荣幸能与才华横溢的 @mixedbreadai 团队合作,利用我们的强化学习技术栈推进最先进的智能体搜索…
摘要
Samsja19 强调了他们与 Mixedbread AI 在 Toast 1 上的合作,这是一个专门的智能体搜索模型,通过强化学习,以 12 倍更快的速度和 1/10 的成本实现了前沿质量。
查看缓存全文
缓存时间: 2026/08/14 11:32
能与才华横溢的 @mixedbreadai 团队合作,用我们的 prime RL 技术栈推动 SOTA 智能体搜索,实在是一件乐事。
RL 真的太美了。
即使是最大的模型,开箱也无法很好地适配新的框架和工具,但通过 RL,你只需花费极小一部分成本,就能让模型表现极其出色。
所有在推理上投入大量资金的人,最终都需要做后训练。
Mixedbread (@mixedbreadai): 隆重推出 Toast 1,我们的第一款专用搜索智能体。
Toast 1 为智能体搜索模型树立了新的帕累托前沿。
前沿的搜索质量,覆盖所有领域,速度快 12 倍,价格仅为其 1/10。
相似文章
介绍 Toast 1
Mixedbread 推出 Toast 1,这是一款专用搜索代理,其质量可与前沿模型媲美,同时成本最高降低 10 倍,速度最高提升 12 倍。它自动化了代理式搜索循环,并在 OfficeQA Pro V2 和法律知识任务等基准测试中取得了最先进的结果。
@__lu__jasper: 在OBLIQ-bench的子采样版本上尝试搜索的一些早期结果。Mixedbread的重排序器是一...
在子采样OBLIQ-bench上测试搜索的早期结果显示,Mixedbread的重排序器获得了较强的MRR,有时在某些指标上优于GPT 5.5,且速度更快,但该基准测试仍具有挑战性。
@samsja19: 非常激动人心的工作,旨在弥合强化学习与中期/预训练之间的差距。你可以从环境中学习,超越奖励信号……
一种名为ECHO的新方法通过在使用工具调用输出上进行下一个词预测,从环境中学习超越奖励信号,将世界建模与代理行为相结合,从而弥合了强化学习与预训练之间的差距。
@samsja19:Prime RL 现在可以表示和训练多智能体系统,支持智能体裁判、自我对弈、用户模拟等用例…
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
@Vtrivedy10: 有一个非常令人兴奋的未来智能体配方,用于构建低成本到无需计量的智能,应用于提取信…
该帖子概述了一个未来智能体配方,通过微调高效、专业化的开源模型,在LLM-as-a-judge任务上超越前沿性能,并将其应用于从追踪数据中提取信号以实现持续学习。LangChain Labs 和 FireworksAI 发布了展示这一方法的新工作。