SciOrch:学习编排专家级大语言模型以解决前沿多模态科学推理任务

Hugging Face Daily Papers 论文

摘要

SciOrch 提出了一种基于 MCTS 训练的 8B 视觉语言模型,用于协调多个专家级大语言模型进行多模态科学推理,在降低 API 成本的同时实现了更优性能。

前沿科学推理对于大语言模型(LLMs)仍然是一个重大挑战,即使最强的商业系统也未能达到专家级表现。仔细观察模型行为会发现,单一模型评估所掩盖的显著互补性:不同前沿模型在不同问题类型上表现出色,没有哪个模型能涵盖全局。我们提出了 SciOrch,一个训练轻量级 8B 模型来编排前沿大语言模型进行科学推理的框架。该编排器将每个问题分解,通过 API 调用将子问题委托给选定的商业模型,并合成最终答案。训练这样的编排器比传统的智能体强化学习要困难得多:每次行动都会触发一次 API 调用,这在成本和延迟上都很昂贵,使得标准的在线 rollout 变得不可行。我们通过基于 MCTS 的方法解决了这一问题,生成了多样化的编排轨迹,提取了每个节点的单轮样本,并使用 GRPO 风格的训练来优化编排器。在一个涵盖 SGI-Reasoning 和 Scientists' First Exam 的 240 道问题测试集上,SciOrch 达到了 56.66% 的平均准确率,比最强的单一商业模型高出 3.74%,比最强的多智能体基线高出 3.33%。它还在 SGI 和 SFE 上均取得了最佳准确率,同时 API 成本不到典型多智能体方法的一半。
查看原文
查看缓存全文

缓存时间: 2026/06/18 07:55

论文页面 - SciOrch:学习编排专家LLM以解决前沿多模态科学推理任务

来源:https://huggingface.co/papers/2606.15872 我们很高兴分享我们的最新工作:SciOrch:学习编排专家LLM以解决前沿多模态科学推理🧬

科学推理常常需要阅读复杂的图表、整合不同领域的知识,并逐步解决问题。不同的LLM在这一过程中各有所长——因此,与其依赖单一模型,我们提出一个问题:一个小模型能否学会协调多个专家LLM?

为了回答这个问题,我们提出了SciOrch🎼,一个8B视觉语言模型,它学习分解科学问题、调用合适的专家模型并综合它们的答案。

由于调用商业模型成本高昂,我们使用基于MCTS的高效流水线 🌳 来训练SciOrch。

我们的结果表明,SciOrch在降低API成本的同时,超越了强大的单模型和多智能体基线。我们希望这是迈向更高效、更协作的科学推理AI系统的一步 🚀

相似文章

SciR:用于LLMs科学推理的可控基准

arXiv cs.AI

SciR是一种新的可控基准,用于评估LLMs在科学推理方面的能力,包括演绎、归纳和因果溯因,并通过参数控制提取难度和推理难度。测试表明,两个难度轴都会降低所有模型的性能,推理模型(如DeepSeek-R1)在推理方面优于指令模型。

学习如何让大语言模型进行推理

OpenAI Blog

OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。

Agora:通过基于拍卖的任务分配增强LLM智能体推理

arXiv cs.AI

Agora引入了一种基于拍卖的任务分配机制,用于LLM智能体,将推理步骤视为可交易物品,并使用校准后的置信度将任务路由到最有能力的专家模型,从而在多个基准测试中提升推理性能。