从专有模型到开源模型:通过多智能体协议蒸馏弥合代理搜索中的分布差距

Hugging Face Daily Papers 论文

摘要

本文介绍了多智能体协议蒸馏(MAPD),这是一个通过结构化协议从专有代理搜索模型中提炼知识到开源模型以弥合分布差距的框架,在七个问答基准上取得了最先进的结果。

代理搜索使大型语言模型能够通过交错多步推理与检索来解决知识密集型任务,然而使用基于结果的强化学习(RL)进行优化只能提供稀疏的监督。知识蒸馏可以提供更密集的指导,而具有强大推理能力的先进专有模型是很有前途的教师。虽然从专有模型中蒸馏可以密集化这种监督信号,但传统的logit匹配由于隐藏的logit和不匹配的分词器而无法实现,而原始自然语言轨迹模仿则传递了肤浅的风格伪影而非核心推理能力。为了解决异构蒸馏问题并弥合分布差距,我们提出了多智能体协议蒸馏(MAPD),这是一个联合蒸馏和强化学习框架,使用结构化的、风格归一化的协议作为中间表示。一个离线多智能体系统(MAS)分解每个查询,检索支持证据,修复失败的搜索,并将生成的探索轨迹转换为一个JSON协议,其中包含任务类型、推理计划和抽取式事实依据。在训练过程中,该协议仅提供给学生策略的一个特权分支,其token分布为稀疏的RL目标提供了密集的蒸馏信号。在七个问答基准上的广泛评估表明,MAPD始终优于有竞争力的蒸馏与强化学习方法,在Qwen3-1.7B上实现了39.4\%的平均成功率,在Qwen3-4B上实现了44.4\%。关键的是,该框架在面对多样的专有教师模型时能稳健地泛化,同时有效减轻学生策略的风格漂移和冗长退化。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:33

论文页面 - 从闭源到开源:通过多智能体协议蒸馏弥合智能体搜索中的分布差距

来源:https://huggingface.co/papers/2607.24280

摘要

智能体搜索通过将多步推理与检索交错进行,使大型语言模型能够解决知识密集型任务,然而基于结果的强化学习(RL)优化方式仅提供稀疏的监督信号。知识蒸馏可以提供密集引导,而具备强大推理能力的高级闭源模型则是理想的教师模型。虽然从闭源模型进行蒸馏能够使监督信号更加密集,但传统的logit匹配因隐藏的logit和不匹配的分词器而无法实现,而简单的自然语言轨迹模仿则只会转移肤浅的风格性伪影,而非核心推理能力。为了解决异构蒸馏问题并弥合分布差距,我们提出了多智能体协议蒸馏(MAPD),一个结合蒸馏与强化学习的联合框架,使用结构化的、风格归一化的协议作为中间表示。一个离线多智能体系统(MAS)将每个查询分解、检索支持证据、修复失败的搜索,并将产生的探索轨迹转换为一个JSON协议,其中包含任务类型、推理计划和可提取的基于事实的支撑信息。在训练期间,该协议仅提供给学生策略的一个特权分支,其token分布与稀疏的RL目标一起提供了密集的蒸馏信号。在七个QA基准上的广泛评估表明,MAPD一致优于竞争性的蒸馏和强化学习方法,在Qwen3-1.7B和Qwen3-4B上分别达到了平均39.4%和44.4%的成功率。关键的是,该框架在多种闭源教师模型上都能稳健泛化,同时有效抑制了学生策略的风格漂移和冗长退化。

查看arXiv页面(https://arxiv.org/abs/2607.24280) 查看PDF(https://arxiv.org/pdf/2607.24280) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.24280)

在你的智能体中获取此论文:

hf papers read 2607.24280

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2607.24280即可从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2607.24280即可从此页面链接。

引用此论文的Spaces0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2607.24280即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

SearchOS-V1: 迈向稳健的开放域信息检索智能体协作

Hugging Face Daily Papers

介绍SearchOS,一个用于稳健开放域信息检索的多智能体框架,通过新颖的面向搜索的上下文管理(SOCM)系统将搜索进度外化为显式状态,在WideSearch和GISA基准上取得了最先进的结果。

OpenThoughts-Agent: 面向智能体模型的数据配方

Hugging Face Daily Papers

本文介绍了OpenThoughts-Agent,一个开源的用于训练智能体语言模型的数据整理流程,在七项基准测试中取得了44.8%的平均准确率,并通过系统性实验超越了先前的开源数据集。