多智能体推理中的流式通信

Hugging Face Daily Papers 论文

摘要

StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。

多智能体推理系统采用“先生成再转移”的范式,导致端到端延迟随流水线深度线性增长。我们提出了 StreamMA,一种多智能体推理系统,它在每个推理步骤生成后立即将其流式传输到下游智能体,使相邻智能体形成流水线,从而降低延迟。令人惊讶的是,这种流水线化还提升了效果:因为多步推理的质量是不均匀的,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而非完整链条可以防止易出错的后期步骤误导下游智能体。我们通过首次对流式、串行和单协议进行闭式联合分析,形式化了这两种优势,推导出效果排序、加速上限和成本比。在涵盖数学、科学和代码的八个推理基准测试、两个前沿大语言模型(Claude Opus 4.6 和 GPT-5.4)以及三种拓扑结构(链、树、图)中,StreamMA 均优于两个基线(在 HMMT 2026 上平均提升 7.3 个百分点,最高 22.4 个百分点;Claude Opus 4.6-high)。除了这些贡献,我们还发现了一个“步骤级别的缩放定律”:增加每个智能体的步骤数能持续提升效果和效率,这是一个新的缩放维度,与智能体数量缩放正交且可组合。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

Paper page - 多智能体推理中的流式通信

来源:https://huggingface.co/papers/2606.05158

摘要

StreamMA 通过流式传输中间结果并利用可靠的早期步骤,实现了高效的多智能体推理,在多种推理任务中同时改善了延迟和有效性。

多智能体推理系统(https://huggingface.co/papers?q=Multi-agent%20reasoning%20systems)采用“先生成后传输“的范式,导致端到端延迟(https://huggingface.co/papers?q=end-to-end%20latency)与流水线深度呈线性增长。我们提出了 StreamMA,一种多智能体推理系统,它在每个推理步骤生成后立即将其流式传输到下游智能体,通过管线化(https://huggingface.co/papers?q=pipelining)相邻智能体来降低延迟。令人惊讶的是,这种管线化(https://huggingface.co/papers?q=pipelining)同时提升了有效性:由于多步推理的质量是不均匀的,早期步骤比后期步骤更可靠,使用这些可靠的早期步骤而非完整链条(https://huggingface.co/papers?q=chain)可以防止容易出错的后期步骤误导下游智能体。我们通过首次对流式、串行和单一协议(https://huggingface.co/papers?q=single%20protocol)进行闭式联合分析,形式化了这两个优势,推导出有效性排序(https://huggingface.co/papers?q=effectiveness%20ordering)、加速上限(https://huggingface.co/papers?q=speedup%20upper%20bound)和成本比(https://huggingface.co/papers?q=cost%20ratio)。在跨越数学、科学和代码的八个推理基准(https://huggingface.co/papers?q=reasoning%20benchmarks)上,使用两个前沿大语言模型(https://huggingface.co/papers?q=LLMs)(Claude Opus 4.6 和 GPT-5.4)以及三种拓扑(Chain(https://huggingface.co/papers?q=Chain)、Tree(https://huggingface.co/papers?q=Tree)、Graph(https://huggingface.co/papers?q=Graph)),StreamMA 在两个基线上均表现更优(在 HMMT 2026 上平均 +7.3 个百分点,最高 +22.4 个百分点;Claude Opus 4.6-high)。除了这些贡献,我们还发现了一个“步骤级缩放定律(https://huggingface.co/papers?q=step-level%20scaling%20law)“:增加每个智能体的步骤能够持续提升有效性和效率,这是一个与智能体数量缩放(https://huggingface.co/papers?q=agent-count%20scaling)正交且可组合的新缩放维度。

查看 arXiv 页面(https://arxiv.org/abs/2606.05158)查看 PDF(https://arxiv.org/pdf/2606.05158)项目页面(https://zhenyangcs.github.io/StreamMA-website/)GitHub2(https://github.com/EnVision-Research/StreamMA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05158)

引用此论文的模型0

没有模型链接此论文

要在模型 README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

要在数据集 README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

要在 Space README.md 中引用 arxiv.org/abs/2606.05158,以从本页面链接。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection)以从本页面链接。

相似文章

StreamMemBench:面向未来辅助的代理记忆流式评估

arXiv cs.AI

StreamMemBench是一个新的流式基准测试,用于评估个人代理记忆系统如何利用观察到的证据和用户反馈来实现面向未来的辅助。实验表明,当前系统通常无法将存储的信息转化为可靠的后续行为。

递归多智能体系统

Papers with Code Trending

本文提出RecursiveMAS,一种将递归扩展原则应用于多智能体系统的框架,以提升协作推理的效率和准确性。与标准基线相比,该框架在多个基准测试中实现了显著的加速和token缩减。